|Agentic AI Group
智能体工程课程
2026 版
应用16 学时更新:2026-07-26

10|综合项目与生产交付

将前九章组合为可部署、可评估、可答辩的企业级智能体项目,并完成从本地复现到服务器上线的交付闭环。

前置知识
  • 完成前九章核心实验
  • 能独立使用 Git、Python 和至少一种 Agent 框架
学习成果
  • 能完成从需求到部署的智能体项目
  • 能建立质量门禁、评估集、监控、安全和成本方案
  • 能用可复现的文档和测试交付项目
综合项目交付闭环
图 10-1:项目不以“能演示”为终点,而以可验证、可治理和可迭代为交付标准。

1. 综合项目任务书

1.1 推荐题目:企业知识与工单协同助手

系统接收员工问题或故障描述,检索制度和 SOP,查询设备数据,必要时委派专业 Agent,并在人工确认后创建工单。项目代码位于 repository/enterprise-agent-lab/,默认只使用合成数据,不连接真实生产控制系统。

1.2 必备功能

  • 登录身份与角色权限;
  • RAG 检索与来源引用;
  • 至少三个 Tool;
  • 至少两个专业 Agent 和一个协调者;
  • 写操作人工确认;
  • 检查点、失败恢复和幂等;
  • 离线评估集与在线审计日志;
  • 成本、延迟、安全和拒答指标;
  • 部署、健康检查和回滚说明。

1.3 明确边界

系统不自动执行高风险设备控制,不替代专业医疗或法律决策,不允许模型绕过权限。无可靠证据时必须拒答或转人工。

2. 应用案例:可运行项目步骤

repository/enterprise-agent-lab/ 目录执行:

python -m unittest discover -s tests -v
python -m app.cli --question "设备 P-100 温度 88 度,应该怎么处理?" --user employee-001
python -m app.cli --question "请创建一个维修工单" --user employee-001 --approve
python -m app.cli --multi-agent --question "设备 P-100 最近有哪些类似故障?" --user manager-001

先确认第一个命令通过,再观察高风险请求的 need_approval,最后检查带相同 request_id 的重复请求是否返回同一工单。HTTP 服务、systemd、Nginx 和服务器安全边界见项目 DEPLOY.md

from app.agent import EnterpriseAgent
from app.schemas import Request

result = EnterpriseAgent().run(
    Request(user_id="employee-001", question="设备 P-100 温度 88 度,应该怎么处理?")
)
assert result["status"] == "need_approval"
assert result["evidence"]
综合验收
  • 每条回答都能回指文档 ID、版本和证据片段。
  • 没有证据、权限不足、高风险写操作和重复请求时,系统都返回可解释的非成功状态。
  • 所有写工具都具备服务端授权、人工审批、幂等键和审计事件。
  • 测试、README、部署文件和版本信息足以让另一台机器复现。

3. 交付工作流

阶段输入产物必须验证
需求与边界业务目标、风险、角色用例、禁止事项、成功指标明确哪些动作必须人工确认
基线实现合成数据、标准库代码Agent Loop、工具和测试无 API Key 可复现
模型/框架适配固定评估集、模型配置模型适配器、编排图、版本锁定与基线逐项 A/B 对比
安全与集成身份、API、数据库权限、超时、重试、审计和降级故障注入后不越权、不重复写
部署与运营构建产物、服务器配置CI/CD、Nginx、systemd、回滚记录健康检查、日志脱敏、回滚成功

3.1 评估集设计

至少覆盖正常问题、边界值、无答案、过期文档、权限不足、提示注入、工具超时、重复写入和人工审批。每条样例包含输入、允许引用、期望状态、禁止动作和评估理由。

3.2 指标

类别指标
任务成功率、人工升级率、完成时延
RAGRecall@K、MRR、证据正确率、拒答率
工具成功率、P95 延迟、重试率、幂等冲突
安全越权阻断率、注入阻断率、敏感字段泄露率
运营单任务成本、错误预算、Bad Case 修复周期

4. 质量门禁

每章和综合项目必须有学习目标、核心图、概念解释、代码、运行步骤、企业项目、验收标准、自测题和可靠来源。提交前执行:

python -m compileall examples scripts repository/enterprise-agent-lab
python scripts/course_review.py
npm run build

禁止提交 API Key、真实个人或企业数据、未经来源支撑的结论和无法复现的截图 Demo。

5. 部署、运营与答辩

5.1 网站自动部署

本站是 Astro 静态站点,npm run build 生成 dist/。GitHub Actions 在 push 到 main 后完成依赖安装、Python 检查、课程结构检查和 Astro 构建,再通过 SSH/rsync 将 dist/ 发布到服务器。完整文件和只需替换服务器 IP、SSH 端口、用户和密钥的步骤见根目录 docs/DEPLOY_GITHUB_SERVER.md

5.2 答辩顺序

  1. 业务痛点、人工流程基线和不使用 Agent 的对照;
  2. 需求、边界、架构、数据流、权限流和异常流;
  3. 一次完整 Trace:检索证据、工具调用、审批、结果和审计;
  4. 正常、失败、越权和重复请求的评估结果;
  5. 成本、延迟、回滚、数据保留和下一步改造。

6. 评分量规

维度权重优秀标准
问题与价值10%场景真实,基线与收益可量化
架构与边界15%Agent、Workflow、Tool 选择合理,边界清楚
数据与 RAG15%数据可追踪,检索有标注评估和权限
Tool 与集成15%Schema、鉴权、超时、幂等、审计完整
编排与恢复10%状态可验收,失败恢复和人工升级合理
评估与测试15%正常和对抗样例齐全,结果可复现
安全与合规10%最小权限、注入防护、敏感数据治理明确
工程交付10%可运行、可部署、文档清楚、版本可追踪

6.1 不合格红线

  • 密钥或真实业务数据提交到代码仓库;
  • 高风险写操作没有人工确认;
  • 无来源却生成确定性业务结论;
  • 无法说明数据来源、用户权限和日志保留;
  • 只展示成功 Demo,没有测试、评估和回滚记录。

7. 可靠参考、论文、代码与部署参考