从 Demo 到生产:Agent 上线清单与 30 天演进
《大模型实战》第 10/10 篇
上篇:本地大模型 + Ollama
下篇预告:《MCP 工具箱》系列(筹备中)
Demo 里 Agent 能跑通一条 Happy Path,不代表能扛真实用户、真实脏数据、真实账单。
本篇是《大模型实战》收官:把 Demo 与生产的差距、30 天演进路线、20 项上线 Checklist、常见翻车场景 和 全系列复盘 一次收拢。你可以把这篇当「上线前最后一遍对照表」。
你将学到
- Demo 与生产在稳定性、成本、安全上的核心差距
- 30 天四阶段演进路线(验证 → 工程 → 治理 → 上线)
- 20 项上线 Checklist(可直接打勾)
- 六个高频翻车场景与应对
- 本系列 10 篇知识地图
- 下一系列方向预告
一、Demo 与生产:差的不只是「加机器」
| 维度 | Demo | 生产 |
|---|---|---|
| 输入 | 干净、短、配合 | 长、脏、对抗、多轮 |
| 失败 | 刷新重来 | 要降级、要解释、要工单 |
| 成本 | 不计 | 预算、路由、熔断 |
| 安全 | 默认信任 | 注入、越权、审计 |
| 观测 | print 调试 | trace、指标、告警 |
| 变更 | 改 Prompt 即发布 | 版本、回滚、灰度 |
一句话:生产 = 能力 × 可靠性 × 可观测 × 可治理。
二、30 天演进路线
Week 1:验证价值(别急着上 Agent)
目标:证明「这条链路值得产品化」,而不是证明「模型很炫」。
- [ ] 选 1 个窄场景(如:制度问答、工单分类、代码审查辅助)
- [ ] 30~50 条真实样本 + 人工标注期望
- [ ] 确定停在 Prompt / RAG / Tool / Agent 哪一层(第 2 篇)
- [ ] 记录基线:准确率、延迟、单次成本
- [ ] 找 3 个「必失败」样例,看能否优雅降级
产出:一页纸 Go/No-Go 决策 + 基线数字。
Week 2:工程化(从脚本到服务)
目标:可重复部署、可并发、可超时。
- [ ] API 网关:鉴权、限流、request_id
- [ ] 异步长任务(Agent 多步)+ 进度查询
- [ ] 检索 / Tool 超时与重试策略(第 5 篇)
- [ ] 配置外置:模型名、Prompt 版本、TopK
- [ ] 开发 / 预发 / 生产环境隔离
产出:可部署的服务 + 基础集成测试。
Week 3:治理(成本、安全、质量)
目标:钱、风险、质量三条线可控。
- [ ] 模型路由与 Token 预算(第 7 篇)
- [ ] Tool 权限矩阵 + 写操作确认(第 8 篇)
- [ ] RAG 评测集回归(第 3 篇)
- [ ] 全链路 trace + 关键指标看板
- [ ] 敏感数据分级与出域策略(第 9 篇)
产出:治理 Runbook + 告警规则。
Week 4:上线与演进
目标:小流量真实用户,快速迭代。
- [ ] 5%~10% 灰度或内部 dogfood
- [ ] 反馈入口(点赞/点踩/纠错)
- [ ] 每周评测回归 + Prompt/检索变更记录
- [ ] 事故演练:模型 429、检索空、Tool 500
- [ ] 文档:用户须知 + 内部 on-call
产出:上线报告 + 下一季度路线图。
三、20 项上线 Checklist
功能与质量(6)
- [ ] 核心场景评测集 ≥ 50 条,近一周回归通过
- [ ] 空检索 / 低置信度有明确用户提示
- [ ] 多轮对话上下文有上限与摘要策略
- [ ] 输出格式异常有解析兜底
- [ ] 引用来源可点击、可核对(RAG 场景)
- [ ] 「不知道」优于胡编——faithfulness 抽检达标
性能与可靠性(5)
- [ ] P95 端到端延迟有 SLA(如 < 8s 首 token)
- [ ] 依赖超时、重试、熔断已配置
- [ ] 峰值 QPS 压测过,无内存泄漏
- [ ] 模型/API 故障有降级路径(换模型 / 缓存 / 静态 FAQ)
- [ ] 长 Agent 任务可取消、可续跑或幂等
成本(3)
- [ ] 单会话 / 单用户 Token 上限
- [ ] 模型路由生效,简单问小模型
- [ ] 月预算告警与自动熔断策略
安全与合规(4)
- [ ] Tool 服务端权限校验,非仅 Prompt 约束
- [ ] 间接注入测试用例通过
- [ ] 日志不含密钥、完整 PII
- [ ] 数据保留策略与用户删除流程
运维与变更(2)
- [ ] Prompt / 索引 / 模型版本可回滚
- [ ] on-call 手册:谁看告警、如何查 trace、如何切路由
四、六个常见翻车场景
1. 「能 Demo」≠「能答对」
现象:领导问的那几条都对,用户一问就废。
根因:无评测集、过拟合 Prompt。
解:Week 1 基线 + 每周回归。
2. RAG 召回看似有,答案仍胡编
现象:引用列表很长,内容不对题。
根因:分块差、无 Rerank、上下文堆砌。
解:第 3 篇链路 + Recall@K 监控。
3. Agent 越调 Tool 越多,账单爆炸
现象:一次对话 20 次 tool call。
根因:无步数上限、无路由、Planner 过激进。
解:max_steps、工具合并、小模型前置分类。
4. 上线一周被 Prompt 注入搞崩
现象:用户让 Agent 发邮件、导数据。
根因:写操作无确认、Tool 权限过大。
解:第 8 篇清单 + 红队测试。
5. 换模型后全线退化
现象:新模型「更聪明」但 Tool JSON 经常坏。
根因:无契约测试、绑定单模型行为。
解:Tool 调用 golden test + 多模型 CI。
6. 没人能复盘线上 bad case
现象:用户投诉,查不到当时检索了什么。
根因:无 trace、日志打不全。
解:request_id 贯穿检索 / LLM / Tool。
五、本系列 10 篇复盘
| 篇 | 标题 | 你应带走的一句话 |
|---|---|---|
| 1 | 大模型格局一张图 | 先场景,再模型;先总成本,再 benchmark |
| 2 | 四层架构 | Prompt / RAG / Tool / Agent 分层演进 |
| 3 | RAG | 切好 → 找准 → 排对 → 测到 |
| 4 | MCP | 工具标准化,Host-Client-Server 边界清晰 |
| 5 | Tool Calling | Schema 精简、执行沙箱、失败可恢复 |
| 6 | 多 Agent | 编排有模式,成本有上限 |
| 7 | 成本治理 | 路由、缓存、预算、熔断 |
| 8 | Agent 安全 | 注入、权限、沙箱、审计 |
| 9 | 本地 + Ollama | 混合路由,本地补合规与成本 |
| 10 | Demo → 生产(本篇) | 30 天路线 + 20 项清单 |
六、下一系列预告
《大模型实战》收在这里。如果你已跟着走完 10 篇,下一程建议:
| 系列 | 聚焦 | 适合谁 |
|---|---|---|
| 《MCP 工具箱》 | 10+ 可复用 MCP Server(Git、DB、发布、监控) | 要把 Agent 接到真实工作流 |
| 《AI 全栈项目从 0 到 1》 | 一个完整产品:前端 + RAG + Agent + 部署 | 要交付可演示的作品集 |
也可以回到业务:选一条你最痛的链路,用本篇 20 项清单做一遍上线前审计。
踩坑清单
- Demo 指标当生产 SLO:单次 happy path 延迟 ≠ P95 / 错误预算。
- Week 1 就上多 Agent:先单链路跑通评测,再拆角色。
- 没有 Kill Switch:出事故不能秒切降级或关工具。
- 成本与安全拖到最后一周:两者应在 Week 3 并行治理,不是上线当天补。
- Checklist 勾了但没演练:Runbook 要至少做一次故障演练。
小结
从 Demo 到生产,记住四句话:
- Week 1 验证价值,别跳过评测
- Week 2 工程化,超时、限流、版本一个不能少
- Week 3 治理,成本、安全、质量三线并行
- Week 4 小流量上线,带着 Checklist 和 Runbook
10 篇读完,你应有的是一张地图,而不是一堆散点技巧。接下来,选一条链路,真的把它上线。
系列完结 — 感谢跟进《大模型实战》全部 10 篇。
系列导航
第 1 篇:2026 大模型格局一张图 · 第 2 篇:Prompt 到 Agent 四层架构 · 第 3 篇:RAG 还值不值得做 · 第 4 篇:MCP 协议实战 · 第 5 篇:Tool Calling 工程化 · 第 6 篇:多 Agent 协作 · 第 7 篇:大模型成本治理 · 第 8 篇:Agent 安全 · 第 9 篇:本地大模型 + Ollama · 第 10 篇:从 Demo 到生产(本篇)
更多推荐


所有评论(0)