《大模型实战》第 10/10 篇
上篇:本地大模型 + Ollama
下篇预告:《MCP 工具箱》系列(筹备中)

Demo 里 Agent 能跑通一条 Happy Path,不代表能扛真实用户、真实脏数据、真实账单。

本篇是《大模型实战》收官:把 Demo 与生产的差距30 天演进路线20 项上线 Checklist常见翻车场景全系列复盘 一次收拢。你可以把这篇当「上线前最后一遍对照表」。

你将学到

  • Demo 与生产在稳定性、成本、安全上的核心差距
  • 30 天四阶段演进路线(验证 → 工程 → 治理 → 上线)
  • 20 项上线 Checklist(可直接打勾)
  • 六个高频翻车场景与应对
  • 本系列 10 篇知识地图
  • 下一系列方向预告

一、Demo 与生产:差的不只是「加机器」

维度 Demo 生产
输入 干净、短、配合 长、脏、对抗、多轮
失败 刷新重来 要降级、要解释、要工单
成本 不计 预算、路由、熔断
安全 默认信任 注入、越权、审计
观测 print 调试 trace、指标、告警
变更 改 Prompt 即发布 版本、回滚、灰度

一句话:生产 = 能力 × 可靠性 × 可观测 × 可治理。

二、30 天演进路线

Week 1:验证价值(别急着上 Agent)

目标:证明「这条链路值得产品化」,而不是证明「模型很炫」。

  • [ ] 选 1 个窄场景(如:制度问答、工单分类、代码审查辅助)
  • [ ] 30~50 条真实样本 + 人工标注期望
  • [ ] 确定停在 Prompt / RAG / Tool / Agent 哪一层(第 2 篇)
  • [ ] 记录基线:准确率、延迟、单次成本
  • [ ] 找 3 个「必失败」样例,看能否优雅降级

产出:一页纸 Go/No-Go 决策 + 基线数字。

Week 2:工程化(从脚本到服务)

目标:可重复部署、可并发、可超时。

  • [ ] API 网关:鉴权、限流、request_id
  • [ ] 异步长任务(Agent 多步)+ 进度查询
  • [ ] 检索 / Tool 超时与重试策略(第 5 篇)
  • [ ] 配置外置:模型名、Prompt 版本、TopK
  • [ ] 开发 / 预发 / 生产环境隔离

产出:可部署的服务 + 基础集成测试。

Week 3:治理(成本、安全、质量)

目标:钱、风险、质量三条线可控。

  • [ ] 模型路由与 Token 预算(第 7 篇)
  • [ ] Tool 权限矩阵 + 写操作确认(第 8 篇)
  • [ ] RAG 评测集回归(第 3 篇)
  • [ ] 全链路 trace + 关键指标看板
  • [ ] 敏感数据分级与出域策略(第 9 篇)

产出:治理 Runbook + 告警规则。

Week 4:上线与演进

目标:小流量真实用户,快速迭代。

  • [ ] 5%~10% 灰度或内部 dogfood
  • [ ] 反馈入口(点赞/点踩/纠错)
  • [ ] 每周评测回归 + Prompt/检索变更记录
  • [ ] 事故演练:模型 429、检索空、Tool 500
  • [ ] 文档:用户须知 + 内部 on-call

产出:上线报告 + 下一季度路线图。

三、20 项上线 Checklist

功能与质量(6)

  1. [ ] 核心场景评测集 ≥ 50 条,近一周回归通过
  2. [ ] 空检索 / 低置信度有明确用户提示
  3. [ ] 多轮对话上下文有上限与摘要策略
  4. [ ] 输出格式异常有解析兜底
  5. [ ] 引用来源可点击、可核对(RAG 场景)
  6. [ ] 「不知道」优于胡编——faithfulness 抽检达标

性能与可靠性(5)

  1. [ ] P95 端到端延迟有 SLA(如 < 8s 首 token)
  2. [ ] 依赖超时、重试、熔断已配置
  3. [ ] 峰值 QPS 压测过,无内存泄漏
  4. [ ] 模型/API 故障有降级路径(换模型 / 缓存 / 静态 FAQ)
  5. [ ] 长 Agent 任务可取消、可续跑或幂等

成本(3)

  1. [ ] 单会话 / 单用户 Token 上限
  2. [ ] 模型路由生效,简单问小模型
  3. [ ] 月预算告警与自动熔断策略

安全与合规(4)

  1. [ ] Tool 服务端权限校验,非仅 Prompt 约束
  2. [ ] 间接注入测试用例通过
  3. [ ] 日志不含密钥、完整 PII
  4. [ ] 数据保留策略与用户删除流程

运维与变更(2)

  1. [ ] Prompt / 索引 / 模型版本可回滚
  2. [ ] on-call 手册:谁看告警、如何查 trace、如何切路由

四、六个常见翻车场景

1. 「能 Demo」≠「能答对」

现象:领导问的那几条都对,用户一问就废。
根因:无评测集、过拟合 Prompt。
:Week 1 基线 + 每周回归。

2. RAG 召回看似有,答案仍胡编

现象:引用列表很长,内容不对题。
根因:分块差、无 Rerank、上下文堆砌。
:第 3 篇链路 + Recall@K 监控。

3. Agent 越调 Tool 越多,账单爆炸

现象:一次对话 20 次 tool call。
根因:无步数上限、无路由、Planner 过激进。
:max_steps、工具合并、小模型前置分类。

4. 上线一周被 Prompt 注入搞崩

现象:用户让 Agent 发邮件、导数据。
根因:写操作无确认、Tool 权限过大。
:第 8 篇清单 + 红队测试。

5. 换模型后全线退化

现象:新模型「更聪明」但 Tool JSON 经常坏。
根因:无契约测试、绑定单模型行为。
:Tool 调用 golden test + 多模型 CI。

6. 没人能复盘线上 bad case

现象:用户投诉,查不到当时检索了什么。
根因:无 trace、日志打不全。
:request_id 贯穿检索 / LLM / Tool。

五、本系列 10 篇复盘

标题 你应带走的一句话
1 大模型格局一张图 先场景,再模型;先总成本,再 benchmark
2 四层架构 Prompt / RAG / Tool / Agent 分层演进
3 RAG 切好 → 找准 → 排对 → 测到
4 MCP 工具标准化,Host-Client-Server 边界清晰
5 Tool Calling Schema 精简、执行沙箱、失败可恢复
6 多 Agent 编排有模式,成本有上限
7 成本治理 路由、缓存、预算、熔断
8 Agent 安全 注入、权限、沙箱、审计
9 本地 + Ollama 混合路由,本地补合规与成本
10 Demo → 生产(本篇) 30 天路线 + 20 项清单

六、下一系列预告

《大模型实战》收在这里。如果你已跟着走完 10 篇,下一程建议:

系列 聚焦 适合谁
《MCP 工具箱》 10+ 可复用 MCP Server(Git、DB、发布、监控) 要把 Agent 接到真实工作流
《AI 全栈项目从 0 到 1》 一个完整产品:前端 + RAG + Agent + 部署 要交付可演示的作品集

也可以回到业务:选一条你最痛的链路,用本篇 20 项清单做一遍上线前审计。

踩坑清单

  1. Demo 指标当生产 SLO:单次 happy path 延迟 ≠ P95 / 错误预算。
  2. Week 1 就上多 Agent:先单链路跑通评测,再拆角色。
  3. 没有 Kill Switch:出事故不能秒切降级或关工具。
  4. 成本与安全拖到最后一周:两者应在 Week 3 并行治理,不是上线当天补。
  5. Checklist 勾了但没演练:Runbook 要至少做一次故障演练。

小结

从 Demo 到生产,记住四句话:

  1. Week 1 验证价值,别跳过评测
  2. Week 2 工程化,超时、限流、版本一个不能少
  3. Week 3 治理,成本、安全、质量三线并行
  4. Week 4 小流量上线,带着 Checklist 和 Runbook

10 篇读完,你应有的是一张地图,而不是一堆散点技巧。接下来,选一条链路,真的把它上线。


系列完结 — 感谢跟进《大模型实战》全部 10 篇。

系列导航
第 1 篇:2026 大模型格局一张图 · 第 2 篇:Prompt 到 Agent 四层架构 · 第 3 篇:RAG 还值不值得做 · 第 4 篇:MCP 协议实战 · 第 5 篇:Tool Calling 工程化 · 第 6 篇:多 Agent 协作 · 第 7 篇:大模型成本治理 · 第 8 篇:Agent 安全 · 第 9 篇:本地大模型 + Ollama · 第 10 篇:从 Demo 到生产(本篇)

Logo

欢迎加入 MCP 技术社区!与志同道合者携手前行,一同解锁 MCP 技术的无限可能!

更多推荐