从 POC 到上线,AI 应用差的不只是代码
30 篇《AI 应用生产化手册》免费连载 · 配套开源项目可跑 仓库:github.com/ChenYingbo/...
先看三个每天都在发生的场景
- 客服 Agent 上线两周,没人敢改提示词------改好了还是改坏了,没有证据。
- 模型 API 深夜 502,用户全挂------降级、熔断、回滚,一样都没有。
- 月底账单 8 万------每个请求花多少钱,没人算得清。
2025 年大家都在做 AI 应用 POC,2026 年卡住所有人的是同一件事:
怎么把"能跑"变成"敢上线、能运维、会迭代"。
市面上的内容要么教"怎么搭"(已经泛滥到割韭菜),要么是零散技巧文(评测、可观测、网关各讲各的)。缺一套完整、免费、动手、贯穿项目的中文体系------这个系列就是来补空白的。
这个系列有什么不一样
- 30 篇完整体系,7 大模块严格递进:评测 → 可观测 → 上线治理 → 成本与网关 → 安全护栏 → 架构韧性 → 贯穿案例。每篇都是前一篇的地基,不是 30 个零散知识点。
- 每个知识点都动手跑通 :配套贯穿项目
ai-prod-demo(FastAPI + LiteLLM + Langfuse + DeepEval),36 次提交、125 个测试全绿。 - 全部真实数据说话(DeepSeek 实测):
| 上线目标 | 实测 |
|---|---|
| 黄金集通过率 ≥ 80% | 97%(30 题真实评测) |
| 延迟 P95 ≤ 5s | 4.5s(并发 6 + 应用限流) |
| 错误率 ≤ 5% | 0%(压测 100% 成功) |
| 成本 ≤ 0.01 元/请求 | 0.001 元/请求 |
| 注入攻击拦截 | 8/8 |
- 踩坑实录,不藏私:deepeval 4.x API 说变就变、LiteLLM 虚拟 Key 必须 PostgreSQL、PII 脱敏正则顺序错会"只剩半张身份证"、"安全拒答被判错"的评测校准......全是我们真实踩过、修过、写下来的。
30 篇地图
| 模块 | 篇目 | 一句话 |
|---|---|---|
| ① 评测工程 | E01-E05 | 评测集 → 判分器 → CI 门禁 → 评测体系包 |
| ② 可观测性 | O01-O04 | 日志 → trace → 指标 → 排障 SOP |
| ③ 上线治理 | R01-R04 | 提示词即代码 → 灰度 → A/B → 回滚降级 |
| ④ 成本与网关 | C01-C05 | 成本模型 → 缓存 → 路由 → 网关 → 厂商可移植 |
| ⑤ 安全护栏 | S01-S04 | 威胁模型 → 注入 → 权限 → PII 合规 |
| ⑥ 架构韧性 | A01-A04 | 超时重试 → 熔断 → 流式 → 人机协同 |
| ⑦ 贯穿案例 | P01-P04 | 项目定义 → 上线前夜 → 灰度上线 → 数据飞轮 |
30 秒快速体验
bash
git clone https://github.com/ChenYingbo/ai-prod-demo.git && cd ai-prod-demo
cp .env.example .env # 填 DEEPSEEK_API_KEY
docker compose up -d postgres langfuse litellm
pip install -r requirements.txt
uvicorn app.main:app --port 8000
# 问它一个问题
curl -X POST http://localhost:8000/api/chat \
-H "Content-Type: application/json" -d '{"question":"什么是 RAG?"}'
跑起来你就能看到:评测门禁、request_id 日志、Langfuse trace、降级链、缓存、注入拦截、熔断、SSE 流式------这个系列讲的每一件事,都在项目里真实存在。
适合谁
- 会 Python、做过 AI 应用 POC、卡在"上线"环节的工程师
- 用 LangChain/LangGraph 但不懂底层可靠性的开发者
- 需要把 AI 应用推向生产的架构师 / 技术负责人
更新节奏
每天一篇。每篇附 GitHub 仓库对应代码。
下一篇:E01《评测为什么是第一生产力》------为什么没有评测,你就不敢改任何东西。 收藏 + 关注,别迷路。