评测体系怎么交付?四件套 + 迁移指南------模块一收官(E05)
系列《AI 应用生产化手册》第 5 篇(共 30 篇)|配套开源项目:github.com/ChenYingbo/...
一、先看问题:"自己能用"≠"交付能用"
E01-E04 学完,手里有:30 条评测集、DeepEval 执行器、三层门禁------但它们散落在各处:
- 同事问"你们的评测体系是什么",你只能现场演示,拿不出一份文档。
- 换一个新项目,评测集、阈值、模型全要重来,没有"迁移清单"。
- 评测报告格式每次都不一样,没法跨版本对比。
解法:把散件打包成"评测体系交付包"------一份文档定义指标,一份模板统一报告,一份迁移指南让体系可复制。
核心认知:技术债的终点是"能交付"。评测体系的价值不在你写出了代码,而在别人(包括三个月后的你)能照着文档把它用起来。
二、原理:交付包四件套
| 件 | 回答什么问题 | 来源 |
|---|---|---|
| ① 指标定义 | "什么叫答得好?" | E01 指标体系 → 落成文档 |
| ② 评测集 | "拿什么测?" | E02 30 条评测集 + 黄金集规则 |
| ③ 执行与门禁 | "怎么测、怎么拦?" | E03 runner + E04 三层门禁 |
| ④ 报告模板 | "结果怎么呈现、怎么读?" | 本篇新增 |
缺任何一件,体系都不完整:没指标文档 = 评分标准靠记忆;没报告模板 = 结果没法跨版本比较。
度量驱动的改进闭环(评测体系的终极用法)
评测(跑黄金集)→ 定位(报告按 category 分域)→ 修复 → 复测(对比通过率)→ 循环
评测不是终点,是改进的导航。 没有评测,改进全靠猜;有了评测,每次改动都有"升降级"证据。
可迁移性:三个"参数化"
| 参数 | 新项目怎么换 |
|---|---|
| 评测集 | 换内容,保持结构(6 类 + 边界 ≥20%) |
| 阈值 | 重新跑基线再定,禁止沿用 |
| judge 模型 / 被测接口 | 改配置 / 改 ask_app() 一行 |
迁移指南的本质:说清楚"什么可以抄、什么必须重来"。 只给代码不给指南的交付包 = 半个交付包。
三、动手:交付包清单(GitHub 仓库里全都有)
bash
git clone https://github.com/ChenYingbo/ai-prod-demo.git && cd ai-prod-demo
交付包结构(对照 eval/README.md):
bash
├── eval/README.md # ①评测体系文档(指标/评测集/执行/门禁/报告/迁移)
├── eval/e02_eval_set.json # ②评测集(30 条)
├── evals/run_evals.py # ③执行器
├── tests/ + .github/workflows/ # ③门禁
└── eval/reports/template.md # ④报告模板
验证"照着文档能跑通":
bash
source .venv/bin/activate
pytest -q tests/ # ① 代码门禁:125 passed
python -m evals.run_evals --dry-run # ② 结构门禁:30 条校验通过
迁移演练(动手写你的迁移计划)
挑一个真实/想象中的新场景(如"公司内部文档问答助手"),回答三问:
- 评测集:你的业务有哪些问题类型?6 类结构还适用吗?边界 case 想加哪几条?
- 阈值:你会怎么跑基线?打算定多少?(先跑 5 次,中位数 - 容差)
- judge:用哪个模型当裁判?为什么?(judge ≠ 被测模型)
报告模板演练
拿一次真实评测报告(配套项目实测 29/30)套进 eval/reports/template.md,回答:
- 总览通过率多少?过没过门禁?(0.97 ≥ 0.8 ✅)
- 退化集中在哪一类?对应哪个行动项?
四、踩坑记录
- 交付包只有代码没有文档:三个月后自己都看不懂"阈值为什么是 0.8"------文档是交付物的一部分
- 报告模板和评测集脱节:报告分类和评测集 category 对不上,无法定位------模板字段必须一一对应
- 阈值写死不说明:0.8 怎么来的?不写"基线+容差"推导,换个人接手就乱调
- 评测体系是一次性的:黄金集锁死 ≠ 不维护;演进集要持续扩充(P30 数据飞轮)
- 迁移时全盘照抄:评测集内容、阈值、judge 全部照搬旧项目------迁移指南明确"什么必须重来"
- 不写"如何读报告":报告生成了没人会解读,等于白跑------模板里带解读方法和行动项
五、模块一小结(评测工程 5 篇收官)
- E01 为什么评测是第一生产力 → E02 评测集构建 → E03 判分器(0/30→29/30 校准实录)→ E04 回归门禁 → E05 交付包
- 一条主线:从"能度量"到"能交付"------评测体系包可直接迁移到任何新 AI 项目
明天(O01):进入模块二《为什么要追踪 AI 应用》------从"离线评测"到"线上可观测"。 收藏 + 关注,每天一篇,30 天把 AI 应用送上生产。