评测体系怎么交付?四件套 + 迁移指南——模块一收官(E05)

评测体系怎么交付?四件套 + 迁移指南------模块一收官(E05)

系列《AI 应用生产化手册》第 5 篇(共 30 篇)|配套开源项目:github.com/ChenYingbo/...

一、先看问题:"自己能用"≠"交付能用"

E01-E04 学完,手里有:30 条评测集、DeepEval 执行器、三层门禁------但它们散落在各处

  1. 同事问"你们的评测体系是什么",你只能现场演示,拿不出一份文档。
  2. 换一个新项目,评测集、阈值、模型全要重来,没有"迁移清单"。
  3. 评测报告格式每次都不一样,没法跨版本对比。

解法:把散件打包成"评测体系交付包"------一份文档定义指标,一份模板统一报告,一份迁移指南让体系可复制。

核心认知:技术债的终点是"能交付"。评测体系的价值不在你写出了代码,而在别人(包括三个月后的你)能照着文档把它用起来。

二、原理:交付包四件套

回答什么问题 来源
① 指标定义 "什么叫答得好?" E01 指标体系 → 落成文档
② 评测集 "拿什么测?" E02 30 条评测集 + 黄金集规则
③ 执行与门禁 "怎么测、怎么拦?" E03 runner + E04 三层门禁
④ 报告模板 "结果怎么呈现、怎么读?" 本篇新增

缺任何一件,体系都不完整:没指标文档 = 评分标准靠记忆;没报告模板 = 结果没法跨版本比较。

度量驱动的改进闭环(评测体系的终极用法)

复制代码
评测(跑黄金集)→ 定位(报告按 category 分域)→ 修复 → 复测(对比通过率)→ 循环

评测不是终点,是改进的导航。 没有评测,改进全靠猜;有了评测,每次改动都有"升降级"证据。

可迁移性:三个"参数化"

参数 新项目怎么换
评测集 换内容,保持结构(6 类 + 边界 ≥20%)
阈值 重新跑基线再定,禁止沿用
judge 模型 / 被测接口 改配置 / 改 ask_app() 一行

迁移指南的本质:说清楚"什么可以抄、什么必须重来"。 只给代码不给指南的交付包 = 半个交付包。

三、动手:交付包清单(GitHub 仓库里全都有)

bash 复制代码
git clone https://github.com/ChenYingbo/ai-prod-demo.git && cd ai-prod-demo

交付包结构(对照 eval/README.md):

bash 复制代码
├── eval/README.md               # ①评测体系文档(指标/评测集/执行/门禁/报告/迁移)
├── eval/e02_eval_set.json       # ②评测集(30 条)
├── evals/run_evals.py           # ③执行器
├── tests/ + .github/workflows/  # ③门禁
└── eval/reports/template.md     # ④报告模板

验证"照着文档能跑通":

bash 复制代码
source .venv/bin/activate
pytest -q tests/                    # ① 代码门禁:125 passed
python -m evals.run_evals --dry-run # ② 结构门禁:30 条校验通过

迁移演练(动手写你的迁移计划)

挑一个真实/想象中的新场景(如"公司内部文档问答助手"),回答三问:

  1. 评测集:你的业务有哪些问题类型?6 类结构还适用吗?边界 case 想加哪几条?
  2. 阈值:你会怎么跑基线?打算定多少?(先跑 5 次,中位数 - 容差)
  3. judge:用哪个模型当裁判?为什么?(judge ≠ 被测模型)

报告模板演练

拿一次真实评测报告(配套项目实测 29/30)套进 eval/reports/template.md,回答:

  • 总览通过率多少?过没过门禁?(0.97 ≥ 0.8 ✅)
  • 退化集中在哪一类?对应哪个行动项?

四、踩坑记录

  1. 交付包只有代码没有文档:三个月后自己都看不懂"阈值为什么是 0.8"------文档是交付物的一部分
  2. 报告模板和评测集脱节:报告分类和评测集 category 对不上,无法定位------模板字段必须一一对应
  3. 阈值写死不说明:0.8 怎么来的?不写"基线+容差"推导,换个人接手就乱调
  4. 评测体系是一次性的:黄金集锁死 ≠ 不维护;演进集要持续扩充(P30 数据飞轮)
  5. 迁移时全盘照抄:评测集内容、阈值、judge 全部照搬旧项目------迁移指南明确"什么必须重来"
  6. 不写"如何读报告":报告生成了没人会解读,等于白跑------模板里带解读方法和行动项

五、模块一小结(评测工程 5 篇收官)

  • E01 为什么评测是第一生产力 → E02 评测集构建 → E03 判分器(0/30→29/30 校准实录)→ E04 回归门禁 → E05 交付包
  • 一条主线:从"能度量"到"能交付"------评测体系包可直接迁移到任何新 AI 项目

明天(O01):进入模块二《为什么要追踪 AI 应用》------从"离线评测"到"线上可观测"。 收藏 + 关注,每天一篇,30 天把 AI 应用送上生产。

相关推荐
秦先生在广东2 小时前
Anthropic Agent Skills 开源发布:Claude 技能系统的定义与扩展指南
人工智能
147API2 小时前
蒸馏模型上线后怎样设置教师回退,避免失败请求反复烧钱
大数据·人工智能·深度学习·机器学习·蒸馏
aaajavac2 小时前
让本地 AI Agent 通过 MCP 协议操控浏览器:Browser Copilot 实战指南
人工智能·copilot·开发工具
2301_768103492 小时前
AI视频创作Agent实战05:Wan场景融合与VideoRetalk口型驱动
人工智能·音视频
软件技术新观察2 小时前
企业数字化开发科普:软件定制、小程序、APP 开发全解析
人工智能·小程序
她的男孩2 小时前
AI 写完 100 万行代码没人 Review,我做了一件事:把 AI 写的代码管起来了
java·人工智能·程序员
差不多的周周2 小时前
《MoChat:面向多转弯动作理解和描述的关节分组时空接地多通道大语言模型》论文核心部分详解
人工智能·深度学习·机器学习·计算机视觉·语言模型·自然语言处理
jimmyleeee2 小时前
大模型安全之七:LLM系统提示词泄露
人工智能·安全
RobinDevNotes2 小时前
为什么AI训练工程师都要懂NCCL
人工智能