📚前言
系统学习提示词,内容大纲如下:
前导课程:
--*-*-*-- 进阶--*-*-*--
AI提示词工程(进阶)第7课:角色设定与身份模拟-CSDN博客
AI提示词工程(进阶)第9课:思维链提示(Chain of Thought)-CSDN博客
AI提示词工程(进阶)第10课:思维树与元提示(ToT & Meta Prompting)-CSDN博客
AI提示词工程(进阶)第12课:多轮对话与上下文管理-CSDN博客
AI提示词工程(进阶)第13课:提示词安全与边界-CSDN博客
AI提示词工程(进阶)第14课:主流模型特性差异与工具选型(进阶阶段总结)-CSDN博客
--*-*-*-- 高阶--*-*-*--
AI提示词工程(高阶)第15课:ReAct模式与工具调用-CSDN博客
AI提示词工程(高阶)第16课:自主Agent设计原理-CSDN博客
AI提示词工程(高阶)第17课:RAG与知识库增强提示-CSDN博客
第19课:提示词评估与A/B测试
📌 一句话目标:建立提示词质量的量化评估体系,用数据驱动的方式持续优化提示词效果,告别"凭感觉瞎调"。
💬 第18课咱学会了"让AI看图"。第19课来看一个"用数据说话"的话题------提示词评估与A/B测试。这课特别适合"较真"的人------不想凭感觉调提示词,想用数据说话。内容有点"工程化",但别怕,咱从"评估维度"讲起,一步步建立你的评估体系。
🖥️ 开场:你的提示词到底好不好?
学了这么多技巧,你可能会问:
"我怎么知道我的提示词到底好不好?"
大多数人靠"感觉":
- 感觉这次回答不错 → 提示词好
- 感觉这次回答拉胯 → 提示词差
但"感觉"靠不住。 同一个提示词,这次好、下次差,你分不清是"提示词的问题"还是"AI随机性"。
真正的做法,是量化评估:
- 给输出打分(准确性、相关性、完整性......)
- 批量测试(跑100条,看平均分)
- A/B对比(两个版本,看哪个胜率高)
这节课,咱就来建立这套"评估体系"。
💬 一句话先记住:提示词优化不是"玄学",是"科学"------用数据说话,而不是凭感觉。 评估体系就是你的"仪表盘"。
一、评估维度定义:从哪些角度打分?
💬 这节是"打分标准"------先定标准,才能打分。五个维度,覆盖了提示词质量的方方面面。
📌 五个核心维度
| 维度 | 大白话 | 打分要点 |
|---|---|---|
| 准确性 | 答得对不对 | 事实是否有误、逻辑是否通顺 |
| 相关性 | 答得贴不贴题 | 是否紧扣用户问题、有没有跑题 |
| 完整性 | 答得全不全 | 是否覆盖所有需求点、有没有遗漏 |
| 安全性 | 答得安不安全 | 有没有有害内容、有没有泄露隐私 |
| 格式合规 | 格式对不对 | 是否按要求输出JSON/表格/字数 |
💡 一个打分示例
提示词:请写一封求职邮件,应聘前端工程师,突出3年React经验,300字以内。
输出评估:
- 准确性:8分(React经验描述准确,无事实错误)
- 相关性:9分(紧扣求职邮件主题)
- 完整性:7分(提到了React经验,但没提"独立项目")
- 安全性:10分(无有害内容)
- 格式合规:9分(约280字,符合300字要求)
- 总分:43/50(86分)
💬 一句话记住:评估不是"好不好"的一刀切,而是"五个维度分别打分"------这样才能知道"到底哪里好、哪里差"。
✅ 一句话总结
评估的五个维度是准确性、相关性、完整性、安全性、格式合规------分别打分,才能精准定位提示词的问题。
二、人工评估:让"人"来打分
💬 这节是"人工打分"的方法。虽然现在流行"AI打分",但人工评估依然是"金标准"------尤其是重要场景。
📌 三种人工评估方法
方法1:Likert量表(1-5分打分)
请对以下回答打分(1-5分):
1分=完全不可用,3分=基本可用,5分=完美
准确性:___分
相关性:___分
完整性:___分
安全性:___分
格式合规:___分
方法2:成对比较(A vs B)
请对比以下两个回答,选择更好的一个,并说明理由:
回答A:______
回答B:______
哪个更好?为什么?
方法3:评分标准设计(Rubric)
评分标准:
- 5分:完全满足需求,可直接使用
- 4分:基本满足需求,小改即可
- 3分:部分满足需求,需要较大修改
- 2分:偏离需求,需要重写
- 1分:完全不可用
请按此标准打分。
💡 三种方法怎么选?
| 方法 | 适用场景 | 特点 |
|---|---|---|
| Likert量表 | 批量打分 | 快,但不够精细 |
| 成对比较 | 对比两个版本 | 精细,但只能两两比 |
| 评分标准 | 重要场景 | 最规范,但成本高 |
💬 一句话记住:日常用Likert量表,对比版本用成对比较,重要场景用评分标准。 三种方法可以混着用。
✅ 一句话总结
人工评估有三种方法------Likert量表(批量打分)、成对比较(两两对比)、评分标准(规范打分),按场景选用。
三、自动评估:LLM-as-a-Judge
💬 这节是"让AI给AI打分"------LLM-as-a-Judge。这是当前的主流方法,能批量、快速、低成本评估。有点新鲜,但很好用。
📌 什么是LLM-as-a-Judge?
LLM-as-a-Judge(让大模型当裁判),就是让一个AI模型,给另一个AI模型的输出打分。
【裁判提示词】
你是一位严格的提示词评估专家。请根据以下标准,对AI的回答打分:
评估维度(每项1-5分):
1. 准确性:事实是否正确
2. 相关性:是否紧扣问题
3. 完整性:是否覆盖所有需求
4. 安全性:是否有害
5. 格式合规:是否符合格式要求
【用户问题】
请写一封求职邮件,应聘前端工程师,突出3年React经验,300字以内。
【AI回答】
(粘贴AI的回答)
请输出JSON格式的评分结果:
{
"accuracy": 分数,
"relevance": 分数,
"completeness": 分数,
"safety": 分数,
"format": 分数,
"total": 总分,
"issues": ["问题1", "问题2"]
}
📌 为什么LLM-as-a-Judge是主流?
| 优势 | 说明 |
|---|---|
| 批量 | 一次能评100条,人工评不完 |
| 快速 | 秒级出结果 |
| 低成本 | 比雇人打分便宜得多 |
| 一致性 | 同一套标准,不会"心情影响" |
⚠️ LLM-as-a-Judge的局限
| 局限 | 说明 |
|---|---|
| 有偏见 | 裁判AI可能偏好"更长"或"更正式"的回答 |
| 不完美 | 裁判AI也会犯错 |
| 需要校准 | 要和人工评估"对齐"一下 |
💬 一句话记住:LLM-as-a-Judge是"主流",但别"全信"------它适合批量初筛,重要结论还得人工复核。 这就是"自动+人工"双层评估。
✅ 一句话总结
LLM-as-a-Judge让AI给AI打分------批量、快速、低成本,是当前主流方法。但它有偏见,需要"自动+人工"双层评估兜底。
四、A/B测试框架:用数据选版本
💬 这节是"终极武器"------A/B测试。两个版本谁的胜率高?用数据说话,不靠猜。
📌 什么是A/B测试?
A/B测试,就是让两个版本的提示词,在相同输入下各跑一批,对比谁的表现好。
版本A:提示词A
版本B:提示词B
同一批测试问题(比如100个问题):
- 版本A跑100个 → 记录得分
- 版本B跑100个 → 记录得分
对比:哪个版本的平均分高?哪个的胜率高?
📌 A/B测试的三个关键
关键1:控制变量
❌ 错误:版本A用"豆包"跑,版本B用"Claude"跑
(模型不同,没法比!)
✅ 正确:版本A和版本B都用"豆包"跑
(只变提示词,其他全一样)
关键2:统计显著性
❌ 错误:版本A跑5个,版本B跑5个,就下结论
(样本太少,可能是运气)
✅ 正确:版本A跑100个,版本B跑100个
(样本够大,结论才可靠)
关键3:样本量计算
样本量参考:
- 差异大(如80% vs 60%):50-100个样本就够
- 差异小(如75% vs 70%):需要200-500个样本
💡 一个A/B测试的完整流程
1. 定义测试目标:提升"求职邮件"提示词的完整性得分
2. 准备两个版本:
版本A(原版):请写一封求职邮件,突出3年React经验,300字以内。
版本B(优化版):请写一封求职邮件,应聘前端工程师,突出3年React经验,提到一个独立完成的电商项目,语气自信,300字以内。
3. 准备测试集:100个求职场景问题
4. 分别运行:版本A跑100个,版本B跑100个
5. 用LLM-as-a-Judge批量打分
6. 统计对比:版本B的完整性平均分是否显著高于版本A?
7. 结论:如果版本B显著更好,就采用版本B
💬 一句话记住:A/B测试的核心是"控制变量 + 足够样本 + 统计对比"------只变提示词,其他全一样,样本够大,结论才靠谱。
✅ 一句话总结
A/B测试通过"控制变量、足够样本、统计对比",用数据判断哪个提示词版本更好------告别"凭感觉选版本"。
五、实操:三大场景实战
💬 这节是动手环节,三个场景从"设计评估方案"到"批量评估"到"胜率分析"。建议都试一遍,尤其第二个------批量评估是核心技能。
🖥️ 场景1:设计电商客服提示词的评估方案
为"电商客服提示词"设计一套评估方案:
请为以下电商客服提示词设计一套评估方案:
【提示词】
你是XX电商的客服助手。请回答用户关于产品、物流、售后的问题。
- 语气友好、专业
- 不承诺未经确认的优惠
- 无法回答时转接人工客服
【评估方案要求】
1. 定义评估维度(至少5个,针对客服场景)
2. 为每个维度设计打分标准(1-5分)
3. 设计10个测试问题(覆盖常见客服场景)
4. 说明评估流程
试一下,看AI能不能设计出"针对客服场景"的评估方案。
💡 观察重点: 客服场景的评估维度,除了通用五维,还应该有"服务态度""解决率""合规性"等客服专属维度。评估方案要"贴合场景",不能照搬通用模板。
🖥️ 场景2:LLM-as-a-Judge批量评估100条输出
用裁判AI批量评估:
你是一位严格的提示词评估专家。请对以下100条AI输出进行批量评估。
评估标准(每项1-5分):
1. 准确性:事实是否正确
2. 相关性:是否紧扣问题
3. 完整性:是否覆盖所有需求
4. 安全性:是否有害
5. 格式合规:是否符合格式要求
【评估任务】
提示词:请写一封求职邮件,应聘前端工程师,突出3年React经验,300字以内。
测试集:100个求职场景问题(见下方列表)
AI输出:100条回答(见下方列表)
请逐条打分,最后输出汇总统计:
- 各维度平均分
- 总分分布
- 得分最低的10条及其问题
- 改进建议
试一下,看AI能不能批量评估并给出汇总统计。
💡 观察重点: 批量评估的价值是"找出规律"------哪类问题得分低?是"完整性"普遍差,还是"格式合规"普遍差? 找到规律,就知道该优化提示词的哪部分。
🖥️ 场景3:两个版本提示词的胜率分析
对比两个版本,用数据选版本:
请对比以下两个版本的提示词,用LLM-as-a-Judge评估胜率。
版本A:请写一封求职邮件,突出3年React经验,300字以内。
版本B:请写一封求职邮件,应聘前端工程师,突出3年React经验,提到一个独立完成的电商项目,语气自信,300字以内。
【测试集】
1. 应聘初级前端,无经验
2. 应聘资深前端,5年经验
3. 转行求职,自学React
4. 应届生求职,有实习经验
...(共20个场景)
【评估流程】
1. 每个场景,分别用版本A和版本B生成回答
2. 用裁判AI对每个回答打分
3. 统计:版本A和版本B的胜率对比
4. 输出结论:哪个版本更好?为什么?
试一下,看AI能不能给出"数据支撑"的选型结论。
💡 观察重点: 注意"控制变量"------两个版本必须用同一个模型跑,否则没法比。 还要注意"样本量"------20个场景可能不够,结论要谨慎。
💡 三个场景的关键差异
| 场景 | 核心技能 | 观察重点 |
|---|---|---|
| 设计评估方案 | 贴合场景 | 维度是否针对客服场景 |
| 批量评估 | 找规律 | 能否找出"哪类问题得分低" |
| 胜率分析 | 数据选型 | 是否控制变量、样本够不够 |
六、当下趋势:评估工具与监控体系
💬 这块是"行业前沿",知道趋势就行。重点理解"评估从手工走向平台化"。
📌 三个趋势
趋势1:LLM-as-a-Judge成主流
配合人工抽检,形成"自动+人工"双层评估体系。
趋势2:评估工具平台化
| 工具 | 特点 |
|---|---|
| LangSmith | LangChain原生,框架无关 |
| PromptLayer | Git式版本控制 |
| Weights & Biases | 端到端评估、追踪、版本管理 |
| 阿里云百炼 / 百度千帆 | 内置模型评估与提示词管理 |
| Dify | 支持接入多模型进行效果对比 |
趋势3:线上效果监控成为核心指标
企业实践中,提示词的线上效果监控(准确率、用户满意度、成本)已成为AI运营的核心指标。
💬 一句话记住趋势:评估正在从"手工打分"走向"平台化、自动化、常态化监控"。 学会了本课的评估思维,你就跟上了这个趋势。
本课小结
📌 今天学了啥
| 知识点 | 一句话回顾 |
|---|---|
| 五个维度 | 准确性、相关性、完整性、安全性、格式合规 |
| 人工评估 | Likert量表、成对比较、评分标准 |
| LLM-as-a-Judge | 让AI给AI打分------批量、快速、低成本 |
| A/B测试 | 控制变量 + 足够样本 + 统计对比 |
| 双层评估 | 自动初筛 + 人工复核 |
| 当下趋势 | 评估平台化、监控常态化 |
📌 三个核心认知
- 评估是"科学"不是"玄学"------用数据说话,不凭感觉
- "自动+人工"双层评估最稳------AI批量初筛,人工复核重要结论
- A/B测试是"选版本"的终极武器------控制变量、样本够大、数据说话
课后练习
💬 练习都动手做一遍,尤其第二个------批量评估是核心技能,练熟了你的提示词优化效率翻倍。
📌 练习1:设计评估方案
选一个你常用的提示词(写邮件、写文案、写代码都行),设计一套评估方案(5个维度 + 打分标准 + 10个测试问题)。
观察重点: 你的维度是否贴合场景?测试问题是否覆盖了常见情况?
📌 练习2:LLM-as-a-Judge批量评估
用本课的裁判提示词,让AI批量评估10条输出(可以用同一提示词跑10个不同问题)。
观察重点: 哪类问题得分低?规律是什么?该优化提示词的哪部分?
📌 练习3:A/B测试实战
设计两个版本的提示词(一个基础版、一个优化版),用同一模型跑10个测试问题,用裁判AI打分,对比胜率。
观察重点: 优化版真的更好吗?样本量够不够?结论可靠吗?
下节预告
🖥️ 第20课:编程领域专项提示词设计
第19课咱学会了"用数据评估提示词"。第20课来看一个"最实用"的专项------编程领域提示词设计。
对程序员来说,提示词工程最大的价值,就是"让AI写代码"。但"让AI写代码"和"让AI写好代码"之间,差着一整套"编程专项约束"。
这节课咱会讲:怎么用"黄金四要素 + 编程专项约束"让AI生成高质量代码?怎么把大任务拆成"架构→接口→实现→测试"分步生成?还会给你一套"拿来就能用"的后端、前端、数据层、算法级代码生成模板。
这是程序员必学的一课。学会了它,你的"AI编程"效率直接起飞。
🎯 高级应用阶段第5课完成,还剩4课。硬核内容越来越实用,继续走。