AI AGENT 工程范式进化史 • 第一站 • PROMPT ENGINEERING
给模型加一句 「你是世界级专家」 准确率反而掉了。
「你是世界级专家」不是魔法咒语。有人认真测过:同一组 MMLU 题,不加人设是 71.6%,加了最短专家人设反而降到 68.0%。这不等于角色都没用,只说明一件事:看起来更专业,不等于答得更准确。
所有人都写过 prompt。
但说句实话,大多数人写的是许愿 ,不是下单。
而更让人不舒服的是:你奉为圭臬的那几条 prompt 铁律,有的没用,有的甚至在帮倒忙。

这一站,我们不聊"十大技巧"。我们干一件更有意思的事:把这些铁律拉出来,一条条验一验。
00 / 先拉回点菜窗口
第一站,先把镜头拉回点菜窗口。
总览讲的是整家餐馆怎么一步步扩建。这一站不重讲全景,只盯住点菜窗口:当客人只能递进去一张订单,怎样写,厨师才更容易一次做对?
🪟 这一站只追一张订单:"一碗牛肉面,不要香菜,面硬一点,汤少一些。"
接下来我们只做四次变化:给厨师戴"世界级专家"的帽子、给他看样板单、要求他把每一步都讲出来、再把同一句订单换一种版式。厨师没换,食材没换,目标也没换。这样才看得清:究竟什么真的有用,什么只是看起来专业。

所以这一站讲的不是技巧大全,而是一件更基础的事:在只有一句话的情况下,怎么把这句话的信息密度榨到最高、并且让它稳定复现。 第二件事比第一件难得多,也是绝大多数教程完全不提的。
01 / 先把地基打好
它到底是个什么东西
技术上说: Prompt Engineering 不改模型本身,只通过输入告诉模型"现在要做什么、按什么规则做"。你可以把它理解成临时工作说明,不必先记住一堆术语。
人话版: 厨师的手艺是固定的,你没法把他送去培训(那叫微调,很贵)。你能做的,只是把订单写得更明白。

Prompt 时代的架构:一个黑盒,进去一次,出来一次
记住 LLM 下面那条虚线------没有回头路。它是这一站所有痛苦的根源,文章最后我们回来收它。
02 / 本文核心 · 拆穿三条铁律
三条最容易被误用的经验
它们不是完全没用,而是经常被当成"任何任务都有效"的固定答案。下面就用同一张订单,一条条看。
安慰剂 01 「你是世界级专家」
几乎所有 prompt 教程的第一条建议,都是给模型一个专家人设。听起来太合理了:告诉它是物理教授,它就该更懂物理。
问题是,这件事被认真测过。
加了专家人设反而掉分,而且人设越长掉得越多
另一项独立研究在更难的博士级问答基准上做了同样的事,结论也很干脆:没有任何一个专家人设能稳定地跑赢"什么都不加" 。更有意思的是反向实验------给模型安上"幼儿""外行"这种低知识人设,成绩确实会掉,而且暗示越无知、掉得越狠。
所以角色提示彻底没用了吗?不。真相更有用:
研究者的解释是,专家人设影响的是"对齐类"能力,而不是"知识类"能力 。它能让输出的风格、结构、语气、安全边界更符合预期------这些是模型在指令微调阶段学的东西。但事实记忆、分类判断、精确推理是模型在预训练阶段就长出来的能力,你在外面裹一层角色扮演,反而成了干扰噪音。
🎭 回到那碗牛肉面: 给同一个厨师戴上"米其林主厨"的高帽子,可能让他报菜名更讲究、摆盘更像样;但帽子不会凭空告诉他顾客是否点了香菜。角色更像服务风格,不是新增知识。
更狠的一点:输出加了人设之后往往"看起来更专业了"------结构更整齐、语气更笃定。这恰恰最危险:表面可信度上升,实际正确率下降。
安慰剂 02 「示例一定要给对」
这条听起来更是天经地义:你给模型看的例子当然得是正确的,不然它不就学歪了吗?
一个反直觉实验
研究者故意打乱示例标签,
模型成绩却只
轻微下降。在论文测试的分类和多选任务里,示例不只是在教答案,还在告诉模型:有哪些标签、输入大概长什么样、答案应该按什么格式写。
这说明什么?说明你对 few-shot 的理解,很可能从一开始就错了。
这里最容易误读: 标签当然还是要写对。真正有用的发现是,示例的作用不只是在教"这道题选什么"。
示例真正传递的三件事------全都跟"答案对不对"无关
Few-shot 到底在教模型什么
🍽️ 还是那碗牛肉面: 你给厨师看三张样板单,他会同时看到"订单长什么样""辣度有哪些选项""顾客通常怎样表达"。哪怕个别样板的辣度贴纸贴错,他仍可能学到单据格式和可选范围。但这绝不等于生产里可以故意写错标签;它只说明示例传递的信息不止答案本身。
实操只记三件事:① 标签照样要写对,别故意制造错误
② 示例要覆盖常见输入和允许的答案
③ 示例格式尽量统一,顺序变化也要测
这篇论文告诉我们的不是"错标签也没事",而是别只盯着答案,示例的格式和分布同样重要。
安慰剂 03 「让它一步步想,总没坏处」
加一句Let's think step by step,最多浪费点 token,对吧?
不一定。 让模型展开思路,复杂题可能受益;简单题却可能变慢、变啰嗦,甚至把本来对的答案绕错。
例如,一项医疗模型实验里,要求模型写思维链,准确率反而比直接回答低了 5.7%。这不代表思维链普遍有害,只说明:它是工具,不是每道题都要按下的开关。
🥢 还是那碗牛肉面: "不要香菜、面硬一点"是简单约束,没必要让厨师先讲三分钟刀工哲学;但如果是十人宴席、有人过敏、上菜还有先后依赖,就值得显式拆解。推理步骤应该跟任务复杂度匹配。
一句话: 复杂推理再开思维链;简单分类、抽取和格式化任务,先别默认开。
03 / 那什么才真正管用?
格式的暴政:一个几乎没人写、但影响最大的因素
大多数教程教你"怎么写得更好"。但没人告诉你:写的是一模一样的意思,只是排版不同,结果可能完全不同。
只换排版,也可能换出完全不同的结果同一个意思、不同格式,极端情况下相差
76 个准确率点。先别被 76 吓到:这是论文里某个模型、某项任务的最大差距 ,不是平均值。跨 50 多个任务和多个模型,平均约差 10 个准确率点。这里的"准确率点"按 0--100 计算,等价于百分点,不是考试里的"76 分" 。
原始论文与完整实验范围见文末参考来源
研究里,换大模型、多放几个示例、改用指令模型,都没有让格式敏感性自动消失。所以一次"感觉变好了"不算证据,至少要用同一批题反复测。
你没法靠"读一遍觉得挺顺"猜出哪个格式好------只能测
格式敏感性:语义不变,结果剧烈波动(示意)
🧾 第四次还是那碗牛肉面: 内容没变,一次写在 POS 的固定字段里,一次挤在餐巾纸角落;这个模型厨师可能读出不同重点。现实后厨会用标准小票消除歧义,Prompt 工程同样要把分隔符、字段名、示例顺序和输出协议固定下来。
连示例顺序都可能影响结果。 同样几条例子,只换前后次序,表现就可能明显波动;一个模型喜欢的顺序,换个模型还不一定管用。所以示例顺序也要固定、也要测试。
你调 prompt 时如果只动了排版就"感觉变好了",那很可能不是你调好了,而是你恰好抽中了一个好格式。而没有测试集,你根本分不清这两者。
04 / 拆穿完了,说点能直接用的
一条能上生产的 prompt,有六个零件
前面四次试验其实只指向一件事:别再往订单上堆咒语,把它写成一张能检查、能复用的标准单。
六个零件:把自然语言订单改造成可检查的标准单
把它翻回厨房:身份/场景 说明送到哪个档口,任务 说明做什么菜,上下文 写清忌口与库存,示例 给标准订单,输出格式 规定小票字段,边界说明缺料或看不懂时怎样上报。角色只需"牛肉面档口",没必要写"世界级大师"。
最后一条最容易被忘:你不给它台阶,它就只能编。 很多幻觉不是模型坏,是你没给它说"我不知道"的权限。
05 / 工业界实战 · 本系列主线案例
把用户的骂街,变成一张结构化工单
现在把厨房比喻落回真实业务:用户的自由文本像前台口述的点单,结构化 JSON 就像后厨统一的小票。这个客服工单系统会跟着系列继续长大;今天只解决把一条口述写成一张标准单。
典型场景(示例,不对应某家公司的公开数据): 高峰期大量反馈涌进来,格式千奇百怪------有人只发一句「?????」,有人写千字小作文,有人把订单号打错。人工逐条分拣既慢又容易积压。
第一版目标(刻意克制): 不做自动回复,只做一件事------把自由文本变成结构化 JSON ,让工单能自动进队列、自动排优先级。为什么先做这个?因为它最适合 prompt 单打独斗:输入输出明确、单步完成、不需要外部知识。
迭代过程(不会一步到位):

最常见的四个坑:
工单系统翻车实录:四个真实的坑
如果这个案例你只带走一句话,带走这句:
先有测试集,再有 prompt。没有测试集的 prompt 调优,等于蒙眼调音。
06 / 分水岭 · 大多数教程的空白区
把 prompt 当代码管,而不是当便签
一个残酷的对比: 你写业务代码,会有版本管理、单元测试、CI、回归。你写 prompt,很多人是:在网页里改一改,觉得好了,复制粘贴进代码,上线。
而我们前面刚证明过:prompt 对排版这种无意义的改动都极度敏感。一个连改个空格都可能翻车的东西,你却在用最随意的方式管理它。
最小可用的评测脚手架,只要三样东西:

把 prompt 当代码管:四条工程纪律
一个容易被忽略的免费午餐:
如果你的模型支持结构化输出 / JSON 模式,优先用它,而不是在 prompt 里反复哀求"请只输出 JSON" 。能在协议层解决的事,别放到自然语言层去赌。
07 / 诚实提醒 · 什么时候别死磕 prompt
一句话能干的事,是有限的
四堵墙:接下来每一站,就是一堵一堵拆它们
关键在于:这四堵墙不是靠"把 prompt 写得更好"能翻过去的。一张标准订单能把一碗面说清楚,却不能替你去仓库查库存、记住熟客昨天的忌口、观察出餐结果,也不能在多道菜之间安排先后。
所以这一站真正要记住的只有一句: Prompt 不是咒语,而是一张要被机器稳定执行的订单。写清目标、格式和边界,再用测试集验证;剩下的问题,就不能继续靠加形容词解决了。

一张订单写清楚以后,真实业务仍然不止一步。抽工单、判优先级、查规则、生成回复、翻译......一句话塞不下,就要开始拆流程。
【进入第二站 · 你搭的 AI WORKFLOW,可能只用对了五分之一 →】
关于这个系列
《AI Agent 工程范式进化史》------跟着同一家餐馆连续升级,一站一站讲透 AI Agent 工程的演进:
Prompt → Chain → Context → Harness → Loop → Graph → 还会有的...
参考来源与数字口径 :
1 Hu, Rostami & Thomason, 2026,Expert Personas Improve LLM Alignment but Damage Accuracy ,arXiv:2603.18507(预印本)。本文 71.6% / 68.0% / 66.3% 均来自其 MMLU 汇总设置。arxiv.org/abs/2603.18...
2 Zheng et al., Findings of EMNLP 2024,162 种角色、4 个模型家族、2,410 道事实题。aclanthology.org/2024.findin...
3 Basil et al., 2025,Playing Pretend ,arXiv:2512.05858(预印本),6 个模型,GPQA Diamond 与 MMLU-Pro。arxiv.org/abs/2512.05...
4 Min et al., EMNLP 2022,DOI: 10.18653/v1/2022.emnlp-main.759。aclanthology.org/2022.emnlp-...
5 Sclar et al., ICLR 2024,FormatSpread ,arXiv:2310.11324。论文原文是"up to 76 accuracy points";本文统一译作"最多 76 个准确率点"。arxiv.org/abs/2310.11...
6 Lu et al., ACL 2022,few-shot 示例顺序敏感性。aclanthology.org/2022.acl-lo...
7 Sadanandan & Behzadan, 2026,When Chain-of-Thought Backfires ,arXiv:2603.25960(预印本)。arxiv.org/abs/2603.25...
口径说明 :
论文结论均受模型、数据集、提示位置、评分方式和推理设置限制,不能直接外推到所有业务。文中客服比例图是工程过程示意,不冒充某次公开实验结果;生产上线必须使用自己的评测集复跑。配图均为原创示意图。