【边界层·算法&论文】论文影响力地图 #3
前两期讲了大模型的地基和规模化逻辑。到 2022 年底,模型够大、够强了------但行业发现一个更尖锐的问题:能力不等于可交付。这一期讲的是,从"会生成"到"能上线"之间,要补齐哪些机制。
如果你经历过 2022 年 11 月那一周,大概率会记得那种感觉。
ChatGPT 上线五天注册用户破百万。社交媒体上,有人用它写求职信,有人用它做高考题,有人让它扮演莎士比亚。很多人第一次觉得:AI 好像真的能用了。

图1:达到 1 亿用户所需时间------ChatGPT 仅用 2 个月即突破 1 亿月活用户,刷新消费级应用增长纪录。数据来源:UBS Research、Sensor Tower、PwC
但同一周里,也有人发现它会一本正经地编造不存在的法律条文,会用极其流畅的语气输出带有偏见的内容,会在被追问时坚持错误答案并且"自信满满"。
这两种体验不矛盾------它们恰好说明了同一件事:能力和可交付之间有一道缺口。 模型够强了,但它不听话、不可控、不可审计。在实验室里这些都不算硬伤,但在企业交付的语境里,每一条都是拦路的。
这一期讲的三组论文,就是在填这道缺口。
-
InstructGPT 和 RLHF 让模型从"自由发挥"变成"听指令";
-
Constitutional AI 尝试让对齐变得更可持续、更可审计;
-
红队测试则把评估从"给个分"推向"找漏洞"。
它们不是在让模型更聪明。它们是在让模型更可用。
一、InstructGPT 与 RLHF:让模型从"自由发挥"变成"听指令"
在讲 InstructGPT 之前,有必要先回忆一下 GPT-3 直接拿来用是什么体验。
2021 年,如果你通过 OpenAI API 调用原版 GPT-3,你会发现它的行为模式更像"接话"而不是"回答"。你输入一个问题,它可能会给你续写成一段对话体小说,或者重复你的问题再加几个类似的问题。它不是不聪明------它是不理解你想让它做什么。因为它的训练目标就是"预测下一个 token",不是"完成你的指令"。
这件事在研究者看来是技术细节,但在用户看来是基本的可用性问题。
Ouyang 等人在 2022 年 3 月发表的《Training language models to follow instructions with human feedback》(即 InstructGPT 论文)直接回应了这个问题。
它的做法说起来不复杂,分三步------

图2:InstructGPT 的 RLHF 三步流程------Step 1: 监督微调(SFT);Step 2: 训练奖励模型(Reward Model);Step 3: 用 PPO 强化学习优化。1.3B 的 InstructGPT 在人类评估中超越了 175B 的原版 GPT-3。来源:Ouyang et al. (2022)
第一步,收集人工编写的高质量指令-回答对,对 GPT-3 做监督微调(SFT)。这一步让模型知道"被问问题时应该回答问题"。
第二步,让人类标注员对同一个问题的多个模型回答进行排序,用这些排序数据训练一个奖励模型(Reward Model)。这一步定义了"什么算好回答"。
第三步,用这个奖励模型的信号通过 PPO(近端策略优化)来进一步调优语言模型。这一步让模型持续向"人类觉得好"的方向靠近。
这套流程后来被统称为 RLHF(Reinforcement Learning from Human Feedback)。技术路线上,它的前身可以追溯到 Christiano 等人 2017 年的工作《Deep Reinforcement Learning from Human Preferences》,但真正把它和大语言模型结合起来、做到可用程度的是 InstructGPT。
InstructGPT 论文里有一个经常被引用的数据:一个 1.3B 参数的 InstructGPT 在人类评估中优于 175B 参数的原版 GPT-3。 这个对比很能说明问题------对齐不是在拼规模,它是在改变模型的行为模式。
ChatGPT 正是 InstructGPT 思路的产品化延伸。论文发表于 2022 年 3 月,ChatGPT 上线于 2022 年 11 月,中间不到八个月。从论文到全球现象级产品,这可能是 AI 历史上从研究到落地最短的周期之一。
但 RLHF 的代价也很明显。
首先是标注成本。高质量的人类偏好标注很贵,而且标注员之间的一致性并不总是很高------不同人对"好回答"的判断可能差异很大。奖励模型学到的偏好,本质上是标注团队的偏好,不一定代表所有用户。
其次是所谓的"对齐税"(alignment tax)。对齐训练可能会让模型在某些任务上变得更保守或更拒绝,牺牲了部分能力换取了安全性。InstructGPT 论文里也承认了这一点。
对企业来说,这意味着:
如果你要自己做 RLHF,标注团队的质量和成本是必须提前预算的事。而如果你用供应商的模型,你需要理解------它的"听话"程度是被某一组人类偏好训练出来的,不一定完美匹配你的业务场景。
二、Constitutional AI:能不能让对齐变得更可持续?
InstructGPT 证明了 RLHF 能让模型听话,但也暴露了一个持续性问题:这件事的成本很高,而且很依赖标注质量。有没有一种方式,能在不那么依赖人工标注的情况下实现对齐?
2022 年 12 月,Anthropic 的 Bai 等人发表了《Constitutional AI: Harmlessness from AI Feedback》,提出了一条不同的路线。
思路:先写一套"宪法"------一组明确的原则清单(比如"不要帮助用户做危险的事""回答应该诚实且不带偏见"),然后让模型基于这些原则对自己的输出进行自我评估和修正。这个过程被称为 RLAIF(Reinforcement Learning from AI Feedback)------用 AI 的反馈替代部分人工反馈。
Anthropic 选择这条路线,有一个容易被忽略的背景。Anthropic 的创始团队中,有多位来自 OpenAI,包括 Dario Amodei 和 Daniela Amodei。他们在 2021 年创办 Anthropic 时,核心关注点就是 AI 安全。Constitutional AI 不只是一种技术方案,也是 Anthropic 的安全哲学的具体表达:对齐应该有据可查、有原则可循,而不是一个黑盒调参过程。
和 RLHF 相比,Constitutional AI 有两个值得关注的优势。
第一是成本结构。 人工标注是 RLHF 最贵的环节,Constitutional AI 用模型自我评估替代了大部分人工标注,显著降低了对齐的边际成本。这对需要持续迭代对齐策略的企业来说,是一个很实际的改善。
第二是可审计性。 RLHF 的对齐结果很难溯源------模型为什么拒绝某个请求?是哪条标注数据导致的?很难追查。Constitutional AI 的对齐基于明确的原则清单,至少在原则层面是可追溯的:你知道模型是基于哪条规则做出了这个判断。
但 Constitutional AI 也留下了一个本质上不是技术问题的问题:原则由谁来定? "不要有偏见"这句话,在不同文化、不同业务场景、不同价值观体系下,含义可能完全不同。当你把对齐建立在一组原则上时,这组原则本身就成了一个需要治理的对象。
在产品层面,Constitutional AI 的思路后来影响了 Claude 系列模型的设计,也影响了行业对"负责任 AI"的讨论方式。如果你用过 Claude 并注意过它在拒绝某些请求时的措辞,那种"我理解你的需求,但基于以下原因我不能帮你做这件事"的风格,背后就有 Constitutional AI 的影子。
三、红队测试与评估升级:你怎么知道模型真的可靠?
对齐解决的是"怎么让模型更合用",但还有一个配套问题:你怎么知道对齐真的生效了?模型说它不会输出有害内容,你怎么验证?
传统的做法是跑 benchmark。MMLU 测知识面,HellaSwag 测常识推理,TruthfulQA 测诚实度。这些 benchmark 有价值,但它们测的是"模型能不能答对特定题目",不是"模型在真实场景中会不会出问题"。一个在 MMLU 上得分 90% 的模型,仍然可能在一个精心构造的 prompt 下输出完全不合规的内容。
红队测试的思路是把评估从"给分"推向"找漏洞"。
Perez 等人在 2022 年发表的《Red Teaming Language Models with Language Models》把这件事往前推了一步:不用人工一个一个构造攻击 prompt,而是用另一个语言模型来自动生成攻击输入。这样做的好处是覆盖面和效率大幅提升------人工红队一天能测几百个 case,自动化红队可以测几万个。
这不只是效率问题。人工红队受限于测试者自己的想象力和经验,自动化红队可以探索到人类不容易想到的边界情况。当然,它也有局限:自动生成的攻击可能过于表面或重复,缺少真正有创意的对抗思路。所以当前行业的做法通常是两者结合------自动化做覆盖面,人工做深度。
在评估方法的演进上,还有一条值得注意的线索。2023 年,Zheng 等人发表了 LMSYS Chatbot Arena 相关的工作,提出了 LLM-as-Judge 的系统评估方案。核心想法是让一个强模型(比如 GPT-4)来充当评委,对其他模型的输出进行比较评分。
这个方案解决了一个真实痛点:人工评估太慢太贵,传统 benchmark 又太粗糙。LLM-as-Judge 在效率和质量之间找到了一个折衷。但它也有一个根本性的循环问题:如果评委本身有偏好或盲区,它的评估结果就继承了这些偏好。你用 GPT-4 评 Claude,GPT-4 的偏好会影响评分;反过来也一样。
对企业来说,这一节的含义比前两节更直接:当你采购或部署一个大模型时,你的评估维度不应该只看准确率或 benchmark 排名。你更应该关心的是------在什么条件下它会出问题?出了问题有没有机制能发现?发现了之后能不能追溯原因?
如果你的供应商只给你看 benchmark 得分而不谈红队测试和对抗评估的结果,这本身就是一个信号。
四、从交付缺口到治理需求
把这三组论文放在一起,它们回答了一条清晰的因果链:
InstructGPT 和 RLHF 解决的是行为层面的问题:让模型从"自由发挥"变成"听指令"。ChatGPT 是这条技术路线最显性的产品证明。
Constitutional AI 解决的是可持续性问题:对齐不能全靠人工标注,需要更可扩展、更可审计的方案。Anthropic 的路线把对齐从一个调参过程推向了一个原则驱动的框架。
红队测试和评估升级 解决的是验证问题:你怎么证明前面两步真的生效了?不是跑个 benchmark 就够的,你需要主动找漏洞、持续监控、追溯根因。
这三步加在一起,试图回答的是同一个问题:你怎么证明一个模型在生产环境中是可靠的?
现在的行业状态是,这个问题还没有稳定的标准答案。对齐方法在快速迭代,评估体系也在重建。但有一点已经很清楚:评估的重心正在从"模型能做什么"转向"模型会不会在什么地方出问题"。这种转向本身,就是行业在走向成熟的标志。
而下一个瓶颈,已经在这个过程中浮出水面了:模型本身的知识是有边界的------训练截止日期之后的事它不知道,你公司内部的文档它没见过,实时变化的数据它跟不上。当对齐和可控性逐步到位之后,行业的注意力开始转向一个新方向:能不能把知识的边界往外推?
这就是下一期的起点------RAG、检索增强与知识边界外移。
边界层笔记
-
RLHF 不是在让模型更聪明,而是在改变模型的行为模式。InstructGPT 用 1.3B 参数在人类评估中超越了 175B 的原版 GPT-3,说明对齐改变的是"怎么用能力",不是"有没有能力"。
-
ChatGPT 的上线(2022 年 11 月)距离 InstructGPT 论文发表(2022 年 3 月)不到八个月。这可能是 AI 领域从研究到全球现象级产品最短的周期。
-
Constitutional AI 把对齐从黑盒调参推向原则驱动的框架,但"原则由谁定"这个问题本质上不是技术问题------它是价值观和治理问题。
-
红队测试和 LLM-as-Judge 代表了评估方向的两次升级:从"能不能答对"到"在哪里会出问题",再到"能不能用模型本身来做评委"。每一步都更接近企业真正需要的安全验证思路。
-
对齐是有成本的。对齐可能让模型变得更保守,这在某些业务场景里是好事,在另一些场景里是约束。企业选模型时,对齐程度和业务需求之间的匹配值得单独评估。
参考资料
-
Ouyang et al., Training language models to follow instructions with human feedback (InstructGPT), NeurIPS 2022.
-
Christiano et al., Deep Reinforcement Learning from Human Preferences, NeurIPS 2017.
-
Bai et al., Constitutional AI: Harmlessness from AI Feedback, arXiv 2022.
-
Perez et al., Red Teaming Language Models with Language Models, arXiv 2022.
-
Zheng et al., Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena, NeurIPS 2023.
-
OpenAI, Introducing ChatGPT, 2022.
科里 Coralyx · 2026-04