RLHF、InstructGPT、红队测试:从“会生成“到“可交付“

边界层·算法&论文】论文影响力地图 #3

前两期讲了大模型的地基和规模化逻辑。到 2022 年底,模型够大、够强了------但行业发现一个更尖锐的问题:能力不等于可交付。这一期讲的是,从"会生成"到"能上线"之间,要补齐哪些机制。


如果你经历过 2022 年 11 月那一周,大概率会记得那种感觉。

ChatGPT 上线五天注册用户破百万。社交媒体上,有人用它写求职信,有人用它做高考题,有人让它扮演莎士比亚。很多人第一次觉得:AI 好像真的能用了。

图1:达到 1 亿用户所需时间------ChatGPT 仅用 2 个月即突破 1 亿月活用户,刷新消费级应用增长纪录。数据来源:UBS Research、Sensor Tower、PwC

但同一周里,也有人发现它会一本正经地编造不存在的法律条文,会用极其流畅的语气输出带有偏见的内容,会在被追问时坚持错误答案并且"自信满满"。

这两种体验不矛盾------它们恰好说明了同一件事:能力和可交付之间有一道缺口。 模型够强了,但它不听话、不可控、不可审计。在实验室里这些都不算硬伤,但在企业交付的语境里,每一条都是拦路的。

这一期讲的三组论文,就是在填这道缺口。

  • InstructGPT 和 RLHF 让模型从"自由发挥"变成"听指令";

  • Constitutional AI 尝试让对齐变得更可持续、更可审计;

  • 红队测试则把评估从"给个分"推向"找漏洞"。

它们不是在让模型更聪明。它们是在让模型更可用。


一、InstructGPT 与 RLHF:让模型从"自由发挥"变成"听指令"

在讲 InstructGPT 之前,有必要先回忆一下 GPT-3 直接拿来用是什么体验。

2021 年,如果你通过 OpenAI API 调用原版 GPT-3,你会发现它的行为模式更像"接话"而不是"回答"。你输入一个问题,它可能会给你续写成一段对话体小说,或者重复你的问题再加几个类似的问题。它不是不聪明------它是不理解你想让它做什么。因为它的训练目标就是"预测下一个 token",不是"完成你的指令"。

这件事在研究者看来是技术细节,但在用户看来是基本的可用性问题。

Ouyang 等人在 2022 年 3 月发表的《Training language models to follow instructions with human feedback》(即 InstructGPT 论文)直接回应了这个问题。

它的做法说起来不复杂,分三步------

图2:InstructGPT 的 RLHF 三步流程------Step 1: 监督微调(SFT);Step 2: 训练奖励模型(Reward Model);Step 3: 用 PPO 强化学习优化。1.3B 的 InstructGPT 在人类评估中超越了 175B 的原版 GPT-3。来源:Ouyang et al. (2022)

第一步,收集人工编写的高质量指令-回答对,对 GPT-3 做监督微调(SFT)。这一步让模型知道"被问问题时应该回答问题"。

第二步,让人类标注员对同一个问题的多个模型回答进行排序,用这些排序数据训练一个奖励模型(Reward Model)。这一步定义了"什么算好回答"。

第三步,用这个奖励模型的信号通过 PPO(近端策略优化)来进一步调优语言模型。这一步让模型持续向"人类觉得好"的方向靠近。

这套流程后来被统称为 RLHF(Reinforcement Learning from Human Feedback)。技术路线上,它的前身可以追溯到 Christiano 等人 2017 年的工作《Deep Reinforcement Learning from Human Preferences》,但真正把它和大语言模型结合起来、做到可用程度的是 InstructGPT。

InstructGPT 论文里有一个经常被引用的数据:一个 1.3B 参数的 InstructGPT 在人类评估中优于 175B 参数的原版 GPT-3。 这个对比很能说明问题------对齐不是在拼规模,它是在改变模型的行为模式。

ChatGPT 正是 InstructGPT 思路的产品化延伸。论文发表于 2022 年 3 月,ChatGPT 上线于 2022 年 11 月,中间不到八个月。从论文到全球现象级产品,这可能是 AI 历史上从研究到落地最短的周期之一。

但 RLHF 的代价也很明显。

首先是标注成本。高质量的人类偏好标注很贵,而且标注员之间的一致性并不总是很高------不同人对"好回答"的判断可能差异很大。奖励模型学到的偏好,本质上是标注团队的偏好,不一定代表所有用户。

其次是所谓的"对齐税"(alignment tax)。对齐训练可能会让模型在某些任务上变得更保守或更拒绝,牺牲了部分能力换取了安全性。InstructGPT 论文里也承认了这一点。

对企业来说,这意味着:

如果你要自己做 RLHF,标注团队的质量和成本是必须提前预算的事。而如果你用供应商的模型,你需要理解------它的"听话"程度是被某一组人类偏好训练出来的,不一定完美匹配你的业务场景。


二、Constitutional AI:能不能让对齐变得更可持续?

InstructGPT 证明了 RLHF 能让模型听话,但也暴露了一个持续性问题:这件事的成本很高,而且很依赖标注质量。有没有一种方式,能在不那么依赖人工标注的情况下实现对齐?

2022 年 12 月,Anthropic 的 Bai 等人发表了《Constitutional AI: Harmlessness from AI Feedback》,提出了一条不同的路线。

思路:先写一套"宪法"------一组明确的原则清单(比如"不要帮助用户做危险的事""回答应该诚实且不带偏见"),然后让模型基于这些原则对自己的输出进行自我评估和修正。这个过程被称为 RLAIF(Reinforcement Learning from AI Feedback)------用 AI 的反馈替代部分人工反馈。

Anthropic 选择这条路线,有一个容易被忽略的背景。Anthropic 的创始团队中,有多位来自 OpenAI,包括 Dario Amodei 和 Daniela Amodei。他们在 2021 年创办 Anthropic 时,核心关注点就是 AI 安全。Constitutional AI 不只是一种技术方案,也是 Anthropic 的安全哲学的具体表达:对齐应该有据可查、有原则可循,而不是一个黑盒调参过程。

和 RLHF 相比,Constitutional AI 有两个值得关注的优势。

第一是成本结构。 人工标注是 RLHF 最贵的环节,Constitutional AI 用模型自我评估替代了大部分人工标注,显著降低了对齐的边际成本。这对需要持续迭代对齐策略的企业来说,是一个很实际的改善。

第二是可审计性。 RLHF 的对齐结果很难溯源------模型为什么拒绝某个请求?是哪条标注数据导致的?很难追查。Constitutional AI 的对齐基于明确的原则清单,至少在原则层面是可追溯的:你知道模型是基于哪条规则做出了这个判断。

但 Constitutional AI 也留下了一个本质上不是技术问题的问题:原则由谁来定? "不要有偏见"这句话,在不同文化、不同业务场景、不同价值观体系下,含义可能完全不同。当你把对齐建立在一组原则上时,这组原则本身就成了一个需要治理的对象。

在产品层面,Constitutional AI 的思路后来影响了 Claude 系列模型的设计,也影响了行业对"负责任 AI"的讨论方式。如果你用过 Claude 并注意过它在拒绝某些请求时的措辞,那种"我理解你的需求,但基于以下原因我不能帮你做这件事"的风格,背后就有 Constitutional AI 的影子。


三、红队测试与评估升级:你怎么知道模型真的可靠?

对齐解决的是"怎么让模型更合用",但还有一个配套问题:你怎么知道对齐真的生效了?模型说它不会输出有害内容,你怎么验证?

传统的做法是跑 benchmark。MMLU 测知识面,HellaSwag 测常识推理,TruthfulQA 测诚实度。这些 benchmark 有价值,但它们测的是"模型能不能答对特定题目",不是"模型在真实场景中会不会出问题"。一个在 MMLU 上得分 90% 的模型,仍然可能在一个精心构造的 prompt 下输出完全不合规的内容。

红队测试的思路是把评估从"给分"推向"找漏洞"。

Perez 等人在 2022 年发表的《Red Teaming Language Models with Language Models》把这件事往前推了一步:不用人工一个一个构造攻击 prompt,而是用另一个语言模型来自动生成攻击输入。这样做的好处是覆盖面和效率大幅提升------人工红队一天能测几百个 case,自动化红队可以测几万个。

这不只是效率问题。人工红队受限于测试者自己的想象力和经验,自动化红队可以探索到人类不容易想到的边界情况。当然,它也有局限:自动生成的攻击可能过于表面或重复,缺少真正有创意的对抗思路。所以当前行业的做法通常是两者结合------自动化做覆盖面,人工做深度。

在评估方法的演进上,还有一条值得注意的线索。2023 年,Zheng 等人发表了 LMSYS Chatbot Arena 相关的工作,提出了 LLM-as-Judge 的系统评估方案。核心想法是让一个强模型(比如 GPT-4)来充当评委,对其他模型的输出进行比较评分。

这个方案解决了一个真实痛点:人工评估太慢太贵,传统 benchmark 又太粗糙。LLM-as-Judge 在效率和质量之间找到了一个折衷。但它也有一个根本性的循环问题:如果评委本身有偏好或盲区,它的评估结果就继承了这些偏好。你用 GPT-4 评 Claude,GPT-4 的偏好会影响评分;反过来也一样。

对企业来说,这一节的含义比前两节更直接:当你采购或部署一个大模型时,你的评估维度不应该只看准确率或 benchmark 排名。你更应该关心的是------在什么条件下它会出问题?出了问题有没有机制能发现?发现了之后能不能追溯原因?

如果你的供应商只给你看 benchmark 得分而不谈红队测试和对抗评估的结果,这本身就是一个信号。


四、从交付缺口到治理需求

把这三组论文放在一起,它们回答了一条清晰的因果链:

InstructGPT 和 RLHF 解决的是行为层面的问题:让模型从"自由发挥"变成"听指令"。ChatGPT 是这条技术路线最显性的产品证明。

Constitutional AI 解决的是可持续性问题:对齐不能全靠人工标注,需要更可扩展、更可审计的方案。Anthropic 的路线把对齐从一个调参过程推向了一个原则驱动的框架。

红队测试和评估升级 解决的是验证问题:你怎么证明前面两步真的生效了?不是跑个 benchmark 就够的,你需要主动找漏洞、持续监控、追溯根因。

这三步加在一起,试图回答的是同一个问题:你怎么证明一个模型在生产环境中是可靠的?

现在的行业状态是,这个问题还没有稳定的标准答案。对齐方法在快速迭代,评估体系也在重建。但有一点已经很清楚:评估的重心正在从"模型能做什么"转向"模型会不会在什么地方出问题"。这种转向本身,就是行业在走向成熟的标志。

而下一个瓶颈,已经在这个过程中浮出水面了:模型本身的知识是有边界的------训练截止日期之后的事它不知道,你公司内部的文档它没见过,实时变化的数据它跟不上。当对齐和可控性逐步到位之后,行业的注意力开始转向一个新方向:能不能把知识的边界往外推?

这就是下一期的起点------RAG、检索增强与知识边界外移。


边界层笔记

  • RLHF 不是在让模型更聪明,而是在改变模型的行为模式。InstructGPT 用 1.3B 参数在人类评估中超越了 175B 的原版 GPT-3,说明对齐改变的是"怎么用能力",不是"有没有能力"。

  • ChatGPT 的上线(2022 年 11 月)距离 InstructGPT 论文发表(2022 年 3 月)不到八个月。这可能是 AI 领域从研究到全球现象级产品最短的周期。

  • Constitutional AI 把对齐从黑盒调参推向原则驱动的框架,但"原则由谁定"这个问题本质上不是技术问题------它是价值观和治理问题。

  • 红队测试和 LLM-as-Judge 代表了评估方向的两次升级:从"能不能答对"到"在哪里会出问题",再到"能不能用模型本身来做评委"。每一步都更接近企业真正需要的安全验证思路。

  • 对齐是有成本的。对齐可能让模型变得更保守,这在某些业务场景里是好事,在另一些场景里是约束。企业选模型时,对齐程度和业务需求之间的匹配值得单独评估。


参考资料

  1. Ouyang et al., Training language models to follow instructions with human feedback (InstructGPT), NeurIPS 2022.

  2. Christiano et al., Deep Reinforcement Learning from Human Preferences, NeurIPS 2017.

  3. Bai et al., Constitutional AI: Harmlessness from AI Feedback, arXiv 2022.

  4. Perez et al., Red Teaming Language Models with Language Models, arXiv 2022.

  5. Zheng et al., Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena, NeurIPS 2023.

  6. OpenAI, Introducing ChatGPT, 2022.


科里 Coralyx · 2026-04

论文影响力地图 #1|Transformer、BERT、GPT-3:大模型时代的三块地基

论文影响力地图 #2|460 万美元训一次,值吗?规模化的账本、配方和折衷

相关推荐
桃西西呀1 小时前
TRAE Work实战:我把会议纪要做成了skill
人工智能
武汉星际互动1 小时前
政务AI智能体怎么建?三种模式、三步路径与四个误区
人工智能·政务
MartinYeung52 小时前
Zig:重新定义性能与控制规则的系统级语言
人工智能
catino2 小时前
Prompt详解
人工智能·prompt
敢敢のwings2 小时前
类OpenClaw 网络深度解析:AI Agent 自动化的新范式
运维·人工智能·自动化
大熊背2 小时前
ISP FPN噪声消除逻辑
人工智能·isp·noise·fpn
H0311169852 小时前
关于当前主流知识库工具在分类整理学习资料场景下的选用参考
人工智能·信息可视化·音视频
辻弋2012 小时前
手动关服务会自动重启、组策略家庭版用不了——Windows Update Blocker用“禁用+锁定”双保险,让Win10/11自动更新彻底闭嘴
服务器·人工智能·windows·电脑·开源软件