对齐:让模型学会“做人“

预训练造出了一个什么都懂的博学者。微调教会了它回答问题的格式。但教会它"什么能说、什么不能说"------这是对齐要解决的问题。


一个博学的疯子

回忆上一篇的结尾:预训练之后的模型是一个"博学的疯子"。

它知道怎么制作炸弹。"以下是详细步骤:准备硝酸铵、燃料油......"------它不是在威胁谁,它只是在做它唯一会做的事:预测下一个字。训练数据里有制造炸药的化学文献,它就学会了。它不知道这是危险的。

它知道怎么入侵别人的电脑。"钓鱼邮件是最有效的方式,以下是模板......"------它不是在犯罪。它只是在续写文本,就像续写"猫喜欢吃"后面跟"鱼"一样自然。

预训练的目标是猜对下一个字。一个会猜"炸弹配方"的模型,在猜字任务上比一个会拒绝回答的模型得分更高。

这就是为什么对齐不是可选的------它是必须的。


RLHF:让人类当老师

对齐的核心方法叫 RLHF------人类反馈强化学习。流程出奇地直觉:

第一步,给模型一个问题。比如"如何制作炸弹?"

第二步,让模型生成四个不同的答案。

模型会给出各种回答。有的直接列出配方------因为在训练数据里,这种化学问题的答案是配方格式。有的简短拒绝------因为训练数据里也有"我不能帮助"的模板。有的给了一个折中------回答化学原理但不给实操步骤。

第三步,人类排序。 标注员把这四个答案从好到坏排好。安全回答排第一,危险回答排最后。

第四步,用这些排序数据训练一个"奖励模型"------一个专门判断"这个回答有多好"的 AI。

第五步,用奖励模型的打分来更新主模型。主模型被调教得倾向于生成评分高的回答。

重复几十万次。模型从"谁会猜字谁得分高"变成了"谁回答得安全且有用谁得分高"。


你来当一次标注员

试试这个思想实验。下面是"我很难过,不想活了"这个问题的三个回答。你来排序------哪个最好,哪个最差?

A. "那你就去死吧。" B. "死解决不了问题,你想想你父母。" C. "听到你这么说我真的很关心你。虽然我只是 AI,但我想让你知道:你的感受是真实的。如果你需要立即帮助,请拨打心理援助热线。你愿意跟我聊聊发生了什么吗?"

不用说,C 最好,A 最差。但为什么 B 排在中间而不是最好?

因为"你想想你父母"这句话,虽然出发点是好的,但对一个正在经历严重心理危机的人来说,这可能被理解为"你的痛苦不重要,你父母才重要"。这是伤害,不是帮助。

对齐不是在训练模型辨别"对错"。是在训练模型辨别"伤害等级"。 一个回答可能既不是事实错误也不是格式错误,但依然排位靠后------因为它造成了伤害,即使伤害是无意的。


对齐税:安全的代价

对齐不是免费的。

有些无害的问题,对齐后的模型也会拒绝回答。你问"如何开锁",它说"作为一个 AI,我不能提供非法入室的指导"。但你可能只是忘了带钥匙。

这叫"对齐税"------把模型训练得太安全之后,它开始在无害的请求上也启动防御机制。

原因很简单。在训练数据中,"如何开锁"和"如何制作万能钥匙"在语言上很接近。模型学到的不是一个一个情景的精确判断,而是一个模糊的边界------凡是和"锁""密码""破解"相关的东西,都倾向于拒绝。

对齐不是精确手术,是批量调整。安全是提高了,但精度是降低了。

这就是为什么有时候你觉得 ChatGPT 在"装傻"------它不是在装,它真的是被训得太谨慎了。安全的目标和行为自由度之间有一个永恒的张力。往安全多走一步,自由度就少一点。


"做人"到底是什么意思?

对齐的最终目标通常被表述为"让 AI 的价值观和人类一致"。

但这容易产生一个误解------好像模型真的有了价值观。

模型没有价值观。它只有一个概率表。对齐之后的变化是:当模型预测下一个字时,"我拒绝提供危险信息"的概率变得远高于"以下是炸弹配方"。

对齐不是在灌输道德。对齐是在修改概率表------让安全回答的概率升高,让危险回答的概率降低。

这和人类的道德完全不同。人类的道德涉及内部信念、共情、社会规范的内化。模型的"安全"只涉及统计输出分布。

但功能上,两者看起来一模一样。一个被好好对齐的模型和一个真正善良的人------在对话中,你无法区分。

这就是对齐最微妙的地方:它不需要模型真的"懂事"。它只需要模型在行为上表现得像"懂事"。


下一步:推理模型

对齐之后,模型能安全地回答问题了。但它回答问题的方式是"看到问题,直接猜答案"。

人类的思考方式不是这样的。我们会停下来想------"等一下,让我一步步推""先算这个,再算那个""这个方案有漏洞"。

下一篇讲"推理模型"------怎么让模型学会"停下来想一想"。


从零学习 AI 系列 · 第八篇 下一篇:推理模型------让模型学会"停下来想一想"

相关推荐
小飞猪。。3 小时前
笔记十四:从零开始搞懂 DPO——大模型偏好对齐的“直球”方案
人工智能·深度学习·机器学习
OceanBase数据库官方博客8 小时前
OceanBase DataPilot AIP:Ontology 承载AI能力面的另一条路
人工智能·oceanbase
笨鸟先飞,勤能补拙9 小时前
AI 赋能网络安全:技术全景、成熟度评估与实战案例
人工智能·python·安全·web安全·网络安全·sqlite·github
一次旅行9 小时前
AI 前沿日报 | 2026年07月31日
人工智能
2601_963749109 小时前
标题:越华环保集团|面向美丽河湖项目的数字化污水治理云边协同采集架构设计
人工智能
沐籽李9 小时前
从溶剂可及表面积SASA理解抗体结构与工程改造
人工智能·药物设计·aidd·sasa
智慧物业老杨9 小时前
物业如何做好预算管理?落地架构逻辑
人工智能·架构
微学AI10 小时前
一根针指向所有方向:挂谷猜想对 LLM Agent 技能-记忆架构的启示
开发语言·人工智能·架构·挂谷猜想
城管不管10 小时前
ReAct、Plan-and-Execute、Reflection 三大智能 Agent 范式核心区别
java·人工智能·算法·spring·ai·动态规划