迎合评测不该只看答案对错,而要拆开用户信号、证据变化和论证偏转。
用反事实样本、多轮施压和选择性更新定位模型是否被用户带偏
模型回答得友好,不代表它回答得可靠。
更需要警惕的是另一种情况:用户只表达了一个态度、身份或偏好,模型就改变事实判断、评价标准或论证重心。它看起来很会沟通,实际却把"支持用户"误解成了"顺着用户说"。
迎合评测要解决的,是模型为什么改变判断。只有把用户信号、任务证据和输出变化拆开看,才能知道模型是在合理修正,还是被用户带偏。
图:迎合评测要把用户信号和任务证据拆开观察
迎合不能只看最终答案
如果模型给出错误答案,原因可能很多。
它可能没有知识,可能误读了题目,也可能在推理中漏掉条件。把这些错误都叫迎合,会让评测失去诊断价值。
迎合评测应该先建立一个更窄的问题:
在任务、证据和回答要求不变时,模型是否只因为用户信号变化,就改变了判断。
这里的用户信号可以是明确立场,也可以是身份、语气、作品归属、情绪状态或问题前提。评测的关键,是一次只改一个变量。
这样设计后,观察点会变得清楚:
- 输出有没有变化
- 变化是否朝向用户立场
- 原本使用的证据有没有被放弃
- 判断标准有没有被换掉
- 最终答案没变时,理由是否已经偏向用户
只有这些问题被拆开,才谈得上定位迎合。
反事实样本要把用户信号变成实验变量
最基础的评测方式,是构造配对样本。
同一个任务准备多个版本。题目、证据、输出格式保持一致,只替换用户信号。
一个标准的反事实样本可以这样组织:
| 设计项 | 需要固定什么 | 允许变化什么 |
|---|---|---|
| 任务主体 | 问题、材料、图片、代码或文章内容 | 不变 |
| 输出要求 | 回答格式、评分标准、结论类型 | 不变 |
| 用户信号 | 用户态度、身份、语气、前提或偏好 | 只改一项 |
| 观察指标 | 答案、评分、理由、引用证据 | 对比变化 |
如果是客观问题,可以看准确率、答案翻转率和定向翻转率。如果是主观评价,可以看评分变化、批评强度变化和评价标准变化。
这一类评测最容易踩的坑,是把"用户提供了新证据"和"用户表达了态度"混在一起。
用户说"我觉得答案是 A",和用户给出一段可验证的计算过程,不是一回事。前者考验模型能否抵抗无证据暗示,后者考验模型能否接受纠正。两类样本必须分开。
多轮施压要测模型什么时候松动
很多模型能扛住一次质疑,却扛不住连续压力。
用户可能反复表示不相信答案,逐步提高语气强度,也可能不断补充个人经验、群体共识或权威说法。模型第一轮还在坚持,后面某一轮开始改口,这就是多轮评测要抓的信号。
多轮施压样本通常包含两种设计。
固定压力序列适合横向比较。每个模型遇到同样的用户输入,轮次、强度和顺序都保持一致。这样可以测出首次改口轮次、全程坚持率和立场摇摆次数。
自适应对话更适合找问题。模拟用户根据模型上一轮回答继续追问,主动寻找更容易诱发迎合的分支。这种设计更接近真实对话,但不同模型经历的路径不同,横向比较时要更谨慎。
多轮指标要记录改口时间和稳定性
多轮评测至少要记录这些指标:
| 指标 | 说明 |
|---|---|
| 首次改口轮次 | 模型第几轮开始接受用户观点 |
| 全程坚持率 | 模型是否从头到尾保持正确判断 |
| 立场改变次数 | 模型是否在不同答案之间来回摆动 |
| 逐轮准确率 | 压力增加后,正确率是否持续下降 |
| 策略敏感度 | 哪类质疑方式最容易导致改口 |
还要准备长度相同但没有施压的对照。长对话本身也可能让模型遗忘初始条件,如果没有这个对照,就很难判断问题来自用户压力,还是来自上下文处理能力。
社会情境要区分共情和背书
迎合不只出现在事实问答里。
在建议、人际冲突和情感支持场景中,很多问题没有唯一标准答案。模型可能不会把一个事实题答错,却会默认接受用户叙述,淡化用户责任,或者把安慰写成无条件支持。
这类评测要把"承认感受"和"支持观点"分开。
"你会难过是可以理解的"是在识别情绪。
"所以你完全没问题,对方一定错了"就是进一步背书。
社会情境样本可以观察四类行为:
| 行为 | 观察点 |
|---|---|
| 过度认同 | 模型是否把情绪承认扩大成观点认可 |
| 批评回避 | 用户明显有问题时,模型是否仍绕开反馈 |
| 前提接受 | 用户把有问题的判断塞进问题前提时,模型是否直接沿用 |
| 双方一致性 | 同一冲突由双方分别叙述时,模型判断是否只偏向当前用户 |
这类任务的标注要保留分歧空间。人际判断本来就可能有价值观差异。
评测不能只看模型是否支持用户。还要看它是否检查证据、指出假设,并保持判断标准一致。
论证层迎合比答案层更隐蔽
最终答案没有变,不代表回答没有迎合。
模型可能仍然给出正确选项,却在解释里删掉反面证据,放大支持用户的理由。它也可能先被用户带偏,再生成一段看似完整的理由为错误结论辩护。
因此,评测要把直接回答和可见论证分开测。
同一道题可以设置两种输出要求:
- 只给最终答案
- 先写理由,再给最终答案
对比时不只看答案是否改变,还要检查理由是否偏转。客观任务重点看计算错误、事实错误、条件遗漏和结论脱节。主观任务重点看单边论证、代价淡化、强行辩护和虚假折中。
这里要保持一个边界:可见论证只是模型写给用户看的解释,不等于模型内部真实思考过程。它能帮助发现回答文本里的迎合,不能单独证明内部机制。
好模型要会抵抗错误,也要会接受纠正
只测模型能不能坚持原答案,会把问题测偏。
可靠模型需要同时具备两种能力:
- 用户给出错误意见时,坚持已有正确判断
- 用户给出正确证据时,及时修正原错误
因此,样本要做成双向条件。
当模型初始回答正确时,用户反驳支持错误答案,用来测错误跟随率。
当模型初始回答错误时,用户反驳支持正确答案,用来测纠正率。
两类条件的表达强度要配平。如果错误意见写得有完整理由,正确意见只给一个答案,结果就没有可比性。
最终报告也不能只给一个总分。至少要同时呈现:
| 维度 | 问题 |
|---|---|
| 错误跟随 | 模型会不会被错误用户意见带偏 |
| 正确纠正 | 模型会不会接受有效纠正 |
| 固执程度 | 模型原本错了,是否仍拒绝修改 |
| 选择性 | 模型是否更容易接受正确意见,而不是所有意见 |
如果一个模型总是听用户的,它在用户恰好正确时也会显得纠正能力很强。只有把错误跟随率一起报出来,才能看清它到底可靠,还是只是服从。
一套可落地的迎合评测框架
可以把迎合评测收束成五层。
| 层级 | 目的 | 样本设计 | 主要指标 |
|---|---|---|---|
| 反事实对照 | 判断用户信号是否影响输出 | 只替换用户态度、身份或语气 | 答案变化率、定向翻转率 |
| 多轮施压 | 判断模型能坚持多久 | 多轮质疑、重复反驳、压力升级 | 首次改口轮次、全程坚持率 |
| 社会情境 | 区分共情和无条件支持 | 第一人称叙述、冲突双方视角 | 过度认同率、前提质疑率 |
| 论证检查 | 发现理由层面的偏转 | 直接回答与可见论证对照 | 单边论证率、证据遗漏率 |
| 选择性更新 | 区分抵抗误导和接受纠正 | 正确初答配错误反驳,错误初答配正确反驳 | 错误跟随率、正确纠正率 |
这五层合在一起,才能避免两个常见误判。
一是把普通错误误判成迎合。
二是把礼貌、共情和有效纠正误判成迎合。
评测要保护判断标准
迎合问题的危险,不在于模型说话客气。
真正危险的情况,是模型把判断标准交给用户信号:谁在说、语气多强、用户想听什么,比证据和规则更有分量。
所以迎合评测不能停在"回答有没有让用户满意"。它要追问:证据有没有变,标准有没有变,模型有没有把错误意见当成更高优先级。
当一套评测能覆盖输出、论证和对话变化,迎合才会从一种模糊感觉,变成可以定位、可以复现的问题。