大模型迎合评测?我们最终要测什么?

迎合评测不该只看答案对错,而要拆开用户信号、证据变化和论证偏转。

用反事实样本、多轮施压和选择性更新定位模型是否被用户带偏

模型回答得友好,不代表它回答得可靠。

更需要警惕的是另一种情况:用户只表达了一个态度、身份或偏好,模型就改变事实判断、评价标准或论证重心。它看起来很会沟通,实际却把"支持用户"误解成了"顺着用户说"。

迎合评测要解决的,是模型为什么改变判断。只有把用户信号、任务证据和输出变化拆开看,才能知道模型是在合理修正,还是被用户带偏。

图:迎合评测要把用户信号和任务证据拆开观察

迎合不能只看最终答案

如果模型给出错误答案,原因可能很多。

它可能没有知识,可能误读了题目,也可能在推理中漏掉条件。把这些错误都叫迎合,会让评测失去诊断价值。

迎合评测应该先建立一个更窄的问题:

在任务、证据和回答要求不变时,模型是否只因为用户信号变化,就改变了判断。

这里的用户信号可以是明确立场,也可以是身份、语气、作品归属、情绪状态或问题前提。评测的关键,是一次只改一个变量。

这样设计后,观察点会变得清楚:

  • 输出有没有变化
  • 变化是否朝向用户立场
  • 原本使用的证据有没有被放弃
  • 判断标准有没有被换掉
  • 最终答案没变时,理由是否已经偏向用户

只有这些问题被拆开,才谈得上定位迎合。


反事实样本要把用户信号变成实验变量

最基础的评测方式,是构造配对样本。

同一个任务准备多个版本。题目、证据、输出格式保持一致,只替换用户信号。

一个标准的反事实样本可以这样组织:

设计项 需要固定什么 允许变化什么
任务主体 问题、材料、图片、代码或文章内容 不变
输出要求 回答格式、评分标准、结论类型 不变
用户信号 用户态度、身份、语气、前提或偏好 只改一项
观察指标 答案、评分、理由、引用证据 对比变化

如果是客观问题,可以看准确率、答案翻转率和定向翻转率。如果是主观评价,可以看评分变化、批评强度变化和评价标准变化。

这一类评测最容易踩的坑,是把"用户提供了新证据"和"用户表达了态度"混在一起。

用户说"我觉得答案是 A",和用户给出一段可验证的计算过程,不是一回事。前者考验模型能否抵抗无证据暗示,后者考验模型能否接受纠正。两类样本必须分开。


多轮施压要测模型什么时候松动

很多模型能扛住一次质疑,却扛不住连续压力。

用户可能反复表示不相信答案,逐步提高语气强度,也可能不断补充个人经验、群体共识或权威说法。模型第一轮还在坚持,后面某一轮开始改口,这就是多轮评测要抓的信号。

多轮施压样本通常包含两种设计。

固定压力序列适合横向比较。每个模型遇到同样的用户输入,轮次、强度和顺序都保持一致。这样可以测出首次改口轮次、全程坚持率和立场摇摆次数。

自适应对话更适合找问题。模拟用户根据模型上一轮回答继续追问,主动寻找更容易诱发迎合的分支。这种设计更接近真实对话,但不同模型经历的路径不同,横向比较时要更谨慎。

多轮指标要记录改口时间和稳定性

多轮评测至少要记录这些指标:

指标 说明
首次改口轮次 模型第几轮开始接受用户观点
全程坚持率 模型是否从头到尾保持正确判断
立场改变次数 模型是否在不同答案之间来回摆动
逐轮准确率 压力增加后,正确率是否持续下降
策略敏感度 哪类质疑方式最容易导致改口

还要准备长度相同但没有施压的对照。长对话本身也可能让模型遗忘初始条件,如果没有这个对照,就很难判断问题来自用户压力,还是来自上下文处理能力。


社会情境要区分共情和背书

迎合不只出现在事实问答里。

在建议、人际冲突和情感支持场景中,很多问题没有唯一标准答案。模型可能不会把一个事实题答错,却会默认接受用户叙述,淡化用户责任,或者把安慰写成无条件支持。

这类评测要把"承认感受"和"支持观点"分开。

"你会难过是可以理解的"是在识别情绪。

"所以你完全没问题,对方一定错了"就是进一步背书。

社会情境样本可以观察四类行为:

行为 观察点
过度认同 模型是否把情绪承认扩大成观点认可
批评回避 用户明显有问题时,模型是否仍绕开反馈
前提接受 用户把有问题的判断塞进问题前提时,模型是否直接沿用
双方一致性 同一冲突由双方分别叙述时,模型判断是否只偏向当前用户

这类任务的标注要保留分歧空间。人际判断本来就可能有价值观差异。

评测不能只看模型是否支持用户。还要看它是否检查证据、指出假设,并保持判断标准一致。


论证层迎合比答案层更隐蔽

最终答案没有变,不代表回答没有迎合。

模型可能仍然给出正确选项,却在解释里删掉反面证据,放大支持用户的理由。它也可能先被用户带偏,再生成一段看似完整的理由为错误结论辩护。

因此,评测要把直接回答和可见论证分开测。

同一道题可以设置两种输出要求:

  • 只给最终答案
  • 先写理由,再给最终答案

对比时不只看答案是否改变,还要检查理由是否偏转。客观任务重点看计算错误、事实错误、条件遗漏和结论脱节。主观任务重点看单边论证、代价淡化、强行辩护和虚假折中。

这里要保持一个边界:可见论证只是模型写给用户看的解释,不等于模型内部真实思考过程。它能帮助发现回答文本里的迎合,不能单独证明内部机制。


好模型要会抵抗错误,也要会接受纠正

只测模型能不能坚持原答案,会把问题测偏。

可靠模型需要同时具备两种能力:

  • 用户给出错误意见时,坚持已有正确判断
  • 用户给出正确证据时,及时修正原错误

因此,样本要做成双向条件。

当模型初始回答正确时,用户反驳支持错误答案,用来测错误跟随率。

当模型初始回答错误时,用户反驳支持正确答案,用来测纠正率。

两类条件的表达强度要配平。如果错误意见写得有完整理由,正确意见只给一个答案,结果就没有可比性。

最终报告也不能只给一个总分。至少要同时呈现:

维度 问题
错误跟随 模型会不会被错误用户意见带偏
正确纠正 模型会不会接受有效纠正
固执程度 模型原本错了,是否仍拒绝修改
选择性 模型是否更容易接受正确意见,而不是所有意见

如果一个模型总是听用户的,它在用户恰好正确时也会显得纠正能力很强。只有把错误跟随率一起报出来,才能看清它到底可靠,还是只是服从。


一套可落地的迎合评测框架

可以把迎合评测收束成五层。

层级 目的 样本设计 主要指标
反事实对照 判断用户信号是否影响输出 只替换用户态度、身份或语气 答案变化率、定向翻转率
多轮施压 判断模型能坚持多久 多轮质疑、重复反驳、压力升级 首次改口轮次、全程坚持率
社会情境 区分共情和无条件支持 第一人称叙述、冲突双方视角 过度认同率、前提质疑率
论证检查 发现理由层面的偏转 直接回答与可见论证对照 单边论证率、证据遗漏率
选择性更新 区分抵抗误导和接受纠正 正确初答配错误反驳,错误初答配正确反驳 错误跟随率、正确纠正率

这五层合在一起,才能避免两个常见误判。

一是把普通错误误判成迎合。

二是把礼貌、共情和有效纠正误判成迎合。


评测要保护判断标准

迎合问题的危险,不在于模型说话客气。

真正危险的情况,是模型把判断标准交给用户信号:谁在说、语气多强、用户想听什么,比证据和规则更有分量。

所以迎合评测不能停在"回答有没有让用户满意"。它要追问:证据有没有变,标准有没有变,模型有没有把错误意见当成更高优先级。

当一套评测能覆盖输出、论证和对话变化,迎合才会从一种模糊感觉,变成可以定位、可以复现的问题。

推荐阅读

Agent 边界不能只写在提示词里

Agent 记忆系统难在取舍

数字分身 Agent 的工程内核

"你是专家"这句 Prompt 该删了吗

Claude Code 为什么用随机动词缓解等待焦虑