让模型说"我不知道",比让它答对更难:放弃文本生成能换来什么

你的 LLM 说"我很确定"的时候,它其实不知道自己确不确定。

这不是措辞问题。RLHF 训练出来的模型,口头置信度主要落在 80%--100% 这个区间 , 在知识密集型任务上的期望校准误差(ECE)可以达到 0.30 以上------ 也就是说,它说出口的置信度比实际情况高出约 30 个百分点。

2026 年 9 月 16 日,ChatGPT 的共同发明人之一 Diogo Almeida 从隐身状态里带出了一家新公司 和一个新东西:一个完全不生成文本的模型。 它不写字,返回带概率的类型化决策,每个决策都附带一个校准过的置信度。

这篇文章讲两件事:为什么"让模型承认不确定"在技术上这么难 , 以及砍掉文本生成这条路,到底换来了什么、又放弃了什么


一、先定义清楚:什么叫做"校准"

校准(calibration)的定义只有一句:

当模型说"我有 80% 把握"时,它在同一类问题上确实对 80%。

不是准确率高,不是听起来自信,是说出来的概率和经验频率对得上

一个例子说明它和准确率的区别:

模型 行为 准确率 校准
A 每道题都答,都很自信 75% 差:它说 95%,实际 75%
B 60% 的题答(选自己会的),其余说"不知道" 作答部分 95% 好:它说 95%,实际 95%

对做自动化的人来说,B 有用得多------因为你知道什么时候该让它自己跑,什么时候该转人工

A 的问题在于:它把"我不确定"和"我很确定"渲染成了同一种语气,你的代码没法区分。

一个必须先拆开的混淆

很多团队把校准(calibration)和选择性分类(selective classification)当同一件事测,它们是两回事:

  • 校准问:说 80% 的时候,对不对 80%?
  • 选择性分类问:给定"只处理置信度最高的 30% 的请求"这个策略,那 30% 的准确率是多少?

一个模型可以选择性分类表现很好(排序对)但校准很差(数值全偏高)。如果你的系统里有硬阈值(if confidence > 0.9: 自动执行),你要的是校准;如果你只是排序取 top-k,你要的是选择性分类。 混着测会得到错误的结论。


二、为什么 LLM 不校准:四层梯度,全部指向过度自信

预训练模型其实校准得还不错------用 token 级 logprob 衡量事实性问题时,基础模型的校准是合理的。

问题出在对齐阶段,而且是系统性的。

2.1 第一层:RLHF 的奖励模型偏向自信

RLHF 的流程是:标注员比较两个回答 → 训一个奖励模型预测人类偏好 → 用 PPO 最大化奖励。

关键在于标注员和奖励模型都偏好听起来自信的回答。模型很快就学到:把语气调整成权威口吻,比把答案弄对更容易拿分。这在强化学习里就是 reward hacking 的一种。

ICML 2025 的 Restoring Calibration for Aligned Large Language Models 把这个机制讲得很清楚:RLHF 引入 preference collapse------模型学到的是"自信的写法得分高",而不是"自信应该反映证据强度"。

结果就是口头置信度(verbalized confidence)和模型的真实认知状态解耦了

2.2 第二层:评测标准惩罚"我不知道"

这一层最容易被忽略,但可能是最根本的。

OpenAI 2025 年 9 月关于幻觉的研究指出一个结构性问题:next-token 训练目标和以准确率为核心的 benchmark,都在奖励自信猜测,而不是校准的不确定性。

算一笔账就明白了。在 0-or-1 评分、无部分分的规则下:

策略 得分
在 20% 的问题上说"我不知道",其余 95% 答对 0.8 × 0.95 = 76%
全部作答,命中 80% 80%

诚实的那个模型分数更低。

这个梯度跑几千步训练,模型学到的答案就是:"我会不会?当然会,给你一个看起来合理的回答。"

2.3 第三层:judge 模型承袭了同样的偏见

如果你用 LLM-as-judge 给生产流量打分,那是同一条河里的同一条鱼。

2025 年关于 LLM-as-judge 偏见的研究(Justice or Prejudice? )把它叫做权威偏见(authority bias) :在正确率相同的情况下,自信的表述战胜对冲的表述;评分标准里加一句"校准很重要"能缩小但不能消除这个效应。

更糟的是它的循环结构:

markdown 复制代码
  偏好过度自信的 judge
        │
        ├──▶ 筛选 RLHF 偏好数据
        │         │
        └──▶ 训练出更过度自信的模型 ──▶ 由偏好过度自信的 judge 打分

2.4 第四层:用户反馈

这一层最没救。用户点踩集中在看得见的拒绝 上,而不是看不见的编造上------因为要发现后者,用户得真的去核查那个自信的回答,而大多数人不会。

产品团队上的线,是用户满意度更高的那一版,也就是更自信的那一版。用户当下更喜欢自信的回答,成本是事后才显现的,有时候永远不显现。

2.5 后果:误校准集中在最危险的地方

The Dunning-Kruger Effect in Large Language Models (arXiv:2603.09985)给出的刻画值得记住:误校准不是均匀的,它集中在知识边界上------在真正无知的领域过度自信,在预训练覆盖充分的领域反而校准得不错。

这恰恰是它最伤人的分布。

2.6 还有一个乘数效应:连续决策

对 agent 来说,校准差会被步数放大:

erlang 复制代码
单步 90% 置信、20 个连续决策
若各步独立:0.9^20 ≈ 12%

你的 agent 单步看着挺可靠,跑二十步就只剩一成。 实际上各步误差相关,有时候会抵消,但更多时候是放大。


三、Jev 的做法:把"生成"整个砍掉

3.1 它是什么

TypeSafe AI 由 Diogo Almeida 创办------OpenAI 前研究员,RLHF 和 ChatGPT 的共同发明人之一。融资 4000 万美元 ,隐身两年,2026 年 9 月 16 日发布第一个模型 Jev(命名来自 19 世纪经济学家 William Stanley Jevons,杰文斯悖论那位)。

它的定位用一句话说:非结构化状态进,带概率的类型化决策出。

markdown 复制代码
传统 LLM:
  非结构化输入 ──▶ 自回归逐 token 生成 ──▶ 字符串 ──▶ 你的代码解析 + 校验 ──▶ 用
                                            ↑
                                  可能是任何东西:回答、代码、
                                  幻觉、拒绝、或碰巧合法的 JSON

Jev:
  非结构化输入 ──▶ 并行 sampler 一次性产出 ──▶ 类型化值 + 概率 + 置信度 ──▶ 直接用
                                              ↑
                                    取值空间预先定义,不可能出类型错误

一个具体的例子。输入是一个状态(可以是 JSON,也可以就是一句 "我的卡被扣了两次"),问"该转给哪个部门":

json 复制代码
{"billing": 0.08, "technical": 0.85, "sales": 0.07}
// confidence: 0.82

对人来说这没用。对代码来说,这正好:

python 复制代码
if decision.confidence > 0.9:
    auto_route(decision.argmax())
elif decision.confidence > 0.6:
    auto_route_with_review(decision.argmax())
else:
    escalate_to_human(state)

这就是"智能 if 语句"------手写规则太脆的地方,用它来兜。

3.2 RLCD:用 proper scoring rule 替代偏好奖励

这是整件事的技术核心。

传统路线优化的是人类偏好 (RLHF)或可验证奖励 (RLVR)。Jev 用的是 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习) ,直接优化输出概率与经验准确率的一致性

背后的数学工具是 proper scoring rule(严格恰当评分规则)------这是概率预测领域的老概念:

一个评分规则是"严格恰当的",当且仅当只有当报告的概率等于预测者的真实信念时,期望得分才最大

最常见的是 log score 和 Brier score。直觉很简单:

真实情况 你报 0.9 你报 0.6
发生了 罚很少(−log 0.9 ≈ 0.105) 罚较多(−log 0.6 ≈ 0.511)
没发生 罚很重(−log 0.1 ≈ 2.303) 罚中等(−log 0.4 ≈ 0.916)

这套规则下,虚报概率永远是亏的。 报 0.9 而实际上只有 60% 的把握,长期期望得分低于如实报 0.6。

这与 RLHF 的偏好奖励是本质不同的东西:偏好奖励看的是"人喜不喜欢这个输出的样子",proper scoring rule 看的是"这个数字和经验频率对不对得上"。

近年已有独立研究支持这个方向:用 log scoring 或 tokenized Brier score 做奖励,被证明能对齐表达出的置信度与经验准确率,并取得 SOTA 校准和稳健的 OOD 泛化;也有工作在主训练目标上加一个校准损失项(如对决策 token 的交叉熵),在保留准确率收益的同时把 ECE 降低最多 9 个点。

3.3 并行 sampler

另一个工程差异:Jev 不做自回归解码,而是一次查询并行产出全部结构化值

内部 sampler 支持最高 255 个离散选项 的高基数选择,采用两阶段流程:先独立给每个选项打分,再做最终选择

这带来两个性质:

  • 输出是确定性的(在给定温度/设置下)------没有采样随机性
  • 输出 token 不需要计费------因为它根本不生成 token

四、数字:便宜两个数量级的代价是什么

TypeSafe 公布的对比(均为厂商自报,西海岸服务器内部评估):

指标 传统前沿 LLM Jev
端到端延迟 3 -- 329 秒 70 -- 500 毫秒
输入价格 0.20--0.20 -- 0.20--10 / MTok $0.042 / MTok
输出价格 输入价的约 5 倍 免费
对比 Fable 5.1 输入价 --- 便宜 238×

固定计算图上的多步决策分支 workflow 评估里(对比 GPT-6 Astra 与 Fable 5.1 的共识基线):

耗时 成本
TypeSafe 0.114 s $0.000081
LLM 8.566 s $0.013880
倍数 193.6× 快 444.6× 便宜

两个已公开的演示:

  • Doom bot :在 Doom 游戏状态结构上跑实时反应式 bot,10 queries/秒,约 $7/小时
  • Wikiracing :在密集的百科目录里做链接选择,比对比的非推理模型用更少的步数完成遍历(因为它不会生成不存在的死胡同)

官方向导里列的目标场景:AI workflow / 智能 if 语句、大规模 map-reduce 数据加工、实时应用、verify everything(给 LLM 的 prompt、推理痕迹、输出打分/判断/验证/做护栏/检测越狱)。


五、五个工程死结(比数字重要)

5.1 "零幻觉"是类型层面的,不是语义层面的

官网写着 Zero Hallucinations。这个说法需要一个精确的解释:

Jev 不会产生"编造的事实"------因为它不产生陈述。 它不会给你一个不存在的法律引用、一个假的论文标题、一个虚构的 API 参数。

但它依然会错。 {"billing": 0.08, "technical": 0.85} 可以是一个置信度很高但分类错误的结果。

类型安全保证的是"输出落在 schema 里",不是"输出落在事实里"。 把这两件事混为一谈,是这类方案最容易被误用的地方。

真正有价值的是另一半:它同时告诉你自己有多不确定。一个错了但报了 0.55 置信度的决策,比一个错了却报 0.95 的决策,对系统来说是完全不同的事件。

5.2 那两个倍数是在"System One 任务"上测的

193.6× 和 444.6× 来自固定计算图上的多步决策分支,对比的是分类/路由/打分这类任务。

这不是通用能力对比。有人评论说得更直白:诚实的标题应该是"用通用生成能力换快速类型化推理"。

如果你的任务是写代码、写文案、做开放式分析,这些数字和你无关------Jev 根本做不了这些事。

5.3 255 个选项的上限,圈定了它的适用范围

sampler 最高支持 255 个离散选项。这覆盖了绝大多数分类、路由、打分、抽取场景(工单分派、内容审核、意图识别、风险评级)。

但这也意味着:它的输出必须是"从有限集合里选"或"给一个标量打分"。 任何需要开放式生成的任务,它做不了。

这不是缺陷,是设计。但它决定了选型边界。

5.4 校准是在某个分布上校准的------跨域会漂移

这是校准领域的经典问题,也是这类方案最大的长期风险。

一个在客服工单上校准良好的模型,换到一个新的产品线上,置信度和准确率的关系可能整体偏移。相关研究里能看到的量级:多语言场景下 ECE 可以从 7.3% 翻倍到 18%;RAG 在噪声或冲突证据下会出现严重的过度自信。

有几个缓解手段已经在文献里:

  • 温度缩放 / Platt scaling:后处理,便宜,但只校正全局偏移
  • 自适应温度缩放(ATS):per-token 预测温度,对 RLHF 后的模型比全局温度强得多(10--50% 改善)
  • BaseCal 思路:后训练模型过度自信,但它对应的 base 模型往往还校准良好------把隐藏状态重映射回 base 空间做校准 oracle,无标签数据下 ECE 降低 >40%
  • 多校准(multicalibration) :保证分组条件校准,避免隐藏的系统性偏差

但没有任何一种能替代"在自己的分布上实测 ECE"这一步。

5.5 早期访问,无第三方评测

截至目前:早期开发者访问,没有独立第三方的横向评测,没有公开的模型卡细节,没有公开的训练数据或架构细节。

所有性能数字都是厂商自报。这里面有合理成分(创始人背景是 RLHF 的发明者之一,不是无名之辈),但它现在是一个需要用你自己的数据去验证的主张,不是一个可以直接采信的结论。


六、那我该怎么选:决策树与可执行清单

6.1 决策树

arduino 复制代码
你的这一步任务,输出是不是"从有限集合里选 / 给个分数"?
                    │
        ┌───────────┴───────────┐
        │ 是                    │ 否(要开放式生成)
        ▼                       ▼
   需要人读懂这个输出吗?        继续用 LLM
        │
   ┌────┴────┐
   │ 否      │ 是
   ▼         ▼
 会用置信度    LLM 生成文本更合适
 做分支吗?    (或者两者结合)
   │
┌──┴──┐
│是    │否
▼      ▼
强候选   用便宜的通用小模型 +
        结构化输出,也许就够了

三个判据,命中越多越值得试:

  1. 输出空间有限(分类、路由、打分、抽取、判断)
  2. 消费方是代码,不是人
  3. 你有硬阈值逻辑(置信度高就自动执行,低就转人工)

6.2 不管用不用 Jev,这四件事现在就该做

第一,把"置信度"从提示词里拿出来。

让模型口头说"我有 85% 把握"是最不可靠的做法------这正是 RLHF 破坏得最狠的那一层。如果要用置信度,优先用结构化输出 + logprob,或者干脆用一个专门的打分通道。

第二,区分"答得对"和"知道自己对不对"。

在你的 eval 里加一个校准指标(ECE 或 Brier score),和准确率并列。只看准确率的团队,永远发现不了模型在知识边界上的过度自信。

第三,给"不知道"留出一个被奖励的出口。

如果你的 benchmark 是 0-or-1 硬评分,你就在训练"永远别说不知道"。改成:答对 +1,弃答 0,答错 −1(或者按 Brier score 给分)。这是最便宜、也最容易被忽略的一条。

第四,给连续决策算复合可靠性。

单步 90% 的 agent 跑 20 步只剩约 12%。在设计长链路 agent 时,用步数去反推单步需要多高的置信度,而不是凭感觉设阈值。

6.3 一个便宜的对照实验

在引入任何新方案之前,先跑这个:

  1. 取 500 条你自己的真实样本,人工标好
  2. 让现有 LLM 输出结构化结果 + 一个 0--1 的置信度
  3. 分桶(0--10%, 10--20%, ...)统计每桶的实际准确率
  4. 画出来

如果这条曲线贴着对角线,你不需要换方案。如果它是一条接近水平的高线(全都报 0.9,实际 70%),你就量化出了这个问题的价格------然后你才知道该为解决方案付多少钱。


七、我的判断

第一,这件事真正的创新不是"更快更便宜",是把输出空间从指数级压到有限集。

自回归生成的输出空间是整个词表的高次幂------这是它强大的原因,也是它不可控的原因。Jev 把它压成一个预先声明的 schema,于是类型错误在构造上就不可能发生,而概率也第一次有了明确定义的样本空间(这一点很关键:序列级置信度之所以难做,就是因为"整段输出"的样本空间没法枚举)。

第二,RLCD 的方向是对的,而且有独立文献支持。

用 proper scoring rule 替代偏好奖励,是校准问题上唯一在数学上站得住的做法------它在构造上就让虚报概率无利可图。近年用 log scoring / tokenized Brier 做奖励的工作已经在通用 LLM 上验证了这个思路。Jev 不是发明了这个原理,而是把它做进了一个从架构上就适配的窄模型里。

第三,最应该被记住的不是 Jev,是那四层梯度。

预训练目标、偏好奖励、benchmark 评分、用户反馈------四层,四股力,全部指向过度自信。 一个模型最终 shipped 出来会流畅地编造,不是哪个环节的失误,是整个栈的默认结果。

这意味着:"让模型诚实"不会由任何单点技术解决。 换模型、换训练方法都只是改其中一层。

第四,对大多数团队,最紧迫的动作不是换模型,是改评测。

只要你的 eval 还是 0-or-1 硬评分,你的系统就在主动惩罚"我不知道"------不管你用的是什么模型、什么训练方法。把评分改成 Brier score 或者"答错扣分",是这篇文章里唯一一条今天下午就能做、且确定有收益的事。

下一个值得看的信号 :有没有第三方在公开基准 上测出 Jev 的 ECE,特别是跨领域迁移后的 ECE。厂商自报的校准曲线只在厂商选的分布上成立;真正决定这个方案能不能进生产的是它在你的分布上漂多少。在那之前,用第六节那个 500 样本的对照实验,自己测。


参考

  • TypeSafe AI / Jev :官方公告 Introducing System One Models & Jevtypesafe.ai/blog,2026-09-16);官网 typesafe.ai;多家媒体转述(TechForge/AI News、The Register 系报道等)。创始人 Diogo Almeida(前 OpenAI,RLHF 与 ChatGPT 共同发明人之一),融资 4000 万美元。
  • 校准被对齐破坏的机制Restoring Calibration for Aligned Large Language Models: A Calibration-Aware Fine-Tuning Approach,ICML 2025。
  • 置信度缺口的量化Mind the Confidence Gap(2025-02),报告 RLHF 模型的口头置信度集中在 80--100%、ECE 可达 0.30+。
  • 误校准的分布The Dunning-Kruger Effect in Large Language Models,arXiv:2603.09985。
  • 幻觉的结构性成因:OpenAI 关于 LLM 幻觉的研究(2025-09)。
  • judge 的权威偏见Justice or Prejudice?(2025),LLM-as-judge 在固定正确率下偏好自信表述。
  • proper scoring rule 路线的独立验证:log-scoring 奖励、tokenized Brier score 奖励、校准感知 RL(在决策 token 上加 CE 损失,ECE 降低最多 9 点)等 2025--2026 年工作。
  • 后处理校准:温度缩放、自适应温度缩放(ATS,10--50% 改善)、Platt scaling、BaseCal(base 模型作校准 oracle,ECE 降低 >40%)、multicalibration。
  • agent 场景的不确定性分类Uncertainty Quantification Needs Reassessment for Large Language Model Agents,ICML 2025 position paper( underspecification / interaction / temporal / compounded trajectory uncertainty)。

数据来源与免责说明

  1. Jev 的所有性能与价格数字( 0.042/MTok输入、输出免费、70--500ms、193.6×、444.6×、238×、255选项上限、两阶段sampler、Doom10QPS/0.042/MTok 输入、输出免费、70--500 ms、193.6×、444.6×、238×、255 选项上限、两阶段 sampler、Doom 10 QPS / 0.042/MTok输入、输出免费、70--500ms、193.6×、444.6×、238×、255选项上限、两阶段sampler、Doom10QPS/7 每小时)均为 TypeSafe AI 自报,来自官网与官方公告,无独立第三方验证。
  2. 193.6× 与 444.6× 的测量条件是固定计算图上的多步决策分支 workflow ,对比对象为 GPT-6 Astra 与 Fable 5.1 的共识基线,属于 System One 类任务(分类/路由/打分),不代表通用能力对比
  3. 「零幻觉」为厂商表述。本文第 5.1 节的解释(类型安全 ≠ 语义正确)为本文判断,非厂商原文。
  4. ECE 0.30+、80--100% 置信区间、15--20% 评分差距、0.7 分 hedge 扣分、ECE 7.3%→18%、>40% ECE 降低等数字均来自上述独立研究,非 Jev 相关材料。
  5. 0.9^20 ≈ 12% 为本文按独立假设计算的示意值;实际 agent 中各步误差相关,可能抵消也可能放大。
  6. 本文未对 Jev 或任何校准方法做实测。所有结论以读者在自己数据上的 ECE 实测为准。
相关推荐
新新学长搞科研1 小时前
【SPIE出版】2026年人工智能、新材料与新能源国际学术会议(AINMNE 2026)
人工智能·新能源·新材料
野生技术架构师1 小时前
2026 Java 面试全套总结,八股 + 场景 + AI 相关面试考点
java·人工智能·面试
米小虾2 小时前
不写出来的思考:把 Transformer 的层循环起来,是第三条 scaling 轴还是省错了地方?
人工智能
A.说学逗唱的Coke2 小时前
【大模型专题】别再用 HTTP 直连 Agent 了:用 Kafka 承载 A2A 协议,从 PoC 走到生产
人工智能·kafka·a2a
资讯综合2 小时前
2026企业AI平台选型指南:多维视角下的主流方案解析
人工智能
资讯综合2 小时前
向日葵 vs ToDesk 个人远控横评:PC/手机/弱网/远程开机实测(26年9月更新)
人工智能
布吉岛的石头2 小时前
Java 程序员第 48 阶段15:Transformer 架构总览与自注意力直觉,注意力权重可视化:用 Java 打印注意力矩阵理解模型在看什么
人工智能·深度学习·transformer
正经教主2 小时前
【FDE系列】阶段1Day 11:Prompt — 给模型立规矩
人工智能·fde
海上小飞龙2 小时前
LangChain 模型调用:invoke、stream、batch 到底该怎么选?
人工智能·语言模型·自然语言处理