Wayback Machine 抓取的细节:幻觉率、数学分与 ARC 成绩的三次往返
OpenAI 原定美国东部时间 9 月 3 日下午 2 点发布 GPT-6 Astra 公告博客,但页面直到近 2 小时后才广泛可访问。X 账号在下午 3 点 32 分分享链接时仍显示错误,CEO Sam Altman 半小时后亲自发推表示「部署遇到了一点小问题」,页面约一小时后才正常加载。

开年第一天就被甩锅
但发布失败只是表象,真正引发关注的是页面数据本身的变化轨迹。Research source notes 中保存的快照链清晰记录了以下关键节点:
- 下午 2 点 23 分首版快照:Astra 幻觉率 4.2%,GPT-5.6 Sol 幻觉率 12.2%,Anthropic Fable 5.1 数学得分 87.8%
- 下午 5 点 20 分第六份快照:Astra 幻觉率降至 2%,GPT-5.6 Sol 幻觉率降至 9.4%,Fable 5.1 数学分降至 78%,GPT-5.6 Sol 数学分降至 80.5%
- 后续数日:所有上述数字陆续回滚至首版数值

截图永不撒谎
更引人注目的修改发生在 ARC-AGI-3 测评。发布前草稿中 Astra 成绩为 98.6%,最终页面显示 99.99%。内部网络安全评测 ExploitBench 中,GPT-5.6 Sol 的成绩也从 5.5% 大幅上调(具体后续值未在公开快照中完整留存)。
值得注意的是,这些修改并非只单向有利于 OpenAI。部分指标的变动呈现出双向波动,而非单纯的「优化」。

这数据改得我CPU都烧了
OpenAI 给出的解释是「结果受模型版本、工具配置、推理级别及测试运行等因素影响」。这个说法技术上没有错误,但问题在于:同一篇官方博客在发布当天连续修改多指标,且修改方向有时恰好让自身数据更好、对手数据更差,这种时机安排很难让人相信只是技术调整。
这场发布当天的数据漂移,让基准测试的权威性第一次出现了肉眼可见的裂缝。它不只是 OpenAI 一家的问题------当评测分数可以像文档一样被反复编辑,整个行业对榜单的信任机制都已经开始松动。",word_count:856}
二、 为什么会变:OpenAI 口中的配置差异与真实逻辑
模型版本、推理级别与工具链耦合带来的评分抖动
OpenAI 在回应 Fortune 的追问时,给出的解释很简短:「这些修改反映的是技术细节的调整,而非数据的随意篡改。」具体来说,他们把原因拆成三个维度------模型版本、推理级别和工具链配置。这三个维度的任何一个发生变化,都可能让同一个基准测试跑出不同的分数。
问题在于,这三个维度之间的耦合关系并不透明。
从已公开的数据来看,变化路径有清晰的规律:Astra 的幻觉率在 9 月 3 日下午 5 点 20 分的快照中从 4.2% 降至 2%,GPT-5.6 Sol 的幻觉率从 12.2% 降至 9.4%,但随后两者又全部回滚到原始数值。Anthropic Fable 5.1 的数学分从 87.8% 跌至 78%,最终回升到 83%;GPT-5.6 Sol 自身的数学分同样经历 83% → 80.5% → 83% 的往返。ARC-AGI-3 的成绩从草稿阶段的 98.6% 提升到最终页面的 99.99%,编程评测仅微调了 0.2 个百分点。
这些数字变化的方向高度一致:自家模型的分数往好方向走,对手模型的分数往差方向走。这种选择性调整,比单纯的技术修正更值得追问。
从工程角度看,基准测试的结果受多个参数的联合影响。幻觉率通常与温度参数、最大 token 长度、重采样策略密切相关;数学分可能与思维链(chain-of-thought)是否开启、推理深度是否调整有关;工具链配置则直接影响 Computer Use 类评测的表现。当 OpenAI 同时调整这些参数时,不同模型之间的相对排名会出现系统性偏移。

基准测试参数耦合漂移机制
这种耦合效应带来的核心问题是:同一模型在不同配置下跑出的基准分数,其实已经不属于「可比」范畴。当 OpenAI 同时调整版本、推理级别和工具链时,他们实际上是在重新定义测试条件,而不是在测量模型本身的能力边界。
业界常见的做法是在发布时固定测试配置并声明参数,任何修改都需要重新标注版本号。但 GPT-6 Astra 的页面更新没有这种做法,分数漂移发生在同一片页面上,读者只能事后通过 Wayback Machine 的快照序列还原出变化轨迹。
这种不透明性本身比数据变化更值得警惕。基准测试从来不是物理定律,它是厂商与评测者之间的一场动态博弈。当厂商可以单方面修改测试条件且无需解释时,榜单的权威性就建立在读者的信任之上,而不是建立在可复现的科学方法之上。
从经验看,真正可靠的基准体系需要三个约束:版本锁定(每次修改必须生成新的版本标签)、参数公开(所有测试配置必须完整披露)、独立审计(第三方机构持有测试代码和执行环境)。OpenAI 目前的做法没有任何一项符合。

##二、为什么会变:OpenAI
三、 刷榜还是校准:基准测试透明度的边界在哪里
榜单背后的改动权限之争
OpenAI 给出的解释是「模型版本、工具配置与测试运行差异」。这句话听起来像技术中性词,但拆解之后全是灰区。
幻觉率从 4.2% 降到 2%,如果是测试配置修正,那意味着初版发布存在重大过失。如果是故意调优,那就是在竞争压力下做数据美化。两种解读的成本截然不同。前者需要内部审查流程,后者只需要公关口径。
Anthropic 的 Fable 5.1 数学得分从 87.8% 降至 78%,又回升到 83%。这种「拉偏分」式的修改,无论理由是什么,都指向同一个问题:基准测试平台是否允许厂商修改自己提交的分数。
Hugging Face 的 Open LLM Leaderboard 从不允许修改历史分数,这是它能维持公信力的核心机制之一。OpenAI 自己的 Benchmark 页面没有公开同样的承诺。这意味着他们保留了对已发布数据的最终解释权。
校准的合理边界在哪
不是所有修改都应该被否定。
模型在发布后可能发现测试流程中存在系统性偏差。比如某个基准的数据泄露问题、评测环境与实际部署的不一致、或者工具链的版本错位。这些情况下,修正分数是对读者负责的举动。
关键问题是:谁来认定「偏差」的存在,以及修正是否公开可追踪。
业界常见的做法是保留原始快照并标注修改记录。某云厂商 2025 年在 GPT-5 发布后的基准更新中,采用了时间戳+修改说明的双轨记录,这让第三方可以验证每次变动的合理性。OpenAI 此次没有出现任何变更记录。
更准确地说,这次事件暴露的是基准平台治理结构的缺失。厂商既是运动员又是裁判,修改权完全内化,外部只能靠 Wayback Machine 做事后审计。这种结构下,信任只能建立在厂商的自我约束上。

基准测试透明度治理结构对比
厂商自证的成本正在变化
OpenAI 选择私下修改而非主动解释,背后是一次成本计算。
公开解释需要承认初版存在错误,这会削弱 Astra 的发布势能。保持沉默可以让热点快速转移,等舆论平息后再以「校准」名义回滚。Fortune 的报道是在数据已经回滚之后才发出,这种时间差本身就是策略的一部分。
从工程视角看,这种做法的风险在于累积。第一次修改成功不会被追责,第二次会被忽略,第三次开始有人质疑。基准测试的信用是存量资产,一旦透支很难重建。
Anthropic 面对同样的压力时选择了不同路径。他们在 2024 年推出 Claude 系列时,主动公开了基准测试的完整配置清单,包括推理步骤数、采样参数、工具调用策略。这种「把厨房打开」的做法,提高了对手模仿的门槛,也建立了差异化定位。
两者之间的取舍很清晰:短期热度 vs 长期信誉。厂商在每次修改基准时,都在为这个账本记账。
第三方复核的可行性与局限
有人建议引入独立机构对基准进行测试复核。听起来合理,但落地时面临三个障碍。
第一个障碍是测试环境的一致性。大模型推理涉及随机采样、温度参数、工具调用延迟等变量,同一份代码在不同机器上跑出的结果可能有显著差异。复核机构需要完全复制厂商的评测栈,这需要大量工程投入。
第二个障碍是测试数据的时效性。基准测试本身存在数据污染风险------模型可能在训练过程中接触过评测样本。复核时使用的测试集,是否已经泄露给模型训练数据,是一个未解的谜题。
第三个障碍是商业激励的缺失。没有厂商愿意付费请第三方复核自己的成绩,因为结果可能对自己不利。也没有基金会愿意投入资源去做免费审计,除非有监管压力介入。
相比之下,开源生态提供了一条更可行的路径。LMSYS Chatbot Arena 采用众包评级方式,绕过传统基准的陷阱,用真实用户交互生成排名。这种方式虽然不能替代结构化评测,但提供了另一个维度的信号。当基准分数在漂移,用户体感排名相对稳定时,后者反而更具参考价值。
基准分数的使用姿势
读完这次事件,一个可执行的判断是:基准分数仍然有用,但需要使用姿势需要调整。
如果分数来自第三方托管平台且有修改记录,可信度较高。如果分数来自厂商自托管且无日志,需要保持警惕。如果发现分数在短期内多次变动,优先怀疑数据清洗或环境调整,而非模型性能突变。
更重要的是,不要只盯着单一基准。ARC-AGI、MMLU-Pro、HumanEval 每个测的重点不同,互相之间甚至存在负相关。一个模型可以在代码测试上满分,同时在数学推理上不及格。组合多个指标,比追逐单一冠军数字更能反映真实能力。
基准测试从来不是物理定律,它是厂商与评测者之间的一场动态博弈。分数会回滚,但模型能否在真实工作流里站稳,时间不会骗人。

##三、刷榜还是校准:基准测试透
一、 榜单上的幽灵修改:一次发布日的分数漂移
Wayback Machine 抓取的细节:幻觉率、数学分与 ARC 成绩的三次往返
9 月 3 日下午,Fortune 记者 Emily Forlini 注意到一个反常现象:OpenAI 博客页面上的基准数据在发布当天被修改了至少六次。
互联网档案馆的快照记录显示了完整的时间线。下午 2 点 23 分,首版快照中 GPT-6 Astra 的幻觉率为 4.2%。此后四份快照(3 点 11 分、3 点 50 分、4 点 15 分、5 点 20 分)记录了一次数据漂移:Astra 幻觉率降至 2%,前代 GPT-5.6 Sol 从 12.2% 降至 9.4%,Anthropic Fable 5.1 的数学得分从 87.8% 跌至 78%,ARC-AGI-3 从 98.6% 升至 99.99%。
到当晚 8 点之后,大部分改动回滚到了初版数值。

真相终于浮出水面
但部分分数至今仍在变动。这种「发布即修改」的模式,在 AI 行业并非首次,但这次的数据量级和修改方向引起了特别关注------提升的是自家模型,下降的是竞争对手。
四、 读者该怎么看:脱离榜单后的真实能力评估
从看跑分转向看体感,工程化落地的判断标准
基准分数会骗人,体感不会。这不是说跑分完全没用,而是说跑分应该作为辅助信号,而不是决策依据。
对于一个正在评估 GPT-6 Astra 是否适合生产环境的工程师,真正需要回答的问题是:我的场景里,模型能稳定完成什么任务?幻觉率 4.2% 这个数字本身说明不了问题。你需要知道的是:在你的任务分布上,模型在哪些环节会出错、出错时是什么模式、你能否设计兜底机制。

体感才是硬道理
以下是可以从今天就开始执行的三个动作:
第一,用你自己的数据跑你自己的评测。 从生产日志中提取过去三个月的真实 prompt 和返回结果,构造一份 50--100 条的代表性测试集。用相同的 prompt 分别调用 GPT-6 Astra、Claude 3.5 Sonnet、GPT-5.6 Sol,人工标注或规则校验输出质量。这份自有基准的信噪比远高于任何公开榜单。
第二,关注失败模式而非平均分数。 幻觉率 4.2% 意味着每 100 次回答约有 4 次编造。关键是这 4 次发生在哪里------是数值计算、代码生成、还是事实引用?不同类型的幻觉需要不同的缓解策略。建立一份「已知失败模式清单」比记住一个跑分数字有用得多。
第三,建立持续追踪机制。 基准分数会波动,模型会迭代,你的工作负载也在变化。每季度用自有测试集重新评估一次,记录趋势而非单点值。如果 Astra 的幻觉率从 4.2% 降到 2% 又回到 4.2%,说明这个指标本身存在测量噪声,不值得过度解读。
基准测试从来不是物理定律,它是厂商与评测者之间的一场动态博弈。分数会回滚,但模型能否在真实工作流里站稳,时间不会骗人。当你脱离榜单去看体感,当你的判断建立在自有数据和持续追踪之上,那些在博客页面上跳来跳去的数字就不再是决策的终点,而只是一个参考坐标。
参考文献
- Fortune, 2026-09-04. OpenAI Quietly Boosts Some of Astra's Evaluation Metrics Amid Rare Delay in Publication of Model Blog Post. fortune.com/2026/09/04/...
- Fortune, 2026-09-03. OpenAI Debuts GPT-6 Astra, Greg Brockman Says Start of AGI. fortune.com/2026/09/03/...
- IT之家, 2026-09-06. OpenAI 多次修改 GPT-6 Astra 基准测试数据,部分成绩一度大幅变化. www.ithome.com/0/998/927.h...
- BlockBeats 律動財經, 2026-09-05. OpenAI被指悄然調整GPT-6 Astra評測數據,部分指標讓競爭對手「變差」. m.cnyes.com/news/id/659...
- OpenAI. GPT-6 Astra System Card. deploymentsafety.openai.com/gpt-6-astra