GPT-5.6 Sol 的 ARC-AGI-3 分数为何翻近三倍:Agent 评测必须记录整套运行合同

GPT-5.6 Sol 的 ARC-AGI-3 分数为何翻近三倍:Agent 评测必须记录整套运行合同

发布边界:本文依据 2026-07-30 可访问的 OpenAI 与 ARC Prize 第一方资料。38.3% 是 OpenAI 在 ARC-AGI-3 Public set 上的自有 Harness 实验,不是 Semi-Private Verified 成绩;公开资料没有给出 retained reasoning 与 compaction 的独立贡献。

摘要

同一个 GPT-5.6 Sol,在同一 ARC-AGI-3 Public set 上,官方 Harness 得到 13.3%,启用 retained reasoning 与 compaction 的 Responses API Harness 得到 38.3%,输出 Token 约减少六倍。这个结果不应被简化成"两个开关让模型聪明了三倍"。真正变化的是 Agent 的运行系统:推理状态是否延续、长历史如何处理、任务在何处重置,以及预算和环境怎样约束模型。本文先厘清 13.3%、38.3% 与 7.78% 的口径,再解释两层失忆、RHAE 计分机制和公开消融缺口,最后给出四组可辨识实验、双轨报告规范与可直接复用的 Agent Eval Contract。

关键词

ARC-AGI-3、Agent Eval、Harness、Responses API、Retained Reasoning、Compaction

目录

  • 同一个模型,为什么会出现两个完全不同的分数
  • [先把 13.3%、38.3% 与 7.78% 放回正确位置](#先把 13.3%、38.3% 与 7.78% 放回正确位置 "#%E5%85%88%E6%8A%8A-133383-%E4%B8%8E-778-%E6%94%BE%E5%9B%9E%E6%AD%A3%E7%A1%AE%E4%BD%8D%E7%BD%AE")
  • [ARC-AGI-3 为什么特别依赖状态连续性](#ARC-AGI-3 为什么特别依赖状态连续性 "#ARC-AGI-3-%E4%B8%BA%E4%BB%80%E4%B9%88%E7%89%B9%E5%88%AB%E4%BE%9D%E8%B5%96%E7%8A%B6%E6%80%81%E8%BF%9E%E7%BB%AD%E6%80%A7")
  • [官方 Harness 的两层失忆](#官方 Harness 的两层失忆 "#%E5%AE%98%E6%96%B9-Harness-%E7%9A%84%E4%B8%A4%E5%B1%82%E5%A4%B1%E5%BF%86")
  • [retained reasoning 与 compaction 各自解决什么](#retained reasoning 与 compaction 各自解决什么 "#retained-reasoning-%E4%B8%8E-compaction-%E5%90%84%E8%87%AA%E8%A7%A3%E5%86%B3%E4%BB%80%E4%B9%88")
  • [Token 少六倍,为什么不会自动把分数抬高](#Token 少六倍,为什么不会自动把分数抬高 "#Token-%E5%B0%91%E5%85%AD%E5%80%8D%E4%B8%BA%E4%BB%80%E4%B9%88%E4%B8%8D%E4%BC%9A%E8%87%AA%E5%8A%A8%E6%8A%8A%E5%88%86%E6%95%B0%E6%8A%AC%E9%AB%98")
  • 两项设置没有公开独立消融
  • 怎样设计一组可辨识的复现实验
  • [通用 Harness 与生产 Harness 应双轨报告](#通用 Harness 与生产 Harness 应双轨报告 "#%E9%80%9A%E7%94%A8-Harness-%E4%B8%8E%E7%94%9F%E4%BA%A7-Harness-%E5%BA%94%E5%8F%8C%E8%BD%A8%E6%8A%A5%E5%91%8A")
  • [Agent Eval Contract:模型名只是一个字段](#Agent Eval Contract:模型名只是一个字段 "#Agent-Eval-Contract%E6%A8%A1%E5%9E%8B%E5%90%8D%E5%8F%AA%E6%98%AF%E4%B8%80%E4%B8%AA%E5%AD%97%E6%AE%B5")
  • FAQ

同一个模型,为什么会出现两个完全不同的分数

OpenAI 在 2026 年 7 月公布了一组很容易被误读的结果:

  • GPT-5.6 Sol + ARC 官方 Harness:Public set 13.3%;
  • GPT-5.6 Sol + Responses API Harness + retained reasoning + compaction:同一 Public set 38.3%;
  • 后一种运行方式的输出 Token 约减少六倍。^1^

模型名字没有变,公开任务集合没有变,结果却从 13.3% 变成 38.3%。最直觉的标题是"两个设置让模型能力翻了近三倍",但这个表述把系统结果错误压缩成了模型属性。

更准确的解释是:原运行系统在每一步都破坏模型刚形成的工作状态,新运行系统停止了这种破坏。对交互式 Agent,Harness 不只是输入输出胶水,它还决定模型能看到什么、记住什么、何时清空、怎样压缩、如何重试,以及能消耗多少动作、Token、时间和成本。

因此,"GPT-5.6 Sol 得了多少分"并不是完整事实。完整事实至少要写成:

某个不可变模型快照,在某个 API、Prompt、状态策略、上下文策略、环境版本、评分版本、工具循环和资源预算下,经过指定次数运行后得到了什么分布。

这张官方图比两个端点更重要:它同时画出了 Low、Medium、High、Xhigh 与 Max reasoning effort。随着推理预算提高,两种 Harness 并没有沿着同一条效率曲线移动。官方 Harness 到 Max 时每局平均输出约 290 万 Token,得分 13.3%;保留 reasoning 并启用 compaction 的 Harness 约 48.5 万 Token,得分 38.3%。^1^

因此,变化不只是"少花 Token 得到同样结果",而是整条质量---资源前沿发生了移动。但图表仍然只能证明两套组合系统的差异,不能把增益分别归因给 retained reasoning 或 compaction。

先把 13.3%、38.3% 与 7.78% 放回正确位置

这三个数字来自两个任务口径,不能串成一条提升曲线。

数字 任务集合 运行与发布方 正确含义
13.3% Public OpenAI 文章中的官方 Harness 基线 同一 Public set 的对照端点
38.3% Public OpenAI 自有 Responses API Harness retained reasoning + compaction 组合结果
7.78% Semi-Private ARC Prize Verified 页面 GPT-5.6 Sol Max 当前 Verified 成绩

ARC Prize 的 GPT-5.6 页面同时列出 Public 13.33% 与 Semi-Private 7.78%。^2^ Semi-Private 用于 Verified frontier 测试,数据和验证流程与 Public 不同。ARC 的政策页还强调 Verified frontier 测试通常是单次运行,并要求外部模型 API 使用 Zero Data Retention。^3^

所以不能写"7.78% 提升到 38.3%",也不能拿 Public 38.3% 推算一个 Semi-Private 成绩。ARC 提到 Public demo 总体上被认为更难,并用绝对差 ±15 个百分点描述数据集级的良好一致性,但这不是模型级换算公式。^3^

这是本文的第一条评测纪律:

任何分数都必须绑定 split、task manifest、环境版本、评分版本与验证方式;只有模型名和 Benchmark 名,不足以比较。

ARC-AGI-3 为什么特别依赖状态连续性

ARC-AGI-3 不是静态问答。Agent 面对一组没有说明书的二维交互环境,需要通过动作观察变化,逐步推断对象、规则、目标和策略。ARC Prize 公布的完整系列包含 135 个环境,其中 25 个作为 Public demo;人类数据包含 458 名参与者和 342 条逐步回放。^4^

这类任务里,正确答案不在初始输入中。Agent 必须不断形成、验证和修正世界模型:

  1. 观察一个场景,提出假设;
  2. 执行动作,读取环境反馈;
  3. 判断假设被支持还是被否定;
  4. 保留有效规则和失败证据;
  5. 在后续关卡复用已经学到的结构。

一次动作本身只是一条记录。真正有价值的是"为什么执行、验证了什么、排除了什么、下一步要做什么"。如果 Harness 只留下动作而丢掉这些工作状态,模型每一轮都要从日志重新反推自己的计划。

官方视频给出了静态分数无法表达的过程证据:当两侧累计输出 Token 都在约 9.6 万时,官方 Harness 仍停在 1/6,Responses API Harness 已推进到 4/6;约 10.1 万 Token 时,右侧继续推进到 5/6,左侧仍是 1/6。^1^ 这不能替代正式消融,却能排除一种过度简化------差异并不是只在最终计分时突然出现,而是在连续探索过程中逐步累积。

官方 Harness 的两层失忆

OpenAI 对运行轨迹的分析指出,官方 Harness 有两种会破坏长期学习的行为。^1^

第一层:每次环境动作之后,private reasoning 被丢弃。

模型可能还看得到"刚才向左移动",却失去"向左是为了验证蓝色区域是否传送,结果否定了假设 A"这类内部工作状态。下一轮不是接着推理,而是重新定向。

第二层:历史增长到 175,000 字符后,最旧消息被滚动删除。

此时丢失的不只是"为什么做",还包括"早期做过什么、观察过什么"。两种失忆叠加后,模型会反复识别同一对象、重新验证失败路线,甚至在后期关卡丢掉早期建立的规则。

这解释了为什么状态策略会同时影响质量与资源:重复定向会产生更多 Token,也可能带来更多无效环境动作。但它仍然只是机制上合理的解释,不是已经完成的因果分解。OpenAI 没有公开逐游戏动作数、中介分析和两项设置的完整消融。

图注:OpenAI 原文界面明确标注 drops reasoning messages 与 drops old messages。来源:OpenAI 官方文章

retained reasoning 与 compaction 各自解决什么

OpenAI 用 Responses API 重写 Harness,并通过 previous response ID 延续 GPT-5.6 的 reasoning state。Responses API 将推理和行动组织为连续循环,模型可以在后续采样中使用先前的 opaque reasoning items。^5^^6^

这里要排除两个误解。

第一,retained reasoning 不等于开发者读取隐藏思维链。OpenAI 明确说明 raw chain-of-thought 不会暴露;reasoning item 由系统内部保留,客户端只获得 response ID、opaque item、加密内容或可选摘要。^5^^6^

第二,状态延续不等于免费上下文。即使使用 previous_response_id,链中先前输入 Token 仍会作为输入 Token 计费。^7^

retained reasoning 解决的是跨工具调用、跨轮次的认知连续性;它不解决历史无限增长。compaction 则在接近上下文阈值时,把关键先前状态和推理压成更少 Token 的 opaque item。服务端压缩可由 compact_threshold 触发,也可以显式调用 standalone compact endpoint。^8^

compaction 不是无损归档。官方只说明它携带 key prior state and reasoning,没有承诺每条消息、数字、顺序与证据都能逐字恢复。standalone compact 的输出还可能包含保留的原始 items,下一轮应原样使用完整输出,不能自行再裁剪。^8^

第二段官方动画把这个差别画成了时间序列:左侧上下文顶部出现红色 dropped 区域,旧消息被直接删除;右侧保留 reasoning,并用紫色 compaction item 携带压缩后的先前状态。两组关键帧还显示,右侧每次动作的输出规模约为 852---1,100 Token,左侧约为 2,600---3,000 Token。^1^ 这与"减少重复定向"的解释一致,但仍应视为机制可视化,而不是逐项独立因果证明。

因此,生产系统不应把 opaque compaction 当作唯一真相。目标、权限、已确认事实、来源、工具结果和审批记录仍应保存在外部 canonical state 或事件日志中。

Token 少六倍,为什么不会自动把分数抬高

ARC-AGI-3 使用 RHAE(Relative Human Action Efficiency)衡量完成度与相对人类动作效率。只有改变环境状态的离散交互才算 action;内部推理、工具调用和不改变环境的重试不计入环境动作。^9^

完成某一关后的核心公式是:

text 复制代码
level_score = (human_baseline_actions / ai_actions)^2

单关得分封顶 1.15,后期关卡权重更高,未完成后续关卡还会限制游戏总分。^9^

输出 Token 不在公式中。因此:

  • Token 减少,但环境动作与完成关卡不变,RHAE 不变;
  • Token 减少,却让模型思考不足、环境动作增加,RHAE 下降;
  • Token 增加,但换来更少环境动作和更多关卡完成,RHAE 可能上升;
  • Harness 即使做了很多内部工具调用,只要不改变环境,RHAE 不会直接惩罚这些成本。

两项指标可以同时改善,但只能通过一条间接路径解释:

text 复制代码
状态连续性提高
  → 重复定向与重复探索减少
  → 输出 Token 和无效环境动作都可能减少
  → 完成更多关卡或用更少动作完成
  → RHAE 上升

RHAE 的平方项会放大动作效率差异:AI 动作数翻倍,单关得分不是减半,而是降到四分之一。后期关卡加权又会放大长期状态连续性的价值。

但没有逐游戏动作、关卡完成和 Token 轨迹,我们不能断言这条路径解释了全部 25 个百分点。

两项设置没有公开独立消融

OpenAI 公开的是两个端点:

  • G00:官方 Harness,13.3%;
  • G11:retained reasoning + compaction,38.3%。

文章没有公开:

  • retained reasoning 开、compaction 关;
  • retained reasoning 关、compaction 开;
  • 各组逐游戏成绩、动作数、Token 与方差;
  • 两项设置是否还有其他实现差异。

更关键的是,native compaction item 本身可能携带 prior state and reasoning。^8^ 即使表面关闭 all_turns,只要仍然回传 native compaction item,就不能自动证明跨窗口 reasoning 已被排除。

所以 retained reasoning 与 native compaction 不是天然正交的两个布尔开关。直接画一个 2×2 表并给每格起名字,不代表实验已经可辨识。

怎样设计一组可辨识的复现实验

一个更诚实的主实验可以采用四组:

跨调用推理 长历史处理 能回答的问题
G00 丢弃 滚动删除最旧完整 turn 官方式参考基线
G10 保留 不压缩,超窗即失败并分类 未超窗范围内 retained reasoning 是否有益
G01 丢弃 自定义、可见、结构化压缩 保留显式任务状态是否优于直接删除
G11 保留 OpenAI native compaction 产品推荐组合的系统效果

G01 不是 native compaction 的"纯关闭 reasoning"版本。它应使用可见 schema,例如:

yaml 复制代码
confirmed_rules: []
rejected_hypotheses: []
current_goal: ""
key_objects: []
open_questions: []
evidence_refs: []

这组测试的是"显式状态压缩优于滚动删除",不会假装能把 native compaction 中的隐藏 reasoning 分离出来。

四组实验还必须固定:

  • 模型不可变快照、reasoning effort、最大输出;
  • API、SDK、Prompt、帧序列化与动作解析;
  • game ID 与 version、task manifest hash、评分版本;
  • 任务顺序、动作预算、Token/时间/成本预算;
  • 重试、超时、非法动作与 overflow 行为;
  • 数据保留、状态重置、重复次数和执行随机化。

指标至少分三层:

  1. 任务指标:RHAE、逐关完成、环境动作;
  2. 资源指标:输入/输出/reasoning Token、模型调用、工具调用、重试、compaction 次数、延迟、成本;
  3. 状态质量:关键事实召回、重复失败动作、重新定向 Token、世界模型探针。

通用 Harness 与生产 Harness 应双轨报告

图注:ARC-AGI-3 技术报告第 15 页明确,官方榜不使用任务专用 Harness;工程化 Harness 的结果应作为另一条能力证据。来源:ARC-AGI-3 Technical Report

通用 Harness 与生产 Harness 回答的是不同问题。

Reference Harness 追求公开、最小、跨供应商和固定预算,回答"在统一接口下,这个模型能做到什么"。它有利于公平比较,也可能压制某些模型训练时预期的原生状态机制。

Production-Aligned Harness 使用模型推荐 API、推理状态、工具和上下文管理,回答"在真实产品栈中,用户能得到什么"。它更接近可部署上限,也会把供应商私有 API 与工程优化混进系统成绩。

更成熟的报告应同时包含:

  1. Reference Harness Score;
  2. Production-Aligned Score;
  3. Resource Envelope:动作、Token、延迟、成本、重试、compaction;
  4. Run Contract Diff:两套运行合同究竟改了什么。

这样研究者可以比较模型,工程团队也能评估产品上限,读者不会把整套运行系统包装成模型本体。

Agent Eval Contract:模型名只是一个字段

ARC 的评分基线、单关上限和多个游戏版本曾在 2026 年 4 月更新;游戏 ID 本身包含稳定 game name 与可变 version。^10^^11^ 只写"ARC-AGI-3 + GPT-5.6 Sol"不足以复现。

下面是一份可裁剪的最低合同:

yaml 复制代码
contract_version: agent-eval-contract/1.0
benchmark:
  name: ARC-AGI-3
  split: public
  scoring_method: RHAE
  scoring_version: exact-date-or-commit
  task_manifest_hash: sha256
  game_ids_and_versions: []
  toolkit_commit: exact

model:
  provider: openai
  public_name: gpt-5.6-sol
  immutable_snapshot: exact-if-available
  reasoning_effort: max
  max_output_tokens: exact

api_and_prompt:
  endpoint: /v1/responses
  api_version: exact
  sdk_version: exact
  system_prompt_sha256: exact
  frame_serializer_version: exact
  action_schema_sha256: exact

state_and_context:
  reasoning_context: all_turns
  hidden_reasoning_readable: false
  reset_on_level: false
  reset_on_game: true
  compaction_mode: server-side
  compact_threshold: exact
  overflow_behavior: fail-and-classify

budget:
  max_environment_actions: exact
  max_model_calls: exact
  retry_limit: exact
  timeout_ms: exact
  cost_budget_usd: exact

run:
  repetitions: exact
  execution_order: randomized
  provider_request_ids: []
  artifact_manifest_sha256: exact

metrics:
  rhae_total: null
  rhae_per_game: {}
  levels_completed: 0
  environment_actions: 0
  model_calls: 0
  retries: 0
  input_tokens: 0
  output_tokens: 0
  compaction_count: 0
  latency_p95_ms: null
  total_cost_usd: null

合同还应绑定失败分类:推理重置、滚动截断遗忘、compaction 遗漏或失真、旧状态污染、上下文溢出、非法动作、重试风暴、预算耗尽、跨任务状态泄漏与异常值。

最终要比较的不是一个孤立分数,而是一条系统前沿:质量、环境动作、Token、延迟、成本、可审计性与可移植性如何随运行合同变化。

FAQ

38.3% 是否说明 GPT-5.6 Sol 的模型能力提高了近三倍?

不能这样下结论。模型名称相同,但 Harness、状态和上下文策略不同。38.3% 证明可实现的系统表现显著变化,不等于权重本体能力被独立测量为提高三倍。

38.3% 是否是 ARC Prize Verified 成绩?

不是。它是 OpenAI 在 Public set 上的自有 Harness 实验。ARC Prize 当前页面列出的 Semi-Private Verified 成绩是 7.78%。^2^

输出 Token 少六倍是否直接导致 RHAE 上升?

不会直接导致。Token 不进入 RHAE 公式;它只能通过减少无效环境动作或帮助完成更多关卡间接影响得分。

retained reasoning 会不会泄露模型的隐藏思维链?

官方机制不会把 raw chain-of-thought 交给客户端。开发者处理的是 response ID、opaque reasoning item、加密内容或可选摘要。^5^^6^

所有 Agent 都应默认启用 retained reasoning 与 compaction 吗?

不应。短任务、样本必须独立的批量评测、强审计任务、跨供应商恢复和状态污染风险较高的场景,都需要单独判断。显式状态机、事件日志、pinned facts 或阶段 checkpoint 可能更合适。

结论

这次结果真正改变的不是某个 API 设置的流行度,而是 Agent 评测的责任边界。

模型名仍然重要,但它只是运行合同中的一个字段。只有同时记录 API、推理状态、上下文策略、环境和评分版本、预算、重试与产物证据,分数才具有可复现、可比较和可归因的意义。

通用 Harness 给出共同坐标,生产 Harness 给出可部署上限,消融实验解释二者之间的差异。三者缺一不可。


Footnotes

  1. OpenAI, How enabling two settings tripled our scores on the ARC-AGI-3 benchmark 2 3 4 5

  2. ARC Prize, GPT-5.6 - ARC-AGI Results 2

  3. ARC Prize, Verified Testing Policy 2

  4. ARC Prize, Measuring Human Performance on ARC-AGI-3

  5. OpenAI Developers, Why we built the Responses API 2 3

  6. OpenAI Developers, Reasoning models 2 3

  7. OpenAI Developers, Conversation state

  8. OpenAI Developers, Compaction 2 3

  9. ARC Prize Docs, ARC-AGI-3 Scoring Methodology 2

  10. ARC Prize Docs, Toolkit Changelog

  11. ARC Prize Docs, Game Schema

相关推荐
极客猴子1 小时前
Android录音转写频繁卡顿?多款APP长时间会议场景稳定性实测
android·人工智能·智能手机·飞书
ShallWeL1 小时前
Orin 上目标检测 + 大模型做端侧应用
人工智能·目标检测·大模型·端侧
A55566677787891 小时前
2026国产OpenClaw替代方案商深度测评:政务级、轻量化、高性能、私有化厂商推荐
人工智能
今天AI了吗1 小时前
【AI智能体】Hermes Agent 从部署到项目实战操作详解
java·人工智能·python·milvus
六边形战士DONK1 小时前
16-估计量的评选标准[无偏性,有效性,相合性,均方误差准则]
人工智能·机器学习·概率论
weixin_431600441 小时前
做 Agent 会用到的 Node API(4):取消与 AbortController
前端·学习·ai·agent·ai编程
心运软件2 小时前
基于机器学习的智能邮件分类系统:从数据采集到模型部署全流程实战
人工智能·python·算法·随机森林·机器学习·分类·scikit-learn
苏灿烤鱼2 小时前
今日 GitHub 热门|Agent 云端电脑登顶,+1,891 项目却只排第三(08.06)
github·agent·资讯
苏灿烤鱼2 小时前
GitHub Trending 榜首|GitHub #1 拆解|为什么「持久工作台」比临时沙箱更值得关注?(08.06)技术拆解
人工智能·typescript·agent