GPT-5.6 Sol 的 ARC-AGI-3 分数为何翻近三倍:Agent 评测必须记录整套运行合同

发布边界:本文依据 2026-07-30 可访问的 OpenAI 与 ARC Prize 第一方资料。38.3% 是 OpenAI 在 ARC-AGI-3 Public set 上的自有 Harness 实验,不是 Semi-Private Verified 成绩;公开资料没有给出 retained reasoning 与 compaction 的独立贡献。
摘要
同一个 GPT-5.6 Sol,在同一 ARC-AGI-3 Public set 上,官方 Harness 得到 13.3%,启用 retained reasoning 与 compaction 的 Responses API Harness 得到 38.3%,输出 Token 约减少六倍。这个结果不应被简化成"两个开关让模型聪明了三倍"。真正变化的是 Agent 的运行系统:推理状态是否延续、长历史如何处理、任务在何处重置,以及预算和环境怎样约束模型。本文先厘清 13.3%、38.3% 与 7.78% 的口径,再解释两层失忆、RHAE 计分机制和公开消融缺口,最后给出四组可辨识实验、双轨报告规范与可直接复用的 Agent Eval Contract。
关键词
ARC-AGI-3、Agent Eval、Harness、Responses API、Retained Reasoning、Compaction
目录
- 同一个模型,为什么会出现两个完全不同的分数
- [先把 13.3%、38.3% 与 7.78% 放回正确位置](#先把 13.3%、38.3% 与 7.78% 放回正确位置 "#%E5%85%88%E6%8A%8A-133383-%E4%B8%8E-778-%E6%94%BE%E5%9B%9E%E6%AD%A3%E7%A1%AE%E4%BD%8D%E7%BD%AE")
- [ARC-AGI-3 为什么特别依赖状态连续性](#ARC-AGI-3 为什么特别依赖状态连续性 "#ARC-AGI-3-%E4%B8%BA%E4%BB%80%E4%B9%88%E7%89%B9%E5%88%AB%E4%BE%9D%E8%B5%96%E7%8A%B6%E6%80%81%E8%BF%9E%E7%BB%AD%E6%80%A7")
- [官方 Harness 的两层失忆](#官方 Harness 的两层失忆 "#%E5%AE%98%E6%96%B9-Harness-%E7%9A%84%E4%B8%A4%E5%B1%82%E5%A4%B1%E5%BF%86")
- [retained reasoning 与 compaction 各自解决什么](#retained reasoning 与 compaction 各自解决什么 "#retained-reasoning-%E4%B8%8E-compaction-%E5%90%84%E8%87%AA%E8%A7%A3%E5%86%B3%E4%BB%80%E4%B9%88")
- [Token 少六倍,为什么不会自动把分数抬高](#Token 少六倍,为什么不会自动把分数抬高 "#Token-%E5%B0%91%E5%85%AD%E5%80%8D%E4%B8%BA%E4%BB%80%E4%B9%88%E4%B8%8D%E4%BC%9A%E8%87%AA%E5%8A%A8%E6%8A%8A%E5%88%86%E6%95%B0%E6%8A%AC%E9%AB%98")
- 两项设置没有公开独立消融
- 怎样设计一组可辨识的复现实验
- [通用 Harness 与生产 Harness 应双轨报告](#通用 Harness 与生产 Harness 应双轨报告 "#%E9%80%9A%E7%94%A8-Harness-%E4%B8%8E%E7%94%9F%E4%BA%A7-Harness-%E5%BA%94%E5%8F%8C%E8%BD%A8%E6%8A%A5%E5%91%8A")
- [Agent Eval Contract:模型名只是一个字段](#Agent Eval Contract:模型名只是一个字段 "#Agent-Eval-Contract%E6%A8%A1%E5%9E%8B%E5%90%8D%E5%8F%AA%E6%98%AF%E4%B8%80%E4%B8%AA%E5%AD%97%E6%AE%B5")
- FAQ
同一个模型,为什么会出现两个完全不同的分数
OpenAI 在 2026 年 7 月公布了一组很容易被误读的结果:
- GPT-5.6 Sol + ARC 官方 Harness:Public set 13.3%;
- GPT-5.6 Sol + Responses API Harness + retained reasoning + compaction:同一 Public set 38.3%;
- 后一种运行方式的输出 Token 约减少六倍。^1^
模型名字没有变,公开任务集合没有变,结果却从 13.3% 变成 38.3%。最直觉的标题是"两个设置让模型能力翻了近三倍",但这个表述把系统结果错误压缩成了模型属性。
更准确的解释是:原运行系统在每一步都破坏模型刚形成的工作状态,新运行系统停止了这种破坏。对交互式 Agent,Harness 不只是输入输出胶水,它还决定模型能看到什么、记住什么、何时清空、怎样压缩、如何重试,以及能消耗多少动作、Token、时间和成本。
因此,"GPT-5.6 Sol 得了多少分"并不是完整事实。完整事实至少要写成:
某个不可变模型快照,在某个 API、Prompt、状态策略、上下文策略、环境版本、评分版本、工具循环和资源预算下,经过指定次数运行后得到了什么分布。

这张官方图比两个端点更重要:它同时画出了 Low、Medium、High、Xhigh 与 Max reasoning effort。随着推理预算提高,两种 Harness 并没有沿着同一条效率曲线移动。官方 Harness 到 Max 时每局平均输出约 290 万 Token,得分 13.3%;保留 reasoning 并启用 compaction 的 Harness 约 48.5 万 Token,得分 38.3%。^1^
因此,变化不只是"少花 Token 得到同样结果",而是整条质量---资源前沿发生了移动。但图表仍然只能证明两套组合系统的差异,不能把增益分别归因给 retained reasoning 或 compaction。
先把 13.3%、38.3% 与 7.78% 放回正确位置

这三个数字来自两个任务口径,不能串成一条提升曲线。
| 数字 | 任务集合 | 运行与发布方 | 正确含义 |
|---|---|---|---|
| 13.3% | Public | OpenAI 文章中的官方 Harness 基线 | 同一 Public set 的对照端点 |
| 38.3% | Public | OpenAI 自有 Responses API Harness | retained reasoning + compaction 组合结果 |
| 7.78% | Semi-Private | ARC Prize Verified 页面 | GPT-5.6 Sol Max 当前 Verified 成绩 |
ARC Prize 的 GPT-5.6 页面同时列出 Public 13.33% 与 Semi-Private 7.78%。^2^ Semi-Private 用于 Verified frontier 测试,数据和验证流程与 Public 不同。ARC 的政策页还强调 Verified frontier 测试通常是单次运行,并要求外部模型 API 使用 Zero Data Retention。^3^
所以不能写"7.78% 提升到 38.3%",也不能拿 Public 38.3% 推算一个 Semi-Private 成绩。ARC 提到 Public demo 总体上被认为更难,并用绝对差 ±15 个百分点描述数据集级的良好一致性,但这不是模型级换算公式。^3^
这是本文的第一条评测纪律:
任何分数都必须绑定 split、task manifest、环境版本、评分版本与验证方式;只有模型名和 Benchmark 名,不足以比较。
ARC-AGI-3 为什么特别依赖状态连续性
ARC-AGI-3 不是静态问答。Agent 面对一组没有说明书的二维交互环境,需要通过动作观察变化,逐步推断对象、规则、目标和策略。ARC Prize 公布的完整系列包含 135 个环境,其中 25 个作为 Public demo;人类数据包含 458 名参与者和 342 条逐步回放。^4^
这类任务里,正确答案不在初始输入中。Agent 必须不断形成、验证和修正世界模型:
- 观察一个场景,提出假设;
- 执行动作,读取环境反馈;
- 判断假设被支持还是被否定;
- 保留有效规则和失败证据;
- 在后续关卡复用已经学到的结构。
一次动作本身只是一条记录。真正有价值的是"为什么执行、验证了什么、排除了什么、下一步要做什么"。如果 Harness 只留下动作而丢掉这些工作状态,模型每一轮都要从日志重新反推自己的计划。

官方视频给出了静态分数无法表达的过程证据:当两侧累计输出 Token 都在约 9.6 万时,官方 Harness 仍停在 1/6,Responses API Harness 已推进到 4/6;约 10.1 万 Token 时,右侧继续推进到 5/6,左侧仍是 1/6。^1^ 这不能替代正式消融,却能排除一种过度简化------差异并不是只在最终计分时突然出现,而是在连续探索过程中逐步累积。
官方 Harness 的两层失忆

OpenAI 对运行轨迹的分析指出,官方 Harness 有两种会破坏长期学习的行为。^1^
第一层:每次环境动作之后,private reasoning 被丢弃。
模型可能还看得到"刚才向左移动",却失去"向左是为了验证蓝色区域是否传送,结果否定了假设 A"这类内部工作状态。下一轮不是接着推理,而是重新定向。
第二层:历史增长到 175,000 字符后,最旧消息被滚动删除。
此时丢失的不只是"为什么做",还包括"早期做过什么、观察过什么"。两种失忆叠加后,模型会反复识别同一对象、重新验证失败路线,甚至在后期关卡丢掉早期建立的规则。
这解释了为什么状态策略会同时影响质量与资源:重复定向会产生更多 Token,也可能带来更多无效环境动作。但它仍然只是机制上合理的解释,不是已经完成的因果分解。OpenAI 没有公开逐游戏动作数、中介分析和两项设置的完整消融。

图注:OpenAI 原文界面明确标注 drops reasoning messages 与 drops old messages。来源:OpenAI 官方文章。
retained reasoning 与 compaction 各自解决什么

OpenAI 用 Responses API 重写 Harness,并通过 previous response ID 延续 GPT-5.6 的 reasoning state。Responses API 将推理和行动组织为连续循环,模型可以在后续采样中使用先前的 opaque reasoning items。^5^^6^
这里要排除两个误解。
第一,retained reasoning 不等于开发者读取隐藏思维链。OpenAI 明确说明 raw chain-of-thought 不会暴露;reasoning item 由系统内部保留,客户端只获得 response ID、opaque item、加密内容或可选摘要。^5^^6^
第二,状态延续不等于免费上下文。即使使用 previous_response_id,链中先前输入 Token 仍会作为输入 Token 计费。^7^
retained reasoning 解决的是跨工具调用、跨轮次的认知连续性;它不解决历史无限增长。compaction 则在接近上下文阈值时,把关键先前状态和推理压成更少 Token 的 opaque item。服务端压缩可由 compact_threshold 触发,也可以显式调用 standalone compact endpoint。^8^
compaction 不是无损归档。官方只说明它携带 key prior state and reasoning,没有承诺每条消息、数字、顺序与证据都能逐字恢复。standalone compact 的输出还可能包含保留的原始 items,下一轮应原样使用完整输出,不能自行再裁剪。^8^

第二段官方动画把这个差别画成了时间序列:左侧上下文顶部出现红色 dropped 区域,旧消息被直接删除;右侧保留 reasoning,并用紫色 compaction item 携带压缩后的先前状态。两组关键帧还显示,右侧每次动作的输出规模约为 852---1,100 Token,左侧约为 2,600---3,000 Token。^1^ 这与"减少重复定向"的解释一致,但仍应视为机制可视化,而不是逐项独立因果证明。
因此,生产系统不应把 opaque compaction 当作唯一真相。目标、权限、已确认事实、来源、工具结果和审批记录仍应保存在外部 canonical state 或事件日志中。
Token 少六倍,为什么不会自动把分数抬高

ARC-AGI-3 使用 RHAE(Relative Human Action Efficiency)衡量完成度与相对人类动作效率。只有改变环境状态的离散交互才算 action;内部推理、工具调用和不改变环境的重试不计入环境动作。^9^
完成某一关后的核心公式是:
text
level_score = (human_baseline_actions / ai_actions)^2
单关得分封顶 1.15,后期关卡权重更高,未完成后续关卡还会限制游戏总分。^9^
输出 Token 不在公式中。因此:
- Token 减少,但环境动作与完成关卡不变,RHAE 不变;
- Token 减少,却让模型思考不足、环境动作增加,RHAE 下降;
- Token 增加,但换来更少环境动作和更多关卡完成,RHAE 可能上升;
- Harness 即使做了很多内部工具调用,只要不改变环境,RHAE 不会直接惩罚这些成本。
两项指标可以同时改善,但只能通过一条间接路径解释:
text
状态连续性提高
→ 重复定向与重复探索减少
→ 输出 Token 和无效环境动作都可能减少
→ 完成更多关卡或用更少动作完成
→ RHAE 上升
RHAE 的平方项会放大动作效率差异:AI 动作数翻倍,单关得分不是减半,而是降到四分之一。后期关卡加权又会放大长期状态连续性的价值。
但没有逐游戏动作、关卡完成和 Token 轨迹,我们不能断言这条路径解释了全部 25 个百分点。
两项设置没有公开独立消融

OpenAI 公开的是两个端点:
- G00:官方 Harness,13.3%;
- G11:retained reasoning + compaction,38.3%。
文章没有公开:
- retained reasoning 开、compaction 关;
- retained reasoning 关、compaction 开;
- 各组逐游戏成绩、动作数、Token 与方差;
- 两项设置是否还有其他实现差异。
更关键的是,native compaction item 本身可能携带 prior state and reasoning。^8^ 即使表面关闭 all_turns,只要仍然回传 native compaction item,就不能自动证明跨窗口 reasoning 已被排除。
所以 retained reasoning 与 native compaction 不是天然正交的两个布尔开关。直接画一个 2×2 表并给每格起名字,不代表实验已经可辨识。
怎样设计一组可辨识的复现实验
一个更诚实的主实验可以采用四组:
| 组 | 跨调用推理 | 长历史处理 | 能回答的问题 |
|---|---|---|---|
| G00 | 丢弃 | 滚动删除最旧完整 turn | 官方式参考基线 |
| G10 | 保留 | 不压缩,超窗即失败并分类 | 未超窗范围内 retained reasoning 是否有益 |
| G01 | 丢弃 | 自定义、可见、结构化压缩 | 保留显式任务状态是否优于直接删除 |
| G11 | 保留 | OpenAI native compaction | 产品推荐组合的系统效果 |
G01 不是 native compaction 的"纯关闭 reasoning"版本。它应使用可见 schema,例如:
yaml
confirmed_rules: []
rejected_hypotheses: []
current_goal: ""
key_objects: []
open_questions: []
evidence_refs: []
这组测试的是"显式状态压缩优于滚动删除",不会假装能把 native compaction 中的隐藏 reasoning 分离出来。
四组实验还必须固定:
- 模型不可变快照、reasoning effort、最大输出;
- API、SDK、Prompt、帧序列化与动作解析;
- game ID 与 version、task manifest hash、评分版本;
- 任务顺序、动作预算、Token/时间/成本预算;
- 重试、超时、非法动作与 overflow 行为;
- 数据保留、状态重置、重复次数和执行随机化。
指标至少分三层:
- 任务指标:RHAE、逐关完成、环境动作;
- 资源指标:输入/输出/reasoning Token、模型调用、工具调用、重试、compaction 次数、延迟、成本;
- 状态质量:关键事实召回、重复失败动作、重新定向 Token、世界模型探针。
通用 Harness 与生产 Harness 应双轨报告

图注:ARC-AGI-3 技术报告第 15 页明确,官方榜不使用任务专用 Harness;工程化 Harness 的结果应作为另一条能力证据。来源:ARC-AGI-3 Technical Report。

通用 Harness 与生产 Harness 回答的是不同问题。
Reference Harness 追求公开、最小、跨供应商和固定预算,回答"在统一接口下,这个模型能做到什么"。它有利于公平比较,也可能压制某些模型训练时预期的原生状态机制。
Production-Aligned Harness 使用模型推荐 API、推理状态、工具和上下文管理,回答"在真实产品栈中,用户能得到什么"。它更接近可部署上限,也会把供应商私有 API 与工程优化混进系统成绩。
更成熟的报告应同时包含:
- Reference Harness Score;
- Production-Aligned Score;
- Resource Envelope:动作、Token、延迟、成本、重试、compaction;
- Run Contract Diff:两套运行合同究竟改了什么。
这样研究者可以比较模型,工程团队也能评估产品上限,读者不会把整套运行系统包装成模型本体。
Agent Eval Contract:模型名只是一个字段

ARC 的评分基线、单关上限和多个游戏版本曾在 2026 年 4 月更新;游戏 ID 本身包含稳定 game name 与可变 version。^10^^11^ 只写"ARC-AGI-3 + GPT-5.6 Sol"不足以复现。
下面是一份可裁剪的最低合同:
yaml
contract_version: agent-eval-contract/1.0
benchmark:
name: ARC-AGI-3
split: public
scoring_method: RHAE
scoring_version: exact-date-or-commit
task_manifest_hash: sha256
game_ids_and_versions: []
toolkit_commit: exact
model:
provider: openai
public_name: gpt-5.6-sol
immutable_snapshot: exact-if-available
reasoning_effort: max
max_output_tokens: exact
api_and_prompt:
endpoint: /v1/responses
api_version: exact
sdk_version: exact
system_prompt_sha256: exact
frame_serializer_version: exact
action_schema_sha256: exact
state_and_context:
reasoning_context: all_turns
hidden_reasoning_readable: false
reset_on_level: false
reset_on_game: true
compaction_mode: server-side
compact_threshold: exact
overflow_behavior: fail-and-classify
budget:
max_environment_actions: exact
max_model_calls: exact
retry_limit: exact
timeout_ms: exact
cost_budget_usd: exact
run:
repetitions: exact
execution_order: randomized
provider_request_ids: []
artifact_manifest_sha256: exact
metrics:
rhae_total: null
rhae_per_game: {}
levels_completed: 0
environment_actions: 0
model_calls: 0
retries: 0
input_tokens: 0
output_tokens: 0
compaction_count: 0
latency_p95_ms: null
total_cost_usd: null
合同还应绑定失败分类:推理重置、滚动截断遗忘、compaction 遗漏或失真、旧状态污染、上下文溢出、非法动作、重试风暴、预算耗尽、跨任务状态泄漏与异常值。
最终要比较的不是一个孤立分数,而是一条系统前沿:质量、环境动作、Token、延迟、成本、可审计性与可移植性如何随运行合同变化。
FAQ
38.3% 是否说明 GPT-5.6 Sol 的模型能力提高了近三倍?
不能这样下结论。模型名称相同,但 Harness、状态和上下文策略不同。38.3% 证明可实现的系统表现显著变化,不等于权重本体能力被独立测量为提高三倍。
38.3% 是否是 ARC Prize Verified 成绩?
不是。它是 OpenAI 在 Public set 上的自有 Harness 实验。ARC Prize 当前页面列出的 Semi-Private Verified 成绩是 7.78%。^2^
输出 Token 少六倍是否直接导致 RHAE 上升?
不会直接导致。Token 不进入 RHAE 公式;它只能通过减少无效环境动作或帮助完成更多关卡间接影响得分。
retained reasoning 会不会泄露模型的隐藏思维链?
官方机制不会把 raw chain-of-thought 交给客户端。开发者处理的是 response ID、opaque reasoning item、加密内容或可选摘要。^5^^6^
所有 Agent 都应默认启用 retained reasoning 与 compaction 吗?
不应。短任务、样本必须独立的批量评测、强审计任务、跨供应商恢复和状态污染风险较高的场景,都需要单独判断。显式状态机、事件日志、pinned facts 或阶段 checkpoint 可能更合适。
结论
这次结果真正改变的不是某个 API 设置的流行度,而是 Agent 评测的责任边界。
模型名仍然重要,但它只是运行合同中的一个字段。只有同时记录 API、推理状态、上下文策略、环境和评分版本、预算、重试与产物证据,分数才具有可复现、可比较和可归因的意义。
通用 Harness 给出共同坐标,生产 Harness 给出可部署上限,消融实验解释二者之间的差异。三者缺一不可。
Footnotes
-
OpenAI, How enabling two settings tripled our scores on the ARC-AGI-3 benchmark ↩ ↩2 ↩3 ↩4 ↩5
-
ARC Prize, GPT-5.6 - ARC-AGI Results ↩ ↩2
-
ARC Prize, Verified Testing Policy ↩ ↩2
-
ARC Prize, Measuring Human Performance on ARC-AGI-3 ↩
-
OpenAI Developers, Why we built the Responses API ↩ ↩2 ↩3
-
OpenAI Developers, Reasoning models ↩ ↩2 ↩3
-
OpenAI Developers, Conversation state ↩
-
OpenAI Developers, Compaction ↩ ↩2 ↩3
-
ARC Prize Docs, ARC-AGI-3 Scoring Methodology ↩ ↩2
-
ARC Prize Docs, Toolkit Changelog ↩
-
ARC Prize Docs, Game Schema ↩