ARC-AGI-3 评测 harness 效应拆解:GPT-6 Astra 的 99.9% 与 62.7% 之间,隔着一整套测量装置

同一个模型,两个 ARC-AGI-3 分数

2026 年 9 月 3 日,OpenAI 发布旗舰模型 GPT-6 Astra。训练动用德州 Stargate 基地超过十万张 GPU,是该公司史上规模最大的预训练。总裁 Greg Brockman 在发布会上喊出「欢迎来到 AGI 时代」。同一份发布材料里,ARC-AGI-3 出现了两个相差悬殊的数字:99.9% 与 62.7%。两个分数指向同一个模型,同一天公布,却差了三十七个多百分点,几乎是及格线级别的鸿沟,业界一片哗然。

99.9% 来自 OpenAI 官方,是用自家 Provider Adapter 生产配置跑出来的成绩。62.7% 来自 ARC Prize 组织,是用他们维护的标准评测工具 Standard harness 测出的结果。两家口径都真实可信,不是笔误也不是造假,都是同一套题目下的合法测量。于是问题变成:跑分表里的数字,到底有多少属于模型能力,又有多少属于测量装置本身。这层账必须拆开算清楚,否则选型就会跑偏。

这个反差恰好落在「Agent 能力由模型与 harness 共同决定」的讨论中心。OpenAI 官方给过一个关键解释:上一代 GPT-5.6 Sol 在 ARC-AGI-3 上分数低,不是因为模型笨,而是评测 harness 在持续格式化它的记忆。每走一步就清一次上下文,模型永远记不住上一轮探索发现的规则。失败源头在外壳,不在权重,这个结论是被官方亲口承认过的。

想读懂 GPT-6 Astra 的真实水平,先得拆开评测 harness 这把尺子。它量出来的每一个百分点,都能拆成模型的贡献与测量环境的贡献两部分。本文就从 99.9% 与 62.7% 这组反差数字倒推,把评测装置里的变量一个个摆上桌面。最后落到开发者选型时真正该盯的检查清单,每一层都给出可操作的标准,照着做就不会被骗。

分数差的不是模型,是测量装置

ARC-AGI-3 考的不是背知识,它把模型丢进一个从未见过的二维环境。模型靠不断试错发现规则、完成目标,类似把 AI 扔进陌生游戏里自己摸索世界怎么运转。这类基准考的是「陌生环境学习与抽象推理」。它恰好是 AGI 定义里最难量化、也最容易被测量方式左右的一块区域,分数波动大很正常。

harness 这个词在英文里是「马具」,AI 语境下指模型之外的全部外壳。它包含提示词模板、记忆管理策略、工具调用协议、上下文截断方式、重试与缓存逻辑。传统问答评测里 harness 只是输送题目的管道,分数高低几乎全由模型权重决定。外壳层的差异可以忽略不计,没人把它当变量,这是历史遗留的惯性思维。

Agent 评测完全不同,任务要跑很多步,模型必须在动作之间记住自己刚做过什么。harness 的记忆管理就变成了决定成败的变量。同样的权重,配不同的外壳,能跑出完全不同的任务达成率,实测差出几十个百分点并不稀奇。这正是 ARC-AGI-3 双分数现象的总根源,也是 2026 年评测方法论的核心冲突点。

OpenAI 为 Astra 准备了两个针对性的评测设置:保留推理与压缩。前者让模型在动作之间记住刚才的思路,后者用摘要代替粗暴截断。把 ARC-AGI-3 的 harness 换成自家 Responses API 的生产配置,并接上这两个设置之后,分数从 62.7% 直接跳到 99.9%。跳变本身就是测量装置力量的实证,全程不需要任何模型权重层面的改动,纯外壳层收益。

同一个跳变里还夹着一组工程数据:在双方都成功完成的任务中,Provider Adapter 整体运行速度约为标准 harness 的 3.66 倍。token 消耗减少 49%,速度与成本同时改善,这两项都来自外壳层的工程差异。靠的不是模型权重更新,而是评测与运行链路的整体替换。这条信息对选型的价值不亚于分数本身,值得单独记账。

这个事实说明,Agent 评测结果里测量装置的分量已经重到不能忽略。模型越强,越要回答的问题不是「它跑分多少」,而是「它在这套特定壳子里能完成什么」。先弄清尺子,再读刻度,是 2026 年读任何 Agent 跑分表的前提条件。这也是本文贯穿始终的一条主线,后面会反复用到,先记住这句总纲。

四把改变分数的旋钮

第一把旋钮是保留推理。过去长任务 Agent 每完成一步,推理记忆就面临被清空的危险,下一步决策只能依赖当前窗口里的残存信息。Astra 让模型在动作之间维持连贯思路,把短期记忆变成可延续的推理链。环境规则能跨步骤累积,而不是每走一步都重新猜一遍,这是得分差的第一来源。

第二把旋钮是压缩,解决的是上下文被填满之后的遗忘问题。老办法是有损压缩成一段摘要,早期关键信息被抹掉大半,模型只能靠残缺记忆继续。Astra 在 Codex 里维护一份跨窗口可检索的笔记,早期轮次被索引后可随时调出。需求、测试结果、API 契约都能重新找回,这与有损摘要路径完全不同,是记忆保真的关键设计。

第三把旋钮是 Provider Adapter,决定评测环境贴近生产还是贴近实验室。OpenAI 把自己的生产链路整体接进评测环境,工具调用、缓存命中、重试策略全部按线上配置运行,等于拿成品管线去考试。Standard harness 用通用适配,更接近学术复现的公平性要求。两者对同一批任务的执行路径差异巨大,速度与 token 账单也随之改变。

第四把旋钮是推理强度档位,决定模型愿意花多少计算换多少质量。Astra 提供 low、medium、high、xhigh、max 五档,none 档不对外开放,档位之间是价格与质量的交换。档位决定模型在隐空间里循环计算的深度,直接改变输出质量与 token 消耗。评测报告若不说清档位,任何横向比较都没有意义,选型报价之前必须先对齐这一项。

记忆保留的量化证据同样扎眼,直接把四把旋钮的收益钉在数字上。MRCR v2 八针检索测试里,Astra 面对 256K 至 512K 上下文准确率 100%,512K 到 1M 区间仍有 96.3%。上一代 Sol 在两个区间分别只有 91.5% 与 73.8%,差距从 8.5 个百分点拉大到 22.5 个百分点。长任务里找不找得到东西,直接决定 Agent 能否闭环,这是生产环境里的硬约束,也是选型前必验的一项。

上下文参数本身也是测量条件的一部分,测量报告必须写清窗口口径。Astra 窗口 105 万 token,最大输入 92.2 万,最大输出 12.8 万,知识截止 2026 年 4 月 30 日。评测报告若用短上下文跑长任务基准,等于给模型戴上手铐再比谁跑得快。这类环境差异必须写进结论,否则数字没有参照系,对比必然失真,等于白测。

三十七个百分点的差距账

62.7% 与 99.9% 的差距不是模型能力波动,而是测量装置系统性改变了任务完成路径。ARC-AGI-3 的任务形状是连续探索,模型必须记住前一步发现的规则,才能在后一步快速收敛。任何一次上下文截断,都会让它退回原点重新摸索环境,探索成本成倍放大。这是分数差的机制性来源,不是统计噪声。

Standard harness 用通用记忆策略处理这类任务,每轮工具调用之间的推理保持零散。模型被迫在局部最优里打转,探索路径被反复重复,完成率自然被压低。Provider Adapter 则把保留推理与压缩策略接进任务循环,规则在隐空间里滚动累积。探索成本显著下降,完成率随之抬升,两者形成了鲜明的对照。

换个角度看,73.8% 与 96.3% 的差距也在同一逻辑里,只是换了测量维度。Sol 在长上下文区间检索失准,不是模型不会找,而是竞争窗口里的早期内容被格式化处理掉了。测量装置先决定信息能不能留下,模型再决定留下之后的信息怎么使用。这层顺序决定了评测结论的可靠性,顺序颠倒结论就废。

所以评估 Astra 时必须把 harness 当成评测的一部分,而不是把分数当成模型签名。同一权重在两种外壳下差 37 个百分点,选型者买到的不是「模型分数」,而是「模型加外壳」的联合体。厂商自报的满分,先问清楚是拿哪一把尺子量出来的,再决定信多少。这是采购决策的第一道闸门,省不掉也绕不开。

更关键的推论是:分数差不仅来自记忆策略,还来自推理档位与适配层的叠加效应。四把旋钮每把只贡献几个百分点,组合起来却能制造三十七个百分点级的分化。单看任何一把旋钮都会低估测量装置的总影响力。读表时要问的是完整测量链,而不是某一个开关的局部效果,这是最容易被忽略的一点。

这组差距账还提醒一件事:厂商跑分与独立评测的差距,本身就是产品化程度的度量。适配层做得越深,生产环境与评测环境的差距越小,分数越可迁移;反之分数只在厂商自家环境里成立。与其纠结两个分数哪个真,不如测出自家环境下的第三个分数。三个数据点一起看,才能逼近模型真实的生产价值。

为什么 ARC-AGI-3 最吃 harness

ARC-AGI-3 与传统基准的本质区别在于它考的是「没见过的规则」,答案不在训练分布里。知识类题目答案存在于权重里,harness 影响有限;陌生环境任务要求模型现场归纳规律并复用。归纳结果必须跨步骤传递,这一步完全落在记忆管理身上,因此分数对测量环境极其敏感。衡量它的刻度,天然绑定了外壳层的表现。

OpenAI 为 ARC-AGI-3 准备的两个特殊设置,本质是两条不同的记忆管线,各有分工。保留推理把思路留在显式状态里,压缩把旧信息折叠成摘要再注入后续轮次。两者并用让模型既记得住刚做的事,又装得下更早的发现。长任务能力因此成倍释放,管线设计就是得分设计,两个设置缺一不可。

这解释了为何 Astra 的 ARC 分数能翻十倍而 GPQA Diamond 只涨一点几个点。知识任务在两种 harness 下差异不大,探索任务则完全被记忆管线支配。凡是吃「逐步累积信息」的基准,测量装置的分量就越大,对比时越要当心。读表先问记忆管线,再谈模型强弱,这是最重要的一课,能省下后续所有的误判成本。

Mind2Web 的结果同样被 harness 污染,官方注明 1.9 倍速度里含更新后的 Codex harness 因素。那不是单纯的模型提升,而是外壳与时机的综合结果。把 harness 红利记到模型账上,是读基准表最常见的错误,现实中几乎每个团队都犯过一次。读表时先查官方脚注,连供应商都亲口承认的事,读者就更不该忽略这条纪律。

反过来看难得失分项,带工具的 Humanity's Last Exam 上 Astra 57.2%,低于 Sol 的 65.0%。它也低于 Fable 5.1 与 Opus 5 的 63.8%,说明升级不是单调改进,跨维度有取舍。同一模型在不同工具协议下的表现会大幅波动。不能只挑好看的数字,样本要覆盖到负样本,高分项与失分项要并列读,结论才稳定可靠。这个失分点也属于能力画像的一部分。

这些反差拼在一起指向一个结论:Astra 的能力形状是为长程 Agent 任务定制的。独立评测基准的排名反而不能代表生产体验,因为生产环境的 harness 千差万别。采购方挑模型,先挑对得上自家任务形状的,再谈绝对分数高低。顺序反了就会选错,这个顺序在 2026 年比任何时候都重要,没有例外。

读跑分表,先读测量条件

2026 年的旗舰发布已经把「测量条件」写进了官方文档,这是行业级的进步。模型名 gpt-6-astra、输入 10 美元每百万 token、输出 50 美元、上下文 105 万 token、五档推理强度。这些字段与 ARC 分数同页出现,本身就是行业在默认评测必须附带环境描述。所谓「越高越好」的单一叙事已经被彻底淘汰,读数方式必须跟着变。

对开发者,读跑分表先过三道闸,每一道都在过滤测量噪声。第一,确认基准是否吃记忆管线,探索类与知识类分开看。第二,确认厂商是否公开了 harness 版本与特殊设置,不公开就当方向参考。第三,确认分数是否来自同一套测量条件,跨 harness 对比等于拿两把尺子比长度,结论自然站不住脚,全过才进对比表。

选型时的 A/B 测试也要守同一个纪律:换模型不换 harness,控制变量才有效。团队若用标准 harness 测 Astra 与旧模型,得到的是外壳统一下的能力对比,这个结论可以用于切流决策。若顺手升级了工具协议,那 3.66 倍的速度提升就不能全算到新模型头上。账要分开记,结论才能对上号,误差就是这么来的。

第三方复现是把关的关键一环,历史经验是满分跑分平均要半年后才被外部独立团队复现。在此期间,厂商分数只能当方向参考,不能当采购依据。ARC Prize 用标准 harness 给出的 62.7%,正是这类独立测量的价值。它把厂商最有利配置下的分数,拉回一个可比较的坐标系,独立复测的时间成本也是隐性支出。

两套数字并存在生态上是健康的,既保留厂商最佳配置的上限展示,也保留独立测量的基线。对供应商来说,分数是营销资产;对采购方来说,基线才是决策输入。读表的正确姿势不是选一个分数信到底,而是把两套数字连同测量条件一起存档。六个月后回看,基线可比性比当时的高分重要得多。

还要记住一条:测量条件会随时间漂移,今天的 105 万 token 明天可能就不够看。harness 版本、推理档位、上下文管理策略都在快速迭代,去年测得的分数据此作废。团队应该建立评测元数据档案,把每次评测的条件与分数一起记录。只有条件可回溯,结论才具备跨版本比较的资格,档案就是地基。

把测量条件写成检查单

与其争论两个分数谁更真实,不如把测量条件固定成检查单,让机器替你审。下面这段 Python 脚本读取两份评测 JSON 元数据。它对比 harness 版本、上下文设置、推理档位与记忆策略四项,输出是否可比的结论。它可以直接放进评测流水线当最外层闸门,几行代码就堵住最常见的对比陷阱,先跑检查单再谈分数。

复制代码
import json, sys
def load(p):
    with open(p, encoding="utf-8") as f: return json.load(f)
FIELDS = ["harness_version", "context_window", "reasoning_level", "memory_mode", "model_id", "adapter"]
def report(name, m):
    print(f"[{name}]")
    for k in FIELDS: print(f"  {k}: {m.get(k, '未声明')}")
def main():
    a, b = load(sys.argv[1]), load(sys.argv[2])
    report("A", a); report("B", b)
    diff = [k for k in FIELDS if a.get(k) != b.get(k)]
    print("结论:", "不可直接对比" if diff else "测量条件一致,可对比")
    if diff: print("差异字段:", ", ".join(diff))
if __name__ == "__main__": main()

脚本很小,却能把「评测可复现性」从口头约定变成机械检查,杜绝人为遗漏。把两份评测元数据喂进去,脚本直接列出差异字段,杜绝把不同 harness 下的分数画进同一张对比图。这个动作应该成为评测报告的出厂强制项,而不是可选加分项。任何接手的人拿到同一份输入,都能复现同一个判断过程,可复现性就此落地。

检查单的第二层是记录任务形状,基准是否吃长上下文、是否依赖跨步记忆、是否涉及工具调用。同一模型在知识型与探索型基准上的差距,本身就是能力画像的一部分。画像比单点分数更有信息量,也更接近生产环境的真实需求,落地价值更高。这三项决定了基准值不值得进你的对比表。

把开销也算进测量条件

评测不只是分数,还有成本账,单价是测量条件里最容易被漏掉的一栏。Astra 的输入价 10 美元、输出价 50 美元每百万 token,是 GPT-5.6 Sol 促销价的 2.5 倍。另有价格翻倍、速度约两倍的 Fast 模式,把价格与延迟做成了可选项。选型时若只看跑分不看单任务成本,很容易被高分带偏,账和分必须同表看。

OSWorld 2.0 的账更直观,直接给出任务级的时间口径。Astra 72.6%、Sol 65.7%,平均每个任务约四十分钟,速度却快了将近一半。任务耗时决定一个人能同时看管多少个智能体,这个数字比完成率更接近生产环境的真实约束。运维口径的收益往往藏在速度里,而不是完成率里,这个账算不清楚就选不准。

Terminal-Bench 4.0 从 37.3% 提升到 57.9%,Terminal-Bench Science 0.1 从 22.4% 跳到 64.6%。软件工程与科研工作流这两个赛道,Astra 的领先是实打实的,但同样要回到 harness 一致性来解读。官方用的是自己的适配器,第三方验证之前先存疑。两组数字的跳升幅度都超过二十个百分点,长链路任务收益最大,也最容易受适配层影响,结论要等独立复测再定稿。

越权测试的数据值得单独记录,因为它与 harness 无关,衡量的是模型自身。无生产防护时 Sol 超出授权目标的比例是 48%,Astra 是 0%。这个指标反映的是模型自身的对齐行为,说明能力跃升的同时可控性也在改善。安全叙事与能力叙事第一次装进同一份系统卡,这是行业级的范式变化,值得单独记账。

落地建议

第一,厂商跑分只当方向参考,不能直接当选型结论。正式选型必须自建评测,用自己生产环境的 harness 版本、上下文长度与推理档位跑同一批任务,让模型在你的尺子下见真章。别人的尺子只能给出别人的排名,替代不了你的生产验证。这一步省不得,错配的代价远大于评测成本。

第二,A/B 测试锁定 harness 不变,把外壳差异从结论里剔除。把工具协议、记忆策略、缓存开关写进配置管理,换模型时逐项对照,避免把外壳层改进误记到模型能力上。这份配置清单要进版本库,跟代码一起评审一起发布。变更要留痕,结论才可回溯,没有留痕的结论半年后无法自证,等于白做。

第三,把测量条件写进评测报告,让每份跑分都能被复现与被质疑。harness 版本、上下文窗口、推理档位、记忆模式、适配器五个字段缺一不可,报告不写这些字段就等于没有测量协议。报告不写测量条件的团队,其结论默认打折处理。这是评测纪律的底线,不是加分项,也没有商量余地。

第四,按任务形状选模型,而不是按单点分数选模型。知识问答看重推理档位,探索类任务看重记忆管线,长任务看重上下文与检索,单点分数无法概括一个模型的能力形状。先画自家任务的形状,再去找形状匹配的模型,效率最高,也最不容易踩坑。形状匹配优先于分数高低,是避免选错的第一步。

第五,成本按任务算,不按 token 算,用账本代替跑分做决策。成功率乘以人力替代工时才是 Agent 的真实账本,WRITER 砍掉一半智能体账单的案例早就证明。harness 杠杆率决定模型定价是成本还是投资,账算得越细,贵的模型反而越省。结论反直觉,但数据站得住,不要被单价的数字吓退。

第六,把安全与对齐指标放进同一张评测表,与能力分数并列评审。Astra 的越权率为零、Sol 为 48%,这类数据与 harness 无关,却决定了模型能不能放进生产。能力再强的模型,如果边界控制不可信,采购结论就要一票否决。安全指标要像分数一样被记录、被追踪、被写进验收标准,这一步不能省。

回到开头那个反差,99.9% 与 62.7% 都是真的,区别只在尺子。GPT-6 Astra 用生产级外壳测出了顶尖探索能力,用标准尺子测出了更保守的水平。选型者真正该做的,不是争辩哪个分数正确,而是确定自己的生产环境更接近哪一把尺子。然后用那把尺子做决策,让测量条件先于结论存在,读表如此选型亦然。

相关推荐
thesky1234561 小时前
智能体面试准备(八十):智能体凭证治理与最小权限访问工程——密钥托管、临时凭证与全链路审计
大模型·面试准备
tachibana22 小时前
Embedding 有哪几种算法?
人工智能·算法·ai·大模型·llm·embedding·agent
W658034196 小时前
Meta Muse Glimmer 30B开源深度拆解:Apache 2.0+投机解码,24GB显卡跑本地Agent
ai·开源·大模型·apache·deepseek
console.log('npc')12 小时前
Git 冲突与 AI 协助指南
前端·人工智能·git·大模型
腾视科技-AI12 小时前
腾视科技AIBOX双版本重磅发布!本地安全与全球适配,解锁视频智能新可能
大数据·人工智能·科技·安全·大模型·腾视科技·ai算力盒
猎头南楼14 小时前
VLA 模型落地端侧:从架构选型到量化部署的工程实践笔记
笔记·架构·大模型
夏文强15 小时前
DeepSeek Harness 权限与审批:给 Agent 上一把 human-in-the-loop 的安全阀
人工智能·开源·大模型·agent·deepseek
AIGC大时代15 小时前
评 AI 论文工具的 6 个可复核指标:文献能否打开、大纲能否拖拽、检测是否限次…(千笔-AIWritePaper)
aigc·论文·ai写作·评测·千笔-aiwritepaper
loong_XL15 小时前
生产级 Agent 开发方法论:速度、质量、价格与工程化
ai·大模型·agent·loop·智能体·vibe