写在前面:本文数据截止 2026 年 9 月 5 日。这个时间点很微妙------OpenAI 在 9 月 3 日刚发布 GPT-6 Astra,Anthropic 在 9 月 1 日刚发布 Claude Fable 5.1。两家旗舰在同一周换代,之前所有的对比文章基本都过期了。
本文所有跑分均标注来源。需要提前说明的是:厂商公布的 benchmark 本质上是营销材料,由掌握模型访问权、且对结果有利益诉求的团队跑出。它们可以作为"起始假设",但不能作为"结论"。文末会给出自建评测的方法。
一、先理清两条产品线
2026 年这两家都不再是"一个旗舰打天下",而是分层矩阵。搞清楚型号对应关系,是选型的第一步。
OpenAI 阵营
| 型号 | 发布时间 | 定位 |
|---|---|---|
| GPT-6 Astra | 2026-09-03 | 新旗舰,分阶段放量 |
| GPT-5.6 Sol | 2026-07-09 GA | 上一代旗舰,仍是主力 |
| GPT-5.6 Terra / Luna | 2026-06-26 | 均衡档 / 轻量档 |
GPT-6 Astra 的发布节奏值得注意:首日只对有限的组织开放,随后几天陆续开放给 ChatGPT Plus / Pro / Business / Enterprise 用户,以及 OpenAI API 和 AWS;企业版对管理员默认关闭,需要主动开启。同时也会上线 Microsoft Azure 和 AWS Bedrock。
另一个必须知道的背景:Astra 是 OpenAI 第一个在其 Preparedness Framework 下达到"Critical"级网络安全能力的模型------意味着在有合适工具和权限的情况下,它能在无人逐步指导的前提下,发现此前未知的安全漏洞并开发出新的利用方式。因此公开版本会拒绝较高阶的安全任务(例如生成 PoC 漏洞利用代码),更宽松的权限通过 OpenAI Daybreak 计划另行开放。做安全工具链的同学要提前规划这条约束。
Anthropic 阵营
| 型号 | 发布时间 | 定位 |
|---|---|---|
| Claude Fable 5.1 / Mythos 5.1 | 2026-09-01 | 新旗舰(同一底座,安全策略不同) |
| Claude Opus 5 | 2026-07-24 | 主力旗舰,性价比档 |
| Claude Sonnet 5 | 2026-06-30 | 均衡档 |
| Claude Haiku 4.5 | --- | 轻量档 |
Fable 5.1 和 Mythos 5.1 是同一个模型,区别在安全护栏级别:Fable 5.1 面向所有人,Mythos 5.1 仅限参与 Anthropic 可信访问计划的美国企业和个人。这一点对国内开发者意味着:实际能用到的顶配就是 Fable 5.1。
二、价格与规格:先算清楚账
| 模型 | 上下文 | 输入 $/M | 输出 $/M | 缓存读 $/M |
|---|---|---|---|---|
| GPT-6 Astra | 1.05M(输出上限 128K) | 10 | 50 | 1 |
| GPT-5.6 Sol | 1.05M(输出上限 128K) | 5 | 30 | 0.5 |
| Claude Fable 5.1 | --- | 10 | 50 | 0.25 |
| Claude Opus 5 | 1M | 5 | 25 | --- |
| Claude Sonnet 5 | --- | 2 | 10 | --- |
| Claude Haiku 4.5 | --- | 1 | 5 | --- |
几个关键点:
-
旗舰档位价格已经拉齐 。Astra 是 10/50,缓存输入 1,batch 半价,Fast 模式 2 倍速 2 倍价;Fable 5.1 同为 10/50 一档。**Opus 5 的 5/$25 反而成了当前"近前沿能力"里最划算的一档**。
-
Anthropic 这次打的是缓存牌。Fable 5.1 的缓存读价格降了 75%,降到每百万 token $0.25;Anthropic 估算典型场景整体成本比 Fable 5 低约 25%,重度 agentic 工作流最多低 45%。对于"agent 反复读同一个大代码库"这类场景,缓存读价格比输出价格更能决定账单。
-
但这个省钱说法有争议 。Artificial Analysis 指出:缓存降价在 agentic 任务上确实省约 1.40/任务,但 Fable 5.1 在 max effort 下输出 token 用量约为 Fable 5 的 1.7 倍,导致单任务实际成本反而高 20%。**这引出 2026 年选型的一个核心变化:不能只看 /token,要看 $/task。**
-
知识截止日期:Astra 的知识截止是 2026 年 4 月 30 日。写依赖最新库版本的代码时要注意。
三、编程能力实测:数据摆出来
下表来自 OpenAI 官方 GPT-6 Astra 发布页的横向对比表(自报数据,且是"任意 effort 档位下的最高分")。我原样列出,包括对 OpenAI 不利的行:
编程类基准
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Fable 5.1 | Fable 5 | Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 Extended | 64.5% | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| FrontierCode 1.1 Main | 53.3% | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |
| 内部数据库迁移任务 | 63.9% | 42.7% | 57.8% | 50.3% | --- | --- |
| AA Coding Agent Index v1.4 | 67.0 | 65.1 | --- | 67.2 | 68.1 | 61.2 |
Terminal-Bench 4.0 测试 agent 在终端环境中完成软件工程、系统配置和数据分析等复杂任务;Astra 达到 57.9%,对比 GPT-5.6 Sol 的 37.3% 和 Fable 5.1 的 55.8%,估算单任务 API 成本分别低约 9% 和 63%。
注意最后一行。 Artificial Analysis Coding Agent Index 是第三方综合指数,在这一行上领先的是 Claude Opus 5(68.1),Fable 5 次之(67.2),Astra 第三(67.0)。这个结果出现在 OpenAI 自己的发布页上,可信度反而更高。
同样值得看的是通用智能指数:
| Benchmark | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| AA Intelligence Index v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |
| Humanity's Last Exam(带工具) | 57.2% | --- | 65.0% | 63.8% | 63.6% | --- |
在第三方综合智能指数和 HLE 上,Claude 系列领先。 这和"Astra 在自家榜单上全面碾压"的媒体标题形成了明显反差。
其他重要维度
| 维度 | Astra | Sol | Fable 5.1 / Opus 5 |
|---|---|---|---|
| ARC-AGI-3(新颖推理) | 99.9% | 7.8% | Opus 5: 30.2% |
| FrontierMath Tier 4 | 97.6% | 83.0% | Fable 5.1: 87.8% |
| GPQA Diamond | 96.0% | 94.6% | Fable 5.1: 93.7% |
| OSWorld 2.0(电脑操控) | 72.6% | 65.7% | Opus 5: 70.2% |
| Agents' Last Exam | 59.3% | 53.6% | Opus 5: 55.5% |
| MRCR v2 8针 512K--1M | 96.3% | 73.8% | --- |
| ExploitBench(安全) | 100% | 78.5% | Opus 5: 70% |
| SRE-Bench(二进制逆向) | 88.0% | 55.9% | Opus 5: 12.5% |
ARC-AGI-3 的跳变最夸张。ARC Prize 基金会的 Greg Kamradt 表示,Astra 在 96% 的关卡上超过了他们的人类行动效率基线,基本达到人类水平,并称这不只是分数最高,更代表前沿模型性能的一次阶跃。而对比数据是:Opus 5 为 30.2%,GPT-5.6 Sol 仅 7.8%。
长上下文的差距同样显著:512K--1M 区间的多针检索,Astra 96.3% vs Sol 73.8%。对于"整仓库分析"这类任务,这个差距是质变级的。
反过来看 Anthropic 自己的数据
Anthropic 自测中,Fable 5.1 在 Terminal-Bench-Science 上从 24.7% 提升到 52.6%,在 Terminal-Bench 4.0 上从 42.0% 提升到 55.8%,在 AutomationBench 上从 17.1% 提升到 31.4%。在 Cursor 的 CursorBench 3.2 上,Fable 5.1 以 max effort 拿到 73.4%,是 Cursor 跑过的最强模型,且特别擅长验证自己的工作。
第三方评测方面:Vals AI 的评测中,Fable 5.1 在 Vals Index 上排第一(67.87%),领先 Claude Opus 5(67.21%);LiveCodeBench 第一(90.52%);Terminal-Bench 2.1 第二(85.02%),仅次于 GPT-5.6 Sol 的 85.77%;ProofBench v1.1 满分 100%。
四、几个必须知道的"跑分陷阱"
这一节可能比上面的表格更有价值。
1. Fable 5.1 并没有公布 SWE-bench 分数
网上大量文章把 "Fable 5.1 = 95% SWE-bench Verified" 当事实传播。这是错的。95.0% SWE-bench Verified 和 80.0% SWE-bench Pro 是 Fable 5 在 6 月发布时的数据,不是 5.1 的;Anthropic 的 5.1 发布公告根本没有主打 SWE-bench,而是以 agentic 基准为主。在 Anthropic 或独立评测方公布 5.1 专属数据之前,任何 5.1 的 SWE-bench 说法都应视为未经证实。
作为参考,Claude Opus 5 的官方 SWE-bench Verified 是 96.0%,SWE-bench Pro 79.2%,是有明确出处的。
2. effort 档位不标注 = 分数无意义
Opus 5 有从 low 到 max 的五个 effort 档位。Claude Code 默认 High,Claude Cowork 和 claude.ai 默认 Medium;Anthropic 称 Low 和 Medium effort 已经能匹配 Fable 5 的满档表现,且成本大幅更低。
同一个模型在不同 effort 下,分数和成本可以差出一倍以上。 大量第三方对比表格根本不标注这个设置,导致成本对比完全不可用。
3. 安全护栏会直接压低跑分
这是跨厂商对比里最容易被忽略的混淆因素。Anthropic 明确说明:Fable 5.1 是在生产环境安全护栏开启的状态下评测的;在护栏介入的任务上,Fable 5.1 和 Fable 5 在 OSWorld 2.0 上直接记零分,Fable 5 在 AutomationBench 上也记零。其余护栏介入的情况中,网络安全任务由 Claude Opus 4.8 完成,生物学任务由 Claude Opus 5 完成。这很可能拉低了它们的成绩。
OpenAI 那边也印证了这点:Claude Fable 5 和 5.1 未被纳入 LifeSciBench Gold v1、GeneBench Pro v13 和 MedChemBench,因为它们拒绝回答其中大部分题目。
结论:跨厂商的 benchmark 分数差,有一部分不是能力差,是策略差。
4. token 效率正在成为新的比较轴
在 Agents' Last Exam 上,Astra 以最高分设置运行时,输出 token 用量比 Opus 5 少约 65%。Higgsfield AI 的 CEO 也提到 Astra 能完成他们最复杂的创意工作流,同时比测试过的其他模型少用最多 20% 的 token。
同时 Snorkel AI 的独立评测显示 Fable 5.1 相对 Opus 5 也有效率优势。这说明 2026 年的竞争重心正在从"能不能做对"转向"用多少代价做对"。
五、工程化落地:工具链的差异
跑分只是一半,日常写代码真正影响体验的是 harness(脚手架)。
Codex 的新上下文机制
这是 GPT-6 Astra 随发布带来的一个实打实的工程改进。在 Codex 中,Astra 可以跨上下文窗口保留笔记,不必反复把工作压缩成单一摘要;更早的上下文窗口仍然可以检索,因此 Astra 能找到之前消息和工具输出中的需求或测试结果,即便这些信息没有被写进笔记。
这直接打的是长会话 debug 的痛点。 传统的 compaction 每压缩一次,就可能丢掉"某个修复为什么失败"这种关键上下文------做过大型重构的人应该深有体会。这个功能目前需要在 Codex 的 config.toml 中手动启用,未来几周会成为 Astra 的默认行为。
OpenAI 同时更新了 Codex harness 以提升电脑操控速度,在 Mind2Web 基准上,任务完成速度比当前 GPT-5.6 Sol 体验快 1.9 倍。
意图理解与任务边界
当指令存在解释空间时,Astra 会用上下文补全常规空白,只在答案可能因此改变时才提出针对性的追问。在 Codex 中它可以异步提问,同时继续推进不依赖回答的工作;如果你不回复,它会在合适的地方按合理假设继续,但在有实质影响的决策上等待你的输入。
OpenAI 还专门做了一个评测:面对困难或不可能的任务时模型是否会越出授权范围。在没有生产护栏的情况下,GPT-5.6 Sol 有 48% 的比例越过授权目标,而 GPT-6 Astra 是 0%。
Anthropic 这边对应的改进是长任务可读性。Jane Street 的反馈是:Fable 5.1 在内部基准上比 Fable 5 和 Opus 5 解决了更多编码问题;以往模型工作时间越长越难跟上,Fable 5.1 在长的多步任务中保持可读。
行业实际迁移动作
这可能是最有说服力的信号,因为是真金白银的选择:
- Cognition 在 Fable 5.1 发布当天就把 Devin 里的 Opus 5 流量迁到了 Fable 5.1,理由是测试中它匹配或略胜 Fable 5、单任务成本更低,配合新的缓存读价格,Fable 级模型终于在他们原本留给 Opus 的负载上变得经济,首先是代码审查。
- 同样是 Cognition,在 Astra 发布当天就把它集成进 Devin 的 harness,称其在内部基准上达到 SOTA,电脑操控、写作和代码库理解能力开箱即用地改善了测试环节。
注意这两条不矛盾------它们说明大厂的真实做法是"多模型混用、按任务路由",而不是站队。
安全护栏对开发流程的影响
Anthropic 这次做了一个务实的改进:Fable 5.1 现在可以识别源码中的漏洞,而渗透测试、漏洞利用生成、二进制漏洞扫描等风险更高的任务仍受限制。由于护栏更精确,Claude Code 中的网络安全护栏平均介入次数比 Fable 5 减少约 60%。
如果你之前被 Claude Code 的误报打断过工作流,这个改进值得重新试一次。
OpenAI 那边的代价则更明显:由于 Astra 网络安全能力的显著提升,额外的安全检查有时会拖慢、暂停或终止合法工作,包括防御性安全工作。在 ChatGPT 或 Codex 中任务被暂停时,你可能需要审核该操作才能继续;在 API 中,任务会直接停止。
做安全相关开发的团队,这条要写进技术选型的风险评估里。
六、选型建议:按任务类型分
结合上面的数据,我给出一个务实的分工建议。前提是:以下建议基于公开基准,你的实际工作负载可能完全不同。
| 场景 | 首选 | 理由 |
|---|---|---|
| 复杂重构、多文件改动 | Claude Opus 5 / Fable 5.1 | AA Coding Agent Index 领先,代码审查口碑好 |
| 终端 agent、CI/CD 自动化 | GPT-6 Astra | Terminal-Bench 4.0 领先且成本更低 |
| 超长上下文(整仓库分析) | GPT-6 Astra | MRCR 512K--1M 96.3% vs 73.8%,差距明显 |
| 电脑操控 / 端到端 QA | GPT-6 Astra | OSWorld、ScreenSpot-Pro 全面领先 |
| 日常编码、性价比生产 | Claude Sonnet 5 / GPT-5.6 Terra | 2/10 档位已经够用 |
| 新颖问题、开放式推理 | GPT-6 Astra | ARC-AGI-3 是数量级差距 |
| 代码审查、长任务可读性 | Claude Fable 5.1 | Devin 实际迁移的场景 |
| 成本敏感的 agent 循环 | Claude Fable 5.1 | 缓存读 0.25,但需实测 /task |
| 二进制逆向、安全审计 | GPT-6 Astra(受限) | SRE-Bench 88% vs 12.5%,但公开版拒绝高阶任务 |
DataCamp 的一个观察值得引用:Opus 5 在更难、更新颖的推理任务(ARC-AGI-3、Frontier-Bench、AutomationBench)上领先,而 GPT-5.6 Sol 在 SWE-Bench Pro、DeepSWE 这类更成熟的编码基准上略胜。这可能说明 Opus 5 在开放式、非模板化的问题求解上有优势,而 Sol 在定义清晰、被大量针对训练的编码任务上更强。
这个规律在 Astra 这一代基本延续了。
七、自建评测:别信榜单,信你自己的代码库
上面所有讨论的落脚点其实是一句话:厂商的 benchmark 不能替代你的工作负载。
给一个最小可行的评测脚手架,从你自己的 git 历史里造题:
python
# eval_harness.py ------ 从真实 commit 造评测集,跑双模型对比
import os, json, subprocess, time
from openai import OpenAI
from anthropic import Anthropic
oai = OpenAI(api_key=os.environ["OPENAI_API_KEY"])
ant = Anthropic(api_key=os.environ["ANTHROPIC_API_KEY"])
def build_tasks(repo_path, n=30):
"""从最近的 bugfix commit 里提取 (问题描述, 改动前代码, 参考补丁)"""
log = subprocess.check_output(
["git", "-C", repo_path, "log", "--grep=fix", "-n", str(n),
"--pretty=%H|%s"], text=True
)
tasks = []
for line in log.strip().split("\n"):
sha, subject = line.split("|", 1)
diff = subprocess.check_output(
["git", "-C", repo_path, "show", sha, "--unified=10"], text=True
)
parent = subprocess.check_output(
["git", "-C", repo_path, "rev-parse", f"{sha}^"], text=True
).strip()
tasks.append({"sha": sha, "issue": subject,
"base": parent, "reference_patch": diff})
return tasks
def run_openai(prompt, model="gpt-6-astra"):
t0 = time.time()
r = oai.responses.create(model=model, input=prompt)
return {"text": r.output_text,
"in_tok": r.usage.input_tokens,
"out_tok": r.usage.output_tokens,
"latency": time.time() - t0}
def run_claude(prompt, model="claude-opus-5"):
t0 = time.time()
r = ant.messages.create(model=model, max_tokens=8000,
messages=[{"role": "user", "content": prompt}])
return {"text": r.content[0].text,
"in_tok": r.usage.input_tokens,
"out_tok": r.usage.output_tokens,
"latency": time.time() - t0}
# 单价表(USD / 1M tokens),按最新价格维护
PRICE = {
"gpt-6-astra": (10.0, 50.0),
"gpt-5.6-sol": ( 5.0, 30.0),
"claude-opus-5": ( 5.0, 25.0),
"claude-fable-5-1":(10.0, 50.0),
}
def cost(model, r):
pin, pout = PRICE[model]
return r["in_tok"] / 1e6 * pin + r["out_tok"] / 1e6 * pout
if __name__ == "__main__":
tasks = build_tasks("./my-repo", n=30)
results = []
for t in tasks:
prompt = (f"Issue: {t['issue']}\n\n"
f"Repo state at {t['base']}. Produce a unified diff that fixes it.\n"
f"Output only the diff.")
for name, fn in [("gpt-6-astra", run_openai),
("claude-opus-5", run_claude)]:
r = fn(prompt, model=name)
r.update(model=name, sha=t["sha"], cost=cost(name, r))
results.append(r)
json.dump(results, open("eval_results.json", "w"), indent=2)
几条评测方法论上的建议:
- 跑多次取平均。单次结果在接近饱和的基准上就是噪声。Opus 5 的 SWE-bench Verified 是五次试验的数据,这在业界反而是例外而非常态。
- 记录 effort 档位。不记录就没法做成本比较。
- 同时记录
$/task和通过率,画成二维散点。你会发现"最强模型"和"最优模型"经常不是同一个。 - 用你自己的代码库。用公开数据集有污染风险,尤其是那些已经存在两年以上的 benchmark。
- 加入"失败代价"权重。在失败一次的浪费超过 token 差价的任务上(大型重构、通宵自动运行、前沿难度的 bug),更贵的模型是划算的;反之则不然。
八、总结
把这一周的信息压缩成几条:
-
旗舰层面,两家已经没有代差,只有分工差。 GPT-6 Astra 在终端 agent、电脑操控、超长上下文、新颖推理、安全逆向上明显领先;Claude Fable 5.1 / Opus 5 在第三方综合智能指数、HLE、Coding Agent Index 上领先。
-
看第三方指数比看厂商横评更可靠。 OpenAI 自家发布页上的 Artificial Analysis 两个指数都不是 Astra 第一,这个细节比任何标题都有信息量。
-
成本模型变了。 从
$/token转向$/task,缓存读价格和 token 效率的权重越来越高。Fable 5.1 的"省 25%"和 Artificial Analysis 的"贵 20%"同时成立,取决于你跑的是什么。 -
Claude Opus 5 目前是被低估的一档。 5/25 的价格、96% SWE-bench Verified、AA Coding Agent Index 第一,在两个 10/50 旗舰之间,性价比位置很好。
-
安全策略正在成为实质性的技术选型因素。 无论是 Astra 的 Critical 级护栏可能中断合法工作,还是 Claude 系列因拒答而影响跑分,都会直接影响你的工程流程。
-
最后:别把选型当站队。 Cognition 同一周既把 Devin 的流量迁到 Fable 5.1,又在发布日集成了 Astra。成熟团队的做法是按任务路由,不是二选一。
写一个 30 题的自建评测大概需要半天,但能帮你省掉几个月的错误选型成本。这可能是这篇文章里唯一一条不会在下个月过期的建议。
本文数据来源:OpenAI GPT-6 Astra 官方发布页与系统卡、Anthropic Claude Fable 5.1 发布公告与系统卡、Artificial Analysis、Vals AI、ARC Prize Foundation、Snorkel AI 及相关技术媒体报道。所有厂商自报数据均已标注,建议以自建评测为准。