GPT vs Claude 深度对比(2026年9月):从模型特性到编程实战,开发者该怎么选

写在前面:本文数据截止 2026 年 9 月 5 日。这个时间点很微妙------OpenAI 在 9 月 3 日刚发布 GPT-6 Astra,Anthropic 在 9 月 1 日刚发布 Claude Fable 5.1。两家旗舰在同一周换代,之前所有的对比文章基本都过期了。

本文所有跑分均标注来源。需要提前说明的是:厂商公布的 benchmark 本质上是营销材料,由掌握模型访问权、且对结果有利益诉求的团队跑出。它们可以作为"起始假设",但不能作为"结论"。文末会给出自建评测的方法。


一、先理清两条产品线

2026 年这两家都不再是"一个旗舰打天下",而是分层矩阵。搞清楚型号对应关系,是选型的第一步。

OpenAI 阵营

型号 发布时间 定位
GPT-6 Astra 2026-09-03 新旗舰,分阶段放量
GPT-5.6 Sol 2026-07-09 GA 上一代旗舰,仍是主力
GPT-5.6 Terra / Luna 2026-06-26 均衡档 / 轻量档

GPT-6 Astra 的发布节奏值得注意:首日只对有限的组织开放,随后几天陆续开放给 ChatGPT Plus / Pro / Business / Enterprise 用户,以及 OpenAI API 和 AWS;企业版对管理员默认关闭,需要主动开启。同时也会上线 Microsoft Azure 和 AWS Bedrock。

另一个必须知道的背景:Astra 是 OpenAI 第一个在其 Preparedness Framework 下达到"Critical"级网络安全能力的模型------意味着在有合适工具和权限的情况下,它能在无人逐步指导的前提下,发现此前未知的安全漏洞并开发出新的利用方式。因此公开版本会拒绝较高阶的安全任务(例如生成 PoC 漏洞利用代码),更宽松的权限通过 OpenAI Daybreak 计划另行开放。做安全工具链的同学要提前规划这条约束。

Anthropic 阵营

型号 发布时间 定位
Claude Fable 5.1 / Mythos 5.1 2026-09-01 新旗舰(同一底座,安全策略不同)
Claude Opus 5 2026-07-24 主力旗舰,性价比档
Claude Sonnet 5 2026-06-30 均衡档
Claude Haiku 4.5 --- 轻量档

Fable 5.1 和 Mythos 5.1 是同一个模型,区别在安全护栏级别:Fable 5.1 面向所有人,Mythos 5.1 仅限参与 Anthropic 可信访问计划的美国企业和个人。这一点对国内开发者意味着:实际能用到的顶配就是 Fable 5.1


二、价格与规格:先算清楚账

模型 上下文 输入 $/M 输出 $/M 缓存读 $/M
GPT-6 Astra 1.05M(输出上限 128K) 10 50 1
GPT-5.6 Sol 1.05M(输出上限 128K) 5 30 0.5
Claude Fable 5.1 --- 10 50 0.25
Claude Opus 5 1M 5 25 ---
Claude Sonnet 5 --- 2 10 ---
Claude Haiku 4.5 --- 1 5 ---

几个关键点:

  1. 旗舰档位价格已经拉齐 。Astra 是 10/50,缓存输入 1,batch 半价,Fast 模式 2 倍速 2 倍价;Fable 5.1 同为 10/50 一档。**Opus 5 的 5/$25 反而成了当前"近前沿能力"里最划算的一档**。

  2. Anthropic 这次打的是缓存牌。Fable 5.1 的缓存读价格降了 75%,降到每百万 token $0.25;Anthropic 估算典型场景整体成本比 Fable 5 低约 25%,重度 agentic 工作流最多低 45%。对于"agent 反复读同一个大代码库"这类场景,缓存读价格比输出价格更能决定账单。

  3. 但这个省钱说法有争议 。Artificial Analysis 指出:缓存降价在 agentic 任务上确实省约 1.40/任务,但 Fable 5.1 在 max effort 下输出 token 用量约为 Fable 5 的 1.7 倍,导致单任务实际成本反而高 20%。**这引出 2026 年选型的一个核心变化:不能只看 /token,要看 $/task。**

  4. 知识截止日期:Astra 的知识截止是 2026 年 4 月 30 日。写依赖最新库版本的代码时要注意。


三、编程能力实测:数据摆出来

下表来自 OpenAI 官方 GPT-6 Astra 发布页的横向对比表(自报数据,且是"任意 effort 档位下的最高分")。我原样列出,包括对 OpenAI 不利的行:

编程类基准

Benchmark GPT-6 Astra GPT-5.6 Sol Fable 5.1 Fable 5 Opus 5 Gemini 3.8 Flash
Terminal-Bench 4.0 57.9% 37.3% 55.8% 44.5% 52.6% 19.1%
DeepSWE v1.1 74.1% 72.7% 67.4% 69.9% 73.7% 73.8%
FrontierCode 1.1 Extended 64.5% 60.6% 63.6% 64.9% 63.6% 56.3%
FrontierCode 1.1 Main 53.3% 47.5% 50.9% 53.5% 53.4% 43.6%
内部数据库迁移任务 63.9% 42.7% 57.8% 50.3% --- ---
AA Coding Agent Index v1.4 67.0 65.1 --- 67.2 68.1 61.2

Terminal-Bench 4.0 测试 agent 在终端环境中完成软件工程、系统配置和数据分析等复杂任务;Astra 达到 57.9%,对比 GPT-5.6 Sol 的 37.3% 和 Fable 5.1 的 55.8%,估算单任务 API 成本分别低约 9% 和 63%。

注意最后一行。 Artificial Analysis Coding Agent Index 是第三方综合指数,在这一行上领先的是 Claude Opus 5(68.1),Fable 5 次之(67.2),Astra 第三(67.0)。这个结果出现在 OpenAI 自己的发布页上,可信度反而更高。

同样值得看的是通用智能指数:

Benchmark Astra Sol Fable 5.1 Fable 5 Opus 5 Gemini 3.8 Flash
AA Intelligence Index v4.1.1 61.2 60.9 65.7 62.1 63.1 58.7
Humanity's Last Exam(带工具) 57.2% --- 65.0% 63.8% 63.6% ---

在第三方综合智能指数和 HLE 上,Claude 系列领先。 这和"Astra 在自家榜单上全面碾压"的媒体标题形成了明显反差。

其他重要维度

维度 Astra Sol Fable 5.1 / Opus 5
ARC-AGI-3(新颖推理) 99.9% 7.8% Opus 5: 30.2%
FrontierMath Tier 4 97.6% 83.0% Fable 5.1: 87.8%
GPQA Diamond 96.0% 94.6% Fable 5.1: 93.7%
OSWorld 2.0(电脑操控) 72.6% 65.7% Opus 5: 70.2%
Agents' Last Exam 59.3% 53.6% Opus 5: 55.5%
MRCR v2 8针 512K--1M 96.3% 73.8% ---
ExploitBench(安全) 100% 78.5% Opus 5: 70%
SRE-Bench(二进制逆向) 88.0% 55.9% Opus 5: 12.5%

ARC-AGI-3 的跳变最夸张。ARC Prize 基金会的 Greg Kamradt 表示,Astra 在 96% 的关卡上超过了他们的人类行动效率基线,基本达到人类水平,并称这不只是分数最高,更代表前沿模型性能的一次阶跃。而对比数据是:Opus 5 为 30.2%,GPT-5.6 Sol 仅 7.8%。

长上下文的差距同样显著:512K--1M 区间的多针检索,Astra 96.3% vs Sol 73.8%。对于"整仓库分析"这类任务,这个差距是质变级的。

反过来看 Anthropic 自己的数据

Anthropic 自测中,Fable 5.1 在 Terminal-Bench-Science 上从 24.7% 提升到 52.6%,在 Terminal-Bench 4.0 上从 42.0% 提升到 55.8%,在 AutomationBench 上从 17.1% 提升到 31.4%。在 Cursor 的 CursorBench 3.2 上,Fable 5.1 以 max effort 拿到 73.4%,是 Cursor 跑过的最强模型,且特别擅长验证自己的工作。

第三方评测方面:Vals AI 的评测中,Fable 5.1 在 Vals Index 上排第一(67.87%),领先 Claude Opus 5(67.21%);LiveCodeBench 第一(90.52%);Terminal-Bench 2.1 第二(85.02%),仅次于 GPT-5.6 Sol 的 85.77%;ProofBench v1.1 满分 100%。


四、几个必须知道的"跑分陷阱"

这一节可能比上面的表格更有价值。

1. Fable 5.1 并没有公布 SWE-bench 分数

网上大量文章把 "Fable 5.1 = 95% SWE-bench Verified" 当事实传播。这是错的。95.0% SWE-bench Verified 和 80.0% SWE-bench Pro 是 Fable 5 在 6 月发布时的数据,不是 5.1 的;Anthropic 的 5.1 发布公告根本没有主打 SWE-bench,而是以 agentic 基准为主。在 Anthropic 或独立评测方公布 5.1 专属数据之前,任何 5.1 的 SWE-bench 说法都应视为未经证实。

作为参考,Claude Opus 5 的官方 SWE-bench Verified 是 96.0%,SWE-bench Pro 79.2%,是有明确出处的。

2. effort 档位不标注 = 分数无意义

Opus 5 有从 low 到 max 的五个 effort 档位。Claude Code 默认 High,Claude Cowork 和 claude.ai 默认 Medium;Anthropic 称 Low 和 Medium effort 已经能匹配 Fable 5 的满档表现,且成本大幅更低。

同一个模型在不同 effort 下,分数和成本可以差出一倍以上。 大量第三方对比表格根本不标注这个设置,导致成本对比完全不可用。

3. 安全护栏会直接压低跑分

这是跨厂商对比里最容易被忽略的混淆因素。Anthropic 明确说明:Fable 5.1 是在生产环境安全护栏开启的状态下评测的;在护栏介入的任务上,Fable 5.1 和 Fable 5 在 OSWorld 2.0 上直接记零分,Fable 5 在 AutomationBench 上也记零。其余护栏介入的情况中,网络安全任务由 Claude Opus 4.8 完成,生物学任务由 Claude Opus 5 完成。这很可能拉低了它们的成绩。

OpenAI 那边也印证了这点:Claude Fable 5 和 5.1 未被纳入 LifeSciBench Gold v1、GeneBench Pro v13 和 MedChemBench,因为它们拒绝回答其中大部分题目。

结论:跨厂商的 benchmark 分数差,有一部分不是能力差,是策略差。

4. token 效率正在成为新的比较轴

在 Agents' Last Exam 上,Astra 以最高分设置运行时,输出 token 用量比 Opus 5 少约 65%。Higgsfield AI 的 CEO 也提到 Astra 能完成他们最复杂的创意工作流,同时比测试过的其他模型少用最多 20% 的 token。

同时 Snorkel AI 的独立评测显示 Fable 5.1 相对 Opus 5 也有效率优势。这说明 2026 年的竞争重心正在从"能不能做对"转向"用多少代价做对"。


五、工程化落地:工具链的差异

跑分只是一半,日常写代码真正影响体验的是 harness(脚手架)。

Codex 的新上下文机制

这是 GPT-6 Astra 随发布带来的一个实打实的工程改进。在 Codex 中,Astra 可以跨上下文窗口保留笔记,不必反复把工作压缩成单一摘要;更早的上下文窗口仍然可以检索,因此 Astra 能找到之前消息和工具输出中的需求或测试结果,即便这些信息没有被写进笔记。

这直接打的是长会话 debug 的痛点。 传统的 compaction 每压缩一次,就可能丢掉"某个修复为什么失败"这种关键上下文------做过大型重构的人应该深有体会。这个功能目前需要在 Codex 的 config.toml 中手动启用,未来几周会成为 Astra 的默认行为。

OpenAI 同时更新了 Codex harness 以提升电脑操控速度,在 Mind2Web 基准上,任务完成速度比当前 GPT-5.6 Sol 体验快 1.9 倍。

意图理解与任务边界

当指令存在解释空间时,Astra 会用上下文补全常规空白,只在答案可能因此改变时才提出针对性的追问。在 Codex 中它可以异步提问,同时继续推进不依赖回答的工作;如果你不回复,它会在合适的地方按合理假设继续,但在有实质影响的决策上等待你的输入。

OpenAI 还专门做了一个评测:面对困难或不可能的任务时模型是否会越出授权范围。在没有生产护栏的情况下,GPT-5.6 Sol 有 48% 的比例越过授权目标,而 GPT-6 Astra 是 0%。

Anthropic 这边对应的改进是长任务可读性。Jane Street 的反馈是:Fable 5.1 在内部基准上比 Fable 5 和 Opus 5 解决了更多编码问题;以往模型工作时间越长越难跟上,Fable 5.1 在长的多步任务中保持可读。

行业实际迁移动作

这可能是最有说服力的信号,因为是真金白银的选择:

  • Cognition 在 Fable 5.1 发布当天就把 Devin 里的 Opus 5 流量迁到了 Fable 5.1,理由是测试中它匹配或略胜 Fable 5、单任务成本更低,配合新的缓存读价格,Fable 级模型终于在他们原本留给 Opus 的负载上变得经济,首先是代码审查。
  • 同样是 Cognition,在 Astra 发布当天就把它集成进 Devin 的 harness,称其在内部基准上达到 SOTA,电脑操控、写作和代码库理解能力开箱即用地改善了测试环节。

注意这两条不矛盾------它们说明大厂的真实做法是"多模型混用、按任务路由",而不是站队。

安全护栏对开发流程的影响

Anthropic 这次做了一个务实的改进:Fable 5.1 现在可以识别源码中的漏洞,而渗透测试、漏洞利用生成、二进制漏洞扫描等风险更高的任务仍受限制。由于护栏更精确,Claude Code 中的网络安全护栏平均介入次数比 Fable 5 减少约 60%。

如果你之前被 Claude Code 的误报打断过工作流,这个改进值得重新试一次。

OpenAI 那边的代价则更明显:由于 Astra 网络安全能力的显著提升,额外的安全检查有时会拖慢、暂停或终止合法工作,包括防御性安全工作。在 ChatGPT 或 Codex 中任务被暂停时,你可能需要审核该操作才能继续;在 API 中,任务会直接停止。

做安全相关开发的团队,这条要写进技术选型的风险评估里。


六、选型建议:按任务类型分

结合上面的数据,我给出一个务实的分工建议。前提是:以下建议基于公开基准,你的实际工作负载可能完全不同。

场景 首选 理由
复杂重构、多文件改动 Claude Opus 5 / Fable 5.1 AA Coding Agent Index 领先,代码审查口碑好
终端 agent、CI/CD 自动化 GPT-6 Astra Terminal-Bench 4.0 领先且成本更低
超长上下文(整仓库分析) GPT-6 Astra MRCR 512K--1M 96.3% vs 73.8%,差距明显
电脑操控 / 端到端 QA GPT-6 Astra OSWorld、ScreenSpot-Pro 全面领先
日常编码、性价比生产 Claude Sonnet 5 / GPT-5.6 Terra 2/10 档位已经够用
新颖问题、开放式推理 GPT-6 Astra ARC-AGI-3 是数量级差距
代码审查、长任务可读性 Claude Fable 5.1 Devin 实际迁移的场景
成本敏感的 agent 循环 Claude Fable 5.1 缓存读 0.25,但需实测 /task
二进制逆向、安全审计 GPT-6 Astra(受限) SRE-Bench 88% vs 12.5%,但公开版拒绝高阶任务

DataCamp 的一个观察值得引用:Opus 5 在更难、更新颖的推理任务(ARC-AGI-3、Frontier-Bench、AutomationBench)上领先,而 GPT-5.6 Sol 在 SWE-Bench Pro、DeepSWE 这类更成熟的编码基准上略胜。这可能说明 Opus 5 在开放式、非模板化的问题求解上有优势,而 Sol 在定义清晰、被大量针对训练的编码任务上更强。

这个规律在 Astra 这一代基本延续了。


七、自建评测:别信榜单,信你自己的代码库

上面所有讨论的落脚点其实是一句话:厂商的 benchmark 不能替代你的工作负载

给一个最小可行的评测脚手架,从你自己的 git 历史里造题:

python 复制代码
# eval_harness.py ------ 从真实 commit 造评测集,跑双模型对比
import os, json, subprocess, time
from openai import OpenAI
from anthropic import Anthropic

oai = OpenAI(api_key=os.environ["OPENAI_API_KEY"])
ant = Anthropic(api_key=os.environ["ANTHROPIC_API_KEY"])

def build_tasks(repo_path, n=30):
    """从最近的 bugfix commit 里提取 (问题描述, 改动前代码, 参考补丁)"""
    log = subprocess.check_output(
        ["git", "-C", repo_path, "log", "--grep=fix", "-n", str(n),
         "--pretty=%H|%s"], text=True
    )
    tasks = []
    for line in log.strip().split("\n"):
        sha, subject = line.split("|", 1)
        diff = subprocess.check_output(
            ["git", "-C", repo_path, "show", sha, "--unified=10"], text=True
        )
        parent = subprocess.check_output(
            ["git", "-C", repo_path, "rev-parse", f"{sha}^"], text=True
        ).strip()
        tasks.append({"sha": sha, "issue": subject,
                      "base": parent, "reference_patch": diff})
    return tasks

def run_openai(prompt, model="gpt-6-astra"):
    t0 = time.time()
    r = oai.responses.create(model=model, input=prompt)
    return {"text": r.output_text,
            "in_tok": r.usage.input_tokens,
            "out_tok": r.usage.output_tokens,
            "latency": time.time() - t0}

def run_claude(prompt, model="claude-opus-5"):
    t0 = time.time()
    r = ant.messages.create(model=model, max_tokens=8000,
                            messages=[{"role": "user", "content": prompt}])
    return {"text": r.content[0].text,
            "in_tok": r.usage.input_tokens,
            "out_tok": r.usage.output_tokens,
            "latency": time.time() - t0}

# 单价表(USD / 1M tokens),按最新价格维护
PRICE = {
    "gpt-6-astra":     (10.0, 50.0),
    "gpt-5.6-sol":     ( 5.0, 30.0),
    "claude-opus-5":   ( 5.0, 25.0),
    "claude-fable-5-1":(10.0, 50.0),
}

def cost(model, r):
    pin, pout = PRICE[model]
    return r["in_tok"] / 1e6 * pin + r["out_tok"] / 1e6 * pout

if __name__ == "__main__":
    tasks = build_tasks("./my-repo", n=30)
    results = []
    for t in tasks:
        prompt = (f"Issue: {t['issue']}\n\n"
                  f"Repo state at {t['base']}. Produce a unified diff that fixes it.\n"
                  f"Output only the diff.")
        for name, fn in [("gpt-6-astra", run_openai),
                         ("claude-opus-5", run_claude)]:
            r = fn(prompt, model=name)
            r.update(model=name, sha=t["sha"], cost=cost(name, r))
            results.append(r)
    json.dump(results, open("eval_results.json", "w"), indent=2)

几条评测方法论上的建议:

  1. 跑多次取平均。单次结果在接近饱和的基准上就是噪声。Opus 5 的 SWE-bench Verified 是五次试验的数据,这在业界反而是例外而非常态。
  2. 记录 effort 档位。不记录就没法做成本比较。
  3. 同时记录 $/task通过率,画成二维散点。你会发现"最强模型"和"最优模型"经常不是同一个。
  4. 用你自己的代码库。用公开数据集有污染风险,尤其是那些已经存在两年以上的 benchmark。
  5. 加入"失败代价"权重。在失败一次的浪费超过 token 差价的任务上(大型重构、通宵自动运行、前沿难度的 bug),更贵的模型是划算的;反之则不然。

八、总结

把这一周的信息压缩成几条:

  1. 旗舰层面,两家已经没有代差,只有分工差。 GPT-6 Astra 在终端 agent、电脑操控、超长上下文、新颖推理、安全逆向上明显领先;Claude Fable 5.1 / Opus 5 在第三方综合智能指数、HLE、Coding Agent Index 上领先。

  2. 看第三方指数比看厂商横评更可靠。 OpenAI 自家发布页上的 Artificial Analysis 两个指数都不是 Astra 第一,这个细节比任何标题都有信息量。

  3. 成本模型变了。$/token 转向 $/task,缓存读价格和 token 效率的权重越来越高。Fable 5.1 的"省 25%"和 Artificial Analysis 的"贵 20%"同时成立,取决于你跑的是什么。

  4. Claude Opus 5 目前是被低估的一档。 5/25 的价格、96% SWE-bench Verified、AA Coding Agent Index 第一,在两个 10/50 旗舰之间,性价比位置很好。

  5. 安全策略正在成为实质性的技术选型因素。 无论是 Astra 的 Critical 级护栏可能中断合法工作,还是 Claude 系列因拒答而影响跑分,都会直接影响你的工程流程。

  6. 最后:别把选型当站队。 Cognition 同一周既把 Devin 的流量迁到 Fable 5.1,又在发布日集成了 Astra。成熟团队的做法是按任务路由,不是二选一。

写一个 30 题的自建评测大概需要半天,但能帮你省掉几个月的错误选型成本。这可能是这篇文章里唯一一条不会在下个月过期的建议。


本文数据来源:OpenAI GPT-6 Astra 官方发布页与系统卡、Anthropic Claude Fable 5.1 发布公告与系统卡、Artificial Analysis、Vals AI、ARC Prize Foundation、Snorkel AI 及相关技术媒体报道。所有厂商自报数据均已标注,建议以自建评测为准。

相关推荐
IT毕设实战小研1 小时前
基于大数据的WTA职业网球赛事演变与竞技格局数据可视化分析
大数据·后端·爬虫·python·信息可视化·课程设计
veminhe1 小时前
python发送邮件带附件
python
zhanghaha13141 小时前
Python进阶教程:28_queue 队列模块 零基础超详细教程
java·开发语言·python
abstract学习1 小时前
文献综述借助gpt辅助
gpt
大海的科技宝箱1 小时前
GPT 6 Astra 开放体验:Pro 太贵?用 llapi.org 低成本尝鲜
gpt
小柯南敲键盘1 小时前
跨马翻译AI工具,批量图片视频翻译与智能抠图一站式解决
人工智能·python·音视频
veminhe1 小时前
python对象的序列化和反序列化
python
weixin199701080161 小时前
[特殊字符]《闲鱼 + 淘宝 + 1688 三平台库存同源:二手ERP主数据治理与超卖防御》(附Python源码)
开发语言·python
yan418290dgjkv1 小时前
2026年汽车贴膜获客新思路:3步锁定精准客户
python·汽车