【生产力】GPT-5.6 发布:前沿智能、智能体协作与更高性价比

发布日期:2026 年 7 月 9 日

OpenAI 正式推出 GPT-5.6 系列模型,包括旗舰模型 GPT-5.6 Sol 、面向日常工作的均衡型模型 GPT-5.6 Terra ,以及成本效率最高的 GPT-5.6 Luna

GPT-5.6 旨在让每一个 token 产生更多有效工作:在编码、知识工作、网络安全和科学任务上取得前沿水平,同时以更少的 token 和更低的预估成本,超过此前及同类的前沿模型。对于相同预算,用户可以完成更多工作;对于相近结果,则可以显著降低总成本。

此外,GPT-5.6 新增了 ultra 能力档位:它会默认协调多个智能体,在并行工作流中处理复杂任务,以缩短完成时间。更强的计算机操作能力和设计判断力,也让 GPT-5.6 Sol 成为 OpenAI 目前完成度最高的协作伙伴之一,能够检查、改进并交付可以直接使用的结果。

默认高效,需要时释放最大性能

OpenAI 训练 GPT-5.6 的目标,是让模型从每一个 token 中获得更多有效工作。在覆盖 55 个专业领域、用于评估长期专业工作流的 Agents' Last Exam 测试中,GPT-5.6 Sol 达到 53.6 的新高,比 Claude Fable 5(自适应推理)高 13.1 分。即使使用 medium 推理等级,它仍以约四分之一的预估成本领先 Fable 5 11.4 分。

这种效率优势同样延伸到更小的模型:GPT-5.6 Terra 和 GPT-5.6 Luna 以约十六分之一的成本超过 Fable 5。

在覆盖智能体工作、编码、科学推理和通用能力的 Artificial Analysis Intelligence Index 上,采用 max 推理的 GPT-5.6 Sol 与 Fable 5 的差距缩小到 1 分以内;与此同时,完成任务所需时间减少 61%,预估成本约为后者的一半。

编码能力

GPT-5.6 Sol 是 OpenAI 目前最强的编码模型。在 Artificial Analysis Coding Agent Index 上,使用 max 推理的 GPT-5.6 Sol 得分为 80,创造新的最佳成绩,比 Fable 5 高 2.8 分;它使用的输出 token 不到后者的一半,耗时不到一半,成本约低三分之一。

这一优势覆盖整个模型系列:Terra 的表现略高于 Fable 5,Luna 则超过 Opus 4.8。两者完成任务的时间约为对比模型的三分之一,输出 token 约减少一半,预估成本约为四分之一。GPT-5.6 还在 Terminal-Bench 2.1 和 DeepSWE 上取得新的最佳成绩;这两个测试分别侧重复杂命令行工作流,以及真实代码库中的长期工程任务。

GPT-5.6 可以编写并运行轻量级程序,用于协调工具、处理阶段性结果、监控进度,并随着工作推进选择下一步行动。因此,工具密集型任务可以使用更少的 token、更少的模型往返和更少的人工引导继续推进。

开发者不必为每一步都编写脚本,也不必把每一个工具响应都重新传回模型。程序化工具调用(Programmatic Tool Calling)可以在 Responses API 中筛选大量中间数据,只保留真正重要的信息,并在执行过程中动态调整工作流。

对于适合投入更多时间和计算资源的问题,GPT-5.6 可以突破默认的高效模式:

  • maxxhigh 提供更多时间,用于推理、探索替代方案、运行检查并修订方法。
  • ultra 更进一步,默认并行协调 4 个智能体,以更高 token 用量换取更强结果,并缩短高难度任务的完成时间。

下表概括了原文所展示的多智能体评测对比。与单智能体基线相比,增加并行智能体后,三个评测的"得分---延迟"前沿都向更高得分、更低延迟方向移动;其中 BrowseComp 和 SEC-Bench Pro 还展示了 16 智能体配置。

评测 对比配置
BrowseComp 单智能体、4 智能体、16 智能体
SEC-Bench Pro 单智能体、4 智能体、16 智能体
Terminal-Bench 2.1 单智能体、4 智能体

在 API 中,开发者可以通过 Responses API 的 multi-agent Beta 构建类似 ultra 的体验。

客户反馈

"GPT-5.6 是我们在 CursorBench 上测试过的最强模型之一。早期评测显示,它在持续性、智能水平和整体效率方面都表现扎实。对于开发者来说,这是令人振奋的一步,我们期待将它带给 Cursor 用户。"

------Oskar Schulz,Cursor 总裁
"在我们的智能体代码审查测试中,GPT-5.6 是表现最强的模型。在内部和外部的同口径 PR 基准测试中,它的 F1 超过 GPT-5.5,同时每个 PR 使用的 token 约减少三倍,中位延迟约降低一半。"

------Itamar Friedman,Qodo 联合创始人兼 CEO
"GPT-5.6 Sol 真的非常出色。它是我们见过最有韧性的解决问题模型,能够连续数天保持专注并持续完成任务。它特别擅长更新 Custom Agents,并随着工作区不断变化改进记忆,因此运行时间越长,智能体就越精准。Terra 和 Luna 的表现也远超其价格所代表的水平。许多使用 GPT-5.5 的智能体,在 Terra 上以一半成本和少 16% 的 token 就能达到相同效果。"

------Simon Last,Notion 联合创始人
"对于生产环境中的编码智能体,GPT-5.6 凭借强大的编码智能体表现和非常出色的成本效率,成为顶尖模型之一。"

------Scott Wu,Cognition 联合创始人兼 CEO
"GPT-5.6 是金融研究智能体的一大进步。在 Rogo 的 Big Finance Benchmark 上,相比 GPT-5.5,它的评分标准质量提高了 6.2 分,答案准确率提高了 3.6 分。使用程序化工具调用后,它在保持相同质量的同时,输出 token 减少 24%,任务完成速度提升 28%。这种准确性、速度和效率的组合,正是扩展高质量金融分析所需要的。"

------Alex Wang,Rogo 应用 AI 团队
"GPT-5.6 给人的感觉不再只是聊天助手,而更像一个端到端的技术操作员。它可以检查实时系统、调试问题、修改代码、验证结果、发布产物,并在长时间会话中保持扎实的上下文理解。"

------Ian Tracey,Ramp 应用 AI 软件工程师
"与前代模型相比,GPT-5.6 更能理解我想要的工作层次。在一个包含研究、规划和分阶段实现的多阶段 Codex 工作流中,它比 GPT-5.5 更好地遵循意图,并且持续生成准确、带有行号链接的 GitHub 引用,而此前的模型经常遗漏这些内容。"

------Shane Moran,Shopify 高级应用 AI/ML 工程师
"GPT-5.6 能够在长期任务中持续保持专注,善于使用工具,并且只需很少引导就能得到高质量解决方案。在研究和设计工作中,它可以生成清晰的报告和直观的图表,帮助团队理解复杂系统并加快推进速度。"

------Arjun Sambamoorthy,Cisco AI Software and Platform 副总裁、CTO
"在法律研究和文档工作流中,GPT-5.6 已经带来了足以改变产品经济模型的效率提升。在我们的综合评测中,它使用的 token 减少 14%,同时在法律研究和交易法场景中提升了质量。对于多步骤文档分析,程序化工具调用在不损失质量的情况下将提示 token 减少了 38%。"

------Angel Faus,Clio 工程副总裁
"GPT-5.6 在复杂金融研究中展现了我们见过的最佳效率表现。在评测中,它以顶级水平完成任务,同时 token 效率提高到 1.72 倍,在三个主要类别中领先,并在多跳任务中取得 88% 的成绩。效率、准确性和质量的结合,使它非常适合扩展金融研究工作流。"

------Alberto Da Costa,Balyasny Asset Management 应用 AI 首席工程师
"GPT-5.6 Sol 在推理、决策和自主性方面都有显著提升。子智能体使用能力的改进,对复杂会计工作尤其有价值。很期待 OpenAI 在智能体发展方向上的下一步。"

------Tarrek Shaban,Basis 产品负责人

设计能力的跨越式提升

GPT-5.6 在设计判断力方面实现了跨越式提升。只需提供高层次方向,它就能创建有品位、符合人体工学且真正可用的界面。更强的计算机操作能力使它能够检查和改进渲染后的结果,而不只是生成底层代码或内容;因此,它可以在交付前发现视觉和功能问题,并完成最后的润色。

原文展示了 GPT-5.6 生成的多个示例,包括:

  • Sailing game
  • Tiny voids game
  • Museum website
  • Clockwork village game
  • Interior design presentation

OpenAI 还提供了一个由 GPT-5.6 生成的交互式游戏演示

GPT-5.6 的前端能力还可以在 ChatGPT Work 中,将自然语言请求转化为精致、可交互的解释和可视化内容。原文示例包括交互式螺旋线、交互式波干涉演示和交互式 GPT tokenizer 解释器。

端到端的知识工作

GPT-5.6 能够为专业任务提供更好的结果。它可以从文档以及 Slack、Notion、Microsoft 365 和 Google Drive 等日常工作流中获取混乱、非结构化的上下文,并将其转换成专家级、可分享的成果物。

GPT-5.6 在知识工作上的优势,体现在长期专业分析、浏览、工具使用和计算机操作等多类评测中:

  • GPT-5.6 Sol 在 BrowseComp 上取得 92.2% 的新最佳成绩。
  • 在 OSWorld 2.0 上取得 62.6%,超过 Opus 4.8,同时输出 token 减少 85%。
  • Luna 以不到一半的预估成本,接近 GPT-5.5 的峰值表现。
  • Terra 以更低成本超过 GPT-5.5。

GPT-5.6 在演示文稿、文档和电子表格方面也提升了质量,生成的内容更精致、更准确。它可以从零开始创建完全可编辑的演示文稿,将提示和源材料转化为具有连贯视觉叙事、清晰布局、层次结构和设计规范的成品。

在使用模板和参考演示文稿时,这种提升尤其明显。GPT-5.6 可以推断演示文稿的设计系统,包括布局、字体、间距、颜色、重复出现的内容模式,以及 Slide Master 中嵌入的规则,并将这些约定一致地应用到新内容中。原文示例显示:当要求模型根据参考文件更新数据时,GPT-5.5 的输出遗漏了母版幻灯片中的关键组件,而 GPT-5.6 更忠实地遵循了参考结构。

GPT-5.6 还能够创建视觉效果更精细的文档和电子表格,更忠实地遵循复杂的参考格式,这对于可重复的知识工作十分重要。它在处理方程式和财务模型时更加精确,也更善于运用字体、间距、层次结构以及页面或工作表布局。

原文展示的知识工作示例包括股票研究文档和杠杆收购模型。

早期客户反馈

"GPT-5.6 在构建生产级应用背后的长期复杂工作流中效率非常高。作为 Lovable 使用的模型之一,它帮助用户比此前的模型少执行约 25% 的步骤、少调用 35%--48% 的工具,同时提高项目成功率,并将卡住的运行减少 15%。对于任何希望从创意走向可运行应用的人来说,这都是有意义的差异。"

------Fabian Hedin,Lovable 联合创始人
"GPT-5.6 Sol 是我们评测过的第一个能够稳定生成可直接投入实际工作的演示文稿模型。在 Model ML 的 FinBench 中,覆盖 20 个具有挑战性的客户工作流和数百份演示文稿,它每份演示文稿使用的 token 比 Fable 少 39%,同时生成了更加精致、易读的幻灯片,以及更清晰、更准确的数据可视化,分享前所需的返工更少。"

------Chaz Englander,Model ML 联合创始人兼 CEO
"GPT-5.6 是我们七项任务基准测试中综合表现最好的前端模型。在满分 5 分的前端质量评估中,它得分 4.4,而 GPT-5.5 为 4.0、Claude 4.8 为 3.5。它持续将复杂的电商、仪表盘和产品需求简报,转化为适配桌面端和移动端的完整响应式界面。"

------AJ Orbach,Triple Whale CEO
"借助 GPT-5.6 的程序化工具调用,我们可以更高效地通过结构化 API 构建详细的 Unity 场景。在场景构建工作流中,与使用直接工具调用的同一模型相比,它使用的总 token 减少 63.5%,模型轮次减少 50.1%,同时生成了相近的视觉效果。这让迭代式游戏创作更具规模化可行性。"

------Teddy Cross,PlayCo 联合创始人兼 CPO
"GPT-5.6 在演示文稿方面尤其出色。在早期设计评测中,它的幻灯片创建能力强于竞争模型,token 效率约为后者的 1.6 倍。在 Canva 这样的规模下生成和优化视觉内容时,这一点非常重要。"

------Danny Wu,Canva AI 产品负责人
"GPT-5.6 推动了 Microsoft 365 中成果物生成能力的发展。在我们的评测中,它覆盖广泛的生产力场景并取得了强劲结果,生成的内容高度连贯、准确且可以直接使用。它减少了优化提示和迭代草稿所需的工作,让用户可以少花时间打磨内容,多花时间采取行动。"

------Charles Lamanna,Microsoft Copilot、Agents and Platform 执行副总裁
"在 30 次真实应用构建对话中,GPT-5.6 比 GPT-5.5 少使用 22% 的输入 token 和 23% 的输出 token,同时在从零开始构建和长期多轮工作中保持竞争力。这是真正的一次提升,尤其体现在设计和前端能力上。"

------Gabriel Grinberg,Base44 AI 工程负责人
"GPT-5.6 在法律工作流上有所提升。在 Legora 的内部评测框架中,它在 7 项任务中的 5 项上提升或保持稳定,其中结构化起草和判例审查的进步最明显,同时对法律结论保持了恰当的谨慎。"

------Jake Lauritzen,Legora CTO
"借助 Figma Make 中的 GPT-5.6,团队可以将复杂设计转化为交互式原型。它提升了设计到代码工作流的标准。"

------Loredana Crisan,Figma 首席设计官

推进网络安全与科学能力的前沿

GPT-5.6 是 OpenAI 目前最强的网络安全模型,在显著减少 token 的情况下取得前沿级表现。

  • ExploitBench 上,GPT-5.6 Sol 得分 73.5%,而 GPT-5.5 为 47.9%。该测试衡量模型从定位易受攻击代码,到实现任意代码执行的进展,二者使用的输出 token 预算相近。
  • 在 ExploitGym 上,模型需要将现实世界的漏洞转化为可运行的利用代码。在两小时限制下,GPT-5.6 Sol 的峰值通过率从 GPT-5.5 的 15.1% 提高到 24.9%;在六小时限制下达到 33.7%。
  • 在 SEC-Bench Pro 上,GPT-5.6 Sol 得分 71.2%,GPT-5.5 为 45.8%,同时延迟表现更好。该测试关注复杂软件中的概念验证生成。

GPT-5.6 同样支持重要的防御性任务,包括安全代码审查、打补丁、威胁建模和蓝队工作。符合条件的个人和组织可以加入 OpenAI Daybreak 的 Trusted Access for Cyber 计划,在获得授权的环境中,通过针对已验证工作的更精细防护,使用更多防御能力。这些任务包括漏洞分级与验证、恶意软件分析、检测工程和补丁验证。

个人用户可以验证身份并申请可信访问,组织可以为团队提交申请。个人成员需要在 9 月 1 日前启用带硬件支持的通行密钥和 Advanced Account Security,才能继续访问 OpenAI 网络安全能力最强的前沿模型;未启用的用户将恢复为默认访问权限。

尚未拥有硬件支持通行密钥的用户,可以通过合作伙伴 Yubico 获得优惠价格。OpenAI 也会进一步限制高风险实体和高风险司法管辖区的访问权限。

在生命科学评测中,GPT-5.6 Sol 在现实世界生物学、生命科学研究工作流和化学任务上,相较 GPT-5.5 取得了帕累托改进:用更少的 token 和更短时间获得更强结果。

GeneBench Pro 上,模型处理长期基因组学和定量生物学分析时,用更少的 token 和更短时间取得更强结果。原文未将 Claude Fable 5 纳入该评测,因为它不会回答高级生物学问题,并拒绝了该评测中的大多数问题。

GPT-5.6 加速 OpenAI 的研发

GPT-5.6 是 OpenAI 目前用于加速 AI 研究能力最强的模型。在 OpenAI 内部,研究人员将它用于完整的开发循环:诊断失败、优化训练系统、运行实验以及解读结果。

在 GPT-5.6 的内部测试期间,OpenAI 已经观察到更快的研究推进速度和更广泛的采用:每位活跃研究人员每天平均生成的输出 token,超过 GPT-5.5 测得的最高水平两倍以上。

这种工作方式正在迅速成为标准。过去六个月中,用于内部代码推理的研究计算占比增长了 100 倍,内部智能体 token 使用量约增长 22 倍。这些采用指标本身并不等同于研究进展,但它们显示出 AI 辅助正在研究团队以及销售、市场、用户运营、财务等其他团队中快速普及。

为了直接衡量这项能力,OpenAI 建立了一套基于真实 AI 研究任务的内部评测,包括调试研究系统、优化 kernel 和训练配方、运行机器学习实验,以及改进另一个模型。

在衡量递归自我改进进展的综合评测中,GPT-5.6 Sol 的 RSI 综合能力比 GPT-5.5 提高了 16.2 分,推动内部研究的各个环节加速。

随能力提升扩展安全与防护

随着模型能力增强,OpenAI 也强化了安全体系,使先进智能保持广泛可用,同时对风险最高的用途进行更严格的审查。针对 GPT-5.6,OpenAI 构建了迄今最稳健的安全系统,根据每个模型的能力进行校准,并投入了比以往更多的计算资源。

GPT-5.6 系列模型在生物学和网络安全两个领域都比早期模型更强,但尚未跨过任一领域的 Critical 临界阈值。网络安全测试表明,GPT-5.6 更擅长发现和修复漏洞,而不是可靠地对经过加固的目标执行自主、端到端攻击。这给防御者留下了在弱点被利用前强化系统的机会。

在生物学方面,测试表明 GPT-5.6 可以支持合法研究,但尚不具备创建、设计或合成高度危险新型威胁所需的端到端能力。

这两个领域本质上都具有双重用途。在网络安全中,可以帮助攻击者利用漏洞的能力,同样可以帮助防御者发现漏洞、复现问题并构建可靠修复方案。因此,过度拦截本身也会制造安全风险:它可能阻止防御者测试系统和部署补丁,而恶意行为者仍会使用其他模型,包括能力不断增强的开源模型和成熟工具。

有效的安全措施需要考虑请求的上下文和可能后果,在保留合法防御工作的同时,对于证据表明存在严重伤害风险的请求施加更强控制。

GPT-5.6 的防护机制采用分层设计,以提高准确性和冗余度,并能随着新型攻击出现而快速适应。训练进模型的保护机制与实时检查、持续监控和账户级执行措施协同工作,即使某一层没有按预期工作,也能帮助系统保持安全。

OpenAI 还加入了推理监控器,用于审查对话并判断请求是否可能造成伤害。这种设计旨在允许防御性工作,同时拦截严重滥用;最敏感的能力则通过 Trusted Access 保留给经过验证的用户。由于部分保护机制使用测试时推理,OpenAI 可以快速更新防护,弥补漏洞,而不必从头训练分类器。

在继续强化系统应对自适应攻击的过程中,OpenAI 采取了更保守的策略。与此前模型相比,GPT-5.6 Sol 的网络安全防护大约会拦截多 10 倍的潜在有害活动。考虑到这些措施可能给正常使用带来摩擦,ChatGPT 和 Codex 提供了便捷的重试选项,可以将提示交由能力较低的模型处理。OpenAI 将继续降低安全措施对正常使用的影响,同时保持较高的稳健性标准。

这体现了 OpenAI 的迭代部署方式:先采用更保守的策略,再根据真实世界使用中获得的经验持续改进。

在正式开放前,OpenAI 进行了迄今最密集的安全评估,包括大规模红队测试、与外部专家开展的能力和防护测试,以及约 700,000 个 NVIDIA A100 Tensor Core GPU 等效小时的黑盒自动化红队测试。这些工作帮助 OpenAI 系统性地探查潜在薄弱点、发现越狱方式,并在发布前强化防护。

不存在绝对完美的安全性。随着模型能力持续增强,新的弱点和绕过现有防护的越狱方式仍会被发现,每一代新模型也会带来新的攻击和滥用途径。OpenAI 通过分层防护、持续监控、快速修复以及防御社区协作来应对这一现实。

针对 GPT-5.6,OpenAI 在现有的安全漏洞赏金计划和生物学漏洞赏金计划基础上,加入了快速修复流程,并采用迄今最强的监控措施。来自研究人员、监控系统和现实世界滥用情况的发现,将持续反馈到新的评测和更强的防护机制中。

更多防护信息请参阅更新后的 GPT-5.6 系统卡

可用性与定价

GPT-5.6 包含三个模型层级:旗舰模型 Sol、性能可与 GPT-5.5 竞争且成本更低的 Terra,以及速度最快、价格最实惠的 Luna。数字代表模型代际;Sol、Terra 和 Luna 则是稳定的能力层级,可以按照各自节奏独立演进。

GPT-5.6 已在 ChatGPT、Codex 和 OpenAI API 中推出。全球发布从现在开始,并将在未来 24 小时内逐步扩大到全部用户。

ChatGPT、ChatGPT Work 与 Codex

  • ChatGPT:Plus、Pro、Business 和 Enterprise 用户可以通过 medium 及更高 effort 设置使用 GPT-5.6 Sol。Pro 和 Enterprise 用户还可以选择 GPT-5.6 Sol Pro,以便在复杂任务中获得最高质量结果。
  • ChatGPT Work 和 Codex :Free 和 Go 用户可以使用 GPT-5.6 Terra。Plus、Pro、Business 和 Enterprise 用户可以在 GPT-5.6 Sol、Terra 和 Luna 之间选择,并分别设置 effort 等级。所有能够在 ChatGPT Work 和 Codex 中使用 GPT-5.6 的用户都可以使用 max,并在设置中开启。ChatGPT Work 中的 ultra 面向 Pro 和 Enterprise 用户开放;Codex 中的 ultra 面向 Plus 及更高版本开放。

OpenAI API

开发者可以通过 OpenAI API 使用 Sol、Terra 和 Luna。在 Responses API 中:

  • 程序化工具调用允许 GPT-5.6 在内存中编写并运行程序,协调工具并处理阶段性结果,同时兼容零数据保留(ZDR)。
  • Multi-agent 最初以 Beta 形式提供,允许 GPT-5.6 并发运行多个子智能体,并在单个请求中综合它们的工作结果。

GPT-5.6 按每 100 万 token 计价:

模型 输入价格 输出价格
GPT-5.6 Sol 5 美元 30 美元
GPT-5.6 Terra 2.50 美元 15 美元
GPT-5.6 Luna 1 美元 6 美元

GPT-5.6 还带来了更加可预测的提示缓存机制,包括支持显式缓存断点和至少 30 分钟的缓存生命周期。

对于 GPT-5.6 及后续模型,缓存写入按照模型未缓存输入价格的 1.25 倍计费;缓存读取仍享受缓存输入 90% 的折扣。

基准评测结果

以下数据来自 OpenAI 原文。除特别说明外,百分比为评测得分;Index score、Elo 等指标保留原始量纲。

专业工作

评测 GPT-5.6 Sol GPT-5.6 Terra GPT-5.6 Luna GPT-5.5 Claude Fable 5 Claude Opus 4.8 Gemini 3.1 Pro Preview Gemini 3.5 Flash
Agents' Last Exam 52.7% 50.4% 50.3% 46.9% 40.5% 45.2% 32.1% ---
GDPval-AA v2 1,747.8 Elo 1,593 Elo 1,591.8 Elo 1,493.7 Elo 1,759.6 Elo 1,600.1 Elo 962.3 Elo 1,348.8 Elo
管理咨询任务(内部) 43.2% 37.2% 35.4% 31.3% 35.5% 31.6% 13.2% ---
Big Finance Bench 53% 51% 36% 49% --- 44% --- ---
Artificial Analysis Intelligence Index v4.1 58.9 55 51.2 54.8 59.9 55.7 46.5 50.2

编码

评测 GPT-5.6 Sol GPT-5.6 Sol Ultra GPT-5.6 Terra GPT-5.6 Luna GPT-5.5 Claude Mythos 5 Claude Mythos Preview Claude Fable 5 Claude Opus 4.8 Gemini 3.1 Pro Preview
Artificial Analysis Coding Agent Index v1.1 80 --- 77.4 74.6 76.4 --- --- 77.2 72.5 42.7
SWE-Bench Pro 64.6% --- 63.4% 62.7% 59.4% 80.3% 77.8% 80% 69.2% 54.2%
DeepSWE v1.1 72.7% --- 69.6% 67.2% 67% --- --- 69.7% 59% 11.8%
Terminal-Bench 2.1 88.8% 91.9% 87.4% 84.7% 85.6% 88% --- 83.1% 78.9% 70.7%

科学与健康

评测 GPT-5.6 Sol GPT-5.6 Terra GPT-5.6 Luna GPT-5.5 Claude Fable 5 Claude Opus 4.8 Gemini 3.1 Pro Preview Gemini 3.5 Flash
GeneBench Pro 28.7% 23.3% 10.8% 12% --- 16% 3.1% 8.14%
LifeSciBench 59.9% 56% 51.2% 50.4% --- 53.6% --- ---
MedChemBench(内部) 48.3% 35% 30.4% 35.5% --- --- --- ---
HealthBench Professional 60.5% 57.7% 55.7% 49.5% 60.9% 53% --- ---

计算机操作

评测 GPT-5.6 Sol GPT-5.6 Sol Ultra GPT-5.6 Terra GPT-5.6 Luna GPT-5.5 Claude Mythos 5 Claude Mythos Preview Claude Opus 4.8 Gemini 3.1 Pro Preview
OSWorld 2.0 62.6% --- 50.2% 45.6% 47.5% --- --- 54.8% ---
BrowseComp 90.4% 92.2% 87.5% 83.3% 84.4% 88% 87.9% 84.3% 85.9%
BenchCAD 70.6% --- 62.3% 63.1% 44.4% 38.4% 35.5% 27.3% ---
BenchCAD(Python 工具) 83.4% --- 78.2% 73.9% 55.8% 65% 61% 51.8% ---

网络安全

评测 GPT-5.6 Sol GPT-5.6 Sol Ultra GPT-5.6 Terra GPT-5.6 Luna GPT-5.5 Claude Mythos 5 Claude Mythos Preview Claude Opus 4.8
Capture-the-Flag Challenges 96.7% --- 91.8% 85.2% 88.1% --- --- ---
SEC-Bench Pro 71.2% 74.3% 57.7% 48.9% 45.8% --- --- ---
ExploitBench 73.5% --- 52.9% 33.2% 47.9% 78% 74.2% 40%
ExploitGym 33.7% --- 23.2% 12.4% 15.1% --- --- ---

自我改进

评测 GPT-5.6 Sol GPT-5.6 Terra GPT-5.6 Luna GPT-5.5
内部研究调试评测 68.3% 67.8% 50.8% 50%
KernelGen 1P 61.1% 49.2% 22.4% 29.3%
NanoGPT 9.69% 14.5% 1.66% 2.65%
PostTrainBench Lite 50.3% 51.5% 29.6% 38.8%
RSI Index 57.9% 56.3% 41.9% 41.7%

多模态

评测 GPT-5.6 Sol GPT-5.6 Terra GPT-5.6 Luna GPT-5.5 Claude Fable 5 Claude Opus 4.8 Gemini 3.1 Pro Preview
MMMU Pro(无工具) 83% 80.7% 78.4% 81.2% --- --- 80.5%
MMMU Pro(使用工具) 84.6% 82% 79.5% 83.2% --- --- ---
gdp.pdf 30.7% 24.7% 22.7% 26% 29.8% 22.5% 16.7%

学术能力

评测 GPT-5.6 Sol GPT-5.6 Terra GPT-5.6 Luna GPT-5.5 Claude Mythos 5 Claude Mythos Preview Claude Fable 5 Claude Opus 4.8 Gemini 3.1 Pro Preview
GPQA Diamond 94.6% 92.9% 92.3% 93.6% 94.1% 94.6% 92.6% 92% 94.3%
FrontierMath Tier 1--3(v2) 89% 84.9% 78.6% 85.3% --- --- 87% 80% 59.6%
FrontierMath Tier 4(v2) 83% 68.3% 58.5% 72.5% --- --- 87.8% 56.1% ---

工具使用

评测 GPT-5.6 Sol GPT-5.6 Terra GPT-5.6 Luna GPT-5.5 Claude Mythos 5 Claude Mythos Preview Claude Fable 5 Claude Opus 4.8 Gemini 3.1 Pro Preview Gemini 3.5 Flash
AutomationBench 18.1% 15.2% 14.9% 12.9% --- --- 17.4% 15.5% --- 14.5%
Toolathlon 58% 53.1% 53.4% 55.6% 61.7% 61.1% 61.7% 59.9% 48.8% ---

长上下文

评测 GPT-5.6 Sol GPT-5.6 Terra GPT-5.6 Luna GPT-5.5 Claude Mythos 5 Claude Mythos Preview Claude Opus 4.8
OpenAI MRCR v2,8-needle,256K--512K 91.5% 89.6% 41.3% 81.5% --- --- ---
OpenAI MRCR v2,8-needle,512K--1M 73.8% 72.5% 41.3% 74% --- --- ---
GraphWalks BFS,256k F1 90.7% 76.9% 81.3% 73.7% 91.1% 85.7% 85.9%
GraphWalks BFS,1M F1 77.1% 71.2% 51.2% 45.4% 79.4% 74.3% 68.1%

抽象推理

评测 GPT-5.6 Sol GPT-5.6 Terra GPT-5.6 Luna GPT-5.5 Claude Opus 4.8 Gemini 3.1 Pro Preview
ARC-AGI-3 7.78% 0.8% 0.18% 0.43% 1.5% 0.42%

评测说明与脚注

  1. 网络安全能力评测使用了降低强度的安全防护。用户可以加入 OpenAI Daybreak 的 Trusted Access for Cyber 计划,以获得更高的防御性网络安全能力访问权限。
  2. 所有模型均使用 ExploitBench API 测试框架、5 个随机种子和推理连续性进行评测。
  3. ExploitGym 使用 Alpha API 运行。该 API 的响应速度快于公开 API,随后再按公开 API 的速度进行缩放。因此,在延迟按公开 API 速度重新计算后,部分预估延迟会超过两小时和六小时的时间限制,尽管模型在实际评测运行中正确遵守了时间限制。对于对时间敏感的工作,OpenAI API 提供优先处理,Codex 提供快速模式。
  4. 延迟和 API 成本是根据模型在生产环境中的行为进行估计,并通过离线模拟得到。估算考虑了工具调用细节、采样 token 和输入 token,但实际结果可能因模拟未覆盖的多种因素而有很大差异。延迟按 API 快速速度模拟,成本按常规 API 定价模拟。
  5. 对于没有报告输出 token、延迟或成本的模型,图表以水平点划线表示。
  6. 对于多智能体配置,延迟根据根智能体计算;输出 token 和 API 成本总量则包含所有 token。ultra 使用 4 个智能体运行。
  7. HealthBench Professional 的得分使用该评测论文中描述的官方评分方式计算,因此不能直接与 Anthropic 系统卡中报告的结果比较。
  8. Claude Opus 4.8 的 ARC-AGI-3 结果使用 high 而不是 max 推理等级运行,因为这是该模型目前公开的唯一 ARC-AGI-3 结果。

总结

GPT-5.6 的核心变化并不只是单项基准分数提升,而是模型在长流程工作中的综合效率更高:它可以更长时间保持任务目标,主动使用工具,处理复杂中间结果,并在需要时协调多个智能体。

对于开发者而言,maxultra 提供了按需增加推理时间和并行计算的方式;对于成本敏感的生产工作流,Terra 和 Luna 则将较强能力带到了更低价格档位。与此同时,GPT-5.6 在设计、演示文稿、文档、电子表格、网络安全防御、科学研究和计算机操作方面都有明显扩展,使它更接近一个能够端到端完成专业工作的技术协作者。

相关推荐
灵感__idea1 小时前
《AI工程》:构建应用,需要哪些技术?(解惑篇)
aigc·openai·ai编程
chaors2 小时前
DeepResearchSystem 0x03:HITL
llm·github·ai编程
东小西3 小时前
第12篇:《AI的幻觉差点让我背锅:于是我给它开了一场"开卷考试"》
openai·ai编程
武子康3 小时前
GAIA、Cosmos、Genie 等视频模型纷纷自称"世界模型",为什么说视觉逼真度不构成决策证据?
人工智能·llm·agent
武子康4 小时前
Video VAE 不是末端编解码器:5 维-潜网格-主模型 Token 的“表示合同“
人工智能·llm·agent
孙启超5 小时前
【AI应用开发】 RAG篇(一):概述与核心架构
llm·embedding·向量数据库·rag·向量化·ai应用开发·chunking
Miracleeee5 小时前
当 Skill 放大一万倍,它就变成了 Memory——从渐进式披露到动态上下文的工程演进
aigc·openai
DigitalOcean6 小时前
Kimi K3 现已上线 DigitalOcean 无服务器推理
llm·agent·ai编程
tkevinjd6 小时前
MiniCode 项目详解7:Memory 记忆系统
大数据·python·搜索引擎·llm·agent