GPT-5.6 来了:Sol、Terra、Luna 三款模型同时登场,OpenAI 为什么重新定义模型家族?

GPT-5.6 来了:Sol、Terra、Luna 三款模型同时登场,OpenAI 为什么重新定义模型家族?

6 月 26 日,OpenAI 正式发布 GPT-5.6 ,并首次采用全新的命名方式------Sol、Terra、Luna 三个模型组成同一代产品,而不是过去熟悉的「标准版 + Mini」模式。与此同时,GPT-5.6 还带来了更强的 Coding、Agent、科研和网络安全能力,并首次加入 max reasoningultra(Subagents) 等能力。

不过,与以往不同的是,GPT-5.6 并未立即向所有用户开放,而是采用 Limited Preview(有限预览),仅面向部分合作伙伴开放 API 和 Codex 使用,ChatGPT 暂未提供体验。


GPT-5.6 不再只有一个模型

OpenAI 为 GPT-5.6 建立了新的模型体系。

模型 官方定位 适合场景 官方描述
GPT-5.6 Sol 旗舰模型 Coding、Agent、科研、复杂推理 能力最强,支持更深层推理
GPT-5.6 Terra 均衡模型 企业办公、日常开发 性能接近 GPT-5.5,但成本约降低一半
GPT-5.6 Luna 高效率模型 大规模调用、自动化任务 系列中速度最快、成本最低

OpenAI 表示,这种命名方式意味着今后 数字代表模型代际(5.6) ,而 Sol、Terra、Luna 则代表长期存在的能力层级。未来每个层级都可以独立演进,开发者能够根据智能水平、速度和成本,更方便地选择适合自己的模型。


官方重点升级了哪些能力?

相比 GPT-5.5,GPT-5.6 的升级重点并非单纯提升聊天能力,而是更加偏向真实工作场景。

① Coding 能力进一步提升

OpenAI 将软件工程列为 GPT-5.6 的核心能力之一。

官方公布的 Terminal-Bench 2.1 测试中,GPT-5.6 Sol 创下新的最佳成绩(SOTA),说明它在命令行、多步骤开发任务以及真实工程流程中的表现进一步提升。

对于开发者来说,这意味着 AI 不仅能写代码,更能完成调试、修改、运行、排查等完整的软件开发流程。


② 更强的 Agent 能力

GPT-5.6 更强调 Long-horizon Agent(长任务 Agent)

官方表示,新模型更适合持续执行复杂、多步骤任务,而不仅仅是完成一次问答。例如持续编程、自动排查问题、科研分析等需要长时间推理和规划的工作。

这也是 GPT-5.6 与 GPT-5.5 最明显的定位区别之一。


③ 新增 max reasoning

Sol 新增 max reasoning 模式。

官方介绍,这是更高等级的推理能力。当遇到复杂分析、科研、规划等任务时,模型可以投入更多推理资源,以获得更好的结果。

简单来说,就是允许模型"多思考一会儿",换取更高质量的答案。


④ ultra 模式(Subagents)

这是 GPT-5.6 最受关注的新能力之一。

官方介绍,ultra 会使用 Subagents(子代理) 协同完成复杂任务,而不是依赖单一路径推理。

多个子代理可以分别负责不同步骤,再共同完成整个任务,更适合大型工作流和复杂项目。


⑤ Tool Use 更成熟

GPT-5.6 持续强化工具调用能力。

官方表示,新模型能够更加自然地结合 API、终端以及外部工具完成任务,更符合开发者构建 AI Agent 的需求。

对于企业来说,这意味着 AI 可以更好地融入现有业务系统,而不仅仅停留在聊天窗口。


⑥ 生物科学与网络安全能力提升

官方重点提到,GPT-5.6 在专业知识工作、生物科学以及网络安全领域均有明显提升。

与此同时,OpenAI 也同步强化了相关安全防护,以降低模型被滥用的风险。


⑦ Prompt Cache 更高效

GPT-5.6 引入了更加可预测的 Prompt Caching。

官方新增 Cache Breakpoints(缓存断点) ,并支持至少 30 分钟缓存生命周期

对于需要频繁调用 API 的企业应用来说,可以减少重复计算,提高响应效率,同时降低调用成本。


为什么采用 Limited Preview?

GPT-5.6 并没有像过去一样立即全面开放。

根据官方说明,本次采用 Limited Preview(有限预览),主要原因包括:

  • 持续执行 Preparedness Framework(准备度框架)
  • 加强网络安全能力评估
  • 开展更多自动化红队测试和人工红队测试
  • 在扩大开放前进一步验证模型安全性

官方同时表示,GPT-5.6 Sol 未达到 Preparedness Framework 中 Cyber Critical 的判定阈值

在测试中,它能够帮助识别漏洞和利用链中的关键环节,但不能自主完成完整的端到端攻击。因此,OpenAI 选择先进行有限预览,再逐步扩大开放范围。


GPT-5.6 更适合哪些人?

开发者

更强的软件工程能力、更成熟的 Tool Use,以及更高效的 Prompt Cache,可以帮助完成更加完整的开发流程。

企业

Terra 在性能与成本之间取得平衡,更适合作为企业日常业务模型。

AI Agent 开发者

长任务执行、max reasoning 和 ultra 模式,为复杂 Agent 提供了更好的底层能力。

自动化办公

GPT-5.6 更适合处理跨系统、多步骤、持续执行的自动化流程。

科研人员

官方重点强化了生物科学和专业知识工作能力,更适合科研辅助分析。

网络安全团队

更适用于漏洞分析、代码审查、防御测试等合法安全工作,同时官方也加强了相关安全限制。


总结

GPT-5.6 最大的变化,并不是简单提升模型能力,而是 围绕真实工作流重新设计了整个模型体系

从 Sol、Terra、Luna 三个模型,到更强的 Agent 能力、更深入的软件工程能力,以及面向科研和网络安全的专项优化,都可以看出 OpenAI 正在让大模型逐步从"回答问题"转向"完成工作"。

对于开发者、企业以及 AI Agent 应用来说,GPT-5.6 值得持续关注。

与此同时,OpenAI 依然坚持 Limited Preview 和逐步开放策略,也说明随着模型能力不断增强,安全评估已经成为模型发布过程中不可或缺的一部分。


参考资料

  1. OpenAI:《Previewing GPT-5.6 Sol》
  2. GPT-5.6 Preview System Card
  3. OpenAI Help Center:《A preview of GPT-5.6 Sol, Terra, and Luna》
  4. OpenAI Community 官方公告
  5. OpenAI 官方 Benchmark(Terminal-Bench、GeneBench、ExploitBench、ExploitGym)
相关推荐
橙时数据 FineInsight8 分钟前
AI 能回答数据问题,但能解释业务原因吗?
大数据·人工智能·数据分析·指标平台·fineinsight
CTA终结者11 分钟前
示例、拆解和练习,要连成一条量化补课线
人工智能·python
Omics Pro14 分钟前
Arc研究所Cell|全新虚拟细胞官方基准评测框架
大数据·人工智能·深度学习·算法·机器学习
yychen_java16 分钟前
从像素到汉字:基于深度学习的中文OCR系统六步全链路剖析
人工智能·深度学习·ocr
Chengbei1116 分钟前
SRC报告成稿 Skill(SRC/0day 提交稿、分层验证门、Step 式 PoC、截图铁律)
网络·人工智能·安全·web安全·自动化·系统安全
花开富贵AI小白进化记20 分钟前
《从微软2.8万美元Token账单,看企业AI的模型路由与成本治理》
人工智能·api
甲维斯22 分钟前
Grok4.6速评GPT6:先当员工,再当科学家 !
人工智能
因_崔斯汀24 分钟前
用 AI 生成 Three.js 沉浸式网站,代码与 Skill 均已开源
前端·人工智能
Vidu_API开放平台30 分钟前
每一句台词都是 AI 现编的:我用一个 WebSocket 接住了 Vidu S1 实时数字人
人工智能
LingYi_030 分钟前
建筑提取—BuildFormer
人工智能·深度学习