GPT-5.6 来了:Sol、Terra、Luna 三款模型同时登场,OpenAI 为什么重新定义模型家族?

GPT-5.6 来了:Sol、Terra、Luna 三款模型同时登场,OpenAI 为什么重新定义模型家族?

6 月 26 日,OpenAI 正式发布 GPT-5.6 ,并首次采用全新的命名方式------Sol、Terra、Luna 三个模型组成同一代产品,而不是过去熟悉的「标准版 + Mini」模式。与此同时,GPT-5.6 还带来了更强的 Coding、Agent、科研和网络安全能力,并首次加入 max reasoning 与 ultra(Subagents) 等能力。

不过,与以往不同的是,GPT-5.6 并未立即向所有用户开放,而是采用 Limited Preview(有限预览),仅面向部分合作伙伴开放 API 和 Codex 使用,ChatGPT 暂未提供体验。


GPT-5.6 不再只有一个模型

OpenAI 为 GPT-5.6 建立了新的模型体系。

模型 官方定位 适合场景 官方描述
GPT-5.6 Sol 旗舰模型 Coding、Agent、科研、复杂推理 能力最强,支持更深层推理
GPT-5.6 Terra 均衡模型 企业办公、日常开发 性能接近 GPT-5.5,但成本约降低一半
GPT-5.6 Luna 高效率模型 大规模调用、自动化任务 系列中速度最快、成本最低

OpenAI 表示,这种命名方式意味着今后 数字代表模型代际(5.6) ,而 Sol、Terra、Luna 则代表长期存在的能力层级。未来每个层级都可以独立演进,开发者能够根据智能水平、速度和成本,更方便地选择适合自己的模型。


官方重点升级了哪些能力?

相比 GPT-5.5,GPT-5.6 的升级重点并非单纯提升聊天能力,而是更加偏向真实工作场景。

① Coding 能力进一步提升

OpenAI 将软件工程列为 GPT-5.6 的核心能力之一。

官方公布的 Terminal-Bench 2.1 测试中,GPT-5.6 Sol 创下新的最佳成绩(SOTA),说明它在命令行、多步骤开发任务以及真实工程流程中的表现进一步提升。

对于开发者来说,这意味着 AI 不仅能写代码,更能完成调试、修改、运行、排查等完整的软件开发流程。


② 更强的 Agent 能力

GPT-5.6 更强调 Long-horizon Agent(长任务 Agent)。

官方表示,新模型更适合持续执行复杂、多步骤任务,而不仅仅是完成一次问答。例如持续编程、自动排查问题、科研分析等需要长时间推理和规划的工作。

这也是 GPT-5.6 与 GPT-5.5 最明显的定位区别之一。


③ 新增 max reasoning

Sol 新增 max reasoning 模式。

官方介绍,这是更高等级的推理能力。当遇到复杂分析、科研、规划等任务时,模型可以投入更多推理资源,以获得更好的结果。

简单来说,就是允许模型"多思考一会儿",换取更高质量的答案。


④ ultra 模式(Subagents)

这是 GPT-5.6 最受关注的新能力之一。

官方介绍,ultra 会使用 Subagents(子代理) 协同完成复杂任务,而不是依赖单一路径推理。

多个子代理可以分别负责不同步骤,再共同完成整个任务,更适合大型工作流和复杂项目。


⑤ Tool Use 更成熟

GPT-5.6 持续强化工具调用能力。

官方表示,新模型能够更加自然地结合 API、终端以及外部工具完成任务,更符合开发者构建 AI Agent 的需求。

对于企业来说,这意味着 AI 可以更好地融入现有业务系统,而不仅仅停留在聊天窗口。


⑥ 生物科学与网络安全能力提升

官方重点提到,GPT-5.6 在专业知识工作、生物科学以及网络安全领域均有明显提升。

与此同时,OpenAI 也同步强化了相关安全防护,以降低模型被滥用的风险。


⑦ Prompt Cache 更高效

GPT-5.6 引入了更加可预测的 Prompt Caching。

官方新增 Cache Breakpoints(缓存断点) ,并支持至少 30 分钟缓存生命周期。

对于需要频繁调用 API 的企业应用来说,可以减少重复计算,提高响应效率,同时降低调用成本。


为什么采用 Limited Preview?

GPT-5.6 并没有像过去一样立即全面开放。

根据官方说明,本次采用 Limited Preview(有限预览),主要原因包括:

  • 持续执行 Preparedness Framework(准备度框架)
  • 加强网络安全能力评估
  • 开展更多自动化红队测试和人工红队测试
  • 在扩大开放前进一步验证模型安全性

官方同时表示,GPT-5.6 Sol 未达到 Preparedness Framework 中 Cyber Critical 的判定阈值。

在测试中,它能够帮助识别漏洞和利用链中的关键环节,但不能自主完成完整的端到端攻击。因此,OpenAI 选择先进行有限预览,再逐步扩大开放范围。


GPT-5.6 更适合哪些人?

开发者

更强的软件工程能力、更成熟的 Tool Use,以及更高效的 Prompt Cache,可以帮助完成更加完整的开发流程。

企业

Terra 在性能与成本之间取得平衡,更适合作为企业日常业务模型。

AI Agent 开发者

长任务执行、max reasoning 和 ultra 模式,为复杂 Agent 提供了更好的底层能力。

自动化办公

GPT-5.6 更适合处理跨系统、多步骤、持续执行的自动化流程。

科研人员

官方重点强化了生物科学和专业知识工作能力,更适合科研辅助分析。

网络安全团队

更适用于漏洞分析、代码审查、防御测试等合法安全工作,同时官方也加强了相关安全限制。


总结

GPT-5.6 最大的变化,并不是简单提升模型能力,而是 围绕真实工作流重新设计了整个模型体系。

从 Sol、Terra、Luna 三个模型,到更强的 Agent 能力、更深入的软件工程能力,以及面向科研和网络安全的专项优化,都可以看出 OpenAI 正在让大模型逐步从"回答问题"转向"完成工作"。

对于开发者、企业以及 AI Agent 应用来说,GPT-5.6 值得持续关注。

与此同时,OpenAI 依然坚持 Limited Preview 和逐步开放策略,也说明随着模型能力不断增强,安全评估已经成为模型发布过程中不可或缺的一部分。


参考资料

  1. OpenAI:《Previewing GPT-5.6 Sol》
  2. GPT-5.6 Preview System Card
  3. OpenAI Help Center:《A preview of GPT-5.6 Sol, Terra, and Luna》
  4. OpenAI Community 官方公告
  5. OpenAI 官方 Benchmark(Terminal-Bench、GeneBench、ExploitBench、ExploitGym)
相关推荐
回眸&啤酒鸭2 天前
【回眸】Minicart 电商购物车核心功能落地指南
人工智能
一隅论数智2 天前
给AI一张“业务概念地图“:本体如何从哲学走向企业智能
大数据·人工智能·经验分享·笔记·学习·学习方法·政务
AI的探索之旅2 天前
97 个 OpenCV 实例(三十):双目立体,从标定到点云
人工智能·opencv·计算机视觉
AlbertZein2 天前
Step-5-Preview 上手实测:3D 游戏、金融分析、网页设计一次跑完
人工智能·aigc
LaughingZhu2 天前
Product Hunt 每日热榜 | 2026-09-19
人工智能·深度学习·神经网络·搜索引擎·百度
美狐美颜SDK开放平台2 天前
开发直播APP时如何接入视频美颜SDK?开发流程与注意事项
android·人工智能·计算机视觉·音视频·直播美颜sdk
wukangjupingbb2 天前
智能网联汽车安全能力框架
人工智能
龙亘川2 天前
明月照湾区,智启新赛道:从顶流文旅IP盛会看智慧文旅升级路径
人工智能·智慧城市·开源软件·数据可视化
飞猫的边缘AI2 天前
边缘AI应用:家用AI摄像头怎么做数据训练?
人工智能·边缘计算·ai算法·边缘ai