GPT-5.6 来了:Sol、Terra、Luna 三款模型同时登场,OpenAI 为什么重新定义模型家族?

GPT-5.6 来了:Sol、Terra、Luna 三款模型同时登场,OpenAI 为什么重新定义模型家族?

6 月 26 日,OpenAI 正式发布 GPT-5.6 ,并首次采用全新的命名方式------Sol、Terra、Luna 三个模型组成同一代产品,而不是过去熟悉的「标准版 + Mini」模式。与此同时,GPT-5.6 还带来了更强的 Coding、Agent、科研和网络安全能力,并首次加入 max reasoningultra(Subagents) 等能力。

不过,与以往不同的是,GPT-5.6 并未立即向所有用户开放,而是采用 Limited Preview(有限预览),仅面向部分合作伙伴开放 API 和 Codex 使用,ChatGPT 暂未提供体验。


GPT-5.6 不再只有一个模型

OpenAI 为 GPT-5.6 建立了新的模型体系。

模型 官方定位 适合场景 官方描述
GPT-5.6 Sol 旗舰模型 Coding、Agent、科研、复杂推理 能力最强,支持更深层推理
GPT-5.6 Terra 均衡模型 企业办公、日常开发 性能接近 GPT-5.5,但成本约降低一半
GPT-5.6 Luna 高效率模型 大规模调用、自动化任务 系列中速度最快、成本最低

OpenAI 表示,这种命名方式意味着今后 数字代表模型代际(5.6) ,而 Sol、Terra、Luna 则代表长期存在的能力层级。未来每个层级都可以独立演进,开发者能够根据智能水平、速度和成本,更方便地选择适合自己的模型。


官方重点升级了哪些能力?

相比 GPT-5.5,GPT-5.6 的升级重点并非单纯提升聊天能力,而是更加偏向真实工作场景。

① Coding 能力进一步提升

OpenAI 将软件工程列为 GPT-5.6 的核心能力之一。

官方公布的 Terminal-Bench 2.1 测试中,GPT-5.6 Sol 创下新的最佳成绩(SOTA),说明它在命令行、多步骤开发任务以及真实工程流程中的表现进一步提升。

对于开发者来说,这意味着 AI 不仅能写代码,更能完成调试、修改、运行、排查等完整的软件开发流程。


② 更强的 Agent 能力

GPT-5.6 更强调 Long-horizon Agent(长任务 Agent)

官方表示,新模型更适合持续执行复杂、多步骤任务,而不仅仅是完成一次问答。例如持续编程、自动排查问题、科研分析等需要长时间推理和规划的工作。

这也是 GPT-5.6 与 GPT-5.5 最明显的定位区别之一。


③ 新增 max reasoning

Sol 新增 max reasoning 模式。

官方介绍,这是更高等级的推理能力。当遇到复杂分析、科研、规划等任务时,模型可以投入更多推理资源,以获得更好的结果。

简单来说,就是允许模型"多思考一会儿",换取更高质量的答案。


④ ultra 模式(Subagents)

这是 GPT-5.6 最受关注的新能力之一。

官方介绍,ultra 会使用 Subagents(子代理) 协同完成复杂任务,而不是依赖单一路径推理。

多个子代理可以分别负责不同步骤,再共同完成整个任务,更适合大型工作流和复杂项目。


⑤ Tool Use 更成熟

GPT-5.6 持续强化工具调用能力。

官方表示,新模型能够更加自然地结合 API、终端以及外部工具完成任务,更符合开发者构建 AI Agent 的需求。

对于企业来说,这意味着 AI 可以更好地融入现有业务系统,而不仅仅停留在聊天窗口。


⑥ 生物科学与网络安全能力提升

官方重点提到,GPT-5.6 在专业知识工作、生物科学以及网络安全领域均有明显提升。

与此同时,OpenAI 也同步强化了相关安全防护,以降低模型被滥用的风险。


⑦ Prompt Cache 更高效

GPT-5.6 引入了更加可预测的 Prompt Caching。

官方新增 Cache Breakpoints(缓存断点) ,并支持至少 30 分钟缓存生命周期

对于需要频繁调用 API 的企业应用来说,可以减少重复计算,提高响应效率,同时降低调用成本。


为什么采用 Limited Preview?

GPT-5.6 并没有像过去一样立即全面开放。

根据官方说明,本次采用 Limited Preview(有限预览),主要原因包括:

  • 持续执行 Preparedness Framework(准备度框架)
  • 加强网络安全能力评估
  • 开展更多自动化红队测试和人工红队测试
  • 在扩大开放前进一步验证模型安全性

官方同时表示,GPT-5.6 Sol 未达到 Preparedness Framework 中 Cyber Critical 的判定阈值

在测试中,它能够帮助识别漏洞和利用链中的关键环节,但不能自主完成完整的端到端攻击。因此,OpenAI 选择先进行有限预览,再逐步扩大开放范围。


GPT-5.6 更适合哪些人?

开发者

更强的软件工程能力、更成熟的 Tool Use,以及更高效的 Prompt Cache,可以帮助完成更加完整的开发流程。

企业

Terra 在性能与成本之间取得平衡,更适合作为企业日常业务模型。

AI Agent 开发者

长任务执行、max reasoning 和 ultra 模式,为复杂 Agent 提供了更好的底层能力。

自动化办公

GPT-5.6 更适合处理跨系统、多步骤、持续执行的自动化流程。

科研人员

官方重点强化了生物科学和专业知识工作能力,更适合科研辅助分析。

网络安全团队

更适用于漏洞分析、代码审查、防御测试等合法安全工作,同时官方也加强了相关安全限制。


总结

GPT-5.6 最大的变化,并不是简单提升模型能力,而是 围绕真实工作流重新设计了整个模型体系

从 Sol、Terra、Luna 三个模型,到更强的 Agent 能力、更深入的软件工程能力,以及面向科研和网络安全的专项优化,都可以看出 OpenAI 正在让大模型逐步从"回答问题"转向"完成工作"。

对于开发者、企业以及 AI Agent 应用来说,GPT-5.6 值得持续关注。

与此同时,OpenAI 依然坚持 Limited Preview 和逐步开放策略,也说明随着模型能力不断增强,安全评估已经成为模型发布过程中不可或缺的一部分。


参考资料

  1. OpenAI:《Previewing GPT-5.6 Sol》
  2. GPT-5.6 Preview System Card
  3. OpenAI Help Center:《A preview of GPT-5.6 Sol, Terra, and Luna》
  4. OpenAI Community 官方公告
  5. OpenAI 官方 Benchmark(Terminal-Bench、GeneBench、ExploitBench、ExploitGym)
相关推荐
宅小年7 分钟前
DeepSeek Harness 发布,一切皆是插件
人工智能
努力的小Qin12 分钟前
梯度下降如何实现参数优化:从线性回归到 Sigmoid 分类
人工智能·python·神经网络
甲维斯15 分钟前
DeepSeekPro 依旧拉跨,配上官方Harness,还不如Flash?
人工智能
听你说3220 分钟前
推进具身智能安全评测:丈八科技与季华实验室达成战略合作
人工智能·科技·安全
阿里云大数据AI技术21 分钟前
DataWorks Data Agent 7月升级: Qwen3.8-max 加持、管住 Token、打通 IM、铺向全球
大数据·人工智能·agent
2601_9557598827 分钟前
如何降低 Claude API 批量生产返工率
大数据·人工智能·算法
搞科研的小刘选手36 分钟前
【南昌航空大学主办 | 南昌举办】第六届计算机图形学、人工智能与数据处理国际学术会议 (ICCAID 2026)
人工智能·数据处理·学术会议·计算机图像学·会议推荐
人工智能技术咨询.1 小时前
工信部教考中心证书
人工智能
ACP广源盛139246256731 小时前
WAIC2026 国产超节点算力浪潮下@ACP#IX9104 在算力矩阵中的定位与落地场景
大数据·数据库·人工智能·嵌入式硬件·线性代数·矩阵
tedcloud1231 小时前
book-to-skill 怎么部署?把技术书和文档转换成可复用的 AI Skill
运维·服务器·人工智能·开源·ai编程