GPT-5.6 正式发布:Codex 并入 ChatGPT,额度与模型体系全面调整

OpenAI 正式发布 GPT-5.6 系列模型,并同步更新 ChatGPT Work、Codex、API 和 Agentic Usage 相关能力。

这次更新不只是模型升级,还涉及产品入口、任务执行方式和额度计费体系的变化。

核心信息可以概括为四点:

  1. GPT-5.6 系列发布:分为 Sol、Terra、Luna 三档模型;

  2. Codex 并入 ChatGPT 桌面端:Codex 仍保留开发能力,但入口开始统一;

  3. ChatGPT Work 上线:面向长任务、文档、表格、PPT、网页和跨工具工作流;

  4. Codex 额度与 credits 体系调整:按 token / credits 更精细计量,多个 Agent 功能开始共享 usage 池。


一、GPT-5.6 系列:Sol、Terra、Luna 三档模型

GPT-5.6 不是单一模型,而是一组模型系列。

OpenAI 将 GPT-5.6 分成三个模型层级:

模型 定位 主要场景
GPT-5.6 Sol 旗舰模型 复杂推理、代码开发、专业分析、科研、安全、复杂办公任务
GPT-5.6 Terra 平衡模型 日常开发、文档处理、数据分析、通用办公任务
GPT-5.6 Luna 高速低成本模型 批量任务、轻量任务、高频调用、简单检查与改写

OpenAI 官方介绍中,Sol 是旗舰模型,Terra 是平衡模型,Luna 是成本最低的模型;GPT-5.6 的发布重点包括更高 token 效率、更好的单位成本表现,以及面向复杂工作的更强能力。

这次模型分层比较清楚:

  • Sol:复杂任务优先;

  • Terra:日常任务主力;

  • Luna:低成本、高频任务。


二、官方评测:三组图看 GPT-5.6 的模型表现

OpenAI 在 GPT-5.6 发布页中放了多组评测图。这里重点看三组:

  • Agents' Last Exam

  • Artificial Analysis Coding Agent Index v1.1

  • BrowseComp (Multi-Agent)


Agents' Last Exam:长链路专业 Agent 任务

Agents' Last Exam 评估的是跨 55 个专业领域的长链路 Agent 工作流。

OpenAI 官方正文中给出的关键结果是:

  • GPT-5.6 Sol:53.6

  • 相比 Claude Fable 513.1 分

  • 在 medium reasoning 下,GPT-5.6 Sol 也比 Claude Fable 5 高 11.4 分

  • OpenAI 同时表示,GPT-5.6 Terra 和 GPT-5.6 Luna 也在约 1/16 成本下超过 Claude Fable 5。

GPT-5.6 Sol 在长链路专业 Agent 任务中刷新了 OpenAI 官方给出的最高分;Terra 和 Luna 则体现出更低成本下的可用表现。


Artificial Analysis Coding Agent Index v1.1:代码 Agent 任务

Artificial Analysis Coding Agent Index v1.1 是面向代码 Agent 的评测,覆盖实现能力、终端使用和真实代码库任务。

OpenAI 官方给出的结果是:

模型 分数
GPT-5.6 Sol 80
GPT-5.6 Terra 77.4
GPT-5.6 Luna 74.6
GPT-5.5 76.4
Claude Fable 5 77.2
Claude Opus 4.8 72.5
Gemini 3.1 Pro Preview 42.7

关键对比:

  • GPT-5.6 Sol 比 Claude Fable 52.8 分

  • GPT-5.6 Sol 比 GPT-5.53.6 分

  • GPT-5.6 Sol 比 Claude Opus 4.87.5 分

  • GPT-5.6 Terra 比 Claude Fable 50.2 分

  • GPT-5.6 Luna 比 Claude Opus 4.82.1 分

OpenAI 还表示,GPT-5.6 Sol 在该评测中使用的输出 token 不到 Claude Fable 5 的一半,耗时不到一半,估算成本约低三分之一;Terra 和 Luna 也在耗时、输出 token 和估算成本上更低。

GPT-5.6 Sol 在代码 Agent 指标上高于 Claude Fable 5、GPT-5.5 和 Claude Opus 4.8;Terra 接近并略高于 Claude Fable 5;Luna 高于 Claude Opus 4.8。


BrowseComp (Multi-Agent):多 Agent 浏览任务

BrowseComp 评估的是 agentic browsing,也就是模型通过浏览、检索、整合信息来完成任务。

OpenAI 官方表格中给出的 BrowseComp 结果如下:

模型 分数
GPT-5.6 Sol Ultra 92.20%
GPT-5.6 Sol 90.40%
GPT-5.6 Terra 87.50%
GPT-5.6 Luna 83.30%
GPT-5.5 84.40%
Claude Mythos 5 88.00%
Claude Mythos Preview 87.90%
Claude Opus 4.8 84.30%
Gemini 3.1 Pro Preview 85.90%

关键对比:

  • GPT-5.6 Sol Ultra 比 GPT-5.57.8 个百分点

  • GPT-5.6 Sol Ultra 比 Claude Mythos 54.2 个百分点

  • GPT-5.6 Sol Ultra 比 Claude Opus 4.87.9 个百分点

  • GPT-5.6 Sol 比 GPT-5.56.0 个百分点

  • GPT-5.6 Sol 比 Claude Mythos 52.4 个百分点

  • GPT-5.6 Terra 比 GPT-5.53.1 个百分点

OpenAI 在正文中说明,ultra 默认使用 4 个 agent 并行;在 multi-agent 图表中,latency 取 root agent,output token 和 API cost 统计所有 agent 的总消耗。

在 BrowseComp 上,GPT-5.6 Sol Ultra 达到 92.2%,GPT-5.6 Sol 达到 90.4%,均高于 GPT-5.5、Claude Mythos 5、Claude Opus 4.8 和 Gemini 3.1 Pro Preview。


三、GPT-5.6 API 价格

GPT-5.6 API 按每 100 万 tokens 计费。

模型 输入价格 输出价格
GPT-5.6 Sol $5 / 1M tokens $30 / 1M tokens
GPT-5.6 Terra $2.50 / 1M tokens $15 / 1M tokens
GPT-5.6 Luna $1 / 1M tokens $6 / 1M tokens

OpenAI 同时说明,GPT-5.6 支持更可预测的 prompt caching。对于 GPT-5.6 及后续模型,cache write 按未缓存输入价格的 1.25 倍 计费,cache read 继续享受 90% cached-input 折扣

按价格看,三档模型定位比较明确:

模型 成本定位
Sol 高能力、高成本
Terra 成本减半,适合日常主力任务
Luna 成本最低,适合批量和轻量任务

四、ChatGPT 里怎么使用 GPT-5.6

GPT-5.6 在不同产品入口中的开放范围并不一样。

在标准 ChatGPT 对话中,GPT-5.5 Instant 仍然是快速日常响应的默认模型;GPT-5.6 Sol 用于 Medium、High、Extra High 等推理选项。

标准 ChatGPT 对话中的开放情况如下:

套餐 Medium / High Extra High Pro
Plus 可用 不可用 不可用
Pro 可用 可用 可用
Business 可用 可用 可用
Enterprise 可用 可用 可用
Free / Go 不可用 不可用 不可用

Terra 和 Luna 不在标准 ChatGPT 对话中直接选择。它们主要出现在 Work、Codex 和 API 中。

在 Work 和 Codex 中,可用范围如下:

产品入口 GPT-5.6 可用情况
Work in ChatGPT Plus / Pro / Business / Enterprise 可使用 Sol、Terra、Luna
Codex Free / Go 可使用 Terra;Plus / Pro / Business / Enterprise 可使用 Sol、Terra、Luna
OpenAI API 可使用 Sol、Terra、Luna

如果在 Codex 中还看不到 GPT-5.6,OpenAI 帮助文档要求最低版本为:

  • ChatGPT desktop app Codex mode:26.707.30751

  • Codex CLI:0.144.0


五、Codex 并入 ChatGPT 桌面端

这次更新里,Codex 和 ChatGPT 的关系发生了明显变化。

OpenAI 官方写明:Codex app is merging with the new ChatGPT desktop app。也就是说,Codex app 正在并入新的 ChatGPT 桌面应用。

这不是说 Codex 的能力取消。

OpenAI 同时说明,Codex 仍然是面向开发者和技术人员的 coding agent,并继续提供:

  • diff 内联编辑;

  • pull request review;

  • GPT-5.6 驱动的更快 computer use;

  • 单项目支持多个代码仓库。

可以理解为:

Codex 保留开发能力,ChatGPT 桌面端成为统一入口。


六、ChatGPT Work 上线

ChatGPT Work 是这次同步发布的重要产品能力。

OpenAI 对 ChatGPT Work 的定义是:一个可以跨 apps 和 files 执行动作的 Agent,能够在需要时围绕一个项目持续工作数小时,并把目标转化为完成的工作。

它主要覆盖这些任务:

  • 创建 slides;

  • 创建 sheets;

  • 创建 docs;

  • 创建 Sites;

  • 连接 Slack、Teams、Google Drive、SharePoint、邮箱、日历、CRM、项目管理工具等;

  • 执行 Scheduled Tasks;

  • 使用桌面端浏览器和 Computer Use 处理网页与本地应用任务。

ChatGPT Work 的推出,意味着 ChatGPT 的产品定位从"对话界面"进一步扩展到"工作任务入口"。


七、Codex 额度:今早已刷新

codex额度已重置 claude code为庆祝GPT5.6上线, 也同步重置


八、Codex 最新 credits 计费方式

OpenAI 最新 Codex rate card 显示,Codex 已按 token-based pricing 计费,也就是按输入 tokens、缓存输入 tokens、输出 tokens 消耗 credits。

最新表格如下:

Codex 模型 输入 tokens 缓存输入 tokens 输出 tokens
GPT-5.6 Sol 125 credits 12.50 credits 750 credits
GPT-5.6 Terra 62.50 credits 6.250 credits 375 credits
GPT-5.6 Luna 25 credits 2.50 credits 150 credits
GPT-5.5 125 credits 12.50 credits 750 credits
GPT-5.4 62.50 credits 6.250 credits 375 credits
GPT-5.4 Mini 18.75 credits 1.875 credits 113 credits

单位是:每 100 万 tokens 对应的 credits 消耗

这个表里有几个明显变化:

  • GPT-5.6 Sol 与 GPT-5.5 的 Codex credit rate 相同;

  • GPT-5.6 Terra 与 GPT-5.4 的 credit rate 相同;

  • GPT-5.6 Luna 成本更低;

  • 输出 tokens 的消耗明显高于输入 tokens;

  • 缓存输入 tokens 的成本最低。

OpenAI 表示,新的 token-based rate card 用来替代过去基于平均消息数的估算,更直接反映输入、缓存输入和输出对 credits 消耗的影响。


九、Banked reset 和 credits 不是一回事

这次很多人关注 Codex 额度重置,也容易把几个概念混在一起。

可以分成四类:

类型 含义
套餐内额度 Plus / Pro / Business / Enterprise 等套餐自带用量
Credits 达到套餐限制后,可购买或使用的额外用量
Banked rate-limit reset 可手动使用的一次额度重置机会
Temporary usage benefit 活动或临时策略提供的短期额外用量

OpenAI 文档说明,部分 Plus 和 Pro 推广活动中,成功邀请可能获得 banked Codex rate-limit reset。用户可以在 profile menu 的 usage summary 中看到可用 reset 数量,例如 "1 reset available"。

同时,OpenAI 也明确说明:referral credits 不是 API credits,rate-limit resets 和 temporary usage benefits 不会产生现金、API 或可转让的 credit balance。

所以,Codex 额度重置可以理解为"使用限制重置",不是 API 余额,也不是现金等价物。


十、Codex、ChatGPT Work、Excel 共享 Agentic Usage

OpenAI 现在把多个 Agent 能力放进统一的 usage / credits 体系中。

OpenAI 帮助文档写明:Plus 和 Pro 用户的 supported agentic features,包括 Codex、ChatGPT Work、ChatGPT for Excel,可以从同一个 agentic usage allowance 中消耗。

Codex rate card 中也写到:Codex、ChatGPT Work、ChatGPT for Excel、Workspace Agents 在可用时,会从同一个 agentic usage and credit pool 中扣除。

这说明这些功能正在被统一管理:

功能 主要任务
Codex 代码开发、代码审查、仓库任务
ChatGPT Work 文档、表格、PPT、网页、跨工具任务
ChatGPT for Excel 表格分析、公式生成、数据处理
Workspace Agents 企业工作空间中的自动化任务

这套体系的重点是:

只要是长任务、工具调用、多步骤执行,就会进入 Agentic Usage 管理。


十一、这次更新可以怎么理解

这次更新可以分成四层:

第一层:模型层

GPT-5.6 发布,形成 Sol、Terra、Luna 三档模型。

第二层:产品层

Codex 并入 ChatGPT 桌面端,ChatGPT Work 成为新的工作入口。

第三层:任务层

ChatGPT 不只处理问答,还开始处理文档、表格、PPT、网页、代码仓库、浏览器和定时任务。

第四层:计费层

Codex 和 ChatGPT Work 等 Agent 能力进入统一 usage / credits 体系,消耗方式更加接近实际 token 和任务复杂度。

这四层组合起来,就是本次更新的主线:

OpenAI 正在把模型、工具、文件、代码、桌面端和额度体系整合到一个统一的 Agent 工作平台中。


十二、总结

GPT-5.6 这次更新,重点不只是模型名称变化。

更完整的变化包括:

  • GPT-5.6 Sol、Terra、Luna 三档模型发布;

  • GPT-5.6 API 价格正式公布;

  • 官方评测中,Sol 在长链路任务、代码 Agent、BrowseComp 等指标上明显提升;

  • Codex app 并入新的 ChatGPT 桌面端;

  • ChatGPT Work 上线,覆盖文档、表格、PPT、网页和跨工具任务;

  • Codex 额度已刷新,但实际使用仍以 Usage 页面显示为准;

  • Codex credits 采用 token-based pricing;

  • Codex、ChatGPT Work、Excel 等 Agent 功能开始共享 usage / credit pool。

这次更新释放的信号比较明确:

ChatGPT 正在从对话产品,升级为 Agent 工作平台。

模型负责能力,Codex 负责开发执行,ChatGPT Work 负责办公任务,credits 体系负责统一计量。

相关推荐
墨舟的AI笔记1 小时前
组件级响应式的破局:CSS 容器查询的工程落地与取舍
人工智能
Molesidy1 小时前
【AI】【ChatGPT】【Codex】codex桌面版的插件(MCP)和技能(skills)的安装和应用
人工智能·codex·ai agent
工业设备方案笔记1 小时前
AI大模型为什么开始跑到边缘设备上?——本地大模型部署正在成为新的行业趋势
人工智能
未知违规用户2 小时前
大模型项目:RAG项目实战与FlagEmbedding模型
人工智能·windows·python·深度学习
蓝狐社2 小时前
宁德时代不是电池厂,是下棋的
人工智能
李燚8 小时前
RAG 流水线设计:Eino 的 Loader → Transformer → Indexer → Retriever(第60篇-E46)
人工智能·深度学习·transformer·agent·rag·aiagent·eino
码农学院8 小时前
Vue3小程序开发实战:服装鞋帽箱包行业库存同步方案
人工智能
To_OC9 小时前
跟 AI 写代码越写越乱?我靠这套「Vibe Coding」思路彻底治好了幻觉屎山
人工智能·agent·vibecoding
IT小盘9 小时前
03-大模型API不只是发送Prompt-流式输出超时重试与异常处理
人工智能·python·prompt