ChatGPT Images 2.5:快与准拆成两个模型
关键词:ChatGPT Images 2.5、GPT-Image-2.5 Flare、Sunburst、图像编辑、API 定价、Adobe Firefly
目录
- [一、9月8日:30 亿张之后改了什么](#一、9月8日:30 亿张之后改了什么)
- 二、真正的升级点:从「生成」转向「编辑」
- [三、Flare 和 Sunburst 该怎么选?](#三、Flare 和 Sunburst 该怎么选?)
- [四、按 token 计费,一张图到底多少钱?](#四、按 token 计费,一张图到底多少钱?)
- [五、Adobe 首日接入:战场从模型转向工作流入口](#五、Adobe 首日接入:战场从模型转向工作流入口)
- 六、竞技场榜首还在吗?
- 七、还有三个没答案的问题
- 八、对不同人的落点
一、9月8日:30 亿张之后改了什么
OpenAI 这次发布的是 ChatGPT Images 2.5,同时在 API 侧推出 GPT-Image-2.5 Flare 与 GPT-Image-2.5 Sunburst 两个图像模型。官方给出的三个关键词是更锐利的细节、更精准的编辑、更快的生成。
先看两个背景数字,它们决定了这次升级的分量:
- 每周有超过 30 亿张图片通过 ChatGPT Images 和 API 里的 GPT-Image 模型生成;
- 相比 Images 2.0,这次图像生成延迟最多降低 50%。
可用范围是 ChatGPT、ChatGPT Work 和 Codex 的全部套餐层级 ,覆盖桌面端、移动端和网页端。C 端还多了四个交互功能:@Sketch 手绘起稿、Poster / Merch 等常用格式模板、在图上直接圈选评论、以及连提示词一起分享给别人复用。
我的判断是:这次真正值得注意的不是"画质又好了",而是 OpenAI 第一次把"快"和"准"拆成了两个 SKU 来卖。 画质提升是渐进的,但"一个快、一个准,且两者同价"这个产品结构,说明图像生成已经过了"大家比谁画得好"的阶段,进入了按工作流分层的阶段。后面几节展开。
把这次的变化分个类会更清楚,也更容易判断它对你的重要性:画质提升属于渐进项 ------每代都会有,而且已经越来越难用肉眼分辨;编辑可控性和多轮一致性属于结构项 ------它决定这条流水线能不能真的替代人工改图;双 SKU 和 Adobe 的接入则属于商业与生态层。后两类才是这次真正的信息量所在,下面按这个顺序展开。
二、真正的升级点:从「生成」转向「编辑」
画质部分官方的表述是更自然的光照、更丰富的纹理,以及在把参考照片里的主体换到新场景、新风格时保留得更好。这些是实打实的进步,但对生产流程来说,它们属于"更好一点",不是"可用与不可用的分水岭"。
真正的分水岭在编辑。两件事:
第一,只改你要求改的部分。 官方的说法是,即使主体和背景更复杂,模型也更能做到只更新你指定的元素,同时保留主体、构图和品牌处理。对开发者来说,这意味着可以单独更新产品、背景或一段文案,而不动其他部分。
Higgsfield AI 产品负责人 Axultan Alimkulov 的评价点得很准------让他印象最深的是模型"很清楚什么不该改"。这句听着朴素,但做过图片编辑的人都知道它的分量:以前让模型换个背景,产品的颜色跟着变了;现在不会。
第二,多轮编辑不再越改越崩。 官方明确说,在更长的对话里,跨多次编辑会更可靠地遵循指令,早期的改动更可能保持一致,而且不会随时间推移降低图像质量。这一条比"画质更锐利"重要得多------真实的设计流程就是一轮一轮改出来的,改三次就糊掉的模型没法进生产。
放进行业背景看会更清楚:2026 年这个领域的共识是,最引人注目的能力已经不是"生成",而是"编辑"------"把左边那个人去掉""让这个产品的光匹配那张图""保留她的脸,换掉衣服"。多图参考、对话式迭代、锁定主体身份,这些才是各家的主战场。Nano Banana Pro 能混合最多 14 张参考图锁定身份,这次 Images 2.5 在 API 侧也支持最多 16 张参考图。
还有一个偏工程、但很实用的进步:透明背景与复杂布局的处理。商品图如果能直接返回真实的 alpha 通道,产品图就能直接落进模板,省掉一整道抠图工序;带坐标轴、引线、多栏小字的图表和信息图能保持整页自洽,意味着这类图不再只能靠人工排版救场。这两项单看都不起眼,但对电商和编辑类流水线来说,省掉的是一道工序,不是几秒钟。
换句话说,一张"能改对"的图,比一张"生成得好看"的图值钱得多。
三、Flare 和 Sunburst 该怎么选?
API 侧这次是两个模型,不是一��。
| 维度 | GPT-Image-2.5 Flare | GPT-Image-2.5 Sunburst |
|---|---|---|
| 定位 | 大多数应用的默认选择 | 高端精细视觉工作流 |
| 相对 GPT-Image-2 | 画质更高,延迟低 50% | --- |
| 生成时间 | 快 | 更长 |
| 编辑特点 | 只改要求的部分,主体构图背景不动 | 多轮修订下控制最紧 |
| 典型场景 | 社媒内容、产品体验、视觉搜索、快速原型、大批量生成 | 可投放的广告创意、产品精修图 |
Manus 评测团队的结论是,Flare 以 GPT-Image-2 的 2 到 4 倍速度产出高质量图像,并且透明背景生成有改善。
图一:Flare 与 Sunburst 分工

(图一:两者 token 费率完全一致,选择只关乎细节与时间)
这里有个信息量很大的细节:Flare 和 Sunburst 的 token 费率完全相同。 这一点被独立核实过------多个第三方接入方的定价页都写明两者同价。
所以选型逻辑很清楚:不存在"贵的更好",只存在"合不合适"。 因为同价,你唯一要权衡的是"这张图值不值得多等一会儿"。
推荐的流程是:Flare 起稿,定稿后只把真正要看细节的那几张丢给 Sunburst 重跑。 这样既不吃 Sunburst 的延迟,又能在最终交付物上拿到精度。跑量素材、AB 测试、快速原型一律 Flare;要投放的主视觉、要放大看的产品图才用 Sunburst。
四、按 token 计费,一张图到底多少钱?
这一节是开发者最该看、但在多数报道里最含糊的部分。
先看费率(每百万 token,Flare 与 Sunburst 完全一致,多个独立来源核实一致):
| token 类型 | 标准输入 | 缓存输入 | 输出 |
|---|---|---|---|
| 文本 | $5.00 | $1.25 | 不计费 |
| 图像 | $8.00 | $2.00 | $30.00 |
再看质量档位。 这次有 low / medium / high / xhigh / max 五档(部分接入方把 auto 也算作一档),而 GPT Image 2 最高只到 high。档位每升一级,细节、延迟和 token 消耗都增加------档位是成本的主开关。
按官方计算器的 1024×1024 快照实算,仅输出侧的单图成本是:
| 档位 | 输出 token | 单图成本 | 每千张 |
|---|---|---|---|
| low | 196 | $0.00588 | $5.88 |
| medium | 439 | $0.01317 | $13.17 |
| high | 1,756 | $0.05268 | $52.68 |
| xhigh | 3,122 | $0.09366 | $93.66 |
| max | 7,024 | $0.21072 | $210.72 |
从 medium 到 max 整整差 16 倍,medium 到 high 差 4 倍。
图二:质量档位与单图成本

(图二:档位才是成本主开关,1024×1024 仅输出侧实算)
两个容易被忽略的地方:
- 编辑比生成贵。 因为参考图要作为图像输入计费($8/1M)。同一尺寸同一档位,编辑的单价会高出一截,参考图越多越明显。
- 真正该看的指标不是"每次调用多少钱",而是"每张被接受的图多少钱"。
第二点值得展开。做creative 工作流买的是通过审核的素材,不是 API 调用次数。提示词重试、编辑循环、废弃的变体,全都要计费。所以正确的公式是:
单张被接受图的成本 = 全部计费尝试的总成本 ÷ 通过审核的输出数
换算一下就很直观:
| 接受率 | 每接受 1 张需尝试 | medium 实际成本 | high 实际成本 |
|---|---|---|---|
| 100% | 1 次 | $0.01317 | $0.05268 |
| 50% | 2 次 | $0.02634 | $0.10536 |
| 34% | 3 次 | $0.03951 | $0.15804 |
结论有点反直觉:medium 试 4 次才等于 high 试 1 次,试 16 次才等于 max 试 1 次。 所以在大多数场景里,与其一上来就开 high 或 max,不如用 medium 多试几轮------成本更低,而且多几个候选反而更容易挑到能用的。
python
# image_cost.py
# 按官方 token 费率估算图像生成成本
RATES = { # 每百万 token 单价(美元)
"text_in": 5.00,
"text_in_cached": 1.25,
"image_in": 8.00,
"image_in_cached": 2.00,
"image_out": 30.00, # 文本输出不计费
}
# 1024x1024 各档位的输出 token 数(官方计算器快照)
OUT_TOKENS = {"low": 196, "medium": 439, "high": 1756, "xhigh": 3122, "max": 7024}
def request_cost(*, text_tokens=0, image_in_tokens=0, image_out_tokens=0, cached=False):
"""一次请求的成本。cached=True 表示这批输入命中了缓存。
注意:编辑请求会多出 image_in_tokens 这一项(参考图按图像输入计费)。
"""
ti = RATES["text_in_cached"] if cached else RATES["text_in"]
ii = RATES["image_in_cached"] if cached else RATES["image_in"]
return (text_tokens * ti
+ image_in_tokens * ii
+ image_out_tokens * RATES["image_out"]) / 1_000_000
def cost_per_accepted(per_attempt, *, attempts_per_accepted=1.0):
"""真正该盯的指标:一张「通过审核」的图的成本。
attempts_per_accepted = 总计费尝试次数 / 最终接受的图数
"""
return per_attempt * attempts_per_accepted
if __name__ == "__main__":
for name, out_tok in OUT_TOKENS.items():
c = request_cost(text_tokens=200, image_out_tokens=out_tok)
print("%-7s 单次 $%.5f | 接受率100%% $%.5f | 50%% $%.5f | 34%% $%.5f"
% (name, c,
cost_per_accepted(c, attempts_per_accepted=1.0),
cost_per_accepted(c, attempts_per_accepted=2.0),
cost_per_accepted(c, attempts_per_accepted=3.0)))
把 attempts_per_accepted 换成你团队真实的通过率再算一遍,你会得到一个和"每次调用多少钱"差别很大的数字。
五、Adobe 首日接入:战场从模型转向工作流入口
发布当天,Adobe 就宣布把 GPT-Image-2.5 集成进 Firefly。这个速度本身说明双方早有技术和商务准备。
更关键的是它是双向的:
- OpenAI 的模型进 Firefly;
- 同时已有 70 多种 Adobe 工具嵌进 ChatGPT,设计师可以在 ChatGPT 里直接调 Photoshop、Premiere 或 Firefly 的能力。
Adobe 产品高级总监 Matt Chotin 的表态是,Firefly 要"汇集领先的 AI 模型和专业级工具",接入 OpenAI 最新模型是为了扩展这种选择。
图三:Adobe 与 OpenAI 双向集成

(图三:谁也没独占「创意任务的起点」)
我的解读是:这两家谁也没能独占"创意任务的起点",于是干脆互为入口。 Adobe 长期把 Firefly 定位成"编排层"------它同时托管 Google、Runway 等家的模型,OpenAI 的最新模型只是其中一个引擎。这个战略很清楚:不试图赢下每一场模型竞赛,而是成为专业人士挑引擎、并施加精确控制的那个中枢。
还有一个容易被忽略的推论:当模型变成编排层里的一个可选项,模型厂商的议价权其实在下降。 今天 Firefly 接 OpenAI,明天可以接别家;反过来 ChatGPT 里也能直接调 Adobe 的工具。真正难被替换的,是积累了资产、历史和协作关系的那一层。这也解释了 Adobe 为什么愿意在第一天就接入一个竞品级的模型------它争的不是模型份额,是这个入口。
对开发者和团队的直接含义有两条:
- 模型正在变成可替换的部件。 今天接 GPT-Image-2.5,明天换成别家,接口层的影响可能比想象中小。真正难迁移的是工作流和资产链路。
- 商业条款的差异比模型差异更需要盯。 Adobe 自有模型基于授权数据训练并提供版权赔偿,而作为合作伙伴模型接入的 OpenAI 模型附带的是免责声明。做对版权敏感的商业交付时,这两者的风险不在一个层级。
六、竞技场榜首还在吗?
Artificial Analysis 图像竞技场采用盲投偏好投票计算 ELO。9 月初读到的榜单大概是这样的:
| 排名 | 模型 | ELO(约) |
|---|---|---|
| 1 | GPT Image 2 (high) | 1177 |
| 2 | MAI-Image-2.6(微软) | 1149 |
| 3 | Reve 2.1 | 1127 |
| 4 | Nano Banana 2(Gemini 3.1 Flash) | 1121 |
| 5 | Muse Image(Meta) | 1115 |
| 6 | GPT Image 1.5 (high) | 1113 |
OpenAI 仍然占着第一,但从第二到第六只差几十个 ELO 分 ,咬得非常紧。更关键的是编辑榜:MAI-Image-2.6 排在前面,GPT Image 2 和 Nano Banana 2 在其后。
需要说明两点:一是 ELO 衡量的是偏好不是正确性;二是Images 2.5 刚发布,尚未进入榜单,官方这次也没有公布第三方盲测的对比数据。
另一个维度是能不能自己托管。如果你的场景对数据出域、成本可控或深度定制有硬要求,闭源 API 这条路本身就走不通。FLUX.2 提供了 Dev(32B 开放权重)和 Klein(Apache 2.0,消费级显卡亚秒级出图)两档,腾讯 HunyuanImage 3.0(80B)和阿里的 Z-Image Turbo(6GB 显存就能跑到接近前沿的质量)也在这个区间。这条路的代价是要自己扛 GPU 和运维,收益是模型可控、可微调、数据不出域------对一部分团队来说,这个交换相当划算。
我的判断是:榜单差距已经小到不该作为唯一的选型依据。 现在更合理的做法是看你具体的工作流------要文字排版准确、要中文场景、要开源自部署、还是要极致的审美,答案各不相同。Ideogram 在文字和 logo 上仍强,FLUX.2 的开源权重(Dev 32B、Klein Apache 2.0)适合要自己托管的团队,Midjourney 依旧是审美首选但没有 API、且正面临迪士尼、NBCUniversal、华纳兄弟的版权诉讼。
七、还有三个没答案的问题
资讯文该有的冷静视角,这里说三条我认为短期内有待验证的。
第一,"快 50%"和"快 2~4 倍"都还没有第三方复现。 延迟降低 50% 是官方口径,2~4 倍来自 Manus 的评测团队。两者都不是独立第三方的公开基准。考虑到不同尺寸、不同档位下的延迟差异很大,建议自己在目标分辨率和档位上实测一轮再下结论。
第二,C2PA 元数据和隐形水印的实际防护强度未知。 官方延续了 C2PA 元数据加隐形水印的做法,用于标识 AI 生成内容。但元数据是可以被剥离的,水印对裁剪、压缩、重编码的鲁棒性也没有公开的评测数据。把它当"可追溯的辅助手段"是对的,当"防伪保证"就过了。
第三,版权与赔偿的边界仍然模糊。 这一条在专业场景里最实际:Adobe 自家模型提供版权赔偿,接入的 OpenAI 模型则是免责声明。而更上层的法律环境本身也在变化------美国最高法院已在 2026 年 3 月认定纯 AI 生成的图像不受版权保护,Midjourney 面临着多家影视公司的诉讼。做商业交付前,条款值得逐条看。
八、对不同人的落点
如果你是开发者,正在接入图像 API:
- 先用 medium 档跑基准,用"每张被接受图的成本"而不是"每次调用成本"做预算;
- Flare 起稿、Sunburst 收尾,两者同价,不要为"用哪个"付额外的钱;
- 编辑请求比生成贵,参考图按图像输入计费,多路参考的成本要算进去;
- 别忽略缓存价:文本和图像输入都有缓存费率(分别为 1.25 / 2 每百万),重复的提示词模板和复用参考图命中缓存时,能省下输入侧的大头;
- 分辨率上,长边上限 3840px,宽高需为 16 的倍数,总像素在 655,360 到 8,294,400 之间。
如果你在做设计或内容生产:
- 交互的变化(
@Sketch起稿、模板、图上圈选评论、提示词分享)对日常效率的影响,可能比画质提升更大------尤其是"图上直接标要改哪"这件事,把"用文字描述左上角那个红色部分"这种别扭操作省掉了; - 如果你本来就在 Adobe 体系里,Firefly 里已经能直接用上这套模型,不用切换工具;
- 提示词可以被分享这件事看着小,但它把"好创意"从结果 变成了可复用的过程------同事拿到你的图和提示词,换成自己的素材就能出一版。对团队协作来说,这比多一个滤镜有用得多。
如果你负责选型或采购:
- 别只看竞技场排名,先明确你的工作流要什么(文字排版 / 中文场景 / 自部署 / 审美);
- 把版权赔偿条款的差异写进评估表,尤其在接入方是"合作伙伴模型"而非平台自有模型的时候。
最后回扣开头的判断:这一代最值得记的不是"画质又好了",而是图像生成已经从"比谁画得好"进入"按工作流分层"------同价的快慢双 SKU、把编辑可控性放在画质之前、以及模型变成可被工作流编排的可替换部件。这三件事放在一起,说明这个赛道的竞争维度已经变了。
#ChatGPTImages2.5 #GPTImage2.5 #Flare #Sunburst #图像编辑 #API定价