ChatGPT的视觉模型:ChatGPT Images 2.5:快与准拆成两个模型

ChatGPT Images 2.5:快与准拆成两个模型

关键词:ChatGPT Images 2.5、GPT-Image-2.5 Flare、Sunburst、图像编辑、API 定价、Adobe Firefly


目录


一、9月8日:30 亿张之后改了什么

OpenAI 这次发布的是 ChatGPT Images 2.5,同时在 API 侧推出 GPT-Image-2.5 Flare 与 GPT-Image-2.5 Sunburst 两个图像模型。官方给出的三个关键词是更锐利的细节、更精准的编辑、更快的生成。

先看两个背景数字,它们决定了这次升级的分量:

  • 每周有超过 30 亿张图片通过 ChatGPT Images 和 API 里的 GPT-Image 模型生成;
  • 相比 Images 2.0,这次图像生成延迟最多降低 50%

可用范围是 ChatGPT、ChatGPT Work 和 Codex 的全部套餐层级 ,覆盖桌面端、移动端和网页端。C 端还多了四个交互功能:@Sketch 手绘起稿、Poster / Merch 等常用格式模板、在图上直接圈选评论、以及连提示词一起分享给别人复用。

我的判断是:这次真正值得注意的不是"画质又好了",而是 OpenAI 第一次把"快"和"准"拆成了两个 SKU 来卖。 画质提升是渐进的,但"一个快、一个准,且两者同价"这个产品结构,说明图像生成已经过了"大家比谁画得好"的阶段,进入了按工作流分层的阶段。后面几节展开。

把这次的变化分个类会更清楚,也更容易判断它对你的重要性:画质提升属于渐进项 ------每代都会有,而且已经越来越难用肉眼分辨;编辑可控性和多轮一致性属于结构项 ------它决定这条流水线能不能真的替代人工改图;双 SKU 和 Adobe 的接入则属于商业与生态层。后两类才是这次真正的信息量所在,下面按这个顺序展开。


二、真正的升级点:从「生成」转向「编辑」

画质部分官方的表述是更自然的光照、更丰富的纹理,以及在把参考照片里的主体换到新场景、新风格时保留得更好。这些是实打实的进步,但对生产流程来说,它们属于"更好一点",不是"可用与不可用的分水岭"。

真正的分水岭在编辑。两件事:

第一,只改你要求改的部分。 官方的说法是,即使主体和背景更复杂,模型也更能做到只更新你指定的元素,同时保留主体、构图和品牌处理。对开发者来说,这意味着可以单独更新产品、背景或一段文案,而不动其他部分。

Higgsfield AI 产品负责人 Axultan Alimkulov 的评价点得很准------让他印象最深的是模型"很清楚什么不该改"。这句听着朴素,但做过图片编辑的人都知道它的分量:以前让模型换个背景,产品的颜色跟着变了;现在不会。

第二,多轮编辑不再越改越崩。 官方明确说,在更长的对话里,跨多次编辑会更可靠地遵循指令,早期的改动更可能保持一致,而且不会随时间推移降低图像质量。这一条比"画质更锐利"重要得多------真实的设计流程就是一轮一轮改出来的,改三次就糊掉的模型没法进生产。

放进行业背景看会更清楚:2026 年这个领域的共识是,最引人注目的能力已经不是"生成",而是"编辑"------"把左边那个人去掉""让这个产品的光匹配那张图""保留她的脸,换掉衣服"。多图参考、对话式迭代、锁定主体身份,这些才是各家的主战场。Nano Banana Pro 能混合最多 14 张参考图锁定身份,这次 Images 2.5 在 API 侧也支持最多 16 张参考图。

还有一个偏工程、但很实用的进步:透明背景与复杂布局的处理。商品图如果能直接返回真实的 alpha 通道,产品图就能直接落进模板,省掉一整道抠图工序;带坐标轴、引线、多栏小字的图表和信息图能保持整页自洽,意味着这类图不再只能靠人工排版救场。这两项单看都不起眼,但对电商和编辑类流水线来说,省掉的是一道工序,不是几秒钟。

换句话说,一张"能改对"的图,比一张"生成得好看"的图值钱得多


三、Flare 和 Sunburst 该怎么选?

API 侧这次是两个模型,不是一��。

维度 GPT-Image-2.5 Flare GPT-Image-2.5 Sunburst
定位 大多数应用的默认选择 高端精细视觉工作流
相对 GPT-Image-2 画质更高,延迟低 50% ---
生成时间 更长
编辑特点 只改要求的部分,主体构图背景不动 多轮修订下控制最紧
典型场景 社媒内容、产品体验、视觉搜索、快速原型、大批量生成 可投放的广告创意、产品精修图

Manus 评测团队的结论是,Flare 以 GPT-Image-2 的 2 到 4 倍速度产出高质量图像,并且透明背景生成有改善。

图一:Flare 与 Sunburst 分工

(图一:两者 token 费率完全一致,选择只关乎细节与时间)

这里有个信息量很大的细节:Flare 和 Sunburst 的 token 费率完全相同。 这一点被独立核实过------多个第三方接入方的定价页都写明两者同价。

所以选型逻辑很清楚:不存在"贵的更好",只存在"合不合适"。 因为同价,你唯一要权衡的是"这张图值不值得多等一会儿"。

推荐的流程是:Flare 起稿,定稿后只把真正要看细节的那几张丢给 Sunburst 重跑。 这样既不吃 Sunburst 的延迟,又能在最终交付物上拿到精度。跑量素材、AB 测试、快速原型一律 Flare;要投放的主视觉、要放大看的产品图才用 Sunburst。


四、按 token 计费,一张图到底多少钱?

这一节是开发者最该看、但在多数报道里最含糊的部分。

先看费率(每百万 token,Flare 与 Sunburst 完全一致,多个独立来源核实一致):

token 类型 标准输入 缓存输入 输出
文本 $5.00 $1.25 不计费
图像 $8.00 $2.00 $30.00

再看质量档位。 这次有 low / medium / high / xhigh / max 五档(部分接入方把 auto 也算作一档),而 GPT Image 2 最高只到 high。档位每升一级,细节、延迟和 token 消耗都增加------档位是成本的主开关。

按官方计算器的 1024×1024 快照实算,仅输出侧的单图成本是:

档位 输出 token 单图成本 每千张
low 196 $0.00588 $5.88
medium 439 $0.01317 $13.17
high 1,756 $0.05268 $52.68
xhigh 3,122 $0.09366 $93.66
max 7,024 $0.21072 $210.72

从 medium 到 max 整整差 16 倍,medium 到 high 差 4 倍。

图二:质量档位与单图成本

(图二:档位才是成本主开关,1024×1024 仅输出侧实算)

两个容易被忽略的地方:

  • 编辑比生成贵。 因为参考图要作为图像输入计费($8/1M)。同一尺寸同一档位,编辑的单价会高出一截,参考图越多越明显。
  • 真正该看的指标不是"每次调用多少钱",而是"每张被接受的图多少钱"。

第二点值得展开。做creative 工作流买的是通过审核的素材,不是 API 调用次数。提示词重试、编辑循环、废弃的变体,全都要计费。所以正确的公式是:

单张被接受图的成本 = 全部计费尝试的总成本 ÷ 通过审核的输出数

换算一下就很直观:

接受率 每接受 1 张需尝试 medium 实际成本 high 实际成本
100% 1 次 $0.01317 $0.05268
50% 2 次 $0.02634 $0.10536
34% 3 次 $0.03951 $0.15804

结论有点反直觉:medium 试 4 次才等于 high 试 1 次,试 16 次才等于 max 试 1 次。 所以在大多数场景里,与其一上来就开 high 或 max,不如用 medium 多试几轮------成本更低,而且多几个候选反而更容易挑到能用的。

python 复制代码
# image_cost.py
# 按官方 token 费率估算图像生成成本
RATES = {                        # 每百万 token 单价(美元)
    "text_in":         5.00,
    "text_in_cached":  1.25,
    "image_in":        8.00,
    "image_in_cached": 2.00,
    "image_out":      30.00,     # 文本输出不计费
}

# 1024x1024 各档位的输出 token 数(官方计算器快照)
OUT_TOKENS = {"low": 196, "medium": 439, "high": 1756, "xhigh": 3122, "max": 7024}


def request_cost(*, text_tokens=0, image_in_tokens=0, image_out_tokens=0, cached=False):
    """一次请求的成本。cached=True 表示这批输入命中了缓存。
    注意:编辑请求会多出 image_in_tokens 这一项(参考图按图像输入计费)。
    """
    ti = RATES["text_in_cached"] if cached else RATES["text_in"]
    ii = RATES["image_in_cached"] if cached else RATES["image_in"]
    return (text_tokens * ti
            + image_in_tokens * ii
            + image_out_tokens * RATES["image_out"]) / 1_000_000


def cost_per_accepted(per_attempt, *, attempts_per_accepted=1.0):
    """真正该盯的指标:一张「通过审核」的图的成本。
    attempts_per_accepted = 总计费尝试次数 / 最终接受的图数
    """
    return per_attempt * attempts_per_accepted


if __name__ == "__main__":
    for name, out_tok in OUT_TOKENS.items():
        c = request_cost(text_tokens=200, image_out_tokens=out_tok)
        print("%-7s 单次 $%.5f | 接受率100%% $%.5f | 50%% $%.5f | 34%% $%.5f"
              % (name, c,
                 cost_per_accepted(c, attempts_per_accepted=1.0),
                 cost_per_accepted(c, attempts_per_accepted=2.0),
                 cost_per_accepted(c, attempts_per_accepted=3.0)))

attempts_per_accepted 换成你团队真实的通过率再算一遍,你会得到一个和"每次调用多少钱"差别很大的数字。


五、Adobe 首日接入:战场从模型转向工作流入口

发布当天,Adobe 就宣布把 GPT-Image-2.5 集成进 Firefly。这个速度本身说明双方早有技术和商务准备。

更关键的是它是双向的:

  • OpenAI 的模型进 Firefly;
  • 同时已有 70 多种 Adobe 工具嵌进 ChatGPT,设计师可以在 ChatGPT 里直接调 Photoshop、Premiere 或 Firefly 的能力。

Adobe 产品高级总监 Matt Chotin 的表态是,Firefly 要"汇集领先的 AI 模型和专业级工具",接入 OpenAI 最新模型是为了扩展这种选择。

图三:Adobe 与 OpenAI 双向集成

(图三:谁也没独占「创意任务的起点」)

我的解读是:这两家谁也没能独占"创意任务的起点",于是干脆互为入口。 Adobe 长期把 Firefly 定位成"编排层"------它同时托管 Google、Runway 等家的模型,OpenAI 的最新模型只是其中一个引擎。这个战略很清楚:不试图赢下每一场模型竞赛,而是成为专业人士挑引擎、并施加精确控制的那个中枢

还有一个容易被忽略的推论:当模型变成编排层里的一个可选项,模型厂商的议价权其实在下降。 今天 Firefly 接 OpenAI,明天可以接别家;反过来 ChatGPT 里也能直接调 Adobe 的工具。真正难被替换的,是积累了资产、历史和协作关系的那一层。这也解释了 Adobe 为什么愿意在第一天就接入一个竞品级的模型------它争的不是模型份额,是这个入口。

对开发者和团队的直接含义有两条:

  1. 模型正在变成可替换的部件。 今天接 GPT-Image-2.5,明天换成别家,接口层的影响可能比想象中小。真正难迁移的是工作流和资产链路。
  2. 商业条款的差异比模型差异更需要盯。 Adobe 自有模型基于授权数据训练并提供版权赔偿,而作为合作伙伴模型接入的 OpenAI 模型附带的是免责声明。做对版权敏感的商业交付时,这两者的风险不在一个层级。

六、竞技场榜首还在吗?

Artificial Analysis 图像竞技场采用盲投偏好投票计算 ELO。9 月初读到的榜单大概是这样的:

排名 模型 ELO(约)
1 GPT Image 2 (high) 1177
2 MAI-Image-2.6(微软) 1149
3 Reve 2.1 1127
4 Nano Banana 2(Gemini 3.1 Flash) 1121
5 Muse Image(Meta) 1115
6 GPT Image 1.5 (high) 1113

OpenAI 仍然占着第一,但从第二到第六只差几十个 ELO 分 ,咬得非常紧。更关键的是编辑榜:MAI-Image-2.6 排在前面,GPT Image 2 和 Nano Banana 2 在其后。

需要说明两点:一是 ELO 衡量的是偏好不是正确性;二是Images 2.5 刚发布,尚未进入榜单,官方这次也没有公布第三方盲测的对比数据。

另一个维度是能不能自己托管。如果你的场景对数据出域、成本可控或深度定制有硬要求,闭源 API 这条路本身就走不通。FLUX.2 提供了 Dev(32B 开放权重)和 Klein(Apache 2.0,消费级显卡亚秒级出图)两档,腾讯 HunyuanImage 3.0(80B)和阿里的 Z-Image Turbo(6GB 显存就能跑到接近前沿的质量)也在这个区间。这条路的代价是要自己扛 GPU 和运维,收益是模型可控、可微调、数据不出域------对一部分团队来说,这个交换相当划算。

我的判断是:榜单差距已经小到不该作为唯一的选型依据。 现在更合理的做法是看你具体的工作流------要文字排版准确、要中文场景、要开源自部署、还是要极致的审美,答案各不相同。Ideogram 在文字和 logo 上仍强,FLUX.2 的开源权重(Dev 32B、Klein Apache 2.0)适合要自己托管的团队,Midjourney 依旧是审美首选但没有 API、且正面临迪士尼、NBCUniversal、华纳兄弟的版权诉讼。


七、还有三个没答案的问题

资讯文该有的冷静视角,这里说三条我认为短期内有待验证的。

第一,"快 50%"和"快 2~4 倍"都还没有第三方复现。 延迟降低 50% 是官方口径,2~4 倍来自 Manus 的评测团队。两者都不是独立第三方的公开基准。考虑到不同尺寸、不同档位下的延迟差异很大,建议自己在目标分辨率和档位上实测一轮再下结论。

第二,C2PA 元数据和隐形水印的实际防护强度未知。 官方延续了 C2PA 元数据加隐形水印的做法,用于标识 AI 生成内容。但元数据是可以被剥离的,水印对裁剪、压缩、重编码的鲁棒性也没有公开的评测数据。把它当"可追溯的辅助手段"是对的,当"防伪保证"就过了。

第三,版权与赔偿的边界仍然模糊。 这一条在专业场景里最实际:Adobe 自家模型提供版权赔偿,接入的 OpenAI 模型则是免责声明。而更上层的法律环境本身也在变化------美国最高法院已在 2026 年 3 月认定纯 AI 生成的图像不受版权保护,Midjourney 面临着多家影视公司的诉讼。做商业交付前,条款值得逐条看。


八、对不同人的落点

如果你是开发者,正在接入图像 API:

  • 先用 medium 档跑基准,用"每张被接受图的成本"而不是"每次调用成本"做预算
  • Flare 起稿、Sunburst 收尾,两者同价,不要为"用哪个"付额外的钱;
  • 编辑请求比生成贵,参考图按图像输入计费,多路参考的成本要算进去;
  • 别忽略缓存价:文本和图像输入都有缓存费率(分别为 1.25 / 2 每百万),重复的提示词模板和复用参考图命中缓存时,能省下输入侧的大头;
  • 分辨率上,长边上限 3840px,宽高需为 16 的倍数,总像素在 655,360 到 8,294,400 之间。

如果你在做设计或内容生产:

  • 交互的变化(@Sketch 起稿、模板、图上圈选评论、提示词分享)对日常效率的影响,可能比画质提升更大------尤其是"图上直接标要改哪"这件事,把"用文字描述左上角那个红色部分"这种别扭操作省掉了;
  • 如果你本来就在 Adobe 体系里,Firefly 里已经能直接用上这套模型,不用切换工具;
  • 提示词可以被分享这件事看着小,但它把"好创意"从结果 变成了可复用的过程------同事拿到你的图和提示词,换成自己的素材就能出一版。对团队协作来说,这比多一个滤镜有用得多。

如果你负责选型或采购:

  • 别只看竞技场排名,先明确你的工作流要什么(文字排版 / 中文场景 / 自部署 / 审美);
  • 把版权赔偿条款的差异写进评估表,尤其在接入方是"合作伙伴模型"而非平台自有模型的时候。

最后回扣开头的判断:这一代最值得记的不是"画质又好了",而是图像生成已经从"比谁画得好"进入"按工作流分层"------同价的快慢双 SKU、把编辑可控性放在画质之前、以及模型变成可被工作流编排的可替换部件。这三件事放在一起,说明这个赛道的竞争维度已经变了。

#ChatGPTImages2.5 #GPTImage2.5 #Flare #Sunburst #图像编辑 #API定价

相关推荐
Behaviour1 小时前
DeepSeek V4.1 Flash 发布开源,Harness v0.1.5同日适配
人工智能·语言模型·开源·aigc·ai编程
VIP_CQCRE1 小时前
用 Ace Data Cloud 把 WordPress 变成你的 AI 内容营销中枢
ai·seo·wordpress·内容营销·ace data cloud
降临-max1 小时前
从零开始快速开发一个 AI 辅助测试设计智能体(附完整源码)
软件测试·人工智能·大模型·agent·ai测试智能体
武子康1 小时前
SGLang 和 vLLM,拿自己的请求测一轮再选
人工智能·llm·agent
hiahiahia1231 小时前
SSE 到底是什么?
前端·人工智能
aixingkong9211 小时前
华为麒麟9050 系列芯片深度解析:韬折叠的奇迹
服务器·人工智能·硬件架构·硬件工程
matlab代码1 小时前
基于直方图优化的图像去雾技术【源码71期】
人工智能·深度学习·计算机视觉
aiot189189352181 小时前
核芯物联蓝牙AOA高精度定位生态合作案例分享金库定位踩坑实录
大数据·运维·网络·人工智能·蓝牙aoa
Sherotree2 小时前
Agent 工程笔记③:为什么要有评测集(比单次演示重要)
ai·agent·评测·系列