
评测背景
当 AI 从"会生图"进化到能替代专业摄影、甚至深度参与艺术创作时,我们该如何评测一个模型的"真实创作能力"?
目前业界的文生图(T2I)评测,大多仍局限于基础语义遵循、图像质量或审美打分。但在真实的影像叙事、品牌设计、游戏美术、漫画创作等工作流中,模型需要的不仅是"能理解提示词",更要创作出具备视听语言美学知识、有逻辑推理能力,能精准控制文字渲染的优秀作品。"能够生成图片"并不等同于"具备用户需要的创作能力"。
Qwen-Image-Bench 正是一个面向真实用户创作需求的文生图创作级评测基准,由专业影像视觉与美学设计团队主导设计,并由 Qwen Image 团队官方开源。该基准已被 EMNLP 2026 主会接收。
论文:2605.28091 Qwen-Image-Bench: From Generation to Creation in Text-to-Image Evaluation
huggingface:https://huggingface.co/datasets/Qwen/Qwen-Image-Bench
Q-Judger 开源地址:https://huggingface.co/Qwen/Qwen-Image-Bench
魔搭社区:Qwen-Image-Bench
榜单概览
Qwen-Image-Bench 当前榜单纳入 19 款主流文生图模型,并按照综合得分进行排名。完整结果如下:

Qwen-Image-Bench 文生图模型总榜
点击访问晓天衡宇评测社区,查看完整评测集详情及详细得分榜单。
核心结论
结论 1:GPT Image 2 总榜居首,Qwen Image 3 Pro 位列第二且五项能力表现均衡
GPT Image 2 以 64.69 分位列总榜第一,Qwen Image 3 Pro 以 62.35 分排名第二,Nano Banana 2.0 以 59.82 分排名第三。Qwen Image 3 Pro 与榜首相差 2.34 分,较第三名高 2.53 分,进入本次榜单头部梯队。
从一级维度看,Qwen Image 3 Pro 在「图像质量」、「图像美学」、「图文一致性」、「现实世界还原」和「创作推理」五项能力中均排名第二,对应得分分别为 57.41 分、63.78 分、63.54 分、56.05 分和 72.45 分。这表明,Qwen Image 3 Pro 在本次评测中呈现出较为均衡的能力结构,综合表现未明显依赖单一维度。
结论 2:「创作推理」维度方差最高,「细分任务」反映模型能力特点
五项一级维度中,「创作推理」的模型间方差为 94.10,位列各维度首位。该维度中,GPT Image 2 以 75.23 分排名第一,Qwen Image 3 Pro 以 72.45 分排名第二;在三级维度中,「文字准确性」、「信息可视化」、「跨语言生成」、「分镜创作」、「平面设计」、「漫画创作」和「游戏设计」等考点位居模型间方差排名前列。
这表明,在本次评测框架下,不同模型在创作推理相关任务中的表现有所不同,「文字编辑」、「知识表达」、「视觉叙事」和「设计应用」等细分能力,是拉开各家模型差距的重要维度。

结论 3:「现实世界还原」仍有提升空间,「物理与交互能力」是重点观察方向
本次评测中,「现实世界还原」维度各模型得分分布在 43.16 分至 57.38 分之间。其中,GPT Image 2 以 57.38 分位列第一,Qwen Image 3 Pro 以 56.05 分位列第二。进一步观察三级维度,「物理逻辑」、「人像保真度」、「动物」、「物体」和「接触交互」五个考点的最高得分均低于 44 分。
这表明,在本次评测框架下,参评模型在「物理规律」、「主体形态」及「对象交互关系」的呈现上仍有完善空间,相关三级考点可为后续模型优化提升,提供更细致的参考。
评测集设计
Qwen-Image-Bench 采用 L1→L2→L3 三级评测框架,将文生图模型的综合能力拆解为 5 项一级能力、23 项二级维度和 56 项三级考点。五项一级能力包括「图像质量」、「图像美学」、「图文一致性」、「现实世界还原」和「创作推理」,形成从"基础生成表现"到"复杂创作能力"的完整评测结构。
其中,「图像质量」、「图像美学」和「图文一致性」主要考察画面清晰度与细节、视觉审美以及对prompt要求的响应情况;「现实世界还原」进一步关注「物理规律」、「主体形态」和「世界知识」的准确呈现;「创作推理」则覆盖「文字编辑」、「影像叙事」、「设计应用」和「创意表达」「逻辑推理」等任务。上述能力进一步细化为可独立评分的具体考点,覆盖「分镜创作」、「游戏设计」、「漫画创作」、「时尚造型」、「字体美学」和「世界知识」等细分方向。
这一设计使评测结果不仅能够形成综合排名,也可以进一步定位模型在具体创作环节中的能力表现,为专项分析和模型后续迭代提供依据。

Qwen-Image-Bench 三级维度框架总览
评测集构造
Qwen-Image-Bench 贯彻"真实创作场景驱动"的构造思路。艺术家及专业影像视觉与美学设计团队从"实际创作流程"中提取典型场景和创作需求,再将其映射至相应的二级维度与三级考点。使评测内容与真实视觉创作中的能力要求形成对应关系。
在此基础上,评测集经过多轮专家驱动的 Prompt 设计与校验,最终形成 1,000 条中英双语分 Prompt。每条 Prompt 至少覆盖 4 项三级考点,并与对应的维度检查清单建立关联,使同一生成结果可以在多个细粒度能力维度上接受评估。Prompt 同时兼顾不同创作类型与文化元素,以提升评测场景的覆盖范围和多样性。
本次评测组织 19 款主流文生图模型完成全部 Prompt 的图像生成,共形成 19,000 个评测样本,生成结果随后进入自动评分环节。

评测集构建流程:专家驱动 Prompt 工程 → 多模型生图 → AI 自动评分
评测方法
Qwen-Image-Bench 采用配套的自动评估模型 Q-Judger 进行评分。
Q-Judger 以 Qwen3.6-27B 为底座,通过超过 130,000 组中英双语专家标注对进行训练。其输入包括评测 Prompt、模型生成图片、评分标准(Rubric)以及 L2/L3 维度检查清单,可在单次推理中输出 56 项三级考点的结构化评分。
每项三级考点采用四档评分标准:Fail 映射为 0 分,Pass 映射为 60 分,Excel 映射为 100 分;不适用于当前图片或 Prompt 的考点标记为 N/A,不参与后续聚合。评分完成后,系统按照 L3→L2→L1 逐层取均值,每项二级维度在对应一级能力中等权计算,五项一级能力再以各占 1/5 的权重形成样本综合得分。每款模型的最终得分取其全部 1,000 个样本综合得分的平均值,并据此形成总榜排名。
Q-Judger 的训练数据由 80 位具有全球艺术院校背景的专业标注专家参与完成,初始标注后由至少 3 名专家进行独立交叉复核。在独立测试中,Q-Judger 与资深人类艺术专家标注的 Spearman 系数达到 0.92,在降低大规模人工评审成本的同时,保留了细粒度、可追溯的评测结果。

Q-Judger 评分映射与逐层聚合机制
案例展示
为进一步呈现 Qwen-Image-Bench 在真实创作任务中的评测方式,以下选取 4组案例,覆盖「现实世界还原」、「产品设计」、「文化元素」、「文字编辑」、「游戏设计」、「艺术风格」等方向。每组 Prompt 均对应多项三级考点,通过并列展示不同模型的生成结果,可以直观观察模型对具体创作要求的响应情况。
以下案例主要用于展示 Prompt 与细粒度考点的对应关系,不作为单一样本下模型优劣的判断依据。
案例 1|秀场后台:「接触互动」与「物理逻辑」
维度考点:时尚造型、接触互动、艺术设计、摄影机/镜头风格、构图、物理逻辑。
Prompt 示例:模拟拍摄一张中央圣马丁艺术与设计学院 White Show 秀场后台抓拍图:后台化妆间镜前灯泡发光;造型师正在为面容姣好的模特系紧束腰,并使用别针固定披风。要求手部与接触互动准确、别针与织物拉力真实、镜面反射合理;构图以镜中倒影形成二次画面。
|---------------------------------------------------------------------------------------------|-------------------------------------------------------------------------------------------------|
|
GPT Image 2 |
Nano Banana 2.0 |
案例 2|敦煌文创:「产品设计」与「文化元素」
维度考点:产品设计、文化元素、色彩、想象力。
Prompt 示例:文创文具系列"敦煌飞天",包括笔记本、书签与胶带,图案提取壁画经典纹样,配色复刻矿物颜料古韵,兼具文化性与实用性。
|---------------------------------------------------------------------------------------------|----------------------------------------------------------------------------------------------------|
|
GPT Image 2 |
Qwen Image 2.0 Pro |
案例 3|像素风RPG:「游戏设计」与「文字呈现」
维度考点:游戏设计、艺术设计、文字准确性、二维空间、清晰度/分辨率、风格控制。
Prompt 示例:2D 像素风 RPG 的城镇场景截图:包含喷泉、武器店、旅馆和三名 NPC;要求像素风格统一、可读性强;画面左上角设置简洁 UI,显示"HP 100/100" 和 "Gold 250",文字需清晰。
|---------------------------------------------------------------------------------------------|----------------------------------------------------------------------------------------------|
|
GPT Image 2 |
Seedream 4.0 |
案例 4|艺术设计:「艺术风格」与「情绪表达」
维度考点:艺术设计、情绪表达、色彩、风格控制。
Prompt 示例:毕加索蓝色时期风格的流浪艺人,冷色调主导,人物瘦削忧郁,笔触沉郁,全图情绪与形式统一。
|---------------------------------------------------------------------------------------------|-------------------------------------------------------------------------------------------------|
|
GPT Image 2 |
Kling Image 2.1 |
综合判断
综合来看,本次榜单形成了由 GPT Image 2、Qwen Image 3 Pro 和 Nano Banana 2.0 组成的前三名格局。其中,Qwen Image 3 Pro 位列总榜第二,并在五项一级能力中均保持第二名。从整体结果看,头部模型的综合表现已不只取决于基础画质或语义对齐,对现实世界的呈现、创作意图的理解以及专业场景的执行,同样是影响综合排名的重要方面。
同时,综合得分相近的模型也可能具有不同的能力结构和适用场景。因此,总榜可以作为判断模型整体能力的基础参考,具体选择时仍需结合一级维度和三级考点,考察模型与实际创作需求的适配程度。
注:本文结论基于本次参评的 19 款模型、1,000 条 Prompt 及 Q-Judger 评分框架,仅反映模型在Qwen-Image-Bench 下的相对表现,不代表其在所有视觉创作任务中的绝对能力。
写在最后
最新官方自建评测集已同步上线至晓天衡宇评测社区官网,欢迎访问查看更详细的评测数据:
