论文简读:Boogu-Image 图像生成与编辑模型

发表时间: 2026年7月14日

论文地址:https://arxiv.org/pdf/2607.13125

模型地址:添加链接描述

项目地址:添加链接描述

Boogu-Image-0.1开源统一多模态理解与生成模型家族,包含Base、Turbo、Edit、Edit-Turbo四大变体,在高质量文生图、极速推理、指令驱动图像编辑、中英双语文字渲染四大任务上均具备极具竞争力的表现。

GPT-Image-2、NanoBanana-Pro等闭源模型依靠整套系统级整合实现顶尖效果,但其内部技术方案并未公开 。Boogu-Image证明:在算力预算受限的前提下,通过针对性优化模型理解能力、提升数据质量、完善训练流程,再搭配推理智能调度策略,就能大幅提升图像生成与编辑效果

多维度综合评测表明:Boogu-Image-0.1在主流基准测试中持续持平或超越其他开源模型,效果逼近顶尖闭源方案 。Boogu-Image训练仅使用2亿张独立图片,基础模型理论训练成本约40万美元。

1 引言

近年来闭源多模型迭代速度极快,代表系列包括GPT-Image、NanoBanana、Seedream:它们不仅能生成超高细节保真图像,还可解读复杂用户指令,部分模型支持生成时联网补充世界知识。

FLUX、Ideogram、通义图像、Z-Image、混元图像等开源项目也取得长足进步,主要通过提升画质、外挂大模型重写提示词来缩小与闭源模型的差距。

为进一步突破开源模型上限,本文将理解能力数据质量、训练配方、推理管线置于同等核心设计目标。实验证明,同步优化这三大维度可显著提升指令遵循度与生成保真度。

当前行业范式文生图(Text-to-Image)时代已经落幕,需求生成图(Requirement-to-Image)时代到来 。用户不再满足简单描述类提示词,而是希望模型解读复杂意图、隐性约束、多层级指令、跨模态上下文。

真实业务需求跨度极大:从极简短句到复杂长文,同时对算力、延迟要求各不相同,单一模型无法适配全部场景。理解能力正是模糊人类需求与精准图像生成、分场景适配推理策略之间的关键桥梁。

为落地"需求生成图"范式,我们将理解能力拆解为整套系统组件,从文本编码器、到Agent控制效果提升。

如图1右侧趋势所示,注入的理解能力越强,生成效果稳步提升。

除理解能力外,训练效率是核心设计原则。在算力受限条件下,我们设计"质量优先"的数据筛选管线,并配套全套训练优化策略。仅依靠2.0862亿独立图片从头训练基础文生模型,总成本约40万美元,性能对标行业SOTA。

同时我们发现大量看似次要的**工程细节(评测规范、数据过滤、标注文案设计)却决定最终上限,工业团队往往通过海量试错掌握,但极少在公开论文披露。**本文完整记录全套实操方案,降低开源开发者的隐性试错成本,为后续研究提供落地参考。

基于整套设计,我们推出Boogu-Image-0.1开源统一多模态系统,以"理解优先"架构实现从传统文生图到需求生成图的跃迁,忠实还原复杂用户意图。在Boogu Arena人工偏好榜单、最新通义图像基准测试中均位列开源第一梯队。

2 实验结果与评测体系

2.1 重新思考开源模型评测范式

公开基准测试仍具备参考价值,但必须正确解读使用。现实问题是:多数顶尖闭源模型几乎不在GenEval、DPG-Bench等通用学术基准上跑分,尽管它们实际效果远超绝大多数开源模型。

我们选取6款主流模型,对比人工偏好LMArena分数与GenEval/DPG-Bench自动指标,结果出现明显分数倒置人工公认最强的GPT-Image-2在两项学术基准仅排在中游 ;我们自家模型也出现同类现象------同架构SANA-VAE版本GenEval得分0.92,线上部署更强版本仅0.85。

2.2 文生图评测

2.2.1 自研Boogu Arena人工对战基准

由于无法使用Arena.ai官方平台,我们复刻其盲选两两对战评测流程,搭建自研Boogu Arena保证公平对比。

提示词设计

提示词划分为三大应用大类:写实影视图像、文字渲染、风格艺术;每类包含约400个细分场景关键词。

利用多模态大模型扩充提示词池,从两个维度分层:

  1. 提示长度:短句/中句/长句比例3:4:3;
  2. 用户分层:新手/进阶/专业创作者比例5:3:2;两类维度交叉匹配(长提示仅匹配专业用户)。

最终生成1200组中英双语提示,评测时随机抽取单语言,所有模型使用同一提示;每组提示仅用随机种子生成一次,保证公平。完整提示数据集后续开源。

盲测对战规则

严格匿名两两投票:同提示下并排展示两款模型生成图,标注A/B无模型名称,标注者四选一:A更好 / B更好 / 两者都优秀持平 / 两者都差持平,投票完成后才揭晓模型。

样本与模型配对采用逆频率加权采样,保证所有提示、所有模型采样均衡;全部投票通过Bradley-Terry模型聚合换算ELO对战分数(分数越高人类偏好越强)。

评测对比模型

Boogu系列:Boogu-0.1-Turbo、Boogu-0.1-Turbo-Thinking

开源基线:Z-Image-Turbo、HiDream-O1-Image

闭源竞品:GPT-Image-2、Nano-Banana-Pro、Seedream-5.0-Lite、Qwen-Image-Max-2025-12-30、Qwen-Image-2.0-2026-03-03

总计9款模型,累计收集超4000组人工投票。

评测结论(图6)

全大类榜单中Boogu系列全面领跑开源阵营,仅落后GPT-Image-2、Nano-Banana-Pro两大闭源头部:

  1. 写实、艺术风格领域,带推理的Thinking变体大幅缩小与闭源差距
  2. 文字渲染任务中Thinking提升最显著------文字对提示词细节高度敏感,推理模块会精准锁定待渲染文字、结构化提示,大幅提升文字正确率。

Boogu Arena与公开LMArena分数皮尔逊相关系数0.986,斯皮尔曼秩相关系数1,证明自研榜单和大众人工偏好高度一致 ,具备可信度。

2.2.2 通义图像基准(Qwen-Image-Bench)

该基准发布于我们模型开发冻结后,受数据泄露干扰更小,是可靠现代评测工具。

中文、英文双提示评测下,Boogu-Image-0.1-Base-Thinking 全部拿下开源模型综合第一:中文总分53.57,英文53.73 ,超越Qwen-Image-2512、混元3.0等强开源基线。

推理变体提升主要集中在创意维度:中文集下无推理Base创意分48.62,带推理版本升至56.74,涨幅超8分;中英规律完全一致,验证模型双语鲁棒性。

2.2.3 长文本基准(LongText-Bench)

面向海报、幻灯片、漫画、长图文设计等高频场景,评测OCR准确度、排版可读性、图文结构完整性。

Boogu-0.1-Turbo-Thinking中文单项得分0.985,全体模型第二,仅次于闭源Seedream-4.5。

补充关键区分:该基准仅评测100字符以内短文本文字精度 ;超过百字符高密度图文场景中,Base版本排版一致性远优于Turbo,Turbo会出现画面噪点瑕疵,因此长图文商用推荐Base-2K版本

基准局限:仅量化文字识别正确率,不评判字体美观、画面融合度,分数高不代表视觉完整;同时头部模型分数集中在0.96~0.99区间,区分度不足,需搭配人工视觉对比。

2.2.4 本文不采用的两类传统基准:GenEval、DPG-Bench

前文已证明二者和人类真实偏好严重脱节,仅在论文附录附数据供历史对照,不作为核心评价依据:

  1. GenEval:侧重物体计数、空间属性基础能力,GPT-Image-2这类顶尖闭源得分仅中游;
  2. DPG-Bench:全局、实体、关系对齐指标,同样出现高分模型落地体验差的倒置现象。
2.2.5 定性视觉对比

选取Boogu Arena测试集原图,横向对比闭源GPT-Image-2、Nano-Banana-Pro、Seedream-5-Lite与开源Z-Image、HiDream-O1:覆盖写实摄影、多元艺术画风、中英文图文海报三大场景。

核心结论:

  1. Turbo变体在百字符以内短文字、通用写实、插画上对齐度、画质全面超越开源竞品,大幅拉近闭源差距
  2. 高密度长图文(>100汉字/英文单词)固定选用Boogu-0.1-Base原生2K模型,小字、多区块排版无畸变、文字零错乱

2.3 图生图/图像编辑评测

2.3.1 ImgEdit-Bench编辑基准

覆盖添加、移除、替换、背景更换、风格化、提取、混合、动作修改全品类编辑任务。

Boogu-Image-0.1-Edit-Thinking综合得分4.64,所有参评模型第一,在物体移除、混合合成、动作修改单项登顶;提取类高难度任务相比无推理版本提升极大(3.69→4.32)

局限提醒:该基准依靠视觉大模型自动打分,并非人工评审,存在偏差。人工实测中Nano-Banana-Pro部分真实编辑场景观感更优,自动分数无法反映细微视觉瑕疵;同时任务分类粗糙,无法覆盖多区域分层编辑、精准文字修改等商用高频需求,仅作辅助参考

2.3.2 编辑定性样例对比

测试集取自ImgEdit官方样本与自研图文编辑数据集,横向对比GPT-Image-2、Nano-Banana-Pro、Seedream-5-Lite、Qwen-Image-Edit-2511:

  1. 通用编辑:物体增删、主体替换、场景迁移精准无崩坏;
  2. 图文专项编辑:文字替换、双语翻译、文字移位、字体风格化精准匹配原图肌理;
  3. 风格转换:皮克斯、乐高、工笔国画、水彩、吉卜力等画风统一,主体结构不丢失。

3 实验分析与核心技术讨论

3.1 以理解能力提升生成效果

Boogu优化两大核心目标:画质(用户意图匹配度)、推理效率(算力消耗)。

为此我们将"理解"拆分为三大系统模块,分别解决生成链路不同误差来源:

3.1.1 指令编码器:文生图的感知传感器

文本编码器是模型输入信息的上限,编码器丢失的细节,后续扩散层无法复原。

固定DiT生成器架构、仅缩放编码器规模实验:Qwen3-1.7B→4B→14B编码器,GenEval分数单调上涨,无性能饱和。

编码器性能提升来源于理解能力而非参数量,最终折中选用开源友好的Qwen3-VL-8B。

3.1.2 智能提示词重写:意图翻译器,而非无限制扩写

现有开源提示词工具普遍存在问题:无差别加长提示词、引入虚构细节偏离用户原始需求、单次推理无法处理模糊描述。

我们设计智能推理型重写代理定位是"翻译模糊需求"而非美化扩充

  1. 歧义消解:间接描述、数学、计数类提示拆解为具象画面描述;
  2. 文字渲染专项:锁定全部待渲染文本、规定排版位置,彻底解决文字错乱;
  3. 安全前置过滤:识别违规提示并修正,提前拦截风险生成;
  4. 最简原则:原始提示清晰无冲突时,不做任何修改(下限恒等于原提示)。

更大规模的推理后端,提示词重写收益更高(397B模型效果最近);不同生成模型训练数据分布不同,必须配套专属重写模块 ,跨模型复用会出现分布偏移、画质下降。

3.1.3 标注文案:优质监督必须贴合用户真实需求

图像标注是模型学习的底层监督信号,标注缺失的视觉特征,模型永远无法自主掌握。

现有单一大模型标注存在计数、空间、风格描述失真问题 ;我们采用多模型分维度标注策略:针对物体、空间、文字、画风分别选用最优VL模型标注,难识别特征辅以人工专家标注,大幅提升图文对齐。

3.1.4 智能模型路由:按需分配算力

简单提示使用轻量化Turbo,复杂长图文、多主体创意任务调度Base;两者画质差距极小,但推理算力差距可达50~100倍,实现成本与画质的帕累托最优。

3.2 全流程实验深度讨论

3.2.1 榜单之外:必须纳入推理耗时评估

现有排行榜仅看画质,完全忽略推理延迟,存在重大缺陷:

  1. 大量提升画质技巧(多图采样、自省、提示词重写、模型集成)都会成倍增加耗时;同一模型在不同算力预算下是完全不同的性能点,只报画质分数无参考意义;
  2. 闭源模型内置安全审核、多轮校验,天然延迟更高,横向对比算力成本难度大;
  3. 开源研发不能只和单一竞品对比,目标是推动整个开源能力边界,单一A/B测试容易得出片面乐观结论。

未来标准化评测方向:构建无污染、固定训练/测试分割、贴合真实业务的动态基准;同时增加世界常识、物理逻辑、模糊语义、延迟成本四大评测维度。

3.2.2 数据:不在数量,而在精细分层规划

主流开源训练集动辄8亿~10亿图片,Boogu仅2.0862亿独立样本即可对标SOTA,核心是教学式分层数据集(Boogu Syllabus)

  1. 互联网图片长尾严重,热门地标、通用物体数据泛滥,增加样本收益趋近于零,稀有场景数据稀缺;我们主动均衡各类别样本数量;
  2. 带瑕疵图片不直接丢弃:水印、过曝、运动模糊、噪点图片全部保留,标注清晰描述缺陷,让模型既能生成干净图,也能按需生成复古、胶片、老旧瑕疵画面;
  3. 原生开源原始数据集图文描述浅层、语义噪声多,仅用原始数据上限极低;经过人工分层梳理的教学数据集,中英通用基准总分从48.45提升至53.65,文字渲染同步大幅上涨。

额外关键问题:全球开源数据集天然西方中心化,即便后期补充大量中文微调数据,模型底层表征仍偏向欧美人物、建筑、服饰,仅靠SFT无法根治文化偏差,必须在预训练阶段平衡东西方视觉素材

3.2.3 专项消融实验核心结论
  1. 汉字渲染:单个汉字训练曝光≥300次才能稳定生成,优先覆盖3500个现代汉语常用字,针对性微调后中文长文本基准从0.9055提升至0.9538;

  2. 人物身份记忆:全新人物需约4500次图文配对样本 ,模型才能稳定还原五官特征;

  3. 美学强化RL风险:大规模美学强化会压缩人物风格多样性,统一美化成网红面孔;我们仅小规模RL修复肢体、文字畸变,保留原生画面多样性;

  4. 2K分辨率时序偏移缺陷:传统动态时序缩放会在高分辨率下过度压缩噪声区间,训练收敛缓慢;我们提出截断修正时序方案,限制最大隐向量token缩放幅度,解决2K生成噪点问题

  5. 2D正交增强引导(BOG):传统CFG将图像摊平一维计算,丢失平面空间结构;BOG保留二维矩阵结构归一化,摄影质感、纹理细节显著提升。

4 结论、局限性与未来方向

结论

本文提出Boogu-Image-0.1统一开源多模态生成套件,Base/Turbo/Edit/Edit-Turbo覆盖文生图、图文编辑全场景,以"理解优先"架构完成从文生图到需求生成图的迭代。

整套训练管线仅2.0862亿独立图片,总成本约40万美元,在算力约束下实现对标头部闭源模型的综合效果;配套智能Agent推理系统,通过提示词解析、动态模型调度、自省采样持续优化输出。

模型基于Apache 2.0完全开源,开放权重、完整训练代码、分层数据集构建方案,降低多模态生成领域研发门槛。

模型局限性

  1. 世界常识短板:在地标、名人、专业商品、小众艺术风格上距离顶尖闭源模型仍有差距,基准分数无法完全体现该差距;
  2. 语言限制:当前仅深度优化中英双语,小语种文字渲染能力薄弱;
  3. 人体结构:多人交互、重度遮挡、非常规视角下易出现肢体、五官畸变;
  4. VAE瓶颈:沿用开源FLUX.1 VAE,重建误差限制极小文字、微型五官细节上限,2K原生生成仅部分缓解该问题。

未来研究方向

  1. 更贴合真实用户的动态、无污染评测体系,摆脱静态学术榜单导向;
  2. 开源社区高质量、分层、均衡多模态数据集建设,消除西方文化偏见;
  3. 深度智能Agent生成闭环:增加生成自检、多轮迭代、外部工具检索,让模型主动规划、修正图像,而非单次被动生成;
  4. 原生高分辨率VAE开发,解决微小细节重建缺陷;
  5. 多语种文字渲染专项优化,拓展全球多语言适配能力。

附录(精简翻译)

A 作者团队

华为莱布尼茨人工智能实验室联合香港大学、港科大、香港理工、城大、中大、南京大学联合研发,完整作者名单见原文。

B 底层架构技术选型

  1. 整体架构:解耦式双模块------Qwen3-VL-8B轻量编码器负责文本条件提取;10B参数DiT扩散生成器负责图像渲染;外置大模型作为推理Agent解析复杂需求;
  2. 推理Agent流程:区分文生图/图像编辑任务,适配两套系统提示词,输出结构化、消歧义后的提示送入编码器;
  3. DiT双流结构:独立处理文本指令流、图像隐向量流,先双流交叉融合,再统一单流解码;配套2D正交增强引导BOG、修正时序偏移两大2K专属优化;
  4. 数据管线:分层教学式数据集,图文标注分维度精细化,瑕疵样本定向标注,汉字高频样本加权扩充。

C 2D正交增强引导(BOG)技术详解

传统无分类引导将图像隐向量展平一维向量归一化,丢失平面空间二维结构信息,导致画面平淡、纹理模糊。

BOG直接基于二维矩阵张量做归一化,保留行列空间关联,强化光影、材质、摄影细节,人像、风光、静物写实提升明显,全文44页附大量对照样例。

相关推荐
Sirius Wu2 小时前
OpenClaw Model Provider(模型提供商)完整详解
服务器·网络·人工智能·安全·aigc
神奇霸王龙3 小时前
AI 音乐作曲:LLM 歌词 + TTS 人声实战指南
人工智能·ai·prompt·aigc·音视频·ai音乐
SimpleLearingAI3 小时前
DiT:Diffusion Transformer原理简介
人工智能·深度学习·transformer
phltxy4 小时前
LangChain_Agent中间件实战
人工智能·python·深度学习·语言模型·中间件·langchain
donoot4 小时前
《大话文渊慧典》:外二篇-洋OCR、云OCR、土OCR:我们把市面上的方案全扒了一遍,结果……
人工智能·aigc·文渊慧典·大话系列
李剑一5 小时前
Kimi暂时关上新用户订阅渠道你以为是缺钱吗?其实可能更缺卡!
aigc·openai·ai编程
workflower5 小时前
从幻觉,到现实
人工智能·深度学习·机器学习·设计模式·机器人
伍树明5 小时前
NER 序列标注横向评测:BERT (Linear/CRF) VS 大模型 LoRA 微调 + API 方案实测对比
人工智能·深度学习·bert
怕浪猫6 小时前
第9章 工程化落地:评估、优化与部署
aigc·agent·ai编程