Lumina-DiMOO:用于多模态生成与理解的全扩散大语言模型

📚 简介

我们推出Lumina-DiMOO------一个实现无缝多模态生成与理解的全能基础模型。Lumina-DiMOO凭借四大创新突破脱颖而出:

  • 统一的离散扩散架构:采用完全离散的扩散建模处理跨模态输入输出,这与先前统一模型形成显著差异。

  • 全能多模态能力:支持广泛的多模态任务,包括文本到图像生成(支持任意高分辨率)、图像到图像生成(如图像编辑、主体驱动生成和图像修复等),以及高级图像理解。

  • 更高采样效率:相比传统自回归或混合自回归-扩散范式,Lumina-DiMOO展现出卓越的采样效率。我们还设计了定制缓存方法,使采样速度进一步提升2倍。

  • 顶尖性能表现:在多项基准测试中达到最先进水平,超越现有开源统一多模态模型,树立了领域新标杆。

📽️ 定性结果

这里我们展示了与其他模型的部分生成效果对比。更多可视化结果请参见我们的项目主页

文本到图像比较
图片编辑对比
可控性与主题驱动生成对比
图像修复与外推

📊 量化表现

GenEval Benchmark
DPG Benchmark
OneIG-EN Benchmark
TIIF Benchmark
Image-to-Image Benchmark
Image Understanding Benchmark

🚀 采样速度分析

  • 由于文本生成是以块为单位进行的,与图像生成采用单一全局解码步骤不同,其速度受块数和步数的双重影响。因此,图像理解的速度提升不如图像生成显著。

  • Lumina-DiMOO 设置:图像生成采样64步;图像理解设置块长度为256,采样步数为128。

采样速度对比

📜 致谢

本工作还得到了MindSpeed MM的支持与实现,这是一个由华为计算产品线开发并维护的开源大规模多模态模型训练框架,专为分布式训练而设计。MindSpeed MM特别针对华为昇腾AI芯片进行了优化,为分布式训练提供全面支持,并适用于广泛的多模态任务。

相关推荐
JarryStudy2 分钟前
HCCL与PyTorch集成 hccl_comm.cpp DDP后端注册全流程
人工智能·pytorch·python·cann
大闲在人14 分钟前
10. 配送中心卡车卸货流程分析:产能利用率与利特尔法则的实践应用
人工智能·供应链管理·智能制造·工业工程
woshikejiaih15 分钟前
**播客听书与有声书区别解析2026指南,适配不同场景的音频
大数据·人工智能·python·音视频
qq74223498417 分钟前
APS系统与OR-Tools完全指南:智能排产与优化算法实战解析
人工智能·算法·工业·aps·排程
兜兜转转了多少年19 分钟前
从脚本到系统:2026 年 AI 代理驱动的 Shell 自动化
运维·人工智能·自动化
LLWZAI22 分钟前
十分钟解决朱雀ai检测,AI率为0%
人工智能
无忧智库22 分钟前
某市“十五五“智慧气象防灾减灾精准预报系统建设方案深度解读 | 从“看天吃饭“到“知天而作“的数字化转型之路(WORD)
大数据·人工智能
方见华Richard22 分钟前
方见华个人履历|中英双语版
人工智能·经验分享·交互·原型模式·空间计算
凤希AI伴侣23 分钟前
凤希AI伴侣:一人成军的工具哲学与全模态内容实践-2026年2月7日
人工智能·凤希ai伴侣
Sagittarius_A*24 分钟前
特征检测:SIFT 与 SURF(尺度不变 / 加速稳健特征)【计算机视觉】
图像处理·人工智能·python·opencv·计算机视觉·surf·sift