MMaDA——开源首个多模态大扩散语言模型

MMaDA是一个全新的多模态扩散基础模型家族,旨在文本推理、多模态理解和文生图等多个领域实现卓越性能。该模型凭借三大创新点脱颖而出:

  1. 采用统一扩散架构:共享概率框架与模态无关设计,无需特定模态组件
  2. 创新混合长思维链微调策略:跨模态构建统一思维链格式
  3. 开发专用强化学习算法UniGRPO:基于策略梯度的统一训练方法,通过多样化奖励建模实现推理与生成任务的后训练统一,确保持续性能提升

📰 最新动态

  • 2025-05-22\] 我们发布了MMaDA模型的推理与训练代码,支持文本生成、多模态生成及图像生成任务。

  • 2025-05-22\] 首篇统一多模态扩散模型MMaDA的[研究论文](https://arxiv.org/abs/2505.15809)及[演示平台](https://huggingface.co/spaces/Gen-Verse/MMaDA)正式上线。

MMaDA 包含一系列反映不同训练阶段的检查点:

  1. MMaDA-8B-Base: 在预训练和指令微调之后。具备基本的文本生成、图像生成、图像描述和思维能力。
  2. MMaDA-8B-MixCoT (coming soon): 经过混合长思维链(CoT)微调。具备复杂的文本、多模态和图像生成推理能力。将于两周内发布。
  3. MMaDA-8B-Max (coming soon): 经过UniGRPO强化学习后,擅长复杂推理和惊艳的视觉生成。将在一个月后发布。

⚙️ 快速入门

首先,设置环境:

bash 复制代码
pip install -r requirements.txt

启动本地 Gradio 演示:

bash 复制代码
python app.py

🚀 推理

对于批量级别的推理任务,我们在此提供相关的推理脚本。

1. 文本生成

在文本生成方面,我们遵循LLaDA的配置和生成脚本。只需运行:

bash 复制代码
python generate.py
2. 多模态生成

对于多模态生成和文本到图像生成,首先登录您的wandb账户:

bash 复制代码
wandb login

多模态生成推理演示,您可以在wandb上查看结果

bash 复制代码
python3 inference_mmu.py config=configs/mmada_demo.yaml mmu_image_root=./mmu_validation question='Please describe this image in detail.' 
3. 文本到图像生成

对于多模态生成和文本到图像生成,首先登录您的wandb账户:

bash 复制代码
wandb login

文本到图像生成的推理演示,您可以在wandb上查看结果

bash 复制代码
python3 inference_t2i.py config=configs/mmada_demo.yaml batch_size=1 validation_prompts_file=validation_prompts/text2image_prompts.txt guidance_scale=3.5 generation_timesteps=15
mode='t2i'
相关推荐
枫叶林FYL1 天前
【自然语言处理 NLP】9.1 检索增强生成高级架构:GraphRAG 与结构化知识检索
人工智能·自然语言处理·架构
天天爱吃肉82181 天前
新能源汽车单级车载电源及高频高密度DCDC设计开发技术入门指南
大数据·人工智能·功能测试·嵌入式硬件·汽车
ZPC82101 天前
moveit2_servo 怎么接收相机调节指令(视觉伺服)
人工智能·数码相机·算法·计算机视觉·机器人
viperrrrrrrrrr71 天前
语音AI的2026:从“听见声音“到“理解世界“
人工智能·macos·语言模型
枫叶林FYL1 天前
【机器学习与智慧医疗】2型糖尿病早期预警系统:当多参数集成模型学会“会诊“
大数据·人工智能
灵机一物1 天前
灵机一物AI原生电商小程序、PC端(已上线)-从单人 10 天 3000 元 AI 爆款,拆解世界模型如何重构游戏与视频生产范式
人工智能
byzh_rc1 天前
[自然语言处理-入门] 语言模型LM
语言模型·自然语言处理·easyui
Agent产品评测局1 天前
化工制造安全生产AI方案主流产品对比详解:2026工业大模型与端到端自动化选型指南
人工智能·安全·ai·chatgpt·制造
灰灰勇闯IT1 天前
CANN Graph Engine 执行链路:一张计算图如何跑上昇腾 NPU
人工智能·深度学习·算法
前端不太难1 天前
从点击到意图:鸿蒙 App 的 AI 进化
人工智能·状态模式·harmonyos