开源新基准!OmniGen2 文本图像对齐度提升 8.6%,视觉一致性超越现有开源模型15%

OmniGen2 是北京人工智能研究院(BAAI)于 2025 年 6 月 16 日发布的开源多模态生成模型,旨在为多种生成任务提供统一的解决方案,包括文本到图像生成、图像编辑和上下文生成。与 OmniGen v1 不同,OmniGen2 为文本和图像模态设计了两条独立的解码路径,采用了非共享参数和分离的图像分词器。这一设计使得 OmniGen2 能够在现有的多模态理解模型基础上进行构建,而无需重新适应 VAE 输入,从而保留了原有的文本生成能力。其核心创新在于双路径架构和自我反思机制,成为当前开源多模态模型的新标杆。相关论文成果为「OmniGen2: Exploration to Advanced Multimodal Generation」。

教程链接:go.openbayes.com/oCWcX

使用云平台: OpenBayes

openbayes.com/console/sig...

首先点击「公共教程」,在公共教程中找到「OmniGen2:探索高级多模态生成」,单击打开。

页面跳转后,点击右上角「克隆」,将该教程克隆至自己的容器中。

在当前页面中看到的算力资源均可以在平台一键选择使用。平台会默认选配好原教程所使用的算力资源、镜像版本,不需要再进行手动选择。点击「继续执行」,等待分配资源。

数据和代码都已经同步完成了。容器状态显示为「运行中」后,点击「 API 地址」,即可进入界面。若显示「Bad Gateway」,这表示模型正在初始化,由于模型较大,请等待约 2-3 分钟后刷新页面。

具体参数:

  • Height:高度
  • Width:宽度
  • Text Guidance Scale:文本引导尺度
  • Image Guidance Scale:图像引导尺度
  • CFG Range Start: 范围起始
  • CFG Range End:范围结束
  • Scheduler:调度器
  • Inference Steps:推理步骤
  • Number of images per prompt:每条提示的图像数量
  • Seed:种子
  • max_input_image_side_length:最大输入图像边长
  • max_pixels:最大像素

官方在这里给出了很多案例,大家可以自行尝试。

我们首先使用文本生成图片功能,输入 prompt「The girl by the sea」后点击「Generate」,可以看到它快速生成了一张在海边的女孩。

接下来可以保存图片,进行图片编辑,输入 prompt「Put a hat on her.」后点击「Generate」,可以看给女孩戴了一顶帽子。

相关推荐
算家云12 小时前
新一代实时检测工具——YOLOv13本地部署教程,复杂场景,一目了然!
人工智能·目标检测·算家云·模型部署教程·镜像社区·yolov13
时序数据说12 小时前
时序数据库IoTDB:为何成为工业数据管理新宠?
大数据·数据库·物联网·开源·时序数据库·iotdb
W-GEO12 小时前
AI搜索新浪潮下的精准获客:GEO优化公司体验分享
人工智能
bin915312 小时前
AI嚼数据吐模块?初级开发者的创意别慌,老码农教你玩出“反卷Buff”
人工智能·ai工具
一RTOS一12 小时前
东土正创AI交通服务器再获北京市批量应用订单
运维·服务器·人工智能
金井PRATHAMA12 小时前
自然语言处理深层语义分析中公理化体系的可行性、挑战与前沿进展
人工智能·自然语言处理·知识图谱
13线13 小时前
Windows+Docker一键部署CozeStudio私有化,保姆级
docker·容器·开源
IT_陈寒13 小时前
Spring Boot 3 + GraalVM:5个实战技巧让Java应用启动速度提升300%
前端·人工智能·后端
max50060013 小时前
YOLOv8主干网络替换为UniConvNet的详细指南
运维·开发语言·人工智能·python·算法·yolo
AI绘画哇哒哒13 小时前
【值得收藏】手把手教你用PyTorch构建Transformer英汉翻译系统,从训练到推理
人工智能·pytorch·ai·语言模型·程序员·大模型·transformer