Stable Diffusion 3 强势来袭,从此将文字绘画出来不是难题!

介绍

Stability AI 刚发布 Stable Diffusion 3 模型进行公测。该模型采用 diffusion transformer 架构,显著提高了在多主题提示、图像质量和拼写能力方面的性能。

特点

spelling abilities

就是可以将提示词中所需要绘制的文本展现在图片上。如下案例:

Prompt: cinematic photo of a red apple on a table in a classroom, on the blackboard are the words "go big or go home" written in chalk

提示词:教室桌子上红苹果的照片,黑板上用粉笔写着"go big or go home"

可以看出提示词中的 go big or go home 完整的展示在黑板上面,又准又狠!

multi-subject prompts

就是可以将用户提示词中的所提到的所有要素都展现出来。如下案例:

prompt:Resting on the kitchen table is an embroidered cloth with the text 'good night' and an embroidered baby tiger. Next to the cloth there is a lit candle. The lighting is dim and dramatic

提示词:厨房的桌子上放着一块绣花布,上面写着"晚安"和一只绣着的小老虎。 布旁边有一支点燃的蜡烛。 灯光昏暗而戏剧性

可以从图片中看出,桌子上的绣花布,晚安的字样,绣出来的小老虎,布旁边的点燃的蜡烛,昏暗的等黄,这些要素都完整的体现了出来!Perfect!

image quality

把图像质量又提升了一个台阶,从此高清写真不在话下!

Prompt: studio photograph closeup of a chameleon over a black background

提示词:黑色背景中变色龙的工作室照片特写

原理概要

Stable Diffusion 3 模型的参数范围在在 800M 到 8B 之间,整个模型的实现结合了 diffusion transformer 架构和 flow matching 机制。该模型的技术报告目前还未公布,不过不难推测,主要的模型还是 DiTflow matching 机制。Stable Diffusion 3 模型致力于打造安全、负责任的目标,并且防止滥用,从开始训练模型时,持续到测试、评估和部署的整个过程,都增加了很多安全措施。

DiT 的主要贡献在于扩散模型可以成功地用 transformer 替换 U-Net 主干,它不仅继承了 Transformer 模型类的优秀扩展特性,性能还优于先前使用 U-Net 的模型。Paper 入口请看文末参考部分。

flow matching 机制提出了基于连续归一化流(CNFs)的生成模型新范式,以及 flow matching 的概念,这是一种基于回归固定条件概率路径的矢量场的免模拟 CNFs 的方法。结果发现使用带有扩散路径的 flow matching ,可以使得训练出来的模型更稳定。Paper 入口请看文末参考部分。

与 DALLE-3、MJ6 效果对比

Prompt: a painting of an astronaut riding a pig wearing a tutu holding a pink umbrella, on the ground next to the pig is a robin bird wearing a top hat, in the corner are the words "stable diffusion"

使用 DALLE-3 输入相同的 Prompt 生成的图像,虽然在关键的图像内容都生成了,但是可以看出在文本生成方面略输一筹,需要显示的"stable diffusion"拼写发生了错误。

使用 midjourneyv6 输入相同的 Prompt 生成的图像,可以看出和 DALLE-3 有同样的问题,可以看出 stable diffusion 3 完胜。

公测入口

参考

相关推荐
侠客工坊2 分钟前
移动端 RPA 的架构重构:基于侠客工坊多模态视觉大模型的自动化调度系统压测复盘
人工智能·智能手机·重构·架构·rpa·数字员工·侠客工坊
胖墩会武术6 分钟前
Obsidian 与 Obsidian Skills 小白入门
人工智能·ai·obsidian·obsidian skills
河北小博博6 分钟前
李宏毅Harness Engineering课程逐字稿整理:有时候模型不是不够聪明,只是没有好的Harness
人工智能
Elastic 中国社区官方博客7 分钟前
Elastic-caveman : 在不损失 Elastic 最佳效果的情况下,将 AI 响应 tokens 减少64%
大数据·运维·数据库·人工智能·elasticsearch·搜索引擎·全文检索
云天AI实战派28 分钟前
Agentic AI 全流程实战:用 OpenAI on AWS 搭一个餐饮补货智能体,从 API 调用到容器化上线
人工智能·云计算·aws
万岳科技程序员小金37 分钟前
2026智慧药店系统源码趋势:药店APP+小程序开发新方向
人工智能·电子处方小程序·药店软件开发·药店系统源码·药店app开发·药店平台搭建·药店小程序
xingyuzhisuan1 小时前
稳定性考验:连续跑7天,哪家云主机不重启、不掉线?
服务器·人工智能·gpu算力
sanshanjianke1 小时前
AI辅助网文创作理论研究笔记(十):软件框架设计——模块化B/S架构
人工智能·ai写作
云天AI实战派1 小时前
AI 智能体问题排查指南:ChatGPT、API 调用到 Agent 上线失灵的全流程修复手册
大数据·人工智能·python·chatgpt·aigc
Tutankaaa2 小时前
知识竞赛题库设计全攻略
人工智能·算法