文生图王者登场:Stable Diffusion 3 Medium正式开源

今年2月,Stability.ai发布了Stable Diffusion 3预览版,在多主题提示、图像质量和拼写能力方面具有显著的性能提升。Stable Diffusion 3是一个系列模型,参数量从800M到8B不等。

6月12日,Stability AI正式开源了Stable Diffusion 3 Medium(2B),这是迄今为止最先进的文生图开源模型,被视为生成式AI发展的一个重要里程碑。它具有一些显著的优点:

  • 照片写实主义:克服手部和面部常见的瑕疵,无需复杂的工作流即可提供高质量的图像。

  • 提示遵循:理解涉及空间关系、构图元素、动作和风格的复杂提示。

  • 排版:在Diffusion Transformer架构的帮助下,在生成没有伪影和拼写错误的文本方面取得了前所未有的效果。

  • 资源高效利用:由于占用较低的VRAM空间,非常适合在标准消费者GPU上运行且不会降低性能。

  • 微调:能够从小数据集中吸收细微的细节,非常适合定制化。

现在,硅基流动团队在云服务平台SiliconCloud上线了SD 3 Medium开源模型。

欢迎来玩儿:

**cloud.siliconflow.cn/models/imag...](p6-juejin.byteimg.com/tos-cn-i-k3...)

**注意!!!**除了最新的Qwen2、DeepSeek V2等语言模型,SD 3 Medium 已进入"6.18购物狂欢节"福利包:"新用户送3亿token(相当于1500张图片)"。

**www.siliconflow.cn/zh-cn/silic...](p9-juejin.byteimg.com/tos-cn-i-k3...)

SD3 Medium 模型效果及表现

(提示词:Masterpiece, best quality, girl, having a tattoo that says "Welcome to SiliconFlow". collarbone, wavy hair, looking at viewer, blurry foreground, upper body, necklace, contemporary, plain pants, intricate, print, pattern, ponytail, red hair, dappled sunlight, smile, happy.)

(提示词:a small, plush cat figurine with orange stripes and large black eyes holds a billboard calld" SiliconCloud" amidst a dreamy landscape of blue felt waves, pink felt hearts, and soft, hazy clouds glowing with a golden sunset, creating a whimsical, serene scene.)

(提示词:Cartoon hand, little girl, long colored hair, holographic coat, white shorts, fair skin, blue eyes, white sneakers, full-body photo, full body, panorama, best quality, best picture quality, black highly reflective background cloth, movie-level lighting effect)

(提示词: a photo-realistic landscape image that portrays a stunning summer scene with an 8K-like quality. The setting is a picturesque beach with golden sand, crystal-clear turquoise waters, and a clear blue sky. The sunlight should be warm and vibrant, casting a beautiful glow over the scene. There should be palm trees swaying gently in the breeze along the coastline.)

(提示词:an ornate, Victorian-era key lying on a weathered, wooden surface, with intricate, steampunk-inspired gears and mechanisms visible within its transparent, glass shaft.)

SD 3 Medium是一个MMDiT的文生图模型,使用三个固定的、预训练的文本编码器(OpenCLIP-ViT/G、CLIP-ViT/L和T5-xxl)

据Stability AI 此前介绍,他们SD 3的输出图像与其他各种开源模型(包括SDXL、SDXL Turbo、Stable Cascade、 Playground v2.5 和 Pixart-α)以及闭源模型(如 DALL·E 3、Midjourney v6 和 Ideogram v1)进行了比较,并根据人工反馈评估效果。

在这些测试中,向人工评估者提供了每个模型的示例输出,并要求他们根据模型输出与所给提示的上下文的接近程度("提示遵循")、根据提示呈现的文本效果("排版")以及哪幅图像的美学质量更高("视觉美学")来选择最佳结果。

以SD3为基准,该图表基于人类对视觉美学、提示遵循和排版的评估,概述了它胜过竞对模型的领域。

根据测试结果,SD 3在上述所有领域都等同于或优于当前最先进的文生图系统。

在早期未优化的消费级硬件推理测试中,他们最大的SD3模型(8B)可用RTX 4090的24GB VRAM,使用50个采样步骤时需要 34 秒才能生成分辨率为1024x1024的图像。此外,Stable Diffusion 3的多个变体模型进一步消除了硬件使用的障碍。

关于SiliconCloud

SiliconCloud是集合主流开源大模型的一站式云服务平台,为开发者提供更快、更便宜、更全面的模型API。

目前,SiliconCloud已上架包括Stable Diffusion 3 Medium、Qwen2、GLM-4-9B-Chat、DeepSeek V2、SDXL、InstantID在内的多种开源大语言模型、图片生成模型,支持用户自由切换符合不同应用场景的模型。同时,SiliconCloud提供开箱即用的大模型推理加速服务,为生成式AI应用带来更高效的用户体验。

真正在乎大模型推理性能和成本的开发者,绝不会错过SiliconCloud。更何况,现在还送3亿token。

快试试吧:

www.siliconflow.cn/zh-cn/silic...

相关推荐
Agentcometoo5 分钟前
智能体来了从 0 到 1:规则、流程与模型的工程化协作顺序
人工智能·从0到1·智能体来了·时代趋势
工程师老罗8 分钟前
什么是目标检测?
人工智能·目标检测·计算机视觉
jarreyer9 分钟前
【AI 编程工具】
人工智能·编程工具
阿杰学AI10 分钟前
AI核心知识75——大语言模型之MAS (简洁且通俗易懂版)
人工智能·ai·语言模型·自然语言处理·agent·多智能体协作·mas
小程故事多_8012 分钟前
深度搜索Agent架构全解析:从入门到进阶,解锁复杂问题求解密码
人工智能·架构·aigc
朴实赋能14 分钟前
AI赋能文旅出海:智矩引擎(MatriPower)社媒矩阵破局与流量长效增长实操指南
人工智能·社媒矩阵·matripower·文旅出海·海外社媒引流·文旅ip出海·智矩引擎
许泽宇的技术分享15 分钟前
第 1 章:认识 Claude Code
开发语言·人工智能·python
沃达德软件34 分钟前
图像处理与复原技术
图像处理·人工智能·深度学习·神经网络·目标检测·计算机视觉·目标跟踪
坐在地上想成仙35 分钟前
人工智能商业落地思考:从人类行为图谱到技术栈映射
人工智能
zhangfeng113335 分钟前
ModelScope(魔搭社区)介绍与模型微调全指南 中国版Hugging Face GPU租借平台 一站式开源模型社区与服务平台
人工智能·开源