[ICCV 2023]Scalable Diffusion Models with Transformers

论文网址:Scalable Diffusion Models with Transformers

项目网址:Scalable Diffusion Models with Transformers

论文代码:GitHub - facebookresearch/DiT: Official PyTorch Implementation of "Scalable Diffusion Models with Transformers" · GitHub

目录

[1. 心得](#1. 心得)

[2. 论文逐段精读](#2. 论文逐段精读)

[2.1. Abstract](#2.1. Abstract)

[2.2. Introduction](#2.2. Introduction)

[2.3. Related Work](#2.3. Related Work)

[2.4. Diffusion Transformers](#2.4. Diffusion Transformers)

[2.4.1. Preliminaries](#2.4.1. Preliminaries)

[2.4.2. Diffusion Transformer Design Space](#2.4.2. Diffusion Transformer Design Space)

[2.5. Experimental Setup](#2.5. Experimental Setup)

[2.6. Experiments](#2.6. Experiments)

[2.6.1. State-of-the-Art Diffusion Models](#2.6.1. State-of-the-Art Diffusion Models)

[2.6.2. Scaling Model vs. Sampling Compute](#2.6.2. Scaling Model vs. Sampling Compute)

[2.7. Conclusion](#2.7. Conclusion)

1. 心得

(1)可以很快速读完

2. 论文逐段精读

2.1. Abstract

①作者把扩散模型的主干从U Net替换为了Transformer

②随着Transformer层变深变宽,效果会变得更好

2.2. Introduction

①替换成Transformer之后还能缩放

subsume vt.将...归入(或纳入) demystify vt.使明白易懂;深入浅出地解释

poise n.沉着自信;自若;仪态;稳重;优雅的举止 v.保持(某种姿势);使稳定;抓紧

①说了一些其他的基础扩散方法,也说要考虑到计算复杂度

2.4. Diffusion Transformers

2.4.1. Preliminaries

①前向高斯加噪扩散:

简化版:

其中

②去噪:

③变分下界损失,用于优化方差:

噪声误差,用于预测噪声:

④贝叶斯定理,对数似然损失项:

梯度项:

⑤Classifier-free guidance:其中把基于条件预测的概率梯度替换为了噪声差值

⑥规模和模型对比:

2.4.2. Diffusion Transformer Design Space

①DiT架构图:

其中输入图片像素由256×256×3被VAE变成32×32×4的作为DiT的输入

②图像切块:

2.5. Experimental Setup

①把DiT在ImageNet上256×256和512×512的图片上训练

②学习率:1e-4,不权重衰减。使用指数移动平均(exponential moving average, EMA)

③批量大小:256

④负责特征压缩的VAE单独训练

2.6. Experiments

①不同设计的对比实验:

②不同模型大小和不同patch大小的对比:

③不同模型设置的Gflops和精度比较:

④比起上一个图,这个图记录了更多时间节点,可以看到斜率:

⑤缩放的影响:

2.6.1. State-of-the-Art Diffusion Models

①模型效果示例:

②在256×256图片上训练模型的对比表格:

③在512×512图片上训练模型的对比表格:

2.6.2. Scaling Model vs. Sampling Compute

①不同规模模型的推理和结果:

2.7. Conclusion

~

相关推荐
MobotStone7 分钟前
做了几个 Agent 项目后,我发现:真正拉开 AI 产品经理差距的,不是技术
人工智能·架构
孟健10 分钟前
Qwen3.8-27B 本地推理实测:从 14 tok/s 到 159 tok/s 的投机解码调优
人工智能·llm·ai编程
思无邪6628 分钟前
用 AI 做 JS 逆向:从抓包到复现的完整方法论
开发语言·javascript·人工智能
KeyAction66661 小时前
AI改写战争规则,也在改写商业规则:体系对抗时代已经到来
大数据·人工智能
小蒋观天下1 小时前
专项方案:大场景港口AI安防、多干扰环境下的算法调优与落地实操
人工智能·深度学习·算法·安全·机器学习·计算机视觉·ai大模型
冬奇Lab1 小时前
一天一个开源项目(第231篇):MiniMind —— 花3块钱、2小时,从零训练一个 64M 参数的大语言模型
人工智能·开源·资讯
揽秀亭长1 小时前
视频转脚本有哪些方法?5种方案技术拆解
人工智能·音视频
冬奇Lab1 小时前
LLM 驱动的自动化测试系列(07):移动端自动化(三)——Mobile-Agent-v3 与自研 GUI-Owl 模型路线
android·人工智能·测试
乃嘿仔1 小时前
AI 热点日报 · 2026-10-08
人工智能·chatgpt
Qyr991 小时前
2026年全球二极管模组行业市场规模全景研判:竞争格局与发展趋势全解析
大数据·人工智能