扩散模型之(十三)条件生成 Conditioned Generation

1.概述

在使用 ImageNet 等各类图像数据集进行具有条件信息的图像训练生成模型时,通常会根据类别标签或一段描述性文本生成条件样本。本文进一步展开介绍条件生成。

2. Classifier Guided Diffusion

为了将类别信息明确地纳入扩散过程,Dhariwal 和 Nichol (2021) 在噪声图像上 训练了一个分类器 。基于梯度 ,通过改变噪声预测来引导扩散采样过程向条件信息 (目标类别标签)靠拢。Review预测模型:

可以写出联合分布的得分函数如下:

因此,一种新的 classifier-guided predictor 形式如下:

为了控制分类器引导的强度,我们可以添加权重 到梯度计算部分,由此得到:

​​​​​​​

由此得到的消融扩散模型ablated diffusion model (ADM ))和带有附加分类器指导的模型(ADM-G)能够取得比 SOTA 生成模型比如 BigGAN 更好的结果。

图1 利用分类器的引导实现DDPM和DDIM进行条件生成

此外, Dhariwal 和 Nichol (2021)对 U-Net 架构进行了一些改进,结果表明其性能优于使用扩散模型的 GAN。这些架构改进包括更大的模型深度/宽度、更多的注意力头、多分辨率注意力机制、用于上采样/下采样的 BigGAN 残差块、残差连接缩放以及自适应组归一化(AdaGN)。

3. Classifier-Free Guidance

没有独立分类器尽管如此,仍然可以通过结合条件扩散模型和非条件扩散模型的得分来运行条件扩散步骤(Ho & Salimans,2021)。令非条件去噪扩散模型通过得分估计器进行参数化以及条件模型通过参数化这两个模型可以通过单个神经网络进行学习。具体来说,就是条件扩散模型。使用配对数据进行训练其中,条件信息会周期性地随机丢弃,这样模型也知道如何无条件地生成图像,即:

隐式分类器的梯度可以用条件得分估计器和非条件得分估计器来表示。一旦代入分类器引导的修正得分,该得分就不再依赖于单独的分类器。

​​​​​​​

实验结果表明,CFG可以在 FID(区分合成图像和生成图像)和 IS(质量和多样性)之间取得良好的平衡。

引导扩散模型 GLIDE(Nichol、Dhariwal 和 Ramesh 等人,2022)探索了两种引导策略:CLIP 引导和无分类器引导,并发现后者更受欢迎。他们推测,这是因为 CLIP 引导利用对抗样本来改进 CLIP 模型,而不是优化生成更匹配的图像。

相关推荐
yangmu32034 小时前
DLSS 5:从“AI提帧”到“AI定义画质”的渲染革命
人工智能
Li Ming&4 小时前
基于OpenCV+MediaPipe+PyGame的手势控制音乐播放器(Python实现)
人工智能·python·计算机视觉
晴天164 小时前
Chrome WebMCP 让网站学会向 AI「自我介绍」
前端·人工智能·chrome
yyywxk4 小时前
ICLR 2026 目标检测(object detection)方向上接收论文总结
人工智能·目标检测·目标跟踪
小程故事多_804 小时前
从理论建模到落地运行,深度拆解DDD与本体论的共生与转化逻辑
人工智能·本体论
玩转单片机与嵌入式4 小时前
深入浅出TinyML 24:剪枝、聚类、蒸馏和算子替换是否真正适合MCU?
人工智能·stm32·机器学习·tinyml
byte轻骑兵4 小时前
【BlueZ 】Adapter 模块:蓝牙适配器(主设备)的初始化与核心逻辑
linux·人工智能·bluez·电脑蓝牙·嵌入式蓝牙
Dawson Zhu4 小时前
Kafka 在 AI Agent 系统中的应用:任务队列与事件总线的角色辨析及工程实践
人工智能·语言模型·架构·aigc·agi
黎阳之光4 小时前
AI黑光相机|赋能低空全域感知,筑牢低空经济全天候视觉防线
人工智能·物联网·算法·安全·数字孪生
wangchunyu1144 小时前
火山引擎 HiAgent介绍和安装说明
人工智能·火山引擎