Stable diffusion 学习过程

diffusion model

讲解:

【较真系列】讲人话-Diffusion Model全解(原理+代码+公式)_哔哩哔哩_bilibili

stable diffusion【CVPR2022】

原始论文: https://arxiv.org/pdf/2112.10752

讲解:【论文简介】Stable Diffusion的基础论文:2112.High-Resolution Image Synthesis with Latent Diffusion Models_stable diffusion论文-CSDN博客

代码:

GitHub - CompVis/stable-diffusion: A latent text-to-image diffusion model

Dreambooth【CVPR 2023】

论文:https://arxiv.org/pdf/2208.12242v1

代码:

感觉就是sd换了一个损失函数,然后又加上了sr模块。

SnapFusion【NeurIPs 2023

讲解:https://zhuanlan.zhihu.com/p/650739412

论文:https://arxiv.org/pdf/2306.00980

创新点:

  1. 改进unet,将里面的结构去掉,分析效果,然后找到去掉结构后对网络影响最小的那几块使用;

  2. 蒸馏,对DDPM的步数进行蒸馏

  3. VAE Decoder 优化,使用蒸馏

感觉改进不是很多。

DeepCache【CVPR2024】

论文:https://arxiv.org/pdf/2312.00858

讲解:https://zhuanlan.zhihu.com/p/673114336

代码:GitHub - horseee/DeepCache: [CVPR 2024] DeepCache: Accelerating Diffusion Models for Free

创新点:

找的角度很好,改进并不大,效果很好,就是将上一时刻的特征缓存下来,然后后续直接使用。

stable diffusion3

讲解:https://zhuanlan.zhihu.com/p/685457842

论文:https://arxiv.org/pdf/2403.03206

改变了forward和backward的格式,后续还需要再研究一下

相关推荐
腾讯云开发者2 小时前
港科大熊辉|AI时代的职场新坐标——为什么你应该去“数据稀疏“的地方?
人工智能
工程师老罗3 小时前
YoloV1数据集格式转换,VOC XML→YOLOv1张量
xml·人工智能·yolo
盐焗西兰花3 小时前
鸿蒙学习实战之路-Reader Kit修改翻页方式字体大小及行间距最佳实践
学习·华为·harmonyos
QiZhang | UESTC3 小时前
学习日记day76
学习
久邦科技3 小时前
20个免费电子书下载网站,实现电子书自由(2025持续更新)
学习
Coder_Boy_3 小时前
技术让开发更轻松的底层矛盾
java·大数据·数据库·人工智能·深度学习
Gain_chance3 小时前
34-学习笔记尚硅谷数仓搭建-DWS层最近一日汇总表建表语句汇总
数据仓库·hive·笔记·学习·datagrip
啊森要自信3 小时前
CANN ops-cv:面向计算机视觉的 AI 硬件端高效算子库核心架构与开发逻辑
人工智能·计算机视觉·架构·cann
2401_836235863 小时前
中安未来SDK15:以AI之眼,解锁企业档案的数字化基因
人工智能·科技·深度学习·ocr·生活