Style Aligned image generation via shared attention

和controlnet的reference only技术类似。

1.introduction

StyleAligned,能够在生成的图像集上实现consistent style interpretation的方法。可以应用于任何基于注意力的文本到图像扩散模型上,在扩散过程中通过从每个生成的图像到batch中的第一个图像进行最小的attention sharing operations,可以得到一组具有一致风格的图像,此外利用扩散反演,可以根据参考风格图像生成具有一致风格的图像,无需优化或微调。

2.Related work

扩散过程中的cross/self-attention对生成图像的布局和内容起到了决定性作用。StyleAligned可以在没有优化阶段和没有依赖训练多个图像的情况下生成一致的图像集合。

3.Method overview

3.1 Preliminaries

T2I扩散模型采用了unet架构,由卷积层和Transformer注意力块组成,在这些注意力机制中,深层图像特征通过self-attention与彼此交互,并通过cross-attention与上下文文本embedding交互。

StyleAligned在self-attention上进行,通过attending to each other来更新深层特征。1.通过learned linear layers将特征投影为QKV;2.计算scaled dot-product attention;直观的看,每个图像特征都是通过V的加权来更新的,其中权重取决于Q和K之间的相关性,

3.2 StyleAligned image set generation

我们方法的目标是生成一组与输入的文本提示集{y1,y2,...yn}对齐并具有一致风格的图像级{L1,...Ln},在图3中可以看到Toy对象的数据集和上方的输入文本风格对齐。生成具有不同内容的风格对齐图像集的一种朴素的方法是在文本提示中使用相同的风格描述,但是在图2中已经展示共享风格描述来生成不同图像会导致不对齐的图像集。

StyleAligned的关键在于利用self-attention机制在各个生成的图像之间进行通信,这是通过在生成图像之间sharing attention layers来实现的。

QKV分别为从集合Li的深层特征投影中得到的query,key和value,full attention sharing可能会影响生成图的质量,会导致图像之间的内容泄露,例如图5所示,图像集中的独角兽染上了恐龙身上的绿色颜料。并且full attention sharing还导致了更少样式的集合。

为了限制内容泄露并允许多样性的集合,我们将注意力仅共享给生成集中的一张图片,通常是batch中的第一张,也就是说,target图像特征仅关注自身以及集合中的一张reference图像的特征,为了实现平衡的reference注意力,使用了AdaIN来对目标的Q和K进行规范化。

4.Evaluations and experiements

在sdxl上应用attention sharing,对模型70层self-attention。单个A100生成四张图需要29s。

相关推荐
DMD168几秒前
从仓库到门店:AI如何重构零售供应链的“最后一公里”
人工智能·科技·重构·零售·数字化转型·产业升级·ai技术开发
秃头小饼干2 分钟前
虚拟机性能优化实战技术文章大纲
人工智能·云计算
番茄迷人蛋3 分钟前
欢迎使用AI美食大师项目
人工智能·ai
InfiSight智睿视界5 分钟前
即时零售仓网管理的AI 智能化演进
大数据·人工智能·零售
汽车仪器仪表相关领域8 分钟前
MTX-AL:传统指针美学与现代数字科技的完美融合 - 模拟宽带空燃比计
大数据·人工智能·科技·单元测试·汽车·压力测试·可用性测试
WHFENGHE14 分钟前
金具线夹测温在线监测装置:电力设备安全运行的核心技术支撑
大数据·人工智能·安全
Coding茶水间20 分钟前
基于深度学习的35种鸟类检测系统演示与介绍(YOLOv12/v11/v8/v5模型+Pyqt5界面+训练代码+数据集)
图像处理·人工智能·深度学习·yolo·目标检测·计算机视觉
AI巨人22 分钟前
“PR插件:轻松减少50%素材寻找时间,内置丰富素材,提升视频制作效率
人工智能·音视频·语音识别
祝余Eleanor25 分钟前
Day 29 类的定义及参数
人工智能·python·机器学习
工藤学编程28 分钟前
零基础学AI大模型之Milvus向量Search查询综合案例实战
人工智能·milvus