Imagic: Text-Based Real Image Editing with Diffusion Models

  1. 问题引入
  • 针对的是text based image editing问题,可以解决non rigid edit,即可以改变图片中object的posture;
  • 模型仅需要原图以及编辑的text,不需要mask,也是在T2I diffusion model上实现的;
  • 首先optimize text embedding,之后使用优化后的text embedding来微调整个模型,最后将优化之后的text embedding和目标text的embedding进行插值得到一个结合原图以及编辑prompt的embedding,然后进行生成得到想要的结果;
  1. methods
  • Text embedding optimization:首先获取到编辑后text的embedding e t g t e_{tgt} etgt,之后只是训练embedding部分,冻结diffusion model主体,训练很少的步数,以使得优化之后的embedding e o p t e_{opt} eopt没有发生很大的变化,便于第三步的插值操作;
  • Model fine-tuning:因为第一步只训练了很少的步数,所以生成的图片不能和原图完全一致,所以进行了全模型的训练(优化之后的embedding冻结),此时使用的是 e o p t e_{opt} eopt,但是在finetune后接的超分模型的时候使用的是 e t g t e_{tgt} etgt;
  • Text embedding interpolation:进行 e t g t , e o p t e_{tgt},e_{opt} etgt,eopt之间的插值: e ‾ = η ⋅ e t g t + ( 1 − η ) ⋅ e o p t \overline{e} = \eta\cdot e_{tgt} + (1 - \eta)\cdot e_{opt} e=η⋅etgt+(1−η)⋅eopt,以这个作为最后的embedding来生成,后接的超分模型还是使用 e t g t e_{tgt} etgt
相关推荐
工业甲酰苯胺15 分钟前
深度学习核心训练逻辑:自迭代五步法深度解析与实践
人工智能·深度学习
shy^-^cky23 分钟前
TensorFlow、PyTorch、PaddlePaddle 三大深度学习框架全维度对比表
pytorch·深度学习·tensorflow·paddlepaddle·飞桨
Francek Chen24 分钟前
【ComfyUI】蓝耘元生代 | ComfyUI深度解析:高性能AI绘画工作流实践
人工智能·深度学习·ai作画·aigc·comfyui·蓝耘元生代
兜兜风d'44 分钟前
PyTorch深度学习实践——卷积神经网络高级篇
人工智能·pytorch·深度学习
再一次等风来1 小时前
深度学习中的梯度消失与梯度爆炸
人工智能·深度学习·梯度
纤纡.1 小时前
从零搭建卷积神经网络(CNN):食品图像分类实战
人工智能·深度学习·cnn
八月瓜科技1 小时前
擎策·知海全球专利数据库 凭差异化优势 筑科技创新检索壁垒
大数据·数据库·人工智能·科技·深度学习·机器人
绵满1 小时前
强化学习基础(RL)笔记
深度学习·强化学习·基础知识
沪漂阿龙2 小时前
微调嵌入模型:站在巨人肩膀上,用少量数据实现性能飞跃
人工智能·深度学习·机器学习
V搜xhliang02462 小时前
任务规划双路径经典规划与分层强化学习
人工智能·深度学习·机器学习·语言模型·自然语言处理