Imagic: Text-Based Real Image Editing with Diffusion Models

  1. 问题引入
  • 针对的是text based image editing问题,可以解决non rigid edit,即可以改变图片中object的posture;
  • 模型仅需要原图以及编辑的text,不需要mask,也是在T2I diffusion model上实现的;
  • 首先optimize text embedding,之后使用优化后的text embedding来微调整个模型,最后将优化之后的text embedding和目标text的embedding进行插值得到一个结合原图以及编辑prompt的embedding,然后进行生成得到想要的结果;
  1. methods
  • Text embedding optimization:首先获取到编辑后text的embedding e t g t e_{tgt} etgt,之后只是训练embedding部分,冻结diffusion model主体,训练很少的步数,以使得优化之后的embedding e o p t e_{opt} eopt没有发生很大的变化,便于第三步的插值操作;
  • Model fine-tuning:因为第一步只训练了很少的步数,所以生成的图片不能和原图完全一致,所以进行了全模型的训练(优化之后的embedding冻结),此时使用的是 e o p t e_{opt} eopt,但是在finetune后接的超分模型的时候使用的是 e t g t e_{tgt} etgt;
  • Text embedding interpolation:进行 e t g t , e o p t e_{tgt},e_{opt} etgt,eopt之间的插值: e ‾ = η ⋅ e t g t + ( 1 − η ) ⋅ e o p t \overline{e} = \eta\cdot e_{tgt} + (1 - \eta)\cdot e_{opt} e=η⋅etgt+(1−η)⋅eopt,以这个作为最后的embedding来生成,后接的超分模型还是使用 e t g t e_{tgt} etgt
相关推荐
_小苔藓_8 分钟前
混合Token与LoRA结合Qwen3-VL高效微调(代码开源)
深度学习·开源·大模型·微调·多模态
MistaCloud2 小时前
Pytorch深入浅出(十四)之完整的模型训练测试套路
人工智能·pytorch·python·深度学习
知乎的哥廷根数学学派2 小时前
基于物理信息嵌入与多维度约束的深度学习地基承载力智能预测与可解释性评估算法(以模拟信号为例,Pytorch)
人工智能·pytorch·python·深度学习·算法·机器学习
柠柠酱2 小时前
【深度学习Day6】不改模型也能涨点?MATLAB老鸟带你玩转 PyTorch 数据增强 (附 Mixup/Cutout 暴力提分法)
深度学习
汤姆yu2 小时前
基于深度学习的火焰烟雾识别系统
人工智能·深度学习·目标跟踪
知乎的哥廷根数学学派3 小时前
基于物理约束与多源知识融合的浅基础极限承载力智能预测与工程决策优化(以模拟信号为例,Pytorch)
人工智能·pytorch·python·深度学习·神经网络·机器学习
yubo05093 小时前
【无标题】
人工智能·深度学习
CoovallyAIHub3 小时前
为AI装上“纠偏”思维链,开源框架Robust-R1显著提升多模态大模型抗退化能力
深度学习·算法·计算机视觉
向量引擎小橙3 小时前
智能体“组团”时代:通信协议标准化如何颠覆未来协作模式?
大数据·人工智能·深度学习·集成学习
CoovallyAIHub4 小时前
YOLO-Maste开源:首个MoE加速加速实时检测,推理提速17.8%!
深度学习·算法·计算机视觉