ReVersion|图像生成中的Relation定制化

新任务:Relation Inversion

新任务:Relation Inversion

今年,diffusion model和相关的定制化(personalization)的工作越来越受人们欢迎,例如DreamBooth,Textual Inversion,Custom Diffusion等,该类方法可以将一个具体物体的概念从图片中提取出来,并加入到预训练的text-to-image diffusion model中,这样一来,人们就可以定制化地生成自己感兴趣的物体,比如说具体的动漫人物,或者是家里的雕塑,水杯等等。

现有的定制化方法主要集中在捕捉物体外观 (appearance) 方面。然而,除了物体的 外观 ,视觉世界还有另一个重要的支柱,就是物体与物体之间千丝万缕的**关系( **relation ** **。目前还没有工作探索过如何从图片中提取一个具体关系(relation),并将该relation作用在生成任务上。为此,我们提出了一个新任务:Relation Inversion

如上图,给定几张参考图片,这些参考图片中有一个共存的relation,例如"物体A被装在 物体B中",Relation Inversion的目标是找到一个relation prompt 来描述这种交互关系,并将其应用于生成新的场景,让其中的物体也按照这个relation互动,例如将蜘蛛侠装进篮子里。

ReVersion框架

作为针对Relation Inversion问题的首次尝试,我们提出了ReVersion框架:

相较于已有的Appearance Invesion任务,Relation Inversion任务的难点在于怎样告诉模型我们需要提取的是relation这个相对抽象的概念,而不是物体的外观这类有显著视觉特征的方面。

我们提出了relation-focal importance sampling策略来鼓励更多地关注high-level的relation;同时设计了relation-steering contrastive learning来引导更多地关注relation,而非物体的外观。更多细节详见论文。

ReVersion Benchmark

我们收集并提供了ReVersion Benchmark: github.com/ziqihuangg/...

它包含丰富多样的relation,每个relation有多张exemplar images以及人工标注的文字描述。我们同时对常见的relation提供了大量的inference templates,大家可以用这些inference templates来测试学到的relation prompt是否精准,也可以用来组合生成一些有意思的交互场景。

结果展示

丰富多样的relation

我们可以invert丰富多样的relation,并将它们作用在新的物体上

丰富多样的背景以及风格

我们得到的relation ,还可以将不同风格背景场景中的物体,按照特定的方式联系在一起。

同一个Relation,丰富多样的物体组合

相关推荐
redreamSo9 小时前
AI Daily | AI日报:Synthesia CEO:不招精英的AI视频独角兽; WAIC 2025大模型论坛:行业大佬硬核辩论; 毕树超:十年转变,深信AGI已至!
程序员·aigc·资讯
redreamSo1 天前
AI Daily | AI日报:微软花17亿买屎埋地换碳减排额度; WAIC聚焦AI幻觉,讯飞星火X1升级破难题; GPT - 5「全家桶」本周或上线,编程能力惊人
程序员·aigc·资讯
不摸鱼2 天前
创业找不到方向?不妨从行业卧底开始 | 不摸鱼的独立开发者日报(第66期)
人工智能·开源·资讯
redreamSo2 天前
AI Daily | AI日报:Meta百亿抢人,AI数据标注产业升级; 百度全栈自研,AI应用大放异彩; Hinton访华:多模态大模型已有「意识」
程序员·aigc·资讯
redreamSo3 天前
AI Daily | AI日报:Altman:GPT - 5将引发就业与欺诈变革; OpenAI 新模型多场竞赛‘翻车’,谷歌躺赢!; 黄仁勋:报废50亿显卡,员工薪酬全加薪
程序员·aigc·资讯
不摸鱼4 天前
Meta大佬:AI能写代码后,程序员最重要的是“品味” | 不摸鱼的独立开发者日报(第64期)
人工智能·开源·资讯
redreamSo4 天前
AI Daily | AI日报:Meta出走团队获融资,打造AI视觉记忆大脑; OpenAI急募300亿,星际之门危机四伏; Altman:GPT - 5将引发就业与经济变革
程序员·aigc·资讯
great9835 天前
AI 及开发领域动态与资源汇总(2025年7月23日)
资讯
算家计算6 天前
阿里开源最强编程模型Qwen3-Coder!超越GPT-4.1,登顶开源榜首
人工智能·ai编程·资讯