论文阅读——Painter

Images Speak in Images: A Generalist Painter for In-Context Visual Learning

GitHub - baaivision/Painter: Painter & SegGPT Series: Vision Foundation Models from BAAI

可以做什么:

输入和输出都是图片,并且不同人物输出的图片格式相同,输入输出图片格式都是H×W ×3,具体大概是原始label像素值重新定义在了三个通道上。语义分割部分如下:

原文:

训练时,输入是同一任务的两对图片concatenation,每对图片是原始图片和相应的任务输出图片,即GT。对于第二张图片即输出图片GT做了随机掩码,比例75%,重建遮挡的这部分,这部分训练时用一个可学习的向量代替被遮挡的patch。然后送入Vit-L,24blosks。从这些blocks中随机选4个特征图concatenation,送入一个三层的head(1x1卷积,3x3卷积,1个线性层)把每个patch还原为原来大小,16x16x3。

由于输入两对图片concatenation,所以计算量大,所以作者降低计算量的办法是输入图片和输出图片分别平行的送入模型,然后三个blocks后相对应的patch相加。节省一半计算开销。

损失函数smooth-l1

任务提示,作者给了两种基线办法:从训练集里面选好的,和生成一个可学习的。

其他实验结果:

相关推荐
易连EDI—EasyLink3 分钟前
电动汽车供应链协同新范式:蔚来(NIO)企业级EDI平台建设实践
网络·人工智能·edi·nio·as2
AI星桥小王子5 分钟前
分清原生音画同步!主流 AI 视频生成平台横向对比
人工智能
xqqxqxxq8 分钟前
技术笔记:上下文工程(Context Engineering)心得总结(李博杰《深入理解 AI Agent》2.1,2.2观后总结)
人工智能·笔记
成都被卷死的程序员9 分钟前
生活与工作AI高效使用指南
人工智能·生活
万岳科技系统开发12 分钟前
智慧医院小程序开发推动医疗服务流程全面线上化
大数据·开发语言·人工智能
用户81818706274617 分钟前
第5章 核心对象与配置系统
人工智能
Litluecat20 分钟前
2026年7月24日科技热点新闻
人工智能·科技·新闻·每日·速览
用户81818706274625 分钟前
第6章 thinkingLevel 思维层级体系
人工智能
熙丫 1338148238633 分钟前
人工智能训练工程师考试报名2026:报考条件、报名入口及注意事项
人工智能
凡情38 分钟前
dify 图片提取文字
人工智能