论文阅读——Painter

Images Speak in Images: A Generalist Painter for In-Context Visual Learning

GitHub - baaivision/Painter: Painter & SegGPT Series: Vision Foundation Models from BAAI

可以做什么:

输入和输出都是图片,并且不同人物输出的图片格式相同,输入输出图片格式都是H×W ×3,具体大概是原始label像素值重新定义在了三个通道上。语义分割部分如下:

原文:

训练时,输入是同一任务的两对图片concatenation,每对图片是原始图片和相应的任务输出图片,即GT。对于第二张图片即输出图片GT做了随机掩码,比例75%,重建遮挡的这部分,这部分训练时用一个可学习的向量代替被遮挡的patch。然后送入Vit-L,24blosks。从这些blocks中随机选4个特征图concatenation,送入一个三层的head(1x1卷积,3x3卷积,1个线性层)把每个patch还原为原来大小,16x16x3。

由于输入两对图片concatenation,所以计算量大,所以作者降低计算量的办法是输入图片和输出图片分别平行的送入模型,然后三个blocks后相对应的patch相加。节省一半计算开销。

损失函数smooth-l1

任务提示,作者给了两种基线办法:从训练集里面选好的,和生成一个可学习的。

其他实验结果:

相关推荐
码农小旋风1 分钟前
GPT-6 Astra 直接进 Blender,AI 开始从会说变成会做
人工智能·gpt·blender
武子康1 分钟前
9/10 和 900/1000 都是 90%:机器人成功率计算器必须阻止的误判
人工智能·llm·agent
weixin_618232303 分钟前
OpenAI智能体“劫持”德国老网站当留言板
人工智能·安全
未来之窗软件服务3 分钟前
城市街道社区综合管理开发之档案管理—东方仙盟
人工智能·仙盟创梦ide·档案系统
武哥聊编程3 分钟前
【AI实战项目】基于SpringAI+Springboot+Vue的AI智能简历优化助手
vue.js·人工智能·spring boot
phoenix-bai3 分钟前
表格神经网络架构发展史:从 MLP 到表格基础模型的二十年
人工智能·神经网络·架构
大虾别跑8 分钟前
ai-daily-2026-09-07
人工智能
微三云 - 廖会灵 (私域系统开发)10 分钟前
垂直行业 SaaS 实践|AI 美业小程序,构建美业服务全链路数字化闭环
人工智能·小程序
m0_6145235516 分钟前
工程工作流:一句需求做视频封面,先拆主题再做小图验收
人工智能·音视频
2501_9336707917 分钟前
内容电商运营岗位能力模型:SQL、Excel、投放数据与AI工具怎么准备
人工智能·sql·excel