论文阅读——Painter

Images Speak in Images: A Generalist Painter for In-Context Visual Learning

GitHub - baaivision/Painter: Painter & SegGPT Series: Vision Foundation Models from BAAI

可以做什么:

输入和输出都是图片,并且不同人物输出的图片格式相同,输入输出图片格式都是H×W ×3,具体大概是原始label像素值重新定义在了三个通道上。语义分割部分如下:

原文:

训练时,输入是同一任务的两对图片concatenation,每对图片是原始图片和相应的任务输出图片,即GT。对于第二张图片即输出图片GT做了随机掩码,比例75%,重建遮挡的这部分,这部分训练时用一个可学习的向量代替被遮挡的patch。然后送入Vit-L,24blosks。从这些blocks中随机选4个特征图concatenation,送入一个三层的head(1x1卷积,3x3卷积,1个线性层)把每个patch还原为原来大小,16x16x3。

由于输入两对图片concatenation,所以计算量大,所以作者降低计算量的办法是输入图片和输出图片分别平行的送入模型,然后三个blocks后相对应的patch相加。节省一半计算开销。

损失函数smooth-l1

任务提示,作者给了两种基线办法:从训练集里面选好的,和生成一个可学习的。

其他实验结果:

相关推荐
2601_956743682 分钟前
上海GEO营销工程实践:知识库构建、AI内容生产、官网承接与监测优化闭环评估
人工智能·ai·geo·上海
盟接之桥17 分钟前
当大模型遇见线束制造:不是通用AI,而是行业AI
大数据·网络·人工智能·安全·制造
归秋14237 分钟前
2026 企业 AI 办公工具选型指南:从评估框架到产品适配
大数据·运维·人工智能
冬奇Lab1 小时前
开源项目第229期:e2e — 用自然语言写 E2E 测试,还能把 Agent 跑过的操作录成‘回放缓存‘免模型调用
人工智能·测试
东风破_1 小时前
从 Neo4j 到 GraphRAG:用 Text-to-Cypher 构建图检索 RAG
人工智能·后端
冬奇Lab1 小时前
LLM 自动化测试系列(05):移动端自动化(一)——ARTEMIS 的双模式架构拆解
人工智能·测试
DisonTangor1 小时前
llama.cpp 新特性:决策模型
人工智能·开源·aigc
鲲穹AI种草1 小时前
AI 生成 PPT 工具怎么选?鲲穹 PPT 功能实测与横向对比
人工智能·powerpoint
AI技术新视界1 小时前
Strata 的工作原理
人工智能·推理引擎·本地ai
2501_926978332 小时前
给自指系统接一个外部锚 —— 一个关于「用 AI 观察自己」的方法
人工智能·经验分享·笔记·机器学习·ai写作