MaskCLIP+

MaskCLIP

CLIP 是否仅能做图像级的零样本分类?还是其实已经隐含了局部/像素级的语义信息,可以直接用于语义分割?

结论是:

CLIP 内部确实已经隐含了丰富的局部语义,可直接输出密集预测,甚至能成为一种强大的开集伪监督方式。

千万不要 fine-tune CLIP,否则会破坏视觉---语言对齐

作者实验了两种天真的方案:

  • 用 CLIP 的 backbone 初始化 DeepLab 再 fine-tune
  • 使用映射器 M(text_embedding) → classifier weights
    结果都失败,原因是:
  • fine-tune 会破坏 CLIP 原有的语义空间
  • mapper 在 seen classes 上训练,无法泛化到 unseen classes
    因此 必须保持 CLIP 冻结,否则开集能力崩溃
    → 这形成 MaskCLIP 的设计原则:"不破坏 CLIP 的语义空间"

密集视觉特征

  • 对于VIT,密集视觉特征就是patch嵌入
  • 对于ResNet的骨干,其密集视觉特征是注意力池化层中的值嵌入。
    作者发现ViT上的表现比ResNet强,因为其分辨率比ResNet高,VIT:32x32,ResNet:7x7
    通过上采样 还原到原始图像的分辨率。

文本嵌入作为分类器权重

分类器权重就是将视觉特征HxWxC映射到HxWxK的矩阵,其中K是类别数。

作者直接将CLIP文本嵌入作为该权重。

去噪和平滑处理

  • 作者将注意力池化层丢弃的k重新利用过来,用于平滑输出的分割掩膜
  • 把在所有像素(位置)的预测概率都小于0.5的类别直接移除,用于去噪。


MaskCLIP+

  • MaskCLIP已经可以实现开放词汇分割了,但是效果不一定强,主要是受限于特征图分辨率太低。
  • 作者采用DeepLab作为主要分割网络,生成高质量高分辨率的特征图,利用MaskCLIP生成的分割掩码进行监督。
  • 在前1/10轮,作者采用MaskCLIP进行监督,但是后面作者采用自训练的形式,对于没有注释的转导设置,作者直接利用主要分割网络自己产生的掩码用于自训练。
相关推荐
ZYJCSZKJ3 分钟前
面向东盟多语种场景的AIGEO与AI数字人融合架构及区域实践
人工智能·架构·#ai数字人·aigeo
Raas10010 分钟前
MAI Gateway (魔芋企业级AI网关) 私有化部署全攻略:AI网关怎么部署?附架构图
人工智能·安全·大模型·gateway·ai网关·mai gateway
Lucifer三思而后行14 分钟前
我准备写 26 篇文章,带 DBA 系统学一遍 AI
数据库·人工智能·dba
JavaPub-rodert15 分钟前
Codex 从 0 开始:安装 ChatGPT,并接入 DeepSeek
人工智能·gpt·chatgpt
每日新鲜事15 分钟前
北大医院引入WPS Comate智能助手,加速医院管理智能化进程
大数据·人工智能·wps
m4Rk_16 分钟前
【论文阅读】Agent 记忆机制(45):ReMemR1——让长期上下文 Agent 可以回溯历史记忆进行非线性推理
论文阅读·人工智能·学习·开源·github
gis分享者16 分钟前
LangChain 和 LlamaIndex 有什么区别?各自适合什么场景?
人工智能·ai·langchain·场景·区别·llamaindex
格林威19 分钟前
C#图像处理:使用imagemagick实现像素放大水印转换等多种功能
android·开发语言·图像处理·人工智能·计算机视觉·c#·视觉检测
丁常彦-自媒体-常言道20 分钟前
工业强桂深化AI与制造业融合,华为助力广西共筑新型工业化高地
人工智能·华为
火山引擎开发者社区6 小时前
七夕漫谈|向量检索界的超强 CP:DiskANN 铺路,RaBitQ 加速,又准又快还能省
人工智能