Segment Anything

参考:【图像分割】Segment Anything(Meta AI)论文解读-CSDN博客

背景

  • 提示分割任务:在给定任何分割提示下返回一个有效的分割掩码
  • 目标:开发一个可提示的图像分割的基础模型,在一个广泛的数据集上预训练,解决新数据分布上的一系列下游分割问题
  • 输入:提示+图片
  • 输出:mask

模型

  • prompt可以是一组前景/背景点、一个粗糙的框或掩码、自由形式的文本(上图中的Task)
  • 三个约束条件:一个强大的图像编码器计算图像嵌入,一个提示编码器嵌入提示,然后将两个信息源组合在一个轻量级掩码解码器中来预测分割掩码。(上图中的Model)
  • 数据加强:分三个阶段:在第一阶段,SAM(Segment everything model)协助注释器对掩码进行注释,类似于经典的交互式分割设置【train】。在第二阶段,SAM可以通过提示可能的对象位置来为对象子集自动生成掩码,注释器专注于对其余对象的注释,帮助增加掩码的多样性【annotate】。在最后一个阶段,我们用一个规则的前景点网格提示SAM,平均每张图像产生100个高质量的掩模。(上图中的Data)
  • 图像编码器:预训练的视觉变换器 (ViT)
  • 提示编码器
    • 两组提示:稀疏的(点、方框、文本)和密集的(mask)
      • 点和方框:位置编码与每种提示类型的学习嵌入相加
      • 文本:用 CLIP的现成文本编码器来表示自由格式文本
      • mask:使用卷积进行嵌入,并与图像嵌入进行元素求和
  • 掩码解码器
    • ​​​​​​​ 有效地将图像嵌入、提示嵌入和输出token映射到掩码。该设计的灵感来自于DETR,采用了对(带有动态掩模预测头的)Transformer decoder模块的修改。
相关推荐
武子康1 分钟前
从声学信号到工具阻断:实时语音安全决策门的系统设计
人工智能·llm·agent
旖旎夜光1 分钟前
【LangChain实战】LangChain 学习笔记(二):结构化输出、流式传输与消息管理
人工智能·笔记·python·学习·ai·langchain
醍醐实验室8 分钟前
推理链中的 Token 冗余与剪枝:消除无意义语气词对注意力权重的稀释
人工智能
a187927218319 分钟前
【算法】动态规划第五篇:区间 DP——从“看什么都像背包“到“最后戳谁“
算法·leetcode·动态规划·dp·区间·区间dp·算法讲解
whitelbwwww13 分钟前
c++ 多线程
开发语言·c++·算法
额鹅恶饿呃15 分钟前
随着CentOS官方停服的时间越来越久,大量仍在使用CentOS7的企业和运维从业者
java·python·算法·c#·ruby
白狐_79820 分钟前
408 数据结构|KMP算法核心:为什么不用主串回退
数据结构·算法
梦想的颜色24 分钟前
2026 年 9 月主流 AI 视频生成模型横向硬核测评:价格、能力定位、质量、Agent 工作流适配
人工智能·aigc·大模型测评·ai视频大模型·minimax h3·seedance 2.5
AI 思录25 分钟前
Prompt 事故档案(五):AI 道歉,还是“道德漂白”?
人工智能·安全·prompt·用户体验·ai安全·ai幻觉
wuyk55526 分钟前
13.堆排序:基于完全二叉树的高效排序算法一、什么是堆排序?
开发语言·算法·排序算法