商汤开源SenseNova-Vision:一套模型通吃检测、分割、深度、3D重建四大核心视觉任务

经典视觉任务正式并入通用大模型

目录

[01 现有视觉三大路线核心短板](#01 现有视觉三大路线核心短板)

[02 三大核心设计](#02 三大核心设计)

[2.1 文本+图像双统一输出范式](#2.1 文本+图像双统一输出范式)

[2.2 SN-Vision Corpus 50M开源数据集](#2.2 SN-Vision Corpus 50M开源数据集)

[2.3 混合任务联合微调策略](#2.3 混合任务联合微调策略)

[03 行业横向对比](#03 行业横向对比)

[04 模型核心涌现能力](#04 模型核心涌现能力)

[05 写在最后](#05 写在最后)


近日,商汤联合多高校开源SenseNova-Vision,核心突破是完全取消任务专属预测头,依托通用多模态大模型原生文本、图像双生成通道,将目标检测、OCR、关键点、分割、单目深度、法线、多视图重建、相机位姿等全品类视觉任务整合至同一主干。

模型依靠自然语言指令切换任务,输出分为结构化文本、稠密图像、图文混合三类形式;对标SAM、DepthAnything、VGGT等专用SOTA综合性能持平,同时开源5000万全视觉标注数据集SN-VC,大幅降低通用视觉模型训练成本。

这套工作核心价值是打破视觉模型碎片化开发模式,为机器人、工业视觉、数字内容提供统一推理底座。

01 现有视觉三大路线核心短板

当下视觉方案各自存在无法兼顾的缺陷,也是SenseNova-Vision的设计出发点:

1. 单任务专用模型(SAM、DepthAnything等)

单任务精度顶尖,但每套任务独立训练部署,算力、维护成本翻倍;任务间几何、物体先验无法复用,新增感知需求需完整重训网络,迭代周期漫长。

图 | SAM

2. 序列通用模型(OFA、Florence-2)

将掩码、坐标全部转为文本序列,稠密几何预测时丢失像素细节,长掩码推理速度暴跌,难以支撑多视图3D重建任务。

图 | OFA

3. 图像生成感知(DICEPTION、GenCeption)

擅长深度、掩码类稠密输出,但缺少结构化文本生成能力,OCR、关键点、相机位姿这类符号化结果必须外挂专用分支,语言交互拓展性弱。

图 | DICEPTION

三类方案均无法同时兼容文本、图像、混合三类输出,SenseNova-Vision以"视觉统一为多模态生成"为核心思路补齐该缺口。

图 | SenseNova-Vision整体架构总览

02 三大核心设计

主干基于Bagel-7B-MoT多模态模型微调,不新增专属解码器,仅优化数据流水线,整体分为统一输出范式、SN-VC数据集、混合任务微调三部分。

2.1 文本+图像双统一输出范式

图 | 四大任务对应图文输出形式

所有视觉任务仅依托模型原生两类生成通道,依靠指令区分任务,无需定制损失:

1. 结构化文本输出(检测/OCR/关键点)

用<bbox><point>标记包裹归一化坐标,以自回归文本输出,损失仅采用标准交叉熵,无定制约束。

2. 稠密图像输出(深度/单目标分割)

深度映射灰度图、法线分RGB三通道存储XYZ分量,二进制掩码黑白输出,复用模型原生VAE图像模块。

3. 图文混合输出(全景分割/多视图重建)

文本输出实例类别、色号、相机参数,图像输出彩色掩码/3D点云,文字承载符号信息,图像保存空间像素细节。

图 | 数据协议典型样例

该设计天然支持语言自定义任务,无需微调即可实现自定义掩码、深度约束等零样本需求。

2.2 SN-Vision Corpus 50M开源数据集

现有视觉数据集品类割裂,团队整合70+公开视觉数据源,搭建统一指令式数据集SN-VC,开源SN-VC-50M子集。

图 | SN-VC数据规模统计图

数据分为四大板块:

结构化2D感知323万样本、稠密几何226万、分割31万、多视图几何467万。

配套定位、OCR四大自动化标注引擎,针对稀疏LiDAR、多视图数据采用MoGe-2、LingBot-Depth生成稠密伪标签,补齐标注缺陷。

图 | 四大数据构建引擎流程图

2.3 混合任务联合微调策略

批次混合检测、分割、几何样本,同时混入VQA、文生图数据,防止微调破坏模型原生图文能力;高分辨率采用SigLIP2编码器,多视图随机采样10帧以内降低显存开销;相机浮点数参数设计专属数值token保障预测精度。

图 | 各任务训练收敛曲线

训练仅两套基础损失:文本交叉熵、图像整流流损失,无任务专属优化项,轻量化显卡即可完成微调与推理。

03 行业横向对比

通用视觉赛道四类方案核心差异对比:

  1. 专用专家模型:单任务精度最优,但部署成本高、拓展难;

  2. 序列统一模型:轻量化,但几何重建能力缺失;

  3. 图像生成感知:稠密预测强,无结构化文本输出;

  4. SenseNova-Vision:唯一全覆盖文本/图像/混合输出,兼顾2D感知、单目几何、多视图重建,依靠多模态预训练拥有跨任务泛化能力。

图 | 全品类任务定性效果汇总

量化表现客观区分纸面数值与落地真实意义:

  • 结构化感知:COCO检测mAP与Ground DINO持平,OCR、定位超越同类通用大模型;
  • 稠密几何:NYUv2深度指标优于Marigold,仅弱于专用MoGe;
  • 分割:通用全景略低于SAM,对话式推理分割表现领先;
  • 多视图重建:通用模型内第一梯队,和DUSt3R专用模型存在小幅差距。
  • 指标局限:测试均为规整标准数据集,动态车流、极端天气、微观工业场景未纳入,纸面SOTA不代表实场景效果。

04 模型核心涌现能力

实验重点展示跨任务泛化优势,而非单纯刷榜数据:

**1. 跨知识迁移:**仅训练基础分割模板,依靠检测学到的坐标知识,解析文本点指令完成实例分割,可按语言要求为密集物体分配独立掩码。

图 | 密集实例分割文本指令测试OOD

**2. 零样本感知:**训练仅日常物体,对动物、陌生器械、文本描述目标均可输出精准深度与掩码,证明模型掌握通用物体几何,而非记忆训练纹理。

图 | 文本分割定性效果图多视图

**3. 稳健重建:**室内、户外、小物体场景无需针对性适配,稀疏视角下可补全缺失几何结构。

图 | 多视图重建各类场景效果图

**实验客观短板:**多任务均衡带来5%~15%单任务精度损耗;高密度遮挡场景易出现实例掩码合并;无序图片输入重建完整性大幅下降。

05 写在最后

此前NLP依靠统一生成范式完成大一统,视觉领域长期任务割裂,SenseNova-Vision以统一多模态生成为底层逻辑,不依赖任何任务专属网络,一套主干通过语言指令完成数十类视觉感知任务,同时开放大规模多任务数据集。

对比GenCeption等单赛道通用方案,该工作任务覆盖广度全面领先。

该方案不会完全替代单任务SOTA,但提供均衡低成本的通用视觉底座,为具身智能、通用视觉基础模型开辟全新路线。

参考论文:Vision as Unified Multimodal Generation

论文链接:https://arxiv.org/pdf/2607.06560

项目开源:https://github.com/OpenSenseNova/SenseNova-Vision

模型&数据集:https://huggingface.co/collections/sensenova/sensenova-vision

相关推荐
AGV算法笔记3 个月前
CVPR 2025 最新感知算法解读:GaussianLSS 如何用 Gaussian Splatting 重构 BEV 表示?
算法·重构·自动驾驶·3d视觉·感知算法·多视角视觉
水龙吟啸7 个月前
基于Orbbec-Gemini深度相机与SFM-2D to 3D重建算法、手部识别视觉算法、Unity运动控制的3D水果切割游戏
python·深度学习·神经网络·c#·游戏引擎·3d视觉·3d重建
苏州知芯传感9 个月前
工业之“眼”的进化:基于MEMS扫描的主动式3D视觉如何驱动柔性制造
工业·扫描·3d视觉·mems
牛奶还是纯的好9 个月前
双目测距实战4-自标定
人工智能·3d视觉
lingxiao168881 年前
管件接头的无序抓取
机器学习·计算机视觉·halcon·3d视觉
lingxiao168881 年前
对3D对象进行形变分析
计算机视觉·halcon·3d视觉·3d表面匹配·3d变形的表面匹配
lingxiao168881 年前
测量3D翼片的距离与角度
计算机视觉·halcon·3d视觉
lingxiao168881 年前
移除3D对象的某些部分点云
计算机视觉·halcon·3d视觉
luofeiju1 年前
理解全景图像拼接
计算机视觉·3d视觉·多视图几何