
「经典视觉任务正式并入通用大模型」
目录
[01 现有视觉三大路线核心短板](#01 现有视觉三大路线核心短板)
[02 三大核心设计](#02 三大核心设计)
[2.1 文本+图像双统一输出范式](#2.1 文本+图像双统一输出范式)
[2.2 SN-Vision Corpus 50M开源数据集](#2.2 SN-Vision Corpus 50M开源数据集)
[2.3 混合任务联合微调策略](#2.3 混合任务联合微调策略)
[03 行业横向对比](#03 行业横向对比)
[04 模型核心涌现能力](#04 模型核心涌现能力)
[05 写在最后](#05 写在最后)
近日,商汤联合多高校开源SenseNova-Vision,核心突破是完全取消任务专属预测头,依托通用多模态大模型原生文本、图像双生成通道,将目标检测、OCR、关键点、分割、单目深度、法线、多视图重建、相机位姿等全品类视觉任务整合至同一主干。
模型依靠自然语言指令切换任务,输出分为结构化文本、稠密图像、图文混合三类形式;对标SAM、DepthAnything、VGGT等专用SOTA综合性能持平,同时开源5000万全视觉标注数据集SN-VC,大幅降低通用视觉模型训练成本。
这套工作核心价值是打破视觉模型碎片化开发模式,为机器人、工业视觉、数字内容提供统一推理底座。
01 现有视觉三大路线核心短板
当下视觉方案各自存在无法兼顾的缺陷,也是SenseNova-Vision的设计出发点:
1. 单任务专用模型(SAM、DepthAnything等)
单任务精度顶尖,但每套任务独立训练部署,算力、维护成本翻倍;任务间几何、物体先验无法复用,新增感知需求需完整重训网络,迭代周期漫长。

图 | SAM
2. 序列通用模型(OFA、Florence-2)
将掩码、坐标全部转为文本序列,稠密几何预测时丢失像素细节,长掩码推理速度暴跌,难以支撑多视图3D重建任务。

图 | OFA
3. 图像生成感知(DICEPTION、GenCeption)
擅长深度、掩码类稠密输出,但缺少结构化文本生成能力,OCR、关键点、相机位姿这类符号化结果必须外挂专用分支,语言交互拓展性弱。

图 | DICEPTION
三类方案均无法同时兼容文本、图像、混合三类输出,SenseNova-Vision以"视觉统一为多模态生成"为核心思路补齐该缺口。

图 | SenseNova-Vision整体架构总览
02 三大核心设计
主干基于Bagel-7B-MoT多模态模型微调,不新增专属解码器,仅优化数据流水线,整体分为统一输出范式、SN-VC数据集、混合任务微调三部分。
2.1 文本+图像双统一输出范式

图 | 四大任务对应图文输出形式
所有视觉任务仅依托模型原生两类生成通道,依靠指令区分任务,无需定制损失:
1. 结构化文本输出(检测/OCR/关键点)
用<bbox><point>标记包裹归一化坐标,以自回归文本输出,损失仅采用标准交叉熵,无定制约束。
2. 稠密图像输出(深度/单目标分割)
深度映射灰度图、法线分RGB三通道存储XYZ分量,二进制掩码黑白输出,复用模型原生VAE图像模块。
3. 图文混合输出(全景分割/多视图重建)
文本输出实例类别、色号、相机参数,图像输出彩色掩码/3D点云,文字承载符号信息,图像保存空间像素细节。

图 | 数据协议典型样例
该设计天然支持语言自定义任务,无需微调即可实现自定义掩码、深度约束等零样本需求。
2.2 SN-Vision Corpus 50M开源数据集
现有视觉数据集品类割裂,团队整合70+公开视觉数据源,搭建统一指令式数据集SN-VC,开源SN-VC-50M子集。

图 | SN-VC数据规模统计图
数据分为四大板块:
结构化2D感知323万样本、稠密几何226万、分割31万、多视图几何467万。
配套定位、OCR四大自动化标注引擎,针对稀疏LiDAR、多视图数据采用MoGe-2、LingBot-Depth生成稠密伪标签,补齐标注缺陷。

图 | 四大数据构建引擎流程图
2.3 混合任务联合微调策略
批次混合检测、分割、几何样本,同时混入VQA、文生图数据,防止微调破坏模型原生图文能力;高分辨率采用SigLIP2编码器,多视图随机采样10帧以内降低显存开销;相机浮点数参数设计专属数值token保障预测精度。

图 | 各任务训练收敛曲线
训练仅两套基础损失:文本交叉熵、图像整流流损失,无任务专属优化项,轻量化显卡即可完成微调与推理。
03 行业横向对比
通用视觉赛道四类方案核心差异对比:
-
专用专家模型:单任务精度最优,但部署成本高、拓展难;
-
序列统一模型:轻量化,但几何重建能力缺失;
-
图像生成感知:稠密预测强,无结构化文本输出;
-
SenseNova-Vision:唯一全覆盖文本/图像/混合输出,兼顾2D感知、单目几何、多视图重建,依靠多模态预训练拥有跨任务泛化能力。

图 | 全品类任务定性效果汇总
量化表现客观区分纸面数值与落地真实意义:
- 结构化感知:COCO检测mAP与Ground DINO持平,OCR、定位超越同类通用大模型;
- 稠密几何:NYUv2深度指标优于Marigold,仅弱于专用MoGe;
- 分割:通用全景略低于SAM,对话式推理分割表现领先;
- 多视图重建:通用模型内第一梯队,和DUSt3R专用模型存在小幅差距。
- 指标局限:测试均为规整标准数据集,动态车流、极端天气、微观工业场景未纳入,纸面SOTA不代表实场景效果。
04 模型核心涌现能力
实验重点展示跨任务泛化优势,而非单纯刷榜数据:
**1. 跨知识迁移:**仅训练基础分割模板,依靠检测学到的坐标知识,解析文本点指令完成实例分割,可按语言要求为密集物体分配独立掩码。

图 | 密集实例分割文本指令测试OOD
**2. 零样本感知:**训练仅日常物体,对动物、陌生器械、文本描述目标均可输出精准深度与掩码,证明模型掌握通用物体几何,而非记忆训练纹理。

图 | 文本分割定性效果图多视图
**3. 稳健重建:**室内、户外、小物体场景无需针对性适配,稀疏视角下可补全缺失几何结构。

图 | 多视图重建各类场景效果图
**实验客观短板:**多任务均衡带来5%~15%单任务精度损耗;高密度遮挡场景易出现实例掩码合并;无序图片输入重建完整性大幅下降。
05 写在最后
此前NLP依靠统一生成范式完成大一统,视觉领域长期任务割裂,SenseNova-Vision以统一多模态生成为底层逻辑,不依赖任何任务专属网络,一套主干通过语言指令完成数十类视觉感知任务,同时开放大规模多任务数据集。
对比GenCeption等单赛道通用方案,该工作任务覆盖广度全面领先。
该方案不会完全替代单任务SOTA,但提供均衡低成本的通用视觉底座,为具身智能、通用视觉基础模型开辟全新路线。
参考论文:Vision as Unified Multimodal Generation
论文链接:https://arxiv.org/pdf/2607.06560
项目开源:https://github.com/OpenSenseNova/SenseNova-Vision
模型&数据集:https://huggingface.co/collections/sensenova/sensenova-vision