【arXiv 2026】GenCeption:视频生成模型是通用视觉学习者|从生成式视觉预训练范式视角

摘要

本文解读 arXiv 2026 论文《Video Generation Models are General-Purpose Vision Learners》。该论文提出 GenCeption ,把大规模文生视频扩散模型改造为单步前馈 的通用视觉感知模型,通过统一 RGB 表示可学习 token统一 L_2 损失 ,让 8 类稠密/稀疏任务共用一个骨干与解码器,其特别之处在于仅用纯合成视频数据训练,即全面超越各任务专用 SOTA。实验表明法向 Hi4D mAE 10.99、深度 Goliath AbsRel 0.008、指代分割 MeViS J&F 70.0,且数据效率达 7\\times-500\\times,为计算机视觉的生成式预训练范式提供了系统性证据。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) Video Generation Models are General-Purpose Vision Learners
标题(中文) 视频生成模型是通用视觉学习者
作者 Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu
机构 Google DeepMind · U. Toronto · UCL · Oxford · MIT · Lund
会议 arXiv 2026
arXiv https://arxiv.org/abs/2607.09024
项目网站 https://genception.github.io

背景与动机

NLP 靠 next-token prediction 从任务专用模型收敛为通用基础模型;计算机视觉却仍停留在"专用模型"阶段------SAM 系列 管分割、Depth Anything 系列 管深度,每个任务都要定制架构。作者提出,通用视觉预训练需满足三条准则:时空演化 (内化 4D 因果与物理)、视觉-语言对齐 (原生继承指令跟随)、可规模化(数据与算力可扩展)。

现有工作各有短板:MAE/VideoMAE、DINO 等自监督表征缺少显式多模态对齐;CLIP/SigLIP 对齐了图文却难做视频级表征且规模受限;扩散复用路线(MarigoldGenPerceptDiception )多为单图单任务且依赖多步采样;视频侧 DepthCrafter/NormalCrafter 聚焦单一稠密任务;同期工作 Vision Banana 只覆盖二维图像空间。GenCeption 的关键差异是:原生视频域 + 单步前馈 + 稠密/稀疏任务统一,在标准 benchmark 上全面超越专用 SOTA。

研究主线:从问题到结论

图 12:GenCeption 研究主线------从"视频生成"到"通用感知"(Mermaid 流程图)

基准/方法设计

GenCeption 的方法论由三条原则驱动:

  1. 多模态生成预训练即表征学习------文生视频扩散模型作通用骨干,生成高保真视频强制内化时空先验、3D 几何与物理规律,同时原生对齐视觉语言概念;为保留先验,最大化兼容原预训练范式、最小化改动。
  2. 任务无关的统一后训练------把感知任务视为统一的序列到序列映射,稠密任务输出编码进标准 RGB 空间(\[0,1\]),文本提示切换任务,单骨干单解码器单损失。
  3. 前馈重构------把多步迭代采样改造成单步确定性预测,兼顾精度与效率。

图 1:方法总览------视频生成模型作预训练基座(左),多任务后训练为前馈感知模型;右图为从专用模型到通用模型的范式转移

分类全景

图 13:GenCeption 任务分类------稠密任务统一进 RGB 空间,稀疏任务由可学习 token 承载(Mermaid 流程图)

方法细节

前馈重构:干净视频潜在 x_0 直接输入 DiT,时间步固定 t=0(Rectified Flow 终止点);DiT 输出速度 v = \\epsilon - x_0,取负后 -v = x_0 - \\epsilon 更接近目标潜在,加速收敛。本质是把 DiT 重铸为特征提取器,特征直接取自最后一层,与解码器原生对齐。

稠密任务统一到 RGB:深度/分割单通道复制为三通道,法向/DensePose 天然三维;相机位姿以像素级 raymap 表示(6 通道),通过空间分区------中心放射线原点、四周放射线方向------压缩进 3 通道,保持单解码器框架。

稀疏任务用可学习 token:每帧追加一个可学习 query token,经 MLP 解码为 K 维坐标;沿用原生 3D RoPE(空间位置可学习),时间位置用插值压缩到预训练所见范围,优于额外注意力层方案。

数据级消歧:深度按场景中值归一化,再用非线性映射 d' = \\mathrm{clip}(\\alpha \\log(d+1), 0, 1) 压到 RGB 范围,彻底免去 scale-invariant 等专用损失------任务差异化全部下沉到数据表示。

合成数据管线:800 个 RenderPeople 模型 × 200 段 CMU 动作,Blender 多渲染通道生成 7,500 段视频,同时产出法向、深度、分割、2D/3D 关键点真值;离线预计算视频/文本潜在加速训练。训练补充 TartanAir、Virtual KITTI、MVS Synth(深度),指代分割用 MeViS/Ref-COCO/YouTube-VOS 真实数据。

图 2:架构总览------输入视频 + 文本提示,一次前向输出目标模态;稠密任务在 RGB 潜在空间监督,稀疏任务由可学习 token 承载

图 3:"Rothko" Raymap------把相机位姿的六通道射线数据压缩进标准 3 通道 RGB

训练配置:WAN 2.1 基座(1.3B/14B),480×832 分辨率、81 帧 @24fps;batch 64 × 256 v6e TPU,Adam lr 5e\^{-5},15,000 步,250 步 warmup;gradient clipping + gradient dropping 保证稳定。

实验设计与结果

评测协议:法向用 Hi4D(Sapiens/DAVID 协议,1,195 帧)与 SINTEL;深度用 KITTI/SINTEL/ETH3D/Goliath(DAVID 子集 2.2k 帧);相机位姿用 SINTEL(ATE/RPE-T/RPE-R);前景分割用 VideoMatte/PhotoMatte 85/PPM-100(MSE);指代分割用 RefVOS-DAVIS 与 MeViS(J&F);3D 关键点用 EMDB(MPJPE)。除指代分割外全部纯合成数据训练,未使用任何评测集训练数据。

与专用 SOTA 对比主表

任务(指标↓) 最强专用 GenCeption L 胜出幅度
法向 Hi4D (mAE) Sapiens 12.14 10.99 -1.15
法向 SINTEL (mAE) Lotus-2 30.3 29.3 -1.0
深度 SINTEL (AbsRel) D4RT 0.148 0.130 -12%
深度 Goliath (AbsRel) DepthAnything 3 0.012 0.008 -33%
相机位姿 SINTEL (ATE) VGGT-Ω 0.057 0.050 -12%
指代分割 MeViS (J&F) ReferEverything 60.3 70.0 +16%
3D 关键点 EMDB (MPJPE) Genmo 73.0 71.8 -1.2
前景分割 VideoMatte (MSE) RVM 0.0010 0.0010(Generalist) 持平

预训练范式与缩放(深度平均 AbsRel)

方法 规模 训练帧数 Avg AbsRel↓
V-JEPA - H 0.6B 0.9M 0.281
VideoMAE V2 - G 1B 0.9M 0.154
Ours - WAN 2.1 - S 1.3B 0.9M 0.122
Ours - WAN 2.1 - L 14B 0.9M 0.093
DepthAnything 3 - G 1.15B ~200M 0.096
D4RT 1B ~86M 0.082
VGGT-Ω 1B ~600M 0.067
Ours - WAN 2.1 - L (4 数据集) 14B 1.23M 0.071

图 4:能力总览------法向、深度、前景分割、指代分割、稠密人体语义、2D/3D 关键点、相机位姿,仅训练于合成人体视频却泛化到动物与卡通角色

图 5:左:通用能力雷达图------匹配或超越各任务专用模型;右:深度估计数据效率------7\\times-500\\times 更少训练数据达到同等性能

图 6:预训练迁移消融------迁移预训练层数越多性能越高,随机初始化 DiT 学习曲线近乎平坦

图 7:深度与表面法向估计定性结果(首帧)

图 8:指代分割定性结果------识别物体、颜色、空间关系与运动,并分割未见类别

图 9:涌现泛化(a)------训练数据单物体,零样本迁移到真实多人场景

图 10:涌现泛化(b)------仅训练人体类别,泛化到猫等未见类别

图 11:3D 姿态估计------滑雪/单板视频(每 10 帧取一帧),无需人体检测或 2D 关键点预处理

推理成本:1.3B 模型 81 帧 480×832 单次前向 5.92s @ 13.6 FPS(DiT 0.96s)、15.3GB 显存;14B 模型 10.03s @ 8.0 FPS(DiT 5.11s)、42.8GB 显存------对比 WAN 2.1 原版 50 步扩散采样,推理成本降低约一个数量级。

结果对比总结

图 14:GenCeption 与各任务专用 SOTA 的对比总结(Mermaid 流程图)

关键发现

  • 生成式预训练范式完胜:同数据同规模下,WAN 2.1 生成式预训练平均 AbsRel 0.093(14B),大幅优于 V-JEPA 的 0.281 与 VideoMAE V2 的 0.154------关键在生成目标本身,而非数据集或规模。
  • 数据效率惊人:14B 模型用 1.23M 帧达到 VGGT-Ω(约 600M 帧)同级水平,即 7\\times-500\\times 更少训练数据;D4RT(约 86M 帧)同样被 1.23M 帧追平。
  • 缩放性质初现:1.3B → 14B、数据翻倍,深度误差单调下降;从零训练 DiT 曲线近乎水平,预训练层数越多收敛越好。
  • 涌现行为显著:纯合成人体视频训练,零样本迁移到真实多人场景与猫、机器人等 OOD 类别,猫胡须等细节甚至超过训练数据画质。
  • 联合训练有代价:前景分割受益于多任务联合训练,但 3D 关键点 MPJPE 明显退化------token 坐标回归偏离像素空间先验,可学习 token 干扰原生注意力。
  • 推理效率数量级提升:14B 单次前向 DiT 5.11s,对比 50 步扩散采样,成本降低约一个数量级。

局限性

  • 稀疏任务退化:联合训练使 3D 关键点明显变差------token 回归与像素空间预训练本质相悖,可学习 token 从零训练破坏预训练注意力。
  • 合成域依赖:训练数据以人体为中心,背景与物体多样性受限;指代分割仍需 MeViS/Ref-COCO/YouTube-VOS 等真实数据补充。
  • 分辨率与显存开销:480×832 输入,14B 模型单次前向需 5.11s 与 42.8GB 显存,虽比 50 步扩散快得多仍非实时。
  • 并发竞争:与 Vision Banana、Wiedemer et al. 等工作同期,范式归属与基准差异需后续检验。
  • 作者展望:后训练应最小化对预训练骨干的架构改动,或从根本上重新设计预训练目标以原生容纳多样化下游任务。

常见问题(FAQ)

GenCeption 和 Vision Banana 有什么区别?

两者同为"生成模型是通用视觉学习者"的同期工作,但 Vision Banana 只覆盖二维图像空间且采用多步生成,GenCeption 扩展到原生视频域、采用单步前馈架构,并在更广泛的任务谱系上做了定量评测。

为什么视频生成预训练比 CLIP、MAE 更好?

因为生成高保真视频强制模型内化时空因果、3D 几何与物理交互,且文本条件生成天然对齐视觉-语言语义;CLIP 等对比方法缺时空建模,MAE 等掩码方法缺模态对齐,且视频表征模型规模普遍小一个量级。

相机位姿怎么编码进 RGB 图像?

采用像素级 raymap:每个像素记录一条射线的原点与方向(共 6 通道),通过空间分区------中心放射线原点、四周放射线方向------压缩进标准 3 通道 RGB,保持单解码器框架不变。

GenCeption 训练数据量有多大?

核心合成数据集 7,500 段视频(800 个 RenderPeople 模型 × 200 段 CMU 动作),深度补充 TartanAir、Virtual KITTI、MVS Synth,指代分割用 MeViS/Ref-COCO/YouTube-VOS;14B 模型全部训练帧约 1.23M,仅为 D4RT 的约 1/70。

为什么联合训练会损害 3D 关键点?

token 式坐标回归偏离连续像素空间预训练,且从零训练的可学习 token 会扰乱预训练 DiT 层的原生注意力机制------说明后训练应最小化对预训练骨干的架构改动。

GenCeption 开源吗?

论文基于开源的开源权重文生视频模型 WAN 2.1,但 GenCeption 本身暂未发布权重与代码;项目页面(genception.github.io)提供更多演示与细节。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

相关推荐
杀生丸学AI2 天前
【三维重建】QuerySplat:在 3DGS 预测中解耦几何与外观表征
人工智能·3d·三维重建·扩散模型·高斯泼溅·空间智能·室内重建
白拾8 天前
【arXiv 2026】Nemotron-Labs-Diffusion:三模式语言模型 统一自回归、扩散与自推测解码|从大模型推理加速视角
大模型·推理加速·扩散语言模型·并行解码·自推测解码·arxiv 2026
爱知菜10 天前
Transformer vs Diffusion:为什么扩散模型更擅长捕捉细节?
人工智能·深度学习·transformer·扩散模型
数据猎手小k11 天前
首个将EDM2扩散架构引入胎儿超声:512×512高分辨率合成使下游分类准确率达93.36%-UltrasoundEDM2
扩散模型·胎儿超声·edm2·合成数据增强·临床评估
杀生丸学AI11 天前
【前馈三维重建】AdaptiveSplat:前馈重建的纹理感知可控3DGS分配方法(ECCV 2026)
3d·三维重建·扩散模型·视觉大模型·高斯泼溅·前馈模型·大场景重建
白拾14 天前
【arXiv 2025】开源视频生成大模型 Wan 2.1|从视频生成开源基座视角
扩散模型·论文分享·视频生成·开源大模型·wan 2.1 论文分享·dit 架构·arxiv 2025
白拾16 天前
【RSS 2025】统一世界模型:耦合视频与动作扩散的机器人预训练|从扩散时间步设计视角
扩散模型·世界模型·模仿学习·rss 2025·uwm 论文分享·机器人预训练
科研小刘带你玩学术17 天前
【学术干货】CVPR论文解析:扩散模型如何推动生成式人工智能进入新时代?
人工智能·深度学习·计算机视觉·生成式ai·扩散模型