【arXiv 2026】GenCeption:视频生成模型是通用视觉学习者|从生成式视觉预训练范式视角

摘要

本文解读 arXiv 2026 论文《Video Generation Models are General-Purpose Vision Learners》。该论文提出 GenCeption ,把大规模文生视频扩散模型改造为单步前馈 的通用视觉感知模型,通过统一 RGB 表示 、可学习 token 与统一 L_2 损失 ,让 8 类稠密/稀疏任务共用一个骨干与解码器,其特别之处在于仅用纯合成视频数据训练,即全面超越各任务专用 SOTA。实验表明法向 Hi4D mAE 10.99、深度 Goliath AbsRel 0.008、指代分割 MeViS J&F 70.0,且数据效率达 7\\times-500\\times,为计算机视觉的生成式预训练范式提供了系统性证据。

视频讲解 :点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) Video Generation Models are General-Purpose Vision Learners
标题(中文) 视频生成模型是通用视觉学习者
作者 Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu
机构 Google DeepMind · U. Toronto · UCL · Oxford · MIT · Lund
会议 arXiv 2026
arXiv https://arxiv.org/abs/2607.09024
项目网站 https://genception.github.io

背景与动机

NLP 靠 next-token prediction 从任务专用模型收敛为通用基础模型;计算机视觉却仍停留在"专用模型"阶段------SAM 系列 管分割、Depth Anything 系列 管深度,每个任务都要定制架构。作者提出,通用视觉预训练需满足三条准则:时空演化 (内化 4D 因果与物理)、视觉-语言对齐 (原生继承指令跟随)、可规模化(数据与算力可扩展)。

现有工作各有短板:MAE/VideoMAE、DINO 等自监督表征缺少显式多模态对齐;CLIP/SigLIP 对齐了图文却难做视频级表征且规模受限;扩散复用路线(Marigold 、GenPercept 、Diception )多为单图单任务且依赖多步采样;视频侧 DepthCrafter/NormalCrafter 聚焦单一稠密任务;同期工作 Vision Banana 只覆盖二维图像空间。GenCeption 的关键差异是:原生视频域 + 单步前馈 + 稠密/稀疏任务统一,在标准 benchmark 上全面超越专用 SOTA。

研究主线:从问题到结论

图 12:GenCeption 研究主线------从"视频生成"到"通用感知"(Mermaid 流程图)

基准/方法设计

GenCeption 的方法论由三条原则驱动:

  1. 多模态生成预训练即表征学习------文生视频扩散模型作通用骨干,生成高保真视频强制内化时空先验、3D 几何与物理规律,同时原生对齐视觉语言概念;为保留先验,最大化兼容原预训练范式、最小化改动。
  2. 任务无关的统一后训练------把感知任务视为统一的序列到序列映射,稠密任务输出编码进标准 RGB 空间(\[0,1\]),文本提示切换任务,单骨干单解码器单损失。
  3. 前馈重构------把多步迭代采样改造成单步确定性预测,兼顾精度与效率。

图 1:方法总览------视频生成模型作预训练基座(左),多任务后训练为前馈感知模型;右图为从专用模型到通用模型的范式转移

分类全景

图 13:GenCeption 任务分类------稠密任务统一进 RGB 空间,稀疏任务由可学习 token 承载(Mermaid 流程图)

方法细节

前馈重构:干净视频潜在 x_0 直接输入 DiT,时间步固定 t=0(Rectified Flow 终止点);DiT 输出速度 v = \\epsilon - x_0,取负后 -v = x_0 - \\epsilon 更接近目标潜在,加速收敛。本质是把 DiT 重铸为特征提取器,特征直接取自最后一层,与解码器原生对齐。

稠密任务统一到 RGB:深度/分割单通道复制为三通道,法向/DensePose 天然三维;相机位姿以像素级 raymap 表示(6 通道),通过空间分区------中心放射线原点、四周放射线方向------压缩进 3 通道,保持单解码器框架。

稀疏任务用可学习 token:每帧追加一个可学习 query token,经 MLP 解码为 K 维坐标;沿用原生 3D RoPE(空间位置可学习),时间位置用插值压缩到预训练所见范围,优于额外注意力层方案。

数据级消歧:深度按场景中值归一化,再用非线性映射 d' = \\mathrm{clip}(\\alpha \\log(d+1), 0, 1) 压到 RGB 范围,彻底免去 scale-invariant 等专用损失------任务差异化全部下沉到数据表示。

合成数据管线:800 个 RenderPeople 模型 × 200 段 CMU 动作,Blender 多渲染通道生成 7,500 段视频,同时产出法向、深度、分割、2D/3D 关键点真值;离线预计算视频/文本潜在加速训练。训练补充 TartanAir、Virtual KITTI、MVS Synth(深度),指代分割用 MeViS/Ref-COCO/YouTube-VOS 真实数据。

图 2:架构总览------输入视频 + 文本提示,一次前向输出目标模态;稠密任务在 RGB 潜在空间监督,稀疏任务由可学习 token 承载

图 3:"Rothko" Raymap------把相机位姿的六通道射线数据压缩进标准 3 通道 RGB

训练配置:WAN 2.1 基座(1.3B/14B),480×832 分辨率、81 帧 @24fps;batch 64 × 256 v6e TPU,Adam lr 5e\^{-5},15,000 步,250 步 warmup;gradient clipping + gradient dropping 保证稳定。

实验设计与结果

评测协议:法向用 Hi4D(Sapiens/DAVID 协议,1,195 帧)与 SINTEL;深度用 KITTI/SINTEL/ETH3D/Goliath(DAVID 子集 2.2k 帧);相机位姿用 SINTEL(ATE/RPE-T/RPE-R);前景分割用 VideoMatte/PhotoMatte 85/PPM-100(MSE);指代分割用 RefVOS-DAVIS 与 MeViS(J&F);3D 关键点用 EMDB(MPJPE)。除指代分割外全部纯合成数据训练,未使用任何评测集训练数据。

与专用 SOTA 对比主表:

任务(指标↓) 最强专用 GenCeption L 胜出幅度
法向 Hi4D (mAE) Sapiens 12.14 10.99 -1.15
法向 SINTEL (mAE) Lotus-2 30.3 29.3 -1.0
深度 SINTEL (AbsRel) D4RT 0.148 0.130 -12%
深度 Goliath (AbsRel) DepthAnything 3 0.012 0.008 -33%
相机位姿 SINTEL (ATE) VGGT-Ω 0.057 0.050 -12%
指代分割 MeViS (J&F) ReferEverything 60.3 70.0 +16%
3D 关键点 EMDB (MPJPE) Genmo 73.0 71.8 -1.2
前景分割 VideoMatte (MSE) RVM 0.0010 0.0010(Generalist) 持平

预训练范式与缩放(深度平均 AbsRel):

方法 规模 训练帧数 Avg AbsRel↓
V-JEPA - H 0.6B 0.9M 0.281
VideoMAE V2 - G 1B 0.9M 0.154
Ours - WAN 2.1 - S 1.3B 0.9M 0.122
Ours - WAN 2.1 - L 14B 0.9M 0.093
DepthAnything 3 - G 1.15B ~200M 0.096
D4RT 1B ~86M 0.082
VGGT-Ω 1B ~600M 0.067
Ours - WAN 2.1 - L (4 数据集) 14B 1.23M 0.071

图 4:能力总览------法向、深度、前景分割、指代分割、稠密人体语义、2D/3D 关键点、相机位姿,仅训练于合成人体视频却泛化到动物与卡通角色

图 5:左:通用能力雷达图------匹配或超越各任务专用模型;右:深度估计数据效率------7\\times-500\\times 更少训练数据达到同等性能

图 6:预训练迁移消融------迁移预训练层数越多性能越高,随机初始化 DiT 学习曲线近乎平坦

图 7:深度与表面法向估计定性结果(首帧)

图 8:指代分割定性结果------识别物体、颜色、空间关系与运动,并分割未见类别

图 9:涌现泛化(a)------训练数据单物体,零样本迁移到真实多人场景

图 10:涌现泛化(b)------仅训练人体类别,泛化到猫等未见类别

图 11:3D 姿态估计------滑雪/单板视频(每 10 帧取一帧),无需人体检测或 2D 关键点预处理

推理成本:1.3B 模型 81 帧 480×832 单次前向 5.92s @ 13.6 FPS(DiT 0.96s)、15.3GB 显存;14B 模型 10.03s @ 8.0 FPS(DiT 5.11s)、42.8GB 显存------对比 WAN 2.1 原版 50 步扩散采样,推理成本降低约一个数量级。

结果对比总结

图 14:GenCeption 与各任务专用 SOTA 的对比总结(Mermaid 流程图)

关键发现

  • 生成式预训练范式完胜:同数据同规模下,WAN 2.1 生成式预训练平均 AbsRel 0.093(14B),大幅优于 V-JEPA 的 0.281 与 VideoMAE V2 的 0.154------关键在生成目标本身,而非数据集或规模。
  • 数据效率惊人:14B 模型用 1.23M 帧达到 VGGT-Ω(约 600M 帧)同级水平,即 7\\times-500\\times 更少训练数据;D4RT(约 86M 帧)同样被 1.23M 帧追平。
  • 缩放性质初现:1.3B → 14B、数据翻倍,深度误差单调下降;从零训练 DiT 曲线近乎水平,预训练层数越多收敛越好。
  • 涌现行为显著:纯合成人体视频训练,零样本迁移到真实多人场景与猫、机器人等 OOD 类别,猫胡须等细节甚至超过训练数据画质。
  • 联合训练有代价:前景分割受益于多任务联合训练,但 3D 关键点 MPJPE 明显退化------token 坐标回归偏离像素空间先验,可学习 token 干扰原生注意力。
  • 推理效率数量级提升:14B 单次前向 DiT 5.11s,对比 50 步扩散采样,成本降低约一个数量级。

局限性

  • 稀疏任务退化:联合训练使 3D 关键点明显变差------token 回归与像素空间预训练本质相悖,可学习 token 从零训练破坏预训练注意力。
  • 合成域依赖:训练数据以人体为中心,背景与物体多样性受限;指代分割仍需 MeViS/Ref-COCO/YouTube-VOS 等真实数据补充。
  • 分辨率与显存开销:480×832 输入,14B 模型单次前向需 5.11s 与 42.8GB 显存,虽比 50 步扩散快得多仍非实时。
  • 并发竞争:与 Vision Banana、Wiedemer et al. 等工作同期,范式归属与基准差异需后续检验。
  • 作者展望:后训练应最小化对预训练骨干的架构改动,或从根本上重新设计预训练目标以原生容纳多样化下游任务。

常见问题(FAQ)

GenCeption 和 Vision Banana 有什么区别?

两者同为"生成模型是通用视觉学习者"的同期工作,但 Vision Banana 只覆盖二维图像空间且采用多步生成,GenCeption 扩展到原生视频域、采用单步前馈架构,并在更广泛的任务谱系上做了定量评测。

为什么视频生成预训练比 CLIP、MAE 更好?

因为生成高保真视频强制模型内化时空因果、3D 几何与物理交互,且文本条件生成天然对齐视觉-语言语义;CLIP 等对比方法缺时空建模,MAE 等掩码方法缺模态对齐,且视频表征模型规模普遍小一个量级。

相机位姿怎么编码进 RGB 图像?

采用像素级 raymap:每个像素记录一条射线的原点与方向(共 6 通道),通过空间分区------中心放射线原点、四周放射线方向------压缩进标准 3 通道 RGB,保持单解码器框架不变。

GenCeption 训练数据量有多大?

核心合成数据集 7,500 段视频(800 个 RenderPeople 模型 × 200 段 CMU 动作),深度补充 TartanAir、Virtual KITTI、MVS Synth,指代分割用 MeViS/Ref-COCO/YouTube-VOS;14B 模型全部训练帧约 1.23M,仅为 D4RT 的约 1/70。

为什么联合训练会损害 3D 关键点?

token 式坐标回归偏离连续像素空间预训练,且从零训练的可学习 token 会扰乱预训练 DiT 层的原生注意力机制------说明后训练应最小化对预训练骨干的架构改动。

GenCeption 开源吗?

论文基于开源的开源权重文生视频模型 WAN 2.1,但 GenCeption 本身暂未发布权重与代码;项目页面(genception.github.io)提供更多演示与细节。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群 :白拾的小屋 (750365700)

⭐B站账号 :白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页 :YhbCode000(工程文件)

相关推荐
风巽·剑染春水1 天前
【扩散模型原理】(六)A Unified and Systematic Lens on Diffusion Models(2)
人工智能·生成模型·diffusion·扩散模型
风巽·剑染春水1 天前
【扩散模型原理】(六)A Unified and Systematic Lens on Diffusion Models(1)
人工智能·生成模型·diffusion·扩散模型
智码看视界2 天前
开源大模型追踪:Qwen-Image-2.1 :7B 视觉生成模型开源榜登顶 60.28,原生 RGBA 透明出图
扩散模型·图像生成·本地部署·开源大模型·qwen-image-2.1·rgba透明
这张生成的图像能检测吗3 天前
(论文速读)一种用于图像超分辨率的有效扩散变换结构
人工智能·计算机视觉·扩散模型·超分辨率
这张生成的图像能检测吗3 天前
(论文速读)FCDM:ConvNeXt 也能做高效扩散模型,卷积网络重新挑战 DiT
扩散模型·图像生成·卷积
Rocky Ding*4 天前
深入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、Qwen-Image、GLM-Image核心基础知识
论文阅读·人工智能·深度学习·机器学习·aigc·扩散模型·ai-native
山顶夕景4 天前
【VLA】Qwen-VLA:VLM+DiT统一多模态理解与连续机器人动作生成
机器人·多模态·扩散模型·具身智能·vla·dit·vlm
一穷二白到年薪百万10 天前
【流匹配模型Flow Maching】流匹配模型入门理解(3)
扩散模型
梦想的初衷~11 天前
深度学习全栈技术复盘:PINN科学计算、Transformer多场景建模、GNN时空网络与强化学习工业实战
深度学习·transformer·扩散模型·遥感影像处理·图神经网络gnn·pytorch实战·pinn正反问题
风巽·剑染春水11 天前
【医学AI前沿】(NPJ-DM-2026)利用身份保持去噪扩散生成对抗网络预测阿尔茨海默病进展
人工智能·生成对抗网络·扩散模型·mri