技术栈

genception 论文分享

白拾
3 天前
扩散模型·前馈模型·arxiv 2026·genception 论文分享·视频生成预训练·通用视觉感知
【arXiv 2026】GenCeption:视频生成模型是通用视觉学习者|从生成式视觉预训练范式视角本文解读 arXiv 2026 论文《Video Generation Models are General-Purpose Vision Learners》。该论文提出 GenCeption,把大规模文生视频扩散模型改造为单步前馈的通用视觉感知模型,通过统一 RGB 表示、可学习 token与统一 $L_2$ 损失,让 8 类稠密/稀疏任务共用一个骨干与解码器,其特别之处在于仅用纯合成视频数据训练,即全面超越各任务专用 SOTA。实验表明法向 Hi4D mAE 10.99、深度 Goliath AbsR
我是有底线的