Emu3大模型深度解析:下一Token预测如何统一图像、视频与理解,以及它尚未解决的问题

写在前面

欢迎大家关注Rocky的知乎:Rocky Ding

《三年面试五年模拟》AIGC/LLM/AI Agent算法工程师/开发工程师求职面试秘籍独家资源:【三年面试五年模拟】WeThinkIn/AIGC-Interview-Book,欢迎大家Star~

Rocky最新撰写的10万字AI Agent(AI智能体)深入浅出全维度解析文章: 深入浅出完整解析AI Agent(AI智能体)的核心基础知识

AIGC/LLM/AI Agent算法岗/开发岗求职面试内推学习社群 (涵盖AIGC、LLM大模型、AI Agent、传统深度学习、自动驾驶、机器学习、计算机视觉、自然语言处理、强化学习、大数据挖掘、具身智能、元宇宙、AGI等AI行业最新面试干货经验与核心知识)欢迎大家加入:https://t.zsxq.com/33pJ0


大家好,我是Rocky。

1. 核心判断:Emu3验证了统一建模的可行性,系统成本仍然需要逐项计算

当一个模型既能看图回答,又能根据文字画图,还能沿着已有视频继续生成,人们很容易把能力归因于某个"万能架构"。Emu3更值得研究的地方,是它把这些任务重新写成了同一种统计问题:给定已经出现的多模态token,预测下一个token。

这一步看起来简单,实际改变了系统的组织方式。图像不再只是外接视觉编码器输出的一段条件特征,视频也不再必须通过独立的扩散主干完成生成。经过离散化,文字、图像和视频都可以进入同一个Transformer的序列建模接口,交叉熵、上下文学习和偏好优化也有了共享的操作对象。

但统一接口不会自动消除信息压缩、长序列推理、数据分布和评测口径的困难。理解Emu3,需要同时保留两个判断:其8B自回归主干证明了下一token预测能够承担多种视觉任务;论文中的全部最终结果,并不能被简化为"一个相同检查点、一个裸模型、一个统一评测协议的全面胜利"。

图1展示文字、图像和视频经过token化后进入同一个Transformer,再由对应解码过程恢复输出。这里统一的是主干建模接口;视觉tokenizer仍然有编码器与解码器。

本文以2024年技术报告《Emu3: Next-Token Prediction is All You Need》的v1版本为研究对象。所有横向成绩均保留该版本的模型和评测范围,不将它们解释为当前产品排行榜。

2. Emu3的统一架构,究竟统一了什么

典型视觉语言系统把预训练视觉编码器接到语言模型上,用视觉特征帮助语言生成;典型图像生成系统则把文本条件输入扩散网络。二者的训练目标、表示空间与输出接口并不天然相同。

Emu3采取了一条更直接的路线:先将视觉内容离散化,再让一个从头训练的decoder-only Transformer学习联合序列。用便于理解的记号表示,其概率分解为:

p θ ( s 1 , ... , s L ) = ∏ i = 1 L p θ ( s i ∣ s < i ) . p_\theta(s_1,\ldots,s_L)=\prod_{i=1}^{L}p_\theta(s_i\mid s_{<i}). pθ(s1,...,sL)=i=1∏Lpθ(si∣s<i).

这是对论文建模机制的数学展开,论文没有为其单独编号。 s i s_i si可以是文本token、视觉token,也可以是标记模态边界与空间结构的特殊token。模型不会因为输出对象从文字换成图像,就改用另一套主干生成目标。

这种统一至少包含三层含义:相同的序列接口、相同的下一token训练目标、相同类型的Transformer主干。它不要求所有模态共用同一个前端tokenizer,也不意味着所有后训练目标最终汇聚为同一个权重文件。论文对视觉生成和视觉理解分别执行后训练,因此解释评测时必须区分任务分支。

图2将图像生成的人类评价、理解任务的12项指标平均值,以及视频的VBench结果放在一起。三组柱状图使用不同评价量纲;OCRBench还经过归一化。可以用它观察各任务内部的相对位置,不能把三组数值直接相加,得到一个所谓"通用智能分数"。

Emu3采用QwenTokenizer处理文字,但语言主干从头训练。使用Qwen的文本分词器,不等于继承Qwen语言模型的预训练知识。类似地,论文将Emu3归入"encoder-free",指不依赖CLIP式预训练语义视觉编码器;它仍然拥有学习得到的视觉编码与重建模块。

3. Emu3视觉tokenizer:统一能力之前,先确定信息瓶颈

视觉tokenizer以SBER-MoVQGAN-270M为基础,在编码器和解码器中增加使用3D卷积的时序残差层,使同一个视觉表示体系支持图像与视频。其码本包含32,768个离散项,latent size为4,时间与空间压缩比例为 4 × 8 × 8 4\times8\times8 4×8×8。

表1|视觉tokenizer配置。 表中的270M属于tokenizer初始化权重的命名,不能与8B主干参数量混淆。

配置项 Vision tokenizer
Pretrained Weights SBER-MoVQGAN-270M
Codebook Size 32768
Latent Size 4
Compression 4 × 8 × 8

以 512 × 512 512\times512 512×512图像为例,空间下采样后得到 64 × 64 64\times64 64×64网格,即4,096个视觉token。论文同样报告,一个包含4帧、每帧 512 × 512 512\times512 512×512的视频片段可以压缩为4,096个视觉token。这里的latent维度4与码本大小32,768分别描述向量表示维度和离散选择数量,并不是每个位置同时生成32,768个token。

对整除压缩比例的视频,忽略边界处理与特殊标记,token数量可以近似写为:

N v i d e o ≈ T 4 H 8 W 8 . N_{\mathrm{video}}\approx\frac{T}{4}\frac{H}{8}\frac{W}{8}. Nvideo≈4T8H8W.

这只是规模估算。实际序列还包含行末、帧末、分辨率和文本条件等信息。以120帧、 512 × 512 512\times512 512×512作估算,仅视觉token就约为122,880个。这解释了为什么Emu3的视频训练需要131,072的上下文长度:视频的连续运动,在自回归主干中对应着相当庞大的离散序列。

图3比较原始内容与tokenizer重建。左侧视频为 540 × 960 540\times960 540×960,展示从30 FPS内容中抽出的8帧;右侧为 512 × 512 512\times512 512×512图像。这是表示压缩后的重建能力展示,不能直接解释成文字条件生成能力。

表2|视频压缩的重建指标。 LPIPS越低越好,PSNR和SSIM越高越好。

视频分辨率 LPIPS ↓ PSNR ↑ SSIM ↑
128 × 128 0.099 21.71 0.630
256 × 256 0.109 21.59 0.622
512 × 512 0.112 22.69 0.690
720 × 720 0.110 24.30 0.771

该评测使用3,172段Pexels视频,按5秒内容重建,保持宽高比,并在评测时执行规定的缩放、裁剪和抽帧。不同分辨率行不能脱离该预处理协议理解。重建指标揭示的是:主干尚未预测任何token之前,系统已经存在一个由视觉压缩决定的质量上限。

tokenizer使用L2、LPIPS、GAN及commitment loss联合训练。像素误差约束局部还原,感知与对抗目标改善视觉质量,commitment约束连续编码与码本的关系。主干使用单一交叉熵目标,不代表整个训练链条只有一个损失函数。

4. Emu3主干与序列格式:把空间和时间写进上下文

Emu3采用8B decoder-only主干,使用RMSNorm、GQA、SwiGLU和RoPE,移除QKV及线性投影偏置,并设置0.1的dropout。32个查询头与8个KV头意味着多个查询头共享键值表示,这有助于控制长序列推理时的KV Cache开销。

表3|Emu3主干配置。

配置项 Emu3
Parameters 8B
Layers 32
Hidden Size 4096
Intermediate Size 14336
Heads 32
KV Heads 8
Vocabulary Size 184622
RoPE Base 1000000
Context Length 131072

训练样本按照下列格式组织:

text 复制代码
[BOS] caption text [SOV] meta text [SOT] vision tokens [EOV] [EOS]

其中,meta text用普通文字描述分辨率,视频还包含帧率、时长。视觉token内部插入[EOL]和[EOF],分别标记行结束与帧结束。对于理解任务,部分数据把caption移到视觉内容之后,训练模型读取图像再生成文字。

这一设计的本质,是用序列顺序表达条件关系:文字在前,模型学习条件视觉生成;视觉在前,模型学习条件语言生成。任务转化依赖数据排列与监督位置,而不是另写一套任务专用网络。

但因果顺序也带来成本。一个视觉token只能利用序列中已经生成的内容,无法直接读取尚未生成的后续位置。高分辨率与长视频增加的不仅是最终输出大小,还包括连续决策步数、注意力上下文和缓存占用。131K上下文长度证明训练能处理这种规模,不意味着131K长度的生成已经便宜或实时。

5. Emu3数据与预训练:简单目标背后的数据工程

Emu3的文本数据沿用Aquila体系中的中英文高质量语料。图像数据包含公开网络数据、AI生成数据及内部高质量数据,既考虑分辨率和审美,也专门补充图表、表格和富文本图像。

图像过滤先排除低分辨率内容,再使用LAION审美预测器。对于未通过审美筛选的样本,进一步结合文字检测与颜色过滤,保留有理解价值的开放世界内容。这说明"适合生成的漂亮图片"与"适合理解的有效图片"不是完全重合的数据集合。

标注链条同样关键:约100万对GPT-4V图像描述用于微调Emu2-17B captioner,然后利用该模型批量生成细致描述,并通过vLLM加速。主干从头训练,仍然可以通过合成标注间接吸收已有视觉语言模型提供的监督;不应把"没有预训练LLM初始化"扩展为"整个训练过程没有使用外部模型知识"。

视频经过镜头切分、文字覆盖筛选、光流过滤和审美筛选。低运动可能缺乏有效时序信息,极端运动则可能对应转场、镜头不稳定或难以学习的噪声。用于筛选的低帧率抽样,也不等于模型训练或生成只有同样的帧率。

图9给出过滤后视频的时长分布。数据中不同长度的比例会影响模型接触的时间跨度,不能单凭最长样本推断长时一致性。

图10展示过滤后的光流分数分布。光流分数以平均像素运动幅度除以短边长度,降低不同分辨率对筛选阈值的影响;它是运动强度代理量,并不直接衡量动作是否符合物理规律。

预训练分两阶段:首先使用文字和图像,从零开始以5,120上下文训练;随后加入视频,将上下文扩展至131,072。两阶段均使用 5 × 10 − 5 5\times10^{-5} 5×10−5学习率并余弦衰减至零,通过张量并行、上下文并行和数据并行协同训练。样本packing时避免切断完整图像。

视觉token远多于文本token,若所有位置同权,优化过程可能被视觉重建相关预测主导。论文将视觉token的交叉熵权重设为0.5。将其写成便于讨论的形式:

L p r e t r a i n = − ∑ i = 1 L w i log ⁡ p θ ( s i ∣ s < i ) , w i = { 0.5 , s i 为视觉token , 1 , 其他受监督位置 . \mathcal L_{\mathrm{pretrain}}=-\sum_{i=1}^{L}w_i\log p_\theta(s_i\mid s_{<i}),\qquad w_i=\begin{cases}0.5,&s_i\text{为视觉token},\\1,&\text{其他受监督位置}.\end{cases} Lpretrain=−i=1∑Lwilogpθ(si∣s<i),wi={0.5,1,si为视觉token,其他受监督位置.

这揭示了统一目标下依然存在的资源分配问题:同一种损失形式可以覆盖多种模态,但不同模态对优化的贡献仍需要校准。论文没有给出足够完整的全部数据规模、混合配比和训练成本明细,因此不能仅凭架构表复原完整预训练预算。

6. Emu3后训练:生成、理解与偏好不是同一件事

生成分支先进行Quality Fine-Tuning(QFT)。图像质量筛选结合HPSv2.1、MPS与LAION审美分数,监督仅施加在视觉token上,并将训练图像分辨率由512提升至720。视频数据也经过更严格的分辨率和光流筛选。

随后进行DPO。每条用户提示生成8---10个候选,由3名评价者考虑视觉吸引力和提示词对齐度,挑选最高和最低评分样本构成偏好对。训练直接保留生成时的token,避免把图像重新编码引入重建差异。最终联合使用DPO损失与下一token交叉熵。

为了说明其机制,标准DPO可表达为下式;这是概念解释,不表示论文公开了全部实现超参数:

L D P O = − E log ⁡ σ β ( log ⁡ π θ ( x + ∣ p ) π r e f ( x + ∣ p ) − log ⁡ π θ ( x − ∣ p ) π r e f ( x − ∣ p ) ) . \mathcal L_{\mathrm{DPO}}=-\mathbb E\log\sigma\left\\beta\\left(\\log\\frac{\\pi_\\theta(x\^+\\mid p)}{\\pi_{\\mathrm{ref}}(x\^+\\mid p)}-\\log\\frac{\\pi_\\theta(x\^-\\mid p)}{\\pi_{\\mathrm{ref}}(x\^-\\mid p)}\\right)\\right. LDPO=−Elogσβ(logπref(x+∣p)πθ(x+∣p)−logπref(x−∣p)πθ(x−∣p)).

p p p是提示词, x + x^+ x+与 x − x^- x−分别为偏好和非偏好视觉序列。DPO推动模型相对参考策略提高优选序列的概率,并不保证每一个外部自动评测指标都同步提高。

理解分支则采用另外的两阶段后训练:先混合图像理解和纯文本数据,忽略视觉token损失,只监督文字预测;再用视觉问答指令调优。第一阶段图像约为 512 × 512 512\times512 512×512;第二阶段按长宽比保留分辨率,过小或过大的图像分别调整到512与1,024的规定边界。

这里最容易出现的误读,是把生成分支、DPO分支和理解分支的最优成绩拼成一个完全相同检查点的能力表。 Emu3报告支持的是共同建模路线下多个后训练分支的有效性,而非由这些实验直接证明所有能力可以无代价地同时最优。

7. Emu3图像生成:从完整表格识别真正的增益

表4|图像生成主表。 †表示使用提示词改写;FID越低越好,其余展示指标通常越高越好。文本预训练列沿用该报告的比较口径,不能据此推导各模型完整系统参数。

方法 文本预训练 COCO CLIP-I COCO CLIP-T COCO FID ↓ GenEval CompBench Color Shape Texture DPG
SDv1.5 CLIP ViT-L/14 0.667 0.302 9.93 0.43 0.3730 0.3646 0.4219 63.18
DALL-E 2 CLIP ViT-H/16 - 0.314 10.93 0.52 0.5750 0.5464 0.6374 -
SDv2.1 CLIP ViT-H/14 - - - 0.50 0.5694 0.4495 0.4982 -
SDXL CLIP ViT-bigG 0.674 0.310 - 0.55 0.6369 0.5408 0.5637 74.65
PixArt-alpha Flan-T5-XXL - - 7.32 0.48 0.6886 0.5582 0.7044 71.11
DALL-E 3 Flan-T5-XXL - 0.320 - 0.67† 0.8110 0.6750 0.8070 83.50
SD3 Flan-T5-XXL - - - 0.74 - - - -
Emu LLaMA-7B 0.656 0.286 11.6 - - - - -
Show-o Phi-1.5 - - 9.24 0.53 - - - -
Transfusion - - - 6.78 0.63 - - - -
Chameleon - - - 26.74 0.39 - - - -
LlamaGen FLAN-T5 XL - - - 0.32 - - - -
Emu3 - 0.689 0.313 12.8 0.66† 0.7913† 0.5846† 0.7422† 80.60
Emu3-DPO - 0.680 0.312 19.3 0.64† 0.7544† 0.5706† 0.7164† 81.60

表4中最醒目的数值是Emu3的GenEval 0.66与Emu3-DPO的0.64,但两者都使用GPT-4V改写。Emu3训练时大量使用密集描述,对极短提示词的适应性与对详细提示词的能力不同。因此,改写可以被视为系统性能的一部分,却不能隐藏在模型本体分数背后。

表7|GenEval与T2I-CompBench全部分项。 保留原有整体结果及有无Rewriter两组结果;紧邻各Emu3行的+ Rewriter分别对应其上一行模型。

方法 GenEval总分 单对象 双对象 计数 颜色 位置 颜色属性 CompBench Color Shape Texture
DALL-E 2 0.52 0.94 0.66 0.49 0.77 0.10 0.19 0.5750 0.5464 0.6374
SDv1.5 0.43 0.97 0.38 0.35 0.76 0.04 0.06 0.3730 0.3646 0.4219
SDv2.1 0.50 0.98 0.51 0.44 0.85 0.07 0.17 0.5694 0.4495 0.4982
SDXL 0.55 0.98 0.74 0.39 0.85 0.15 0.23 0.6369 0.5408 0.5637
PixArt-alpha 0.48 0.98 0.50 0.44 0.80 0.08 0.07 0.6886 0.5582 0.7044
DALL-E 3 0.67 0.96 0.87 0.47 0.83 0.43 0.45 0.8110 0.6750 0.8070
SD3 0.74 0.99 0.94 0.72 0.89 0.33 0.60 - - -
Show-o 0.53 0.95 0.52 0.49 0.82 0.11 0.28 - - -
Transfusion 0.63 - - - - - - - - -
Chameleon 0.39 - - - - - - - - -
LlamaGen 0.32 0.71 0.34 0.21 0.58 0.07 0.04 - - -
Emu3 0.54 0.98 0.71 0.34 0.81 0.17 0.21 0.6107 0.4734 0.6178
+ Rewriter 0.66 0.99 0.81 0.42 0.80 0.49 0.45 0.7913 0.5846 0.7422
Emu3-DPO 0.52 0.98 0.69 0.33 0.78 0.15 0.16 0.5514 0.4641 0.5476
+ Rewriter 0.64 0.99 0.76 0.38 0.85 0.45 0.40 0.7544 0.5706 0.7164

在没有改写时,Emu3的GenEval是0.54,SDXL是0.55;使用改写后Emu3提高到0.66。因此,"Emu3在GenEval超过SDXL"必须绑定改写协议。与此同时,位置分项由0.17提高到0.49、颜色属性由0.21提高到0.45,也揭示了一条工程线索:表达清楚条件,可能显著改变模型对关系约束的满足程度。

改写与基础能力之间不能画等号。它可能补充描述,也可能改变用户原意。部署时应记录原始提示、改写提示以及最终图像,分别检查约束保持和生成质量,而不是只观察改写后的总分。

Emu3-DPO未经改写的GenEval为0.52,使用改写后为0.64,均低于对应Emu3结果;COCO FID也从12.8变为19.3。偏好优化没有带来所有指标的单调改进。这不等于DPO无效,而是说明偏好目标与评测器关注的能力并不重合。

表8|DPG-Bench全部结果。 DPG强调较长描述中的细粒度条件满足,其总体评分不应按表内五个分项直接求简单平均。

方法 DPG总分 Global Entity Attribute Relation Other
SDv1.5 63.18 74.63 74.23 75.39 73.49 67.81
SDXL 74.65 83.27 82.43 80.91 86.76 80.41
PixArt-alpha 71.11 74.97 79.32 78.60 82.57 76.96
Playground v2.5 75.47 83.06 82.59 81.20 84.08 83.50
Lumina-Next 74.63 82.82 88.65 86.44 80.53 81.82
Hunyuan-DiT 78.87 84.59 80.59 88.01 74.36 86.41
PixArt-Sigma 80.54 86.89 82.89 88.94 86.59 87.68
DALLE 3 83.50 90.97 89.61 88.39 90.58 89.83
SD3-Medium 84.08 87.90 91.01 88.83 80.70 88.68
Playground v3 87.04 91.94 85.71 90.90 90.00 92.72
Emu3 80.60 85.21 86.68 86.84 90.22 83.15
Emu3-DPO 81.60 87.54 87.17 86.33 90.61 89.75

DPG上Emu3为80.60,Emu3-DPO为81.60,高于表中的SDXL 74.65,但低于DALL-E 3的83.50、SD3-Medium的84.08和Playground v3的87.04。严谨的结论是:Emu3在该版本比较范围内具有较强的长提示词对齐能力,DPO进一步改善了这一整体指标;现有证据不支持"全面领先所有扩散模型"。

评测配置还影响可比性:Top-k为16,384,Top-p为1.0;GenEval每条提示生成4张图、CFG为5.5;CompBench生成10张、CFG为5.0;DPG生成4张、CFG为5.0。COCO采用30K提示和CFG 5.0,但DALL-E 2/3的CLIP-T来自4,096样本。跨模型列举成绩时,需要保留这些不同的样本与来源协议。

8. Emu3人类偏好:自动评测下降,为什么体验仍可能改善

图4展示25张不同题材、比例和风格的生成样例。它帮助判断视觉多样性,不能代替随机采样失败率或严格的提示词满足评测。

图5基于100条用户提示及每条3名独立评价者,比较视觉质量与提示词遵循的加权评分。它呈现该提示集合上的偏好结果,并非线上全部场景的产品优劣排序。中英文提示还对应不同任务分布,不能只看一个平均柱形便断言跨语言能力完全一致。

图6给出的视觉质量分由60.6提高到61.6,提示对齐分由52.3提高到57.3。这些数值与GenEval、FID不是相同量纲。它们共同表明:偏好训练可以改善人类关心的部分体验,同时牺牲另一些自动指标。

这里还需要一个因果边界。附录中Emu3输出分辨率为 512 × 512 512\times512 512×512,Emu3-DPO为 720 × 720 720\times720 720×720。因此,不能把两个最终系统之间的所有视觉变化都纯粹归因于DPO算法。若要判断偏好训练的独立贡献,需要固定分辨率、数据、采样参数和评价协议进行对照。

Rocky认为,偏好优化真正有价值的场景,是团队已经明确"用户愿意接受什么样的输出"。若只把它当作让所有榜单一起上涨的通用按钮,就会忽略目标冲突,也无法解释上线后的体验回归。

9. Emu3视频生成:序列统一成立,完整系统仍包含后处理

图7以抽帧方式展示人物、自然景观和动画等视频。论文报告原生支持5秒、24 FPS视频;展示图截取前3秒中的若干帧。抽帧能呈现场景变化,但无法直接检验完整播放时的闪烁、局部抖动与连续动作质量。

表5|VBench完整比较。 保留所列11个子指标及总分,均按越高越好的方向阅读。总分来自VBench协议,不能用这11列直接重算完整16维评估。

模型 类型 总分 运动平滑 动态程度 美学 对象类别 多对象 人类动作 空间关系 场景 外观风格 主体一致性 背景一致性
ModelScope Diff 75.75 95.79 66.39 56.39 82.25 38.98 92.4 33.68 39.26 25.67 89.87 95.29
LaVie Diff 77.08 96.38 49.72 54.94 91.82 33.32 96.8 34.09 52.69 23.56 91.41 97.47
OpenSoraPlan V1.1 Diff 78.00 98.28 47.72 56.85 76.3 40.35 86.80 53.11 27.17 22.90 95.73 96.73
Show-1 Diff 78.93 98.24 44.44 57.35 93.07 45.47 95.60 53.50 47.03 23.06 95.53 98.02
OpenSora V1.2 Diff 79.76 98.50 42.39 56.85 82.22 51.83 91.20 68.56 42.44 23.95 96.75 97.61
AnimateDiff-V2 Diff 80.27 97.76 40.83 67.16 90.90 36.88 92.60 34.60 50.19 22.42 95.30 97.68
Gen-2 Diff 80.58 99.58 18.89 66.96 90.92 55.47 89.20 66.91 48.91 19.34 97.61 97.61
Pika Diff 80.69 99.50 47.50 62.04 88.72 43.08 86.20 61.03 49.83 22.26 96.94 97.36
VideoCrafter-2.0 Diff 80.44 97.73 42.50 63.13 92.55 40.66 95.00 35.86 55.29 25.13 96.85 98.22
T2V-Turbo (VC2) Diff 81.01 97.34 49.17 63.04 93.96 54.65 95.20 38.67 55.58 24.42 96.28 97.02
CogVideoX-5B Diff 81.61 96.92 70.97 61.98 85.23 62.11 99.40 66.35 53.20 24.91 96.23 96.52
Kling (2024-07) Diff 81.85 99.40 46.94 61.21 87.24 68.05 93.40 73.03 50.86 19.62 98.33 97.60
Gen-3 Diff 82.32 99.23 60.14 63.34 87.81 53.64 96.4 65.09 54.57 24.31 97.10 96.62
Emu3 (Ours) AR 80.96 98.93 79.27 59.64 86.17 44.64 77.71 68.73 37.11 20.92 95.32 97.69

Emu3总分80.96,高于OpenSora V1.2的79.76,但低于CogVideoX-5B的81.61、Kling的81.85和Gen-3的82.32。动态程度79.27很突出,人类动作77.71却明显弱于多种对照模型。这说明"运动丰富"与"动作正确"是两个不同评价轴。

更关键的是附录B.2:视频评测使用经过稳定化与超分处理的输出。 稳定化模型基于Stable Video Diffusion的temporal VAE训练,采用L1、LPIPS、GAN与KL惩罚;训练对由tokenizer重建视频和真实视频组成,尺寸为 16 × 256 × 256 16\times256\times256 16×256×256。超分模块是时空UNet,支持4倍放大,使用BlurPool下采样与sub-pixel上采样,以L2、LPIPS和GAN联合训练。

这里使用SVD的时序VAE,并不等于视频主干又变成扩散采样;但它确实说明,最终被评测的视频系统除了自回归Transformer,还包含专门改善时序与清晰度的网络。论文标题中的"下一token预测"应在主干建模层面理解。

对于工程团队,更有用的评估方式是同时报告基础解码视频与完整后处理视频,并分别记录生成、稳定化、超分的时延和显存。否则,架构看起来统一,线上成本却无法归因。

10. Emu3未来预测:视频续写离世界模型还有哪些距离

图8以2秒、24 FPS视频作为上下文,生成随后2秒内容,每秒抽取3帧展示。论文还观察到,以2秒视频为条件延展8秒内容是可行的,并提出通过自回归续写实现更长的视频生成。

从建模上看,这是一种条件分布学习:已有片段限制了场景、主体和运动方向,模型继续预测后续token。它确实是从静态内容生成迈向时间演化建模的重要一步。

但能够续写与理解物理机制之间仍存在证据距离。有限上下文内的视觉连贯,不等于长期保持身份、因果和能量约束。生成更长视频还可能受到上下文截断、递归误差积累和训练长度分布影响。论文中"可以无限扩展"的表达描述一种递推方式,不是无限时长稳定性已经被实验验证。

如果把Emu3用作世界模型研究起点,后续应增加动作条件、可控干预和状态一致性测量。例如,相同初始场景改变外部动作后,后续预测是否随干预一致变化;镜头离开后再回到物体,身份与位置是否保持。这样的测试比单纯展示一段更长视频,更接近对因果环境模型的验证。

11. Emu3视觉理解:共享离散表示能做什么,又损失了什么

表6|视觉语言理解完整结果。 *保留论文标记,表示相关训练数据集的图像在训练中被观察过;这不应被擅自改写为已证实使用测试答案。缺失项仍保留为横线。

方法 预训练 LLM SEEDB OCRB MMV POPE VQAv2 GQA SQA TQA CQA DVQA IVQA AI2D RWQA MMMU MMB
InstructBLIP Vicuna-7B 53.4 276 26.2 - - 49.2 60.5 50.1 12.5 13.9 - 33.8 37.4 30.6 36.0
IDEFICS-9B LLaMA-7B - 252 - - 50.9 38.4 - 25.9 - - - 42.2 42.1 18.4 48.2
QwenVL-Chat Qwen-7B 58.2 488 - - 78.2* 57.5* 68.2 61.5 49.8 66.3 - 45.9 49.3 35.9 60.6
LLaVA-1.5 Vicuna-7B 64.3 318 30.5 85.9 78.5* 62.0* 66.8 46.1 18.2 28.1 25.8 54.8 54.8 35.3 64.3
InternVL-Chat Vicuna-7B - - - 86.4 79.3* 62.9* - 57.0 - - - - - - -
mPLUG-Owl2 LLaMA2-7B 57.8 255 36.5 86.2 79.4* 56.1* 68.7 58.2 22.8 - - 55.7 50.3 32.7 64.5
ShareGPT4V Vicuna-7B - 371 37.6 - 80.6* 63.3* 68.4 60.4 21.3 - - 58.0 54.9 37.2 68.8
LLaVA-1.6(HD) Vicuna-7B 64.7 532 43.9 86.5 81.8* 64.2* 70.2 64.9 54.8* 74.4* 37.1 66.6* 57.8 35.1 67.4
VILA LLaMA2-7B 61.1 - 34.9 85.5 80.8* 63.3* 73.7 66.6 - - - - - - 68.9
Fuyu-8B(HD) Persimmon-8B - - 21.4 74.1 74.2 - - - - - - 64.5 - 27.9 10.7
Chameleon-MT-34B - - - - - 69.6 - - - - - - - - - -
Show-o Phi-1.5-1.3B - - - 73.8 59.3* 48.7* - - - - - - - 25.1 -
EVE-7B(HD) Vicuna-7B 56.8 - 25.7 85.0 78.6* 62.6* 64.9 56.8 - - - - - - 52.3
Emu3 - 68.2 687 37.2 85.2 75.1* 60.3* 89.2* 64.7 68.6* 76.3* 43.8* 70.0* 57.4 31.6 58.5

缩写对应:SEEDB为SEEDBench-Img,OCRB为OCRBench,MMV为MMVet,SQA为ScienceQA-Img,TQA为TextVQA,CQA为ChartQA,DVQA为DocVQA,IVQA为InfoVQA,RWQA为RealWorldQA,MMB为MMBench;其他列沿用通用名称。

Emu3在SEEDB达到68.2、OCRBench达到687,展示了不依赖CLIP式语义编码器也能学习较强理解能力。但它的MMMU为31.6、MMBench为58.5,并未在所有理解维度超过LLaVA-1.6。是否更优取决于任务,而不能被图2的平均值完全代表。

离散视觉token同时服务重建和理解,具有接口统一的好处,也存在表示竞争:某些像素细节值得保留用于生成,却未必是推理所需的最紧凑信息;小字、复杂图表中的关键差异,则可能被量化误差削弱。架构统一之后,如何优化tokenizer使两类目标都受益,仍是值得继续研究的问题。

附录示例表A保留输入与模型回答,用于展示地标描述、公式转写和图示问答。它们是定性模型输出,不能把其中的地标认定或选项回答当作另行验证的事实。公式识别案例输出如下,它是示例内容,不是Emu3训练目标:

S Δ = 2 ⋅ 7 2 = 14 2 . S_{\Delta}=\frac{\sqrt{2}\cdot\sqrt{7}}{2}=\frac{\sqrt{14}}{2}. SΔ=22 ⋅7 =214 .

附录示例表B展示长篇封面描述。长输出证明模型能组织连续文字,但准确性还应逐句检查:可见文字是否读对,人物属性是否由图像支持,是否补出了不存在的栏目或细节。理解质量不等于描述长度。

12. Emu3的研究价值:把架构争论转化为可检验的系统问题

Emu3的贡献,是提供了一组连贯证据:文本、图像与视频可以采用统一离散序列接口;从头训练的自回归主干能覆盖理解与生成;DPO可以作用于视觉token序列;视频可以沿着已有上下文继续生成。

它没有证明所有模态都已经达到同等效率,没有证明偏好优化改善所有指标,也没有证明一个未经分支后训练、未经后处理的单一检查点在全部任务领先。把这些边界写清,恰恰能看见真正值得投入的研究方向。

对于算法研究者,重点是视觉码率、量化损失、token序列长度和任务冲突。对于推理工程师,重点是KV Cache、长序列吞吐和后处理的端到端成本。对于产品团队,重点是原始提示与改写提示的差异、人类偏好与自动指标的分歧,以及理解和生成分支能否满足同一工作流的约束。

Rocky的判断是:统一多模态模型的长期价值,在于让能力可以在共同接口上训练、组合和优化;这种价值最终必须通过完整系统的质量、可靠性与成本兑现。 Emu3将这条路线推进到了可以用图像、视频、理解评测同时讨论的阶段。接下来决定上限的,是表示、数据与系统优化能否持续跟上这一统一接口。

推荐阅读

1. 深入浅出完整解析AI Agent(AI智能体)的核心基础知识

2025年可以说是AI Agent全面落地应用的元年,因此Rocky在持续撰写对AI Agent的全维度解析文章:

深入浅出完整解析AI Agent(AI智能体)的核心基础知识

2. 深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识

Rocky对扩散模型的本质原理与和核心基础知识进行了全面系统的深入浅出分析讲解,同时不断跟进补充扩散模型的最新技术发展,希望能给大家带来帮助:

深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识

3. 入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识

Rocky对AIGC时代"中场时刻"之后的主流AIGC创作大模型的核心基础知识进行了全面系统的深入浅出分析讲解,力求让大家通俗易懂理解AIGC时代的技术浪潮的本质价值:

入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识

4. 深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识

Rocky对FLUX.1 Kontext和FLUX.1 Krea的核心基础知识作了全面系统的梳理与解析:

深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识

5. 深入浅出完整解析DeepSeek系列核心基础知识

Rocky对DeepSeek系列模型的核心基础知识作了全面系统的梳理与解析:

深入浅出完整解析DeepSeek系列核心基础知识

6. 深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识

Rocky对Stable Diffusion 3和FLUX.1的核心基础知识作了全面系统的梳理与解析:

深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识

7. 深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识

Rocky对Stable Diffusion XL的核心基础知识作了全面系统的梳理与解析:

深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识

8. 深入浅出完整解析Stable Diffusion(SD)核心基础知识

Rocky对Stable Diffusion 1.x-2.x系列模型的核心基础知识做了全面系统的梳理与解析:

深入浅出完整解析Stable Diffusion(SD)核心基础知识

9. 深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识

Rocky对Stable Diffusion中最为关键的U-Net结构进行了深入浅出的全面解析,包括其在传统深度学习中的价值和在AIGC中的价值:

深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识

10. 深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识

对于AIGC时代中的"ResNet"------LoRA模型,Rocky进行了深入浅出的全面讲解:

深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识

11. 深入浅出完整解析ControlNet核心基础知识

AIGC图像创作开源社区已经形成以Stable Difffusion/FLUX为核心,ConrtolNet和LoRA作为首要AI辅助工具的变化万千的AIGC图像创作工作流。

ControlNet正是让AI图像创作社区无比繁荣的关键一环,它让AIGC图像创作过程更加的可控,更有助于广泛地将AIGC算法解决方案应用到各行各业中:

深入浅出完整解析ControlNet核心基础知识

12. 深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识

AI绘画和AI视频是两个互相促进、相互交融的领域,2024年无疑是AI视频领域的爆发之年,Rocky对AI视频领域核心的Sora、Seedance、Keling等大模型进行了全面系统的梳理与解析:

深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识

13. 深入浅出完整解析AIGC时代Transformer核心基础知识

在AIGC时代中,Transformer为AI行业带来了深刻的变革。Transformer架构正在一步一步重构所有的AI技术方向,成为AI技术架构大一统与多模态整合的关键核心基座,大有一统"AI江湖"之势。Rocky也对Transformer模型进行持续的深入浅出梳理与解析:

深入浅出完整解析AIGC时代Transformer核心基础知识

14. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识

AIGC创作框架正是AIGC算法工作流的运行载体,目前主流的AIGC创作框架有ComfyUI、Diffusers、Stable Diffusion WebUI等 。在传统深度学习时代,PyTorch、TensorFlow以及Caffe是传统深度学习模型的基础运行框架,到了AIGC时代,Rocky相信ComfyUI就是AIGC时代的"PyTorch"、Stable Diffusion WebUI就是AIGC时代的"TensorFlow"、Diffusers就是AIGC时代的"Caffe":

深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识

15. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识

在AIGC时代中,如何快速转身,入局AIGC产业?如何成为AIGC/LLM/AI Agent算法/开发工程师?如何在学校中系统性学习AIGC/LLM/AI Agent知识,斩获心仪的AIGC/LLM/AI Agent算法/开发offer?

Don't worry,Rocky为大家总结整理了全面的AIGC/LLM/AI Agent算法/开发工程师成长秘籍,为大家答疑解惑,希望能给大家带来帮助:

手把手教你成为AIGC/LLM/AI Agent算法/开发工程师,斩获AIGC/LLM/AI Agent算法/开发offer!

16. AIGC产业的深度思考与分析

2023年3月21日,微软创始人比尔·盖茨在其博客文章《The Age of AI has begun》中表示,自从1980年首次看到图形用户界面(graphical user interface)以来,以OpenAI为代表的科技公司发布的AIGC模型是他所见过的最具革命性的技术进步。

Rocky也认为,AIGC及其生态,会成为AI行业重大变革的主导力量。AIGC会带来一个全新的红利期,未来随着AIGC的全面落地和深度商用,会深刻改变我们的工作、生活、学习以及交流方式,各行各业都将被重新定义,过程会非常有趣。

那么,在此基础上,我们该如何更好的审视AIGC的未来?我们该如何更好地拥抱AIGC引领的革新?Rocky准备从技术、产品、商业模式、长期主义等维度持续分享一些个人的核心思考与观点,希望能帮助各位读者对AIGC有一个全面的了解:

深入浅出全面解析AIGC时代核心价值与发展趋势(2025年版)

17. AI算法工程师的独孤九剑秘籍

为了方便大家实习、校招以及社招的面试准备,同时帮助大家提升扩展技术基本面,Rocky将符合大厂和AI独角兽价值的算法高频面试知识点撰写总结成《三年面试五年模拟》之独孤九剑秘籍:

【三年面试五年模拟】AIGC时代的算法工程师的求职面试秘籍(持续更新中)

18. 深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识

GAN系列模型作为传统深度学习时代的最热门生成式Al模型,在AIGC时代继续繁荣,作为Stable Diffusion/FLUX系列大模型的"得力助手",广泛活跃于AlGC图像创作的产品与工作流中:

深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识

相关推荐
IT大白鼠1 小时前
彭大帅的AI运维助手跨出 Linux:全面接管 Windows 服务器
运维·服务器·人工智能
Tingmanyi1 小时前
YOLOv13改进策略【卷积层篇】| RFAConv 感受野注意力卷积,每个位置都值得被单独加权
深度学习·算法·yolo·目标检测·计算机视觉
聪明蛋子哟1 小时前
大模型工程化全景实战:打通Prompt、RAG、Tool Calling与跨系统集成的任督二脉
人工智能·prompt
Web3&Basketball1 小时前
给Agent上线前加一道自动化稳定性闸门
深度学习·大模型·ai技术
阿明副业观察1 小时前
动漫AI视频创作工具在哪找到的?2026年最新动漫AI视频平台与软件指南
人工智能·ai作画·aigc·音视频·ai写作
来自于狂人1 小时前
GitHub 开源趋势日报 | 2026年10月7日用 AI Agent 逆向工程一切
人工智能·开源·github
?? Daisy1 小时前
ZCode 添加自定义模型:自定义供应商的字段与易错点(2026-09)
人工智能·ai·ai编程
区块链小八歌1 小时前
股票代币化之后,Berachain 正在走向传统资本市场
人工智能·区块链
Summer-Bright2 小时前
拆解 | 谷歌3590兆瓦核电协议:真正的新增核电只有890兆瓦,「最大核能协议」四分之三是包装
人工智能·谷歌·核电·pjm