【arXiv 2026】Nemotron-Labs-Diffusion:三模式语言模型 统一自回归、扩散与自推测解码|从大模型推理加速视角

摘要

本文解读 arXiv 2026 论文《Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding》。该论文提出 Nemotron-Labs-Diffusion 三模式语言模型 ,通过融合自回归(AR)解码扩散(Diffusion)并行解码自推测(Self-Speculation)解码 ,用联合 AR-扩散训练目标把三种解码范式统一进单一架构,其特别之处在于无需任何模式专用架构改动即可切换解码模式。实验表明 8B 模型每前向解码 token 数(TPF)最高达 6.38× 、平均精度 64.04 全面超越 Qwen3-8B,自推测接受长度 6.82 是 Eagle3 的 2.5 倍,速度上限(SOL)分析进一步揭示扩散解码还有 76.5% 的并行潜力,为扩散语言模型的规模化落地提供了重要借鉴。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding
标题(中文) Nemotron-Labs-Diffusion:三模式语言模型 统一自回归、扩散与自推测解码
作者 Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Norouzi, Jingyu Liu, Shiyi Lan, Ligeng Zhu, Jin Wang, Jindong Jiang, Morteza Mardani, Mehran Maghoumi, Song Han, Ante Jukić, Nima Tajbakhsh, Jan Kautz, Pavlo Molchanov
机构 NVIDIA Research · MIT EECS
会议 arXiv 2026(NVIDIA 技术报告)
arXiv https://arxiv.org/abs/2607.05722
项目网站 https://huggingface.co/collections/nvidia/nemotron-labs-diffusion

背景与动机:为什么 AR 与扩散不能二选一?

自回归(AR)语言模型逐 token 串行解码,推理并行度被根本性限制:每个 token 依赖前一个 token 的输出,GPU 在低并发场景下严重利用率不足。扩散语言模型(Diffusion LM)则换了一条路------一次前向可以并行解码多个 token,但精度与学习效率长期落后于 AR 模型:LLaDA(arXiv:2502.09992)和 Dream 7B(arXiv:2508.15487)等规模化掩码扩散模型虽然逼近 AR 精度,却需要显著更多的训练数据,且扩散训练把所有 token 排列一视同仁,没有利用自然语言固有的左到右先验。

更关键的是,现有扩散语言模型相对多 token 预测(MTP)方法(如 Eagle3,arXiv:2503.01840)并没有体现出明确的效率优势。Eagle3 用一个小草稿模型递归生成多个候选 token,再由大模型单次前向验证,其瓶颈在于:草稿模型容量有限、递归生成仍然串行、还要承担嵌入层与 LM head 的额外开销。

这篇论文把问题重新表述为三个问句:Q1 扩散应该与 AR 竞争,还是可以调和?Q2 扩散能否提供比 MTP 更强的加速机制?Q3 扩散解码有没有足够的长期潜力?作者的回答是:两者不是竞争关系------AR 提供左到右的语言先验,扩散增强前瞻规划能力,联合训练可以让一个模型同时拥有三种解码模式。

研究主线:从问题到结论

图 8:研究主线------问题→动机→联合设计→三模式方法→实验→结论(Mermaid 流程图)

基准/方法设计:一个模型,三种解码模式

Nemotron-Labs-Diffusion(下文简称 NLD)的核心设计是一个联合 AR-扩散训练框架,训练完成后同一个模型天然支持三种解码模式:

  • 模式一:AR 解码------标准左到右生成,适合高并发云服务场景,可直接替换现有 AR 模型(drop-in replacement);
  • 模式二:块式扩散解码------把序列分成连续块,块内并行去噪多个 token,配合置信度阈值或训练过的采样器决定提交哪些 token,实现精度-吞吐的灵活权衡;
  • 模式三:自推测解码------扩散通路并行草稿 k 个 token,AR 通路复用前缀 KV 缓存验证,接受最长匹配前缀,每步产出 1 到 k{+}1 个 token。

图 1:三种模式示意(a)与准确率-吞吐权衡(b, c)------扩散模式随块大小扫描权衡曲线,8B 模型在 GB200 上相对 Qwen3-8B-Eagle3 获得更优的系统/单用户吞吐权衡

训练目标是最小化联合损失 L = L_{AR} + \\alpha L_{diff},其中 AR 损失系数固定为 1,扩散损失系数 \\alpha=0.3 用于对齐两个损失的量级。作者特别强调 \\alpha 的选择:扩散损失通常比 AR 损失大,把两者对齐到同一量级时两种模式同时达到最优,说明两个目标共同升降、互补而非竞争

分类全景:三模式与它们的适用场景

图 9:三模式分类全景------四种解码模式与各自的 TPF 与精度(Mermaid 流程图)

方法细节:联合训练与三模式推理

训练目标。 AR 目标为逐 token 的左到右最大似然:L_{AR} = -\\sum_i \\log p_\\theta(x_i \| x_{\。扩散目标采用块式(block-wise)扩散公式:序列划分为 B 个连续块,噪声级别 t \\sim U\[0,1\] 下只对当前块加噪,前缀保持干净:L_{diff} = -\\frac{1}{t}\\sum_b \\log p_\\theta(x\^b \| \\tilde{x}_t\^b, x\^{\

图 2:双流注意力模式------噪声块内双向、跨块因果;与 Block Diffusion 的关键差异是 clean 流严格因果,使 AR 与扩散损失可在同一前向反向中计算而无标签泄漏

双流注意力。 训练时同时输入加噪视图与干净视图:噪声流中块内 token 双向注意、跨块因果注意,去噪当前块时可额外关注干净流前缀;干净流则强制严格因果------这样 AR 损失与扩散损失能在同一次前向反向中计算,不产生标签泄漏。这与 Block Diffusion(arXiv:2503.09573)、Efficient-DLM(arXiv:2512.14067)等此前设计(干净流允许关注未来)不同。

两个稳定训练的关键技巧。 1. 两阶段训练 :第一阶段纯 AR(\\alpha=0)持续预训练 1T token,建立强左到右语言先验;第二阶段联合训练 300B token。消融显示两阶段训练带来 +5.74% 平均精度增益。 2. 全局损失平均:按 token 而非按序列平均损失。由于扩散损失带 1/t 重加权,小 t 样本的少量 token 权重巨大,序列平均会放大梯度方差;全局平均按贡献 token 数加权每个样本,+2.12% 精度。

三模式推理。 模式切换只需改变注意力模式,无需任何架构改动。扩散模式支持两种提交策略:固定置信度阈值,或一个训练过的轻量采样器(4 层 Transformer,d=384,参数仅 0.06%)逐位置预测"top-1 是否可安全提交",同精度下多 1.3× TPF。

图 3:三模式推理------左到右 AR 解码(a)、并行扩散解码(b)、线性自推测解码(c):扩散草稿 + AR 验证共享 KV 缓存

LoRA 增强的自推测。 线性自推测的扩散草稿通路用 LoRA 适配器微调(仅注意力 o_{proj} 层,rank 128、\\alpha=512,约 3600 万参数 / 0.4%),损失为 LK 混合分布匹配(top-200 并集截断避免全词表 KL 发散)+ 针对验证器 argmax 的交叉熵,且只在"已接受前缀 + 首个拒绝位置"上计算------因为部署时验证器在该点重建 KV 缓存,更远位置的 logits 在训练时不可见。二次自推测则是更激进的变体:把上轮草稿与新掩码交错成 k\^2 个掩码,单次前向同时完成草稿与验证,并支持 AR-扩散集成验证器 p\^{ens} = \\lambda p\^{AR} + (1-\\lambda) p\^{diff}

实验设计与结果:精度与吞吐的双重验证

评测协议。 10 项基准:科学问答与指令遵循(GPQA、IFEval、MMLU)、代码(HumanEval、MBPP、LiveCodeBench-CPP)、数学推理(Math500、GSM8K、AIME24、AIME25)。AR 基线包括 Qwen3-8B/4B/14B、Qwen2.5-7B、Ministral3;扩散基线包括 LLaDA-8B Instruct、Dream-7B Instruct、SDAR-8B Chat。吞吐用 SPEED-Bench 在 SGLang 部署下测量(GB200 / RTX Pro 6000 / DGX Spark)。

8B Instruct 主表(10 项任务平均):

模型 模式 Avg Acc TPF
Qwen3-8B AR 62.75 1.00
LLaDA-8B Instruct 扩散 37.24 1.00
SDAR-8B Chat 扩散 54.09 1.75
NLD-8B AR 63.61 1.00
NLD-8B 扩散 63.18 2.57
NLD-8B 线性 SS(LoRA) 62.81 5.99
NLD-8B 二次 SS 64.04 6.38

图 4:NLD-8B Instruct 对比 SOTA AR/扩散模型------10 项任务平均精度与每前向 token 数(TPF),精度最高、并行度最高

训练消融(25B token 持续预训练逐项叠加,扩散模式):

技术 HumanEval MBPP GSM8K Avg
Block-wise 注意(基线) 39.02 53.40 82.87 54.23
+ 全局损失平均 42.07 56.20 83.78 56.35
+ DP-rank 变化掩码比例 45.12 55.80 81.58 57.06
+ 两阶段训练 58.54 53.00 83.17 62.80
+ AR 损失 64.02 65.60 86.73 70.28

累计 +16.05%:AR 损失单项贡献 +7.48% 最大,两阶段训练 +5.74% 次之------保留 AR 目标,是扩散语言模型精度达标的关键\\alpha 扫描(0.1/0.2/0.3/0.5/1.0)显示两种模式都在 \\alpha=0.3 同时达峰(AR 70.62 / 扩散 69.77),且扩散损失对 AR 精度几乎无损(base +0.14%、instruct +0.43%,代码与数学基准反而上涨)。

图 5:不同扩散损失系数 \\alpha 下 AR/扩散损失随训练步数的演化------\\alpha=0.3 两损失平衡最佳,两目标"同升同降",印证互补而非竞争

自推测 vs MTP 接受长度(SPEED-Bench,草稿长度 31):

类目 NLD Native NLD LoRA Eagle3 MTP
coding 6.61 8.57 3.14 5.97
math 6.24 8.14 2.79 4.80
reasoning 6.18 7.99 3.40 3.68
multilingual 7.96 10.06 1.91 4.47
平均 5.46 6.82 2.75 4.24
4 类目平均 6.75 8.69 2.81 4.73

LoRA 版接受长度是 Eagle3 的 2.5 倍、MTP 的 1.6 倍,在 GB200 上实测系统吞吐 2.4× 优于 Qwen3-8B-Eagle3。

图 6:SGLang 部署实测------线性 SS 相对 AR 最高 3.3×(GB200 优化 kernel 3.97×、1015 tok/s;RTX Pro 6000 上 FP8/INT4 量化 3.46×/2.35×;DGX Spark 3.14×/2.69×)

速度上限(SOL)分析。 构造上先用串行去噪(每步提交峰值置信位置)得到收敛目标,再用递归动态压缩(二分搜索可安全批量提交的最大匹配前缀,每块预算 5000 次前向)逼近目标。块长 32 时 SOL 接受率平均 7.60× (多语言 11.26×、coding 10.24×、roleplay 3.49×),随块长近似线性增长;而当前置信度采样仅约 3× TPF。对比线性自推测:接受率 6.82 vs 7.60(差 10.3%),但真实 TPF 3.41 vs 6.02------76.5% 的差距来自验证的二次前向开销与仅接受连续前缀的限制。

图 7:各 SPEED-Bench 类目下扩散 SOL 与线性自推测的接受率与 TPF------接受率接近(6.82 vs 7.60),真实 TPF 差距 76.5%

模型家族扩展:3B/14B 与 VLM 同样成立------3B 线性 SS 55.0 精度 / 4.36× TPF(比 Qwen3-4B +1.77),14B 66.36 / 5.96×(比 Qwen3-14B +1.19),NLD-VLM-8B 线性 SS 59.4 / 3.63--7.45×(长回答 >200 token 时 TPF 7.45);并行扩散能力随规模增强(线性 SS TPF 3B→14B:4.36→5.96)。

结果对比总结

图 10:结果对比总结------Qwen3-8B → NLD-8B 四种模式,精度与 TPF 同时提升(Mermaid 流程图)

关键发现

  1. 三模式由联合训练自然涌现:无需任何模式专用架构,切换注意力模式即切换解码范式,一个模型覆盖高并发(AR)、低并发(自推测)与灵活权衡(扩散)三种部署场景。
  2. AR 与扩散损失互补而非竞争\\alpha=0.3 时两模式同时达峰;AR 损失给扩散模式带来 +7.48% 最大单项增益,扩散损失几乎无损保留 AR 精度(instruct +0.43%)。
  3. 自推测全面优于 MTP:接受长度 6.82 vs Eagle3 2.75 / MTP 4.24,GB200 实测 2.4× 吞吐优势,且不需要辅助预测头与独立草稿模型。
  4. LoRA 对齐高效:仅 0.4% 参数(36M)让线性自推测 TPF 提升 14.4%/32.5%/27.6%(3B/8B/14B)。
  5. 扩散解码仍有 76.5% 头room:SOL 上限真实 TPF 6.02× vs 线性自推测 3.41×,更强采样器 + 非前缀提交是两条关键路径。
  6. 训练方差控制是扩散训练的关键:全局损失平均 +2.12%、两阶段训练 +5.74%,均来自对扩散损失高方差的抑制。

局限性

  1. 采样器远未达到 SOL 上限:置信度/学习采样器仅约 3× TPF,离 7.60× 上限差距大,最优采样策略仍是开放问题。
  2. 前缀式验证限制:AR 验证只接受连续前缀,丢弃首个拒绝点之后的自信 token,真实 TPF 被结构性封顶。
  3. 二次自推测基础设施不成熟:FlexAttention 专用 mask kernel 未优化,6.38× 理论 TPF 未转化为实测吞吐。
  4. 扩散损失非完全免费:指令遵循(IFEval −3.01)与 HumanEval(−2.44)轻微回落,严格指令遵循能力受联合训练影响。

作者展望四个方向:逼近 SOL 的优化采样器、训练时对齐草稿与验证器、非前缀的扩散验证器、段级/段级并行训练以解锁全局规划能力。

常见问题(FAQ)

Nemotron-Labs-Diffusion 是什么?

NVIDIA 发布的三模式语言模型家族(3B/8B/14B,含 base、instruct 与视觉语言版本),用联合 AR-扩散训练把自回归、扩散与自推测解码统一进单一架构,精度持平最强开源 AR 模型的同时吞吐最高提升 6 倍。

TPF(tokens per forward)是什么意思?

每前向一次解码出的 token 数。AR 模型 TPF=1(逐 token),NLD-8B 扩散模式 2.57×、线性自推测 5.99×、二次自推测 6.38×,即一次前向分别产出约 2.6/6.0/6.4 个 token。

自推测解码和推测解码(speculative decoding)有什么区别?

推测解码通常用独立的小草稿模型 + 大模型验证(如 Eagle3);自推测用同一个模型的扩散通路草稿、AR 通路验证,共享 KV 缓存,不需要辅助预测头和额外草稿模型,接受长度更高(6.82 vs 2.75)。

SOL 分析的 76.5% 是怎么来的?

SOL 是扩散模式配最优采样器时的速度上限:真实 TPF 6.02×,而线性自推测仅 3.41×(需两次前向 + 只接受前缀),差距 (6.02−3.41)/3.41 ≈ 76.5%,说明当前采样器浪费了大量可用并行度。

为什么要两阶段训练?

第一阶段纯 AR 建立强左到右语言先验,第二阶段联合扩散训练。消融显示两阶段带来 +5.74% 精度提升------更充分的 AR 初始化让模型学会更好的前瞻规划,也更容易完成 AR 到扩散的转换。

模型权重在哪里可以获取?

Hugging Face NVIDIA 官方集合(https://huggingface.co/collections/nvidia/nemotron-labs-diffusion),训练/推理管线通过 Megatron Bridge 开源(https://github.com/NVIDIA-NeMo/Megatron-Bridge/pull/3105),并支持 SGLang 部署。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

相关推荐
dozenyaoyida5 小时前
AI与大模型新闻日报 | 2026-08-13
人工智能·ai·大模型·新闻
tachibana210 小时前
文件上传分布式限流如何做?
人工智能·ai·大模型·llm·prompt
智码看视界10 小时前
Day49-AI微服务化-将大模型能力封装为标准微服务
java·微服务·ai·架构·大模型·sse流式输出·ai中台
安逸sgr11 小时前
激活函数有什么用?Sigmoid、Tanh、ReLU 到底怎么选?
人工智能·ai·大模型·agent·智能体
小田学Python21 小时前
100行Python代码,搭一个能干活的AI Agent
python·langchain·大模型·ai agent
thesky1234561 天前
27届大模型面试准备(二十八):大模型安全与对齐——越狱、红队、拒答与机器遗忘
大模型·红队·对齐·大模型安全·机器遗忘·越狱·拒答
赵大仁1 天前
Agent 安全:沙箱、权限、Prompt 注入与审计
ai·大模型·agent·ai安全·合规
VIP_CQCRE1 天前
用 LobeChat 接入 Ace Data Cloud:一个 Token 解锁 GPT、Claude、Gemini 等 60+ 模型
ai·大模型·openai·lobechat·acedatacloud