扩散语言模型的"灵活性陷阱":为什么训练时反而应该按自回归顺序探索?ICML 2026
原论文:The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models
作者:Zanlin Ni、Shenzhi Wang、Yang Yue、Tianyu Yu、Weilin Zhao、Yeguo Hua、Tianyi Chen、Jun Song、Cheng Yu、Bo Zheng、Gao Huang
会议/年份:ICML 2026;原文为 arXiv:2601.15165v4(2026-06-08)
30秒看懂这篇论文
- 研究问题:扩散语言模型(diffusion language models,dLLMs)的任意顺序生成,真的扩大了推理搜索空间吗?
- 使用方法:比较 Arbitrary Order 与严格左到右的 Autoregressive(AR)Order,并用 Pass@k、解空间覆盖率和熵分析检查其差异;随后提出 JustGRPO。
- 核心发现:在数学和代码推理任务上,任意顺序在单次采样时可能很强,但随着采样数 k 增大,AR Order 的 Pass@k 增长更快;任意性越高,实际可达的解空间反而越小。
- 主要贡献:把 dLLM 在强化学习阶段临时当作 AR policy,直接套用标准 GRPO;训练阶段按顺序探索,推理阶段仍保留并行解码。
- 最大局限:Pass@k 被当作 RL 可达推理上限的代理指标,且顺序、block size、温度和采样器之间仍可能存在耦合,论文尚未证明"任意顺序普遍有害"。
1. 为什么要研究这个问题?
扩散语言模型最吸引人的地方,通常不是"它也能生成文字",而是它改变了生成文字的方式。传统 autoregressive(AR)模型把序列分解成严格的左到右链条:先生成第一个 token,再生成第二个 token,后面的 token 只能依赖已经出现的前文。掩码扩散语言模型则从一串 [MASK] 出发,反复预测并解除一部分掩码。由于多个位置可以同时被预测,它天然支持 parallel decoding;由于下一个被解除掩码的位置不必总是最左侧位置,它还拥有 arbitrary-order generation 的自由。
第一种自由------一次处理多个 token------主要影响速度,已经有相当多工作讨论。第二种自由------可以先决定后文、再补前文------则更容易被解释为一种推理优势:如果模型不必被左到右的顺序束缚,也许能够先写出草图、先完成容易的部分,或者在 Sudoku、Zebra puzzle 等结构化任务中跳到信息量更高的位置。由此产生了一个自然但未经充分检验的直觉:任意顺序包含了 AR 轨迹,因此至少不应比 AR 更差,甚至应该拥有更大的 reasoning potential。
这篇论文抓住了这个直觉中的一个缺口。它问的不是"任意顺序能否在某些任务上工作",而是:在数学和代码这类需要多步探索的 general reasoning 任务中,任意顺序是否真的扩大了强化学习能够触达的正确解分布?如果答案是否定的,那么为了保留任意顺序而设计的复杂 dLLM 强化学习方法,可能是在优化一个并不值得保留的自由度。
2. 作者提出了什么问题或假设?
论文的核心观察可以概括为一句话:理论上更大的生成自由,在实际采样和 RL 探索中可能变成"灵活性陷阱"(flexibility trap)。
作者把推理过程看成一组可能的 reasoning trajectories。强化学习只有在 rollout 阶段采到正确路径、得到正向可验证奖励之后,才有机会提高这条路径的概率。因此,能够覆盖多少不同的正确解,是一个比单次准确率更接近"可学习上限"的问题。论文使用 Pass@k 作为代理指标:在 k 次独立采样中至少得到一个正确答案的概率越高,意味着模型分布中可被 RL 发现和强化的正确路径越多。
需要注意,这是一个重要但并非无条件成立的代理假设。RL 训练可能改变分布,也可能通过更长时间训练、不同奖励设计或更好的数据扩大能力边界。论文的论证更准确的表述是:在其采用的 RLVR 设定中,较高的基础模型 Pass@k 往往意味着更大的可探索空间,因此可以作为 reasoning boundary 的实用近似,而不是严格的理论上限。
论文进一步提出一个机制假设:推理中的不确定性并不是均匀分布在每个 token 上的。像 "Therefore""Thus""Since""Given" 这样的连接词或转折标记,常常是逻辑分叉点。它们看似只是短词,却决定接下来应该沿哪一条论证路径继续。若采样器在这些位置保持较高熵,模型还有多个方向可选;若模型先把未来的"容易 token"填好,等回头补连接词时,未来上下文可能已经把分叉压缩成一个几乎确定的答案。
3. 方法:这项研究是怎样完成的?
3.1 dLLM 与两种解码顺序
在 masked diffusion language model 中,前向过程以概率 t 独立地把干净序列中的 token 变成 [MASK];反向过程由模型在当前混合状态上预测被遮挡位置的原始 token,并逐步解除掩码。AR Order 是这个过程的一个特殊情形:每一步只解除当前最左侧的未知 token。Arbitrary Order 则按照置信度等启发式,在可选位置中优先处理模型更有把握的位置,并对低置信度位置重新掩码。
论文首先在 LLaDA-Instruct、Dream-Instruct 和 LLaDA 1.5 三个 dLLM 上比较两种顺序,并覆盖 GSM8K、MATH-500、HumanEval 和 MBPP 四个数学与代码基准。主分析采用最多 256 个生成 token、256 个解码 step、半自回归 block size 为 B=32;部分 Pass@k 分析使用温度 0.6。作者还改变 block size、温度和采样算法,用来检查观察是否只是某个单一配置的产物。
3.2 从 Pass@k 到熵退化
Pass@k 使用无偏估计形式计算:如果 n 个样本中有 c 个正确样本,则估计在 k 次抽样中至少出现一个正确解的概率。它回答的是"多采样几次后,模型还能不能找到新的正确路径",而不是"第一次输出是否连贯"。因此,Pass@1 可能偏向 exploitation,而 Pass@k 的增长曲线更能体现 exploration。
为了理解曲线差异,作者检查被任意顺序频繁绕过的 token,并比较这些 token 被解码时的熵。论文把观察到的现象称为 entropy degradation:任意顺序的全局平均 token entropy 与 AR 相近,但逻辑分叉 token 在真正被填入时的熵显著降低。换言之,模型并没有在分叉点作出开放式选择,而是先由未来上下文确定了大致方向,再回头用一个低不确定性的连接词把"缺口"补起来。
3.3 JustGRPO:把 AR 当作训练脚手架
任意顺序的 RL 有三个结构性难题。第一,状态由当前噪声序列和随机解除掩码轨迹共同决定,难以给每个 token 指派唯一、对齐的条件概率。第二,完整序列概率需要对所有有效去噪轨迹求和,长度为 N 时轨迹空间大致呈 O(N!) 增长,精确似然难以计算。第三,rollout 可能由 confidence-based sampler 产生,但优化目标却近似原始扩散分布,形成 sampler-learner mismatch。
JustGRPO 的处理非常直接。训练 RL 时,给定已经生成的前缀 o<k,把未来全部遮住,只取位置 k 的 logits 作为下一个 token 的分布:
text
x̃k = [o1, ..., ok−1, [MASK], ..., [MASK]]
πARθ(·|o<k,q) = Softmax(fθ,k(x̃k,q))
于是整段序列概率可以按左到右的条件概率精确分解,标准 GRPO 的 token-level importance ratio 也有了清晰定义。关键点是,AR 约束只作用在 RL rollout 和 credit assignment 阶段,不加入 causal mask,也不改变 dLLM 的双向注意力或掩码扩散架构。因此,作者把它描述成一种训练脚手架:用顺序探索帮助模型在高不确定性位置作出决定,再把训练后的模型交给并行 sampler 做推理。
实验中 JustGRPO 直接作用于 LLaDA-Instruct,使用 full-parameter fine-tuning,不额外加入 task-specific SFT。数学任务使用各数据集官方训练集,代码任务从 AceCoder-87K 中选择带可验证 unit test 的约 21K 个样本。附录给出的代表性配置包括 LLaDA 8B Instruct、AdamW、学习率 5×10^-6、global batch size 64、group size 16、125 个 training steps、最大 completion length 256;实验使用 16 张 NVIDIA H100 GPU。代码奖励由测试通过率和格式奖励组成,数学题采用答案等价的二值奖励。
4. 核心结果与论文原图
4.1 任意顺序的理论自由没有转化成更大的可达解空间

来源:原论文 Figure 1,PDF 第 2 页;仅作忠实裁剪,DOI/标识:arXiv:2601.15165。
Figure 1 把论文的两条主线放在一起。左侧的 GSM8K Pass@k 曲线显示,AR Order 在 k 增大后持续拉开差距;右侧则给出 JustGRPO 在 GSM8K、MATH-500、HumanEval 和 MBPP 上的结果,其中在统一报告的代表点上分别达到 89.1%、45.1%、49.4% 和 52.4%。右侧对照来自不同方法,原论文已经明确提醒 Table 1 的 baseline 设置并不完全同质,因此这些柱形图适合用来形成总体印象,不能简单当作严格的逐项 head-to-head 实验。

来源:原论文 Figure 3,PDF 第 5 页;仅作忠实裁剪,DOI/标识:arXiv:2601.15165。
Figure 3 是"解空间"论证的主体证据。三行分别对应 LLaDA-Instruct、Dream-Instruct 和 LLaDA-1.5,四列对应 GSM8K、MATH-500、HumanEval 和 MBPP。AR Order 在 k=1 时并非处处更好,任意顺序甚至可能有更高的单次结果;但随着 k 从 1 增至 128,AR 曲线通常更陡,说明它更能继续挖掘新的正确解。这个结果支持一个很具体的判断:任意顺序的优势若存在,更多体现为局部的一次性连贯性,而不是可持续的多路径探索。

来源:原论文 Figure 4,PDF 第 4 页;仅作忠实裁剪,DOI/标识:arXiv:2601.15165。
Figure 4 进一步问:任意顺序是不是只是"找到同样的解比较慢",其实仍然覆盖另一批解?在 LLaDA-Instruct 的 Pass@1024 分析中,两种方法解决的问题高度重叠,但 AR-only 的区域更明显。四个基准上,AR-only 的比例分别为 GSM8K 1.2%、MATH-500 4.8%、HumanEval 21.3% 和 MBPP 14.0%;AO-only 只有 0.0%、0.6%、0.6% 和 0.8%。尤其 HumanEval 的差距很难解释为单纯采样效率差异:大量题目是 AR 能找到而 arbitrary order 找不到,反向情况却很少。

来源:原论文 Figure 5,PDF 第 5 页;仅作忠实裁剪,DOI/标识:arXiv:2601.15165。
Figure 5 把"AR 对比 arbitrary order"的二元比较推广到连续程度。半自回归 block size B=1 等价于纯 AR;B 越大,模型在一个 block 内选择下一个位置的自由越多。HumanEval 上 Pass@8、Pass@32 和 Pass@128 都随 B 增大而单调下降。这个趋势让论文的结论更有说服力:观察到的差异并不只来自两个极端点,而是在这一组设置中呈现出"越任意,越难扩大解覆盖"的渐变关系。
4.2 机制:模型绕过了最需要探索的逻辑分叉

来源:原论文 Figure 2,PDF 第 2 页;仅作忠实裁剪,DOI/标识:arXiv:2601.15165。
Figure 2 是一个机制示意,而不是独立的性能实验。AR Order 被迫在左侧尚未确定的位置作决定;Arbitrary Order 可以先跳到后面更容易预测的位置。等未来被填好,原本的分支就被未来上下文"事后约束"了。这个解释的关键不在于连接词本身有多重要,而在于它们是一个稀疏的决策瓶颈:少数高熵位置可能承担了大部分推理分支。

来源:原论文 Figure 7,PDF 第 6 页;仅作忠实裁剪,DOI/标识:arXiv:2601.15165。
Figure 7 给出定量支持。横轴列出 Therefore、Thus、Since、To、Now、determine、Given 等 token;橙色 AR Order 的分叉熵普遍高于蓝色 Arbitrary Order,而两条虚线所示的全局平均熵却相近。因此,差异不是简单的"AR 整体更随机",而是局部地保留了模型在关键逻辑点上的不确定性。作者据此推断,AR 的顺序更有利于让 rollout 产生彼此不同的 rationale。

来源:原论文 Figure 12,PDF 第 18 页;仅作忠实裁剪,DOI/标识:arXiv:2601.15165。
Figure 12 把 token 集合扩展到 Therefore、Thus、So、Since、When、Given、However、Let、First、Then、Next 以及更多词。大多数位置仍呈现 AR 熵更高的模式,但并不是每个 token 都严格如此,例如 because、follows 等位置存在反向或接近的情况。这一点很重要:熵退化是跨多个连接词的总体趋势,而不是一个对所有词都成立的硬规则。
4.3 JustGRPO 的效果:顺序训练不等于顺序推理

来源:原论文 Figure 8,PDF 第 9 页;仅作忠实裁剪,DOI/标识:arXiv:2601.15165。
Figure 8 检验了最容易被误解的一点:如果训练时按 AR 顺序,模型会不会变成普通 AR 模型?结果并非如此。横轴是 tokens/step,代表推理时并行程度;JustGRPO 模型在四个基准上都保留了并行采样能力,而且并行度越高时,相比原始 LLaDA-Instruct 的准确率优势往往越明显。MBPP 上的差距从 1 token/step 的 +10.6% 扩大到约 5 tokens/step 的 +25.5%。更合理的解释是,JustGRPO 改善了模型分布对近似并行采样的鲁棒性,而不是把推理阶段锁死在单 token 左到右。

来源:原论文 Figure 9,PDF 第 10 页;仅作忠实裁剪,DOI/标识:arXiv:2601.15165。
精确 GRPO 的代价是每个位置都要计算概率比,因此单步开销可能高于依赖近似的 ESPO。Figure 9 显示,在 GSM8K 上,JustGRPO 的 accuracy/wall-clock trade-off 仍然有竞争力;JustGRPO-Fast 进一步只在 rollout 记录的 top-25% 高熵位置计算概率比,省去约 75% 的相关 forward evaluation,并继续改善时间---精度折中。这个设计也与论文机制保持一致:如果推理分支主要由少数高熵位置驱动,就没有必要对所有低熵位置投入同等的优化计算。

来源:原论文 Figure 10,PDF 第 16 页;仅作忠实裁剪,DOI/标识:arXiv:2601.15165。
Figure 10 是对采样温度的鲁棒性检查。HumanEval 上,AR Order 在中等温度约 T=0.6 附近达到较好的 Pass@k scaling;当温度升高到 1.2 或 1.5 时,AR 曲线反而明显下降。Arbitrary Order 在较高温度下能够继续探索,但在论文报告的 "T=Optimal" 配置中仍未超过 AR。这个结果说明温度会改变两种顺序的表现,却没有消除主趋势;同时也提示,顺序比较必须明确记录温度与采样协议。
5. 证据是否支持作者的解释?
数据真正显示了什么?
第一,AR Order 在多模型、多任务上的 Pass@k scaling 更好;第二,Pass@1024 的问题覆盖显示任意顺序解决的题目大多落在 AR 已覆盖的区域内;第三,增大 block size 会降低 Pass@k;第四,逻辑连接词在 arbitrary order 中被延后且在被解码时呈现更低熵;第五,JustGRPO 在统一设置的对照中取得 GSM8K 89.1%、MATH-500 45.1%、HumanEval 49.4%、MBPP 52.4%,并且仍能用并行 sampler 推理。
哪些是作者的解释?
作者把这些现象串成"任意顺序偏向 exploitation、AR 顺序保留 exploration"的机制故事:任意顺序优先完成容易的 token,未来上下文提前固定轨迹,压低逻辑分叉的熵;AR 则被迫在分叉处采样,保留更多可供 RL 发现的路径。JustGRPO 的成功进一步说明,训练时的顺序约束可以充当探索脚手架,而不必成为模型推理时的结构约束。
独立评价:还不能把结论推广成"任意顺序永远不好"
这篇论文最有价值的地方,是把"更灵活所以更强"的直觉拆成了两个问题:一次输出是否更好,以及多次探索能否覆盖更多正确路径。但它的因果证据仍有边界。
其一,Pass@k 作为 RL reasoning boundary 的代理是合理的工程指标,却不是严格上限。论文展示了 AR 的基础采样分布更适合后续 RL,但没有证明任何 RL 算法都不能从 arbitrary-order 的其他区域学习到能力。
其二,顺序、block size、温度和采样策略并非完全独立。附录的温度分析显示,AR 在中等温度附近表现较好,arbitrary order 的最佳温度可能更高;这说明论文已经做了鲁棒性检查,但也提醒我们:不同顺序是否应使用完全相同的温度,仍然是实验设计的一部分,而不是无关紧要的细节。
其三,Table 1 的基线存在 full fine-tuning 与 LoRA、每步解除一个或两个 token、不同数据规模等差异。论文用 Table 2 做了统一配置复现,这是加分项;不过统一对照覆盖的方法数量仍有限,不能据此宣称 JustGRPO 在所有 dLLM RL 方法上都占优。
其四,任务范围集中在 GSM8K、MATH-500、HumanEval 和 MBPP。论文自己也承认,任意顺序可能在 Sudoku、Zebra puzzle 或需要填空式全局约束的任务中有价值。因此更稳妥的结论是:对当前这类数学与代码 general reasoning,在所测的 confidence-based/半自回归采样及 RLVR 设定中,任意顺序并没有兑现其理论上的解空间优势。
其五,JustGRPO 的训练收益与并行推理兼容性很强,但还需要更广泛的模型规模、上下文长度、奖励形式和非英语任务测试,才能判断"AR training scaffold + parallel diffusion inference"是否是普适范式。论文给出了 16×H100 的训练信息和关键超参数,但完整复现实验仍依赖代码、数据处理和 sampler 实现的细节核对。
6. 贡献、局限与可复现性
论文的贡献可以归纳为三点。第一,它用 Pass@k 而不是只看 Pass@1,把 dLLM 的 arbitrary-order 讨论拉回到 RL 最关心的探索覆盖问题。第二,它提出 entropy degradation,把"模型似乎过早确定方向"的直觉连接到可测量的局部熵变化。第三,它给出一个很简洁的训练方案:在 dLLM backbone 上构造精确可计算的 AR policy,直接使用标准 GRPO,同时保留原有并行解码。
可复现性方面,论文公开了模型、基准、生成长度、block size、训练 GPU 数、主要优化器和奖励设计,也报告了统一协议下的部分基线。需要复现者特别注意:Table 1 不能直接当作严格公平比较;应优先使用 Table 2 的 generation length 256、full fine-tuning、one token per step 配置。还应固定 temperature、prompt template、remasking 策略、并行 tokens/step 和代码测试执行方式,否则结果可能发生明显变化。
7. 对研究和实践的启发
对 dLLM 研究者,最直接的启发是不要把"能任意顺序生成"自动等同于"更会推理"。任意顺序也许提高单次生成的局部一致性或带来速度收益,但 RL 需要的是覆盖多个可验证的正确分支。评估时应同时报告 Pass@1、Pass@k 曲线、问题级解空间重叠和不同并行度下的准确率,而不能只报一个最优点。
对 RL 算法设计者,JustGRPO 提供了一个低复杂度基线:先让模型在精确的 AR policy 下学习如何穿过高熵决策点,再把同一模型交给并行 diffusion sampler。只有当这一基线充分失败时,才有必要为组合去噪轨迹、边际似然或位置选择策略引入更复杂的估计器。JustGRPO-Fast 还说明,优化预算可以集中到高熵位置。
对工程实践者,训练和推理不必采用同一种顺序。可以把训练顺序理解为"如何探索和分配 credit",把推理顺序理解为"如何在可接受的速度下执行已经学到的分布"。这为速度---质量折中留下空间:训练阶段保留关键逻辑分叉,部署阶段再使用 EB-sampler 或其他并行策略。
对后续研究,一个值得继续验证的问题是:是否可以自适应地识别每个任务中的真正分叉点,而不是对所有任务一律使用纯 AR?如果某类结构化任务需要先填后文,那么理想策略可能不是完全取消任意顺序,而是只在高熵逻辑瓶颈处施加顺序约束。换言之,论文并没有终结 arbitrary order,而是把研究问题从"自由越多越好"改写成了"哪些位置值得自由,哪些位置必须被探索"。
总结
这篇论文的反直觉结论并不是"扩散语言模型不行",而是:dLLM 的并行解码和任意顺序生成是两个不同的能力,前者可以保留,后者未必适合在 RL 推理训练中不加限制地使用。 在数学和代码基准上,任意顺序会优先解决容易的局部 token,绕开承担逻辑分叉的高不确定性位置;未来上下文一旦形成,原本可能的推理分支就被提前压窄。严格左到右的 AR Order 看似牺牲自由,却让模型在关键分叉处真正探索,因而得到更好的 Pass@k scaling。
JustGRPO 将这个观察变成了一个简洁方案:训练时用 AR policy 和标准 GRPO,推理时仍用 dLLM 的 parallel decoding。它最值得借鉴的不是某个具体数字,而是训练目标与部署机制可以解耦这一设计原则。对于下一代 dLLM,真正重要的问题可能不再是"如何让模型在任何位置都能生成",而是"如何让模型在正确的高不确定性位置保留选择权"。
参考资料与图片来源
- Ni, Z. et al. The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models . arXiv:2601.15165v4, 2026. 论文;项目页。
- Ni, Z. et al. JustGRPO 代码仓库:LeapLabTHU/JustGRPO。
- Shao, Z. et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. arXiv:2402.03300, 2024(GRPO 基础方法)。
本文展示的 Figure 1、2、3、4、5、7、8、9、10、12 均直接来自上述论文 PDF,通过对应页面的无损 page crop 提取;未使用生成、重绘、增强或外部配图。每幅图的页码、原始图号、裁剪框与 SHA-256 均记录在本文章包的 manifest.json 中。