关于 Qwen3.8-Next 架构的设计:评估、效率与训练稳定性我们介绍了 Qwen3.8-Flash-Next 的架构及其消融实验。这是一个稀疏混合专家(MoE)模型,拥有 1250 亿(125B)总参数,每个 token 激活 60 亿(6B)参数,并额外包含 510 亿(51B)参数的 n-gram 嵌入表,这些表被卸载到加速器(accelerator)之外。在 14 个预训练基准测试中,该模型在 8 个测试中领先于其 397B-A17B 的前代模型,在其余测试中落后幅度不超过 2.6 个百分点,而其激活参数量仅为前代的 1/31/31/3,训练 token 数