阿里巴巴开源多模态 MoE 模型Qwen3.8-Flash-Next ,众智 FlagOS 社区同步完成 Day0 多芯片适配。Qwen3.8-Flash-Next 已在平头哥、英伟达、摩尔线程、华为昇腾、沐曦、昆仑芯、海光、天数智芯等 8 家 AI 芯片上完成基于 FlagOS 统一开源技术栈的多芯适配、精度对齐与部署验证,首批统一提供 BF16 精度版本。多芯片版本开源到魔搭及 HuggingFace 平台。开发者可直接获取对应芯片的开箱即用方案。本次为了适配 Qwen3.8-Flash-Next 新架构,新增了8个高性能融合算子(支持多种AI芯片),已经开源到 FlagGems-vLLM 算子库。
Qwen3.8-Flash-Next 被认为是 Qwen4 架构的早期预览版,它从注意力、残差、Embedding、优化器四个方面做了系统性升级,在提升模型能力的同时进一步优化计算效率、模型容量与训练稳定性:
-
**注意力:**GDN + QSA 混合架构。Gated DeltaNet(GDN)高效压缩历史信息;Qwen Sparse Attention(QSA)用压缩后的轻量索引器在 micro-block 粒度上挑选重要上下文,大幅降低长序列的注意力开销
-
**残差:**Gated Residual(GR)把残差流加宽为4条分支,由动态门控控制读写,增强跨层信息流动与训练稳定性
-
**Embedding:**N-gram Embedding 用局部上下文查表来扩展模型容量,额外计算量很小;查表参数可放到 Host Memory,通过异步预取与模型计算重叠
-
**优化器:**使用 Muon 优化器,围绕正交化精度、Muon 与 AdamW 的参数分工、融合参数拆分三方面做了改进,并针对新架构重新拟合 Scaling Law
Qwen3.8-Flash-Next 的主模型参数量为 125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数。 相比于 Qwen3.7-Plus,Qwen3.8-Flash-Next 显著降低了训练与推理成本,训练开销仅约为前者的 1/9,但在编码和办公任务上却具有更强的能力。且原生支持 262,144 tokens 上下文,可通过 YaRN 扩展至 1,000,000 tokens。
一、Qwen新混合架构的适配挑战与系统优化
Qwen3.8-Flash-Next 引入了 QSA 稀疏注意力、Gated Residual、N-gram Embedding 三类新结构,FlagOS 原有算子库尚未覆盖,这是本轮跨芯适配的主要挑战。这些结构的原生实现面向 CUDA 生态,要在多种芯片上运行,需要先补齐后端中立的算子实现。FlagOS 团队新增 8 个基于 Triton 的算子覆盖这三类结构:3 个面向 Hyper-Connection(HC,Gated Residual 多分支门控读写的推理侧实现)、3 个面向 QSA、2 个面向 PLE state(N-gram Embedding 的查表状态)的 gather/scatter,并通过多芯片编译器 FlagTree 高效适配到多款AI芯片上。本次新增的所有算子,都适用于基于 vLLM 框架的 Qwen3.8-Flash-Next 的高效推理。用户可以从 FlagOS 技术栈的 FlagGems-vLLM 算子库获取。
- FlagGems-vLLM 算子库:https://github.com/flagos-ai/FlagGems-vllm
算子融合是收益的主要来源,其中 Hyper-Connection 贡献最大。 原本门控注入环节要经过 div、sigmoid、两次 mul、add 共 5 个独立 Torch kernel,融合为 1 个后,96 个 module 累计减少 384 次调用;三个 HC kernel 的融合叠加起来,每步能省下约 6.3 ms,占计算侧总收益的七成以上。QSA 侧对 sparse GQA 做了 tile 调整与 gate epilogue 融合,12 层单次调用从 213.62 μs 降到 108.67 μs,整体贡献约 1.3 ms。加上 MoE 专家调度(fused expert 本体更快,扣除 align/routing 开销后净收益约 0.6 ms)与 dense/projection 路径复用英伟达原生 fast path(约 0.5 ms),整条计算路径每步累计节省约 8.66 ms。
但算子提速不等于端到端的提速。 FlagOS 在算子之上多了一层 Python 与 FlagGems 的 dispatch,逐 kernel 的 host launch 开销会把上面这些计算收益重新抵消掉。真正的解锁动作是把 metadata 构造也送进 CUDA Graph,因此新增和改写了 3 个 metadata kernel(QSA metadata 构造、common slot mapping 与 computed-token 计算)。如果单独放在原生版本上只有 +0.93% 的提升,而在 FlagOS 上从部分入图到完整入图带来 +7.46%。这几个 metadata kernel 本身的 GPU 计算量也很小,4K/16K 场景下合计只占每步约 0.27--0.31 ms,它真正的作用是消除框架侧的 launch 抖动和跨 rank 到达偏差,让前面的算子融合收益能在端到端结果中真正体现。
这套架构会延续到 Qwen 下一代模型,因此新增的 QSA、Hyper-Connection、PLE 算子,以及围绕 CUDA Graph 完整入图积累的 metadata kernel 与调度经验,都可以直接用于下一代 Qwen 全系的多芯片部署,我们也把这8个融合优化算子提交到了 vLLM 上游社区(https://github.com/vllm-project/vllm/pull/53909)。在进行长序列任务精度对齐任务评测中,FlagOS团队还发现一个上游精度缺陷:GDN Packed Decode 路径中 beta 的 FP32 计算结果被不必要地舍入回 BF16,在长序列解码中造成循环状态误差累积,修复与回归测试已提交至 vLLM 上游(https://github.com/vllm-project/vllm/pull/53877)。
二、开发者速用指南
FlagOS 为 Qwen3.8-Flash-Next 提供了统一支持多种 AI 芯片的推理插件,包括 vLLM-plugin-FL 和 SGLang-plugin-FL 两种推理框架插件。目前在 FlagOS 推理插件的支持下,平头哥、英伟达、摩尔线程、华为昇腾、沐曦、昆仑芯、海光、天数智芯等已经通过不同的推理框架插件方式完成 Qwen3.8-Flash-Next 的推理部署及评测验证。业务代码与标准调用接口无需修改,环境依赖、模型路径与启动参数按各芯片模型卡配置。
使用源码安装部署,可参考以下官方文档。
-
vLLM-plugin-FL:
-
SGLang-plugin-FL:
方式一:FlagOS 安装部署(以 vLLM 为例)
以下代码,以平头哥的验证为例。其他芯片的运行时版本、插件分支、FlagGems/FlagTree 提交以及是否需要 FlagCX,请以对应芯片的模型卡和 vLLM-plugin-FL / SGLang-plugin-FL 仓库 README 为准。使用 SGLang 请替换为 sglang-plugin-FL 的安装步骤。
# 1. 安装 vLLM
git clone https://github.com/vllm-project/vllm.git
cd vllm
git checkout v0.24.0
VLLM_TARGET_DEVICE=empty pip install -v --no-build-isolation --no-deps .
# 2. 安装 vllm-plugin-FL
git clone https://github.com/flagos-ai/vllm-plugin-FL
cd vllm-plugin-FL
git checkout v0.3.0-dev
pip install --no-build-isolation -e .
# 3. 安装 FlagGems 算子库
git clone https://github.com/flagos-ai/FlagGems
cd FlagGems && git checkout v5.3.0
pip install --no-build-isolation -e .
# 4. (可选) 安装 FlagTree 跨芯编译器
# 5. (可选) 安装 FlagCX 跨芯通信库
# 详见 https://github.com/flagos-ai/FlagCX
以下内容,以平头哥芯片 BF16 版本的运行推理为示例,模型路径、tensor_parallel_size、max_num_batched_tokens、max_num_seqs 等参数需按实际芯片型号、卡数与服务配置调整,各芯片的推荐取值见对应模型卡。
from vllm import LLM, SamplingParams
prompts = ["请介绍下阿里巴巴最新开源模型Qwen3.8-Flash-Next "]
sampling_params = SamplingParams(max_tokens=10, temperature=0.0)
llm = LLM(
model="FlagRelease/Qwen3.8-Flash-Next-BF16-zhenwu-FlagOS",
max_num_batched_tokens=8192,
max_num_seqs=32,
tensor_parallel_size=16)
outputs = llm.generate(prompts, sampling_params)
for output in outputs:
print(f"Prompt: {output.prompt!r}")
print(f"Generated: {output.outputs[0].text!r}")
方式二:模型镜像直接下载
用户也可以直接拉取在 FlagRelease 上发布的迁移后的模型文件、代码和镜像,开箱即用、无需迁移。下表列出已在 FlagRelease 上线的 8 款芯片适配版本。
魔搭平台

HuggingFace

三、开发者体验
1. 零改码适配
模型原有接口、vLLM 推理引擎使用逻辑以及开发者的日常调用代码均无需修改。FlagOS 通过多芯片推理框架插件(vLLM-plugin-FL / SGLang-plugin-FL),把算子实现从 CUDA 替换为基于 Triton 语言的 FlagGems 算子库,由插件层完成与各芯片后端的对接。Qwen3.8-Flash-Next 的 Hybrid 架构在不同芯片上可用的并行切分方式与执行模式存在差异,这部分同样由插件层承接,开发者无需了解硬件相关的底层开发知识。
2. 核心能力与原生版本对齐
我们在 GPQA_Diamond、MUSR 两个评测集上,将各芯片 FlagOS 版本与英伟达原生版本做了对照,从已出评测结果数据来看,与 CUDA 原生结果对齐。
评测数据

注:本测试结果仅用于在同一测试环境下的对齐验证,并不代表 Qwen 模型的官方性能。Qwen 模型的官方性能以 Qwen 官方公布数据为准。
3. 开箱即用部署
FlagRelease 直接提供了多芯片版本的 Qwen3.8-Flash-Next-FlagOS 模型版本和配套镜像,其中已预置 FlagGems 算子库、FlagTree 编译器等组件,加载模型时底层优化自动生效,开发者无需添加 FlagOS 初始化代码,也无需自行迁移。若不使用 FlagRelease 镜像而采用源码方式部署,则需按前文步骤自行安装 vLLM-plugin-FL 与 FlagGems。
四、大模型核心基座:FlagOS 五大技术支撑,实现极速跨芯适配
包括 Qwen3.8-Flash-Next 在内的多款模型跨芯适配,依托的是 FlagOS 2.1 统一多芯片系统软件栈的全链路能力。从算子层、编译层、框架层到工具层,全链路为大模型跨芯适配提供技术支撑。

1. 统一多芯片推理框架插件
FlagOS 为主流推理框架打造了统一的多芯片插件,包括 vLLM-plugin-FL 和 SGLang-plugin-FL,基于 FlagOS 统一多芯片后端开发,在不改变原生接口与用户使用习惯的前提下,实现 Qwen3.8-Flash-Next 的多芯片推理部署。本次适配中,平头哥、英伟达、沐曦、海光、天数智芯基于 vLLM-plugin-FL 部署,摩尔线程、华为昇腾基于 SGLang-plugin-FL 部署,精度对齐进度以评测章节的表格为准。插件针对 Hybrid 混合注意力架构下的 QSA 稀疏索引、Hyper-Connection 与 PLE 辅助结构,以及 MoE 专家调度、张量并行等环节做了适配与优化,各芯片支持的框架版本与并行配置请参考对应模型卡。用户可根据业务场景选择 vLLM 或 SGLang。
2. 多芯片量化压缩工具 FlagOS-Compress
FlagOS-Compressor 是 FlagOS 面向大模型压缩与高效部署的模型优化工具,聚焦模型量化等压缩技术。本次 Qwen3.8-Flash-Next 首批适配以 BF16 原生权重为主,未走量化路径;FlagOS-Compressor 的多芯片量化能力仍在持续建设,为后续在显存受限芯片上的压缩部署做准备。
3. 高性能算子库 FlagGems 及 FlagGems-vLLM
FlagGems 及 FlagGems-vLLM 是 FlagOS 核心的高性能、多芯片通用算子库,基于 Triton/Triton-TLE 语言实现。FlagGems 对应了 PyTorch 的算子库,FlagGems-vLLM 对应了 vLLM 推理框架的大量融合算子。本次针对 Qwen3.8-Flash-Next 推理链路,除 MoE 专家调度(fused_experts_impl)与 Attention 计算等既有算子外,新增了 8 个面向新架构结构的算子实现。其中,3 个面向 Hyper-Connection(对应 Gated Residual 的多分支门控读写),3 个面向 QSA 稀疏注意力,2 个面向 PLE state 的 gather/scatter,并完成了 QSA 算子调度层优化,这也是本轮适配工作量最集中的部分。各芯片实际启用的算子集合以模型卡说明为准。
4. 统一 AI 编译器 FlagTree
FlagTree 是 FlagOS 面向多 AI 芯片后端的统一编译器,基于 Triton 深度定制,可将 Qwen3.8-Flash-Next 的核心算子编译为平头哥、英伟达、摩尔线程、华为昇腾、沐曦、昆仑芯、海光、天数智芯等多个 AI 芯片后端可识别的指令,解决不同芯片编译器生态割裂的问题。
5. 模型跨芯迁移发布工具 FlagRelease
依托 FlagOS 全栈技术能力,FlagRelease 已完成 Qwen3.8-Flash-Next 在多种芯片上的模型迁移、精度对齐与版本发布,覆盖 HuggingFace、魔搭等开源社区平台。开发者可直接下载使用,无需自行迁移。截至 2026 年 8 月,FlagRelease 已发布覆盖 10+ 家芯片厂商、12+ 款硬件、80+ 个开源模型实例的跨芯适配版本。
五、开源共建:FlagOS 持续做开发者的"跨芯适配后盾"
当下,"异构算力协同、大模型普惠落地"已成为全球开源开发者社区的核心热点,打破硬件生态隔离、让大模型在不同算力平台高效低成本运行,是无数开发者的核心诉求。FlagOS 从诞生之初就将开源开放、众智共建刻入技术基因,始终以开发者为中心,通过全栈开源的统一系统软件栈,把复杂的"M×N"硬件适配问题降维为"M+N",做每一位开发者最可靠的跨芯适配后盾。
全栈开源无保留,把技术主动权交给开发者
目前,FlagOS 已形成完整的开源技术体系,所有核心组件均已开源在 GitHub,同时开放了数十款最新的主流基础大模型、十多款 AI 芯片的适配方案与最佳实践
-
**四大核心技术库:**FlagGems 通用大模型算子库、FlagTree 统一 AI 编译器、FlagScale 训练推理并行框架、FlagCX 统一通信库,覆盖算子开发、编译优化、并行计算、跨芯片通信全链路;
-
三大开源工具平台: FlagRelease 大模型自动迁移发版平台、KernelGen 算子自动生成工具、FlagPerf 多芯片评测工具,提供从模型适配、性能评测到工程落地的一站式工具链;
-
全场景使能生态: vLLM-plugin-FL、SGLang-plugin-FL、Megatron-LM-FL、TransformerEngine-FL、PyTorch-plugin-FL 等框架增强组件,以及 FlagOS-Robo 具身智能工具包,覆盖大模型训练、推理、应用全场景。
多路径参与共建
我们为不同技术方向、不同经验层级的开发者设计了低门槛、多路径的共建方式。
-
新手友好型参与: 可在对应仓库提交 Issue 反馈 bug、优化建议,或是补充完善文档、撰写入门教程与最佳实践,也可参与社区技术交流、分享使用经验(社区文档参考:https://docs.flagos.io/en/latest/)
-
深度技术共建: 开发者可直接参与 FlagGems 算子开发与优化(新增算子 / 性能调优 / 新芯片后端支持)、KernelGen 算子生成流程增强、FlagTree 编译器后端扩展等核心模块,与社区核心开发者一起推动技术演进
-
生态工具贡献: 开发者可基于 FlagOS Skills 开发面向国产芯片的 AI Agent 专业技能,帮助更多开发者通过自然语言完成芯片适配、模型部署等操作