近日,阿里千问开源多模态MoE模型Qwen3.8-Flash-Next 。摩尔线程依托全生态兼容能力,基于Triton在MTT S5000上快速完成该模型Day-0独立适配;同时联合众智FlagOS社区 同步完成**Day-0适配、** 精度对齐与部署验证,首批提供BF16精度版本,已开源至魔搭及HuggingFace平台,开发者可直接获取开箱即用方案。
Qwen3.8-Flash-Next被认为是Qwen4架构的早期预览版,采用GDN + QSA混合注意力架构,结合Gated Residual与N-gram Embedding等创新设计。Qwen3.8-Flash-Next的主模型总参数量125B,每token仅激活6B参数,编码与办公任务能力显著增强,原生支持262,144 tokens长上下文,可通过YaRN扩展至1M tokens。
针对该模型新引入的混合注意力等架构,FlagOS团队新增8个高性能融合算子,通过统一编译器FlagTree完成向摩尔线程全功能GPU的编译适配。在GPQA_Diamond精度评测中,摩尔线程版本得分91.66,与英伟达原生版本92.9得分高度对齐。
|------------------|----------------|--------------------|---------------------|
| 评测集 | 英伟达 原生 | 英伟达 FlagOS | 摩尔线程 FlagOS |
| GPQA_Diamond | 92.9 | 91.3 | 91.66 |
| MUSR | 78.57 | 评测中 | 评测中 |
注:本测试结果仅用于在同一测试环境下的对齐验证,并不代表 Qwen 模型的官方性能。Qwen 模型的官方性能以 Qwen 官方公布数据为准。
开发者可通过两种方式在MTT S5000上部署该模型: 一是摩尔线程官方镜像 ,已发布开箱即用版本*(文末附下载地址)* ;二是**FlagOS联合版本,**可直接拉取在FlagRelease上发布的迁移后的模型文件、代码和镜像,开箱即用。
开发者速用指南
FlagOS为Qwen3.8-Flash-Next提供了两种推理框架插件,包括vLLM-plugin-FL 和SGLang-plugin-FL。摩尔线程已通过上述插件完成该模型的推理部署及评测验证,业务代码与标准调用接口无需修改,环境依赖、模型路径与启动参数按摩尔线程智算卡配置即可。
使用源码安装部署,可参考以下官方文档:
vLLM-plugin-FL
▼ GitHub:
https://github.com/flagos-ai/vllm-plugin-FL/blob/main/README.md
▼ GitCode:
https://gitcode.com/flagos-ai/vllm-plugin-FL/blob/main/README.m
SGLang-plugin-FL
**▼**GitHub:
https://github.com/flagos-ai/sglang-plugin-FL/blob/main/README.md
▼ GitCode:
https://gitcode.com/flagos-ai/s
FlagOS安装部署
快速安装(以 vLLM 为例)
# 1. 安装 vLLM
git clone https://github.com/vllm-project/vllm.git
cd vllm
git checkout v0.24.0
VLLM_TARGET_DEVICE=empty pip install -v --no-build-isolation --no-deps .
# 2. 安装 vllm-plugin-FL
git clone https://github.com/flagos-ai/vllm-plugin-FL
cd vllm-plugin-FL
git checkout v0.3.0-dev
pip install --no-build-isolation -e .
# 3. 安装 FlagGems 算子库
git clone https://github.com/flagos-ai/FlagGems
cd FlagGems && git checkout v5.3.0
pip install --no-build-isolation -e .
# 4. (可选) 安装 FlagTree 跨芯编译器
# 5. (可选) 安装 FlagCX 跨芯通信库
# 详见 https://github.com/flagos-ai/FlagCX
运行推理(摩尔线程平台BF16版本为例)
from vllm import LLM, SamplingParams
prompts = ["请介绍下阿里巴巴最新开源模型Qwen3.8-Flash-Next "]
sampling_params = SamplingParams(max_tokens=10, temperature=0.0)
llm = LLM(
model="FlagRelease/Qwen3.8-Flash-Next-BF16-mthreads-FlagOS",
max_num_batched_tokens=8192,
max_num_seqs=32,
tensor_parallel_size=16)
outputs = llm.generate(prompts, sampling_params)
for output in outputs:
print(f"Prompt: {output.prompt!r}")
print(f"Generated: {output.outputs[0].text!r}")
模型镜像下载
开发者可下载镜像进行开箱体验:
摩尔线程官方镜像
registry.mthreads.com/mcconline/inference/sglang:qwen3.8-flash-next-mr535-20260827
FlagOS联合版本
▼ 魔搭社区:
https://modelscope.cn/models/FlagRelease/Qwen3.8-Flash-Next-BF16-mthreads-FlagOS
▼ HuggingFace平台:
https://huggingface.co/FlagRelease/Qwen3.8-Flash-Next-BF16-mthreads-FlagOS