Day-0支持|摩尔线程+智源FlagOS,率先完成Qwen3.8-Flash-Next适配

近日,阿里千问开源多模态MoE模型Qwen3.8-Flash-Next 。摩尔线程依托全生态兼容能力,基于Triton在MTT S5000上快速完成该模型Day-0独立适配;同时联合众智FlagOS社区 同步完成**Day-0适配、** 精度对齐与部署验证,首批提供BF16精度版本,已开源至魔搭及HuggingFace平台,开发者可直接获取开箱即用方案。

Qwen3.8-Flash-Next被认为是Qwen4架构的早期预览版,采用GDN + QSA混合注意力架构,结合Gated Residual与N-gram Embedding等创新设计。Qwen3.8-Flash-Next的主模型总参数量125B,每token仅激活6B参数,编码与办公任务能力显著增强,原生支持262,144 tokens长上下文,可通过YaRN扩展至1M tokens。

针对该模型新引入的混合注意力等架构,FlagOS团队新增8个高性能融合算子,通过统一编译器FlagTree完成向摩尔线程全功能GPU的编译适配。在GPQA_Diamond精度评测中,摩尔线程版本得分91.66,与英伟达原生版本92.9得分高度对齐。

|------------------|----------------|--------------------|---------------------|
| 评测集 | 英伟达 原生 | 英伟达 FlagOS | 摩尔线程 FlagOS |
| GPQA_Diamond | 92.9 | 91.3 | 91.66 |
| MUSR | 78.57 | 评测中 | 评测中 |

注:本测试结果仅用于在同一测试环境下的对齐验证,并不代表 Qwen 模型的官方性能。Qwen 模型的官方性能以 Qwen 官方公布数据为准。

开发者可通过两种方式在MTT S5000上部署该模型: 一是摩尔线程官方镜像 ,已发布开箱即用版本*(文末附下载地址)* ;二是**FlagOS联合版本,**可直接拉取在FlagRelease上发布的迁移后的模型文件、代码和镜像,开箱即用。

开发者速用指南

FlagOS为Qwen3.8-Flash-Next提供了两种推理框架插件,包括vLLM-plugin-FLSGLang-plugin-FL。摩尔线程已通过上述插件完成该模型的推理部署及评测验证,业务代码与标准调用接口无需修改,环境依赖、模型路径与启动参数按摩尔线程智算卡配置即可。

使用源码安装部署,可参考以下官方文档:

vLLM-plugin-FL

GitHub:

https://github.com/flagos-ai/vllm-plugin-FL/blob/main/README.md

GitCode:

https://gitcode.com/flagos-ai/vllm-plugin-FL/blob/main/README.m

SGLang-plugin-FL

**▼**GitHub:

https://github.com/flagos-ai/sglang-plugin-FL/blob/main/README.md

GitCode:

https://gitcode.com/flagos-ai/s

FlagOS安装部署

快速安装(以 vLLM 为例)

复制代码
# 1. 安装 vLLM
git clone https://github.com/vllm-project/vllm.git
cd vllm 
git checkout v0.24.0
VLLM_TARGET_DEVICE=empty pip install -v --no-build-isolation  --no-deps . 

# 2. 安装 vllm-plugin-FL
git clone https://github.com/flagos-ai/vllm-plugin-FL
cd vllm-plugin-FL
git checkout v0.3.0-dev
pip install --no-build-isolation -e .

# 3. 安装 FlagGems 算子库
git clone https://github.com/flagos-ai/FlagGems
cd FlagGems && git checkout v5.3.0
pip install --no-build-isolation -e .

# 4. (可选) 安装 FlagTree 跨芯编译器

# 5. (可选) 安装 FlagCX 跨芯通信库
# 详见 https://github.com/flagos-ai/FlagCX

运行推理(摩尔线程平台BF16版本为例)

复制代码
from vllm import LLM, SamplingParams
prompts = ["请介绍下阿里巴巴最新开源模型Qwen3.8-Flash-Next "]
sampling_params = SamplingParams(max_tokens=10, temperature=0.0)
llm = LLM(
    model="FlagRelease/Qwen3.8-Flash-Next-BF16-mthreads-FlagOS", 
    max_num_batched_tokens=8192,
    max_num_seqs=32,
    tensor_parallel_size=16)
outputs = llm.generate(prompts, sampling_params)
for output in outputs:
    print(f"Prompt: {output.prompt!r}")
    print(f"Generated: {output.outputs[0].text!r}")

模型镜像下载

开发者可下载镜像进行开箱体验:

摩尔线程官方镜像

registry.mthreads.com/mcconline/inference/sglang:qwen3.8-flash-next-mr535-20260827

FlagOS联合版本

魔搭社区:

https://modelscope.cn/models/FlagRelease/Qwen3.8-Flash-Next-BF16-mthreads-FlagOS

HuggingFace平台:

https://huggingface.co/FlagRelease/Qwen3.8-Flash-Next-BF16-mthreads-FlagOS

相关推荐
摩尔线程1 天前
Day-0支持|摩尔线程完成智谱GLM-5.3-Flash极速适配
摩尔线程
摩尔线程2 天前
MTT AIBOOK实战手册丨快速体验DeepSeek Harness:从开箱启动到工作区上手
摩尔线程
摩尔线程17 天前
摩尔线程完成开源库CV-CUDA在MUSA上的兼容支持 助力国产GPU视觉计算生态升级
开源·摩尔线程
摩尔线程21 天前
摩尔线程发布Mooncake MUSA预编译包 加速国产GPU PD分离落地
摩尔线程
摩尔线程23 天前
摩尔线程LiteGS入选ECCV 2026 高质量3DGS训练迎来效率突破
3d·摩尔线程
摩尔线程2 个月前
Day-0支持|摩尔线程率先完成腾讯Hy3大模型适配
开源·摩尔线程
摩尔线程3 个月前
五大能力升级|MTT AIBOOK推送AIOS 1.4.1版本,核心场景流畅度提升30%
摩尔线程
摩尔线程3 个月前
摩尔线程 × 中科院计算所丨DeferredGS全栈国产化适配落地
摩尔线程
摩尔线程3 个月前
喜报|摩尔线程MTT S5000(PH100芯片)通过国家《安全可靠测评》
人工智能·摩尔线程