摩尔线程发布Mooncake MUSA预编译包 加速国产GPU PD分离落地

近期,摩尔线程与Mooncake社区共同完善了MUSA平台的构建与发布链路:自Mooncake v0.3.12版本起,官方正式提供Mooncake Transfer Engine的MUSA预编译wheel包(以下简称"MUSA Wheel")。开发者无需再手动编译复杂的C++/MUSA工程,仅需一行pip install命令,即可在摩尔线程全功能GPU上无缝接入Transfer Engine,获得KV Cache跨节点高效传输的能力。

突破大模型推理中的传输与编译瓶颈

大模型推理服务正从"单机部署"向"分布式分离架构"加速演进。在PD分离架构中,Prefill阶段计算密集,Decode阶段对显存带宽高度敏感,两者分别部署于不同节点,之间需要一条高效的数据通道来完成KV Cache的跨节点传递。这条通道面临着多重技术挑战:需要支撑高带宽的显存数据吞吐,在TCP、RDMA等多种传输协议间根据环境智能切换,并对异构GPU设备内存提供统一的访问接口。

Mooncake正是为解决此类分布式推理挑战而生的基础设施开源项目。其核心采用以KV Cache为中心的分离式架构,将Prefill集群与Decode集群分离,同时将GPU集群中原本未被充分利用的CPU、DRAM及SSD资源纳入统一管理,构建起一层分离式的KV Cache池。

Mooncake包含高性能传输引擎Transfer Engine、分布式KV Cache与模型权重管理组件Mooncake Store,以及弹性MoE扩展组件Mooncake EP & PG,已与SGLang、vLLM等主流推理引擎生态深度集成,可显著提升LLM系统的Cache复用率、降低服务时延,并在多节点集群中实现高效的弹性扩展。

在整个Mooncake架构中,Transfer Engine扮演着关键角色------它负责在Prefill节点与Decode节点之间建立高效的数据通路,完成KV Cache的跨节点传输。在异构硬件和网络条件下,Transfer Engine通过设备内存注册、拓扑发现和智能传输路由等机制,在TCP、RDMA等多种传输方式间灵活选择最优路径,确保KV Cache在跨节点传输中始终保持低延迟与高吞吐。

*图1:Mooncake Transfer Engine。图片源自GitHub kvcache-ai/Mooncake。

为了让更多开发者能够便捷地在摩尔线程全功能GPU上使用Mooncake,摩尔线程与Mooncake社区共同完善了MUSA平台的构建与发布链路,为开发者提供了预编译的MUSA Wheel,免去了手动克隆源码、搭建编译环境、完成整套C++工程构建的步骤。开发者无需再关注底层编译细节,即可直接获得Transfer Engine带来的高性能KV Cache跨节点传输能力。

自动化构建与发布流程

作为Mooncake社区官方推出的Transfer Engine MUSA预编译版本,MUSA Wheel负责设备内存注册、拓扑发现、传输任务管理,并可根据底层网络环境自动选择TCP或RDMA等传输方式,在Prefill节点产出的KV Cache与Decode节点之间建立一条低延迟的数据通路------而这一切,现在只需一行pip install即可获得。

*图2:当前release-musa.yaml的流程。

本次发布的核心在于MUSA Wheel自动化构建与发布流程的落地,当前工作流具备以下设计要点:

▼ **自动触发构建:**稳定版tag推送后,GitHub Actions自动拉起MUSA 5.2+PyTorch 2.9.1构建容器,完成USE_MUSA=ON编译和CPython 3.10 wheel打包;

▼ **双通道同步分发:**产物同时上传至GitHub Release和PyPI(通过OIDC Trusted Publishing),开发者可按需选择安装来源。

快速安装与校验

当前推荐版本为v0.3.12.post1,开发者可通过以下命令直接安装:

复制代码
pip install mooncake-transfer-engine-musa

安装后即可在Python中直接引入验证:

复制代码
from mooncake.engine import TransferEngine

环境说明:

▼ PyPI上的标准发行包mooncake-transfer-engine面向CUDA环境;MUSA环境请安装独立的mooncake-transfer-engine-musa。两者提供同名的mooncake模块,请勿在同一环境中混装。

▼ 当前预编译产物覆盖CPython 3.10、Linux x86_64和manylinux_2_35平台,构建基线为Ubuntu 22.04、MUSA 5.2.0和PyTorch 2.9.1.post1。

▼ 预编译 wheel 包不包含 MUSA Runtime 和 GPU 驱动,这两项仍由宿主机或基础镜像自行提供。

vLLM与SGLang推理框架已就绪

MUSA Wheel的发布大幅简化了主流推理框架的集成过程。目前,vLLM与SGLang两大框架已完成对接:

▼ **vLLM-MUSA:**PR #122已将mooncake-transfer-engine-musa==0.3.12.post1接入默认的v0.24.0-dev分支。镜像内部直接安装PyPI预编译包,移除了冗长的源码构建环节,并复用了上游vLLM的MooncakeConnector。在摩尔线程智算卡MTT S5000+RoCE环境下,摩尔线程已对Qwen3-0.6B完成eager和compiled两条推理路径的回归验证。使用最新vLLM-MUSA镜像的开发者通常无需再次手动安装Mooncake。

▼ **SGLang-MUSA:**主分支已同时提供MUSA平台支持和Mooncake PD backend。开发者完成SGLang源码安装后,只需执行pip install mooncake-transfer-engine-musa,即可沿用Mooncake PD backend接入PD分离推理。

两套框架均提供完整的单机双卡PD分离示例------通过Prefill、Decode与路由代理三个进程,即可在摩尔线程GPU上验证 KV Cache 跨卡传输的端到端流程。

开源生态协同

Mooncake MUSA Wheel的发布,是摩尔线程在大模型推理基础设施领域的又一进展。此前,MUSA后端已正式合入SGLang主线,vLLM-MUSA已为摩尔线程全功能GPU提供完整的推理支持;Triton、TileLang等算子编译项目也已完成MUSA平台迁移并进入实际应用阶段。

本次与Mooncake社区的合作,将摩尔线程在大模型推理基础设施中的能力进一步延伸至传输层------从算子编译、框架适配到KV Cache跨节点传输,国产GPU在PD分离推理这条关键路径上的技术拼图正在趋于完整。摩尔线程将持续深耕大模型推理技术栈,携手开源社区共建国产GPU推理生态。

了解更多信息,请访问以下链接或点击下方"阅读原文":

▼ Mooncake Transfer Engine MUSA Wheel技术博客:

https://blog.mthreads.com/blog/AI/2026-07-27-mooncake-transfer-engine-musa/

▼ mooncake-transfer-engine-musa on PyPI:

https://pypi.org/project/mooncake-transfer-engine-musa/

▼ Mooncake MUSA Release Workflow:

https://github.com/kvcache-ai/Mooncake/blob/v0.3.12.post1/.github/workflows/release-musa.yaml

阅读原文

相关推荐
摩尔线程13 小时前
摩尔线程完成开源库CV-CUDA在MUSA上的兼容支持 助力国产GPU视觉计算生态升级
开源·摩尔线程
摩尔线程7 天前
摩尔线程LiteGS入选ECCV 2026 高质量3DGS训练迎来效率突破
3d·摩尔线程
摩尔线程1 个月前
Day-0支持|摩尔线程率先完成腾讯Hy3大模型适配
开源·摩尔线程
摩尔线程2 个月前
五大能力升级|MTT AIBOOK推送AIOS 1.4.1版本,核心场景流畅度提升30%
摩尔线程
摩尔线程2 个月前
摩尔线程 × 中科院计算所丨DeferredGS全栈国产化适配落地
摩尔线程
摩尔线程2 个月前
喜报|摩尔线程MTT S5000(PH100芯片)通过国家《安全可靠测评》
人工智能·摩尔线程
Mike_6663 个月前
摩尔线程AB100安装torch环境
人工智能·深度学习·ffmpeg·aarch64·摩尔线程·musa
摩尔线程3 个月前
摩尔线程携手紫光计算机发布《语音识别全栈国产化技术实践白皮书》
人工智能·语音识别·摩尔线程
摩尔线程3 个月前
Day-0支持 | 摩尔线程适配商汤日日新SenseNova U1系列原生理解生成统一模型
摩尔线程