近期,摩尔线程与Mooncake社区共同完善了MUSA平台的构建与发布链路:自Mooncake v0.3.12版本起,官方正式提供Mooncake Transfer Engine的MUSA预编译wheel包(以下简称"MUSA Wheel")。开发者无需再手动编译复杂的C++/MUSA工程,仅需一行pip install命令,即可在摩尔线程全功能GPU上无缝接入Transfer Engine,获得KV Cache跨节点高效传输的能力。
突破大模型推理中的传输与编译瓶颈
大模型推理服务正从"单机部署"向"分布式分离架构"加速演进。在PD分离架构中,Prefill阶段计算密集,Decode阶段对显存带宽高度敏感,两者分别部署于不同节点,之间需要一条高效的数据通道来完成KV Cache的跨节点传递。这条通道面临着多重技术挑战:需要支撑高带宽的显存数据吞吐,在TCP、RDMA等多种传输协议间根据环境智能切换,并对异构GPU设备内存提供统一的访问接口。
Mooncake正是为解决此类分布式推理挑战而生的基础设施开源项目。其核心采用以KV Cache为中心的分离式架构,将Prefill集群与Decode集群分离,同时将GPU集群中原本未被充分利用的CPU、DRAM及SSD资源纳入统一管理,构建起一层分离式的KV Cache池。
Mooncake包含高性能传输引擎Transfer Engine、分布式KV Cache与模型权重管理组件Mooncake Store,以及弹性MoE扩展组件Mooncake EP & PG,已与SGLang、vLLM等主流推理引擎生态深度集成,可显著提升LLM系统的Cache复用率、降低服务时延,并在多节点集群中实现高效的弹性扩展。
在整个Mooncake架构中,Transfer Engine扮演着关键角色------它负责在Prefill节点与Decode节点之间建立高效的数据通路,完成KV Cache的跨节点传输。在异构硬件和网络条件下,Transfer Engine通过设备内存注册、拓扑发现和智能传输路由等机制,在TCP、RDMA等多种传输方式间灵活选择最优路径,确保KV Cache在跨节点传输中始终保持低延迟与高吞吐。

*图1:Mooncake Transfer Engine。图片源自GitHub kvcache-ai/Mooncake。
为了让更多开发者能够便捷地在摩尔线程全功能GPU上使用Mooncake,摩尔线程与Mooncake社区共同完善了MUSA平台的构建与发布链路,为开发者提供了预编译的MUSA Wheel,免去了手动克隆源码、搭建编译环境、完成整套C++工程构建的步骤。开发者无需再关注底层编译细节,即可直接获得Transfer Engine带来的高性能KV Cache跨节点传输能力。
自动化构建与发布流程
作为Mooncake社区官方推出的Transfer Engine MUSA预编译版本,MUSA Wheel负责设备内存注册、拓扑发现、传输任务管理,并可根据底层网络环境自动选择TCP或RDMA等传输方式,在Prefill节点产出的KV Cache与Decode节点之间建立一条低延迟的数据通路------而这一切,现在只需一行pip install即可获得。

*图2:当前release-musa.yaml的流程。
本次发布的核心在于MUSA Wheel自动化构建与发布流程的落地,当前工作流具备以下设计要点:
▼ **自动触发构建:**稳定版tag推送后,GitHub Actions自动拉起MUSA 5.2+PyTorch 2.9.1构建容器,完成USE_MUSA=ON编译和CPython 3.10 wheel打包;
▼ **双通道同步分发:**产物同时上传至GitHub Release和PyPI(通过OIDC Trusted Publishing),开发者可按需选择安装来源。
快速安装与校验
当前推荐版本为v0.3.12.post1,开发者可通过以下命令直接安装:
pip install mooncake-transfer-engine-musa
安装后即可在Python中直接引入验证:
from mooncake.engine import TransferEngine
环境说明:
▼ PyPI上的标准发行包mooncake-transfer-engine面向CUDA环境;MUSA环境请安装独立的mooncake-transfer-engine-musa。两者提供同名的mooncake模块,请勿在同一环境中混装。
▼ 当前预编译产物覆盖CPython 3.10、Linux x86_64和manylinux_2_35平台,构建基线为Ubuntu 22.04、MUSA 5.2.0和PyTorch 2.9.1.post1。
▼ 预编译 wheel 包不包含 MUSA Runtime 和 GPU 驱动,这两项仍由宿主机或基础镜像自行提供。
vLLM与SGLang推理框架已就绪
MUSA Wheel的发布大幅简化了主流推理框架的集成过程。目前,vLLM与SGLang两大框架已完成对接:
▼ **vLLM-MUSA:**PR #122已将mooncake-transfer-engine-musa==0.3.12.post1接入默认的v0.24.0-dev分支。镜像内部直接安装PyPI预编译包,移除了冗长的源码构建环节,并复用了上游vLLM的MooncakeConnector。在摩尔线程智算卡MTT S5000+RoCE环境下,摩尔线程已对Qwen3-0.6B完成eager和compiled两条推理路径的回归验证。使用最新vLLM-MUSA镜像的开发者通常无需再次手动安装Mooncake。
▼ **SGLang-MUSA:**主分支已同时提供MUSA平台支持和Mooncake PD backend。开发者完成SGLang源码安装后,只需执行pip install mooncake-transfer-engine-musa,即可沿用Mooncake PD backend接入PD分离推理。
两套框架均提供完整的单机双卡PD分离示例------通过Prefill、Decode与路由代理三个进程,即可在摩尔线程GPU上验证 KV Cache 跨卡传输的端到端流程。
开源生态协同
Mooncake MUSA Wheel的发布,是摩尔线程在大模型推理基础设施领域的又一进展。此前,MUSA后端已正式合入SGLang主线,vLLM-MUSA已为摩尔线程全功能GPU提供完整的推理支持;Triton、TileLang等算子编译项目也已完成MUSA平台迁移并进入实际应用阶段。
本次与Mooncake社区的合作,将摩尔线程在大模型推理基础设施中的能力进一步延伸至传输层------从算子编译、框架适配到KV Cache跨节点传输,国产GPU在PD分离推理这条关键路径上的技术拼图正在趋于完整。摩尔线程将持续深耕大模型推理技术栈,携手开源社区共建国产GPU推理生态。
了解更多信息,请访问以下链接或点击下方"阅读原文":
▼ Mooncake Transfer Engine MUSA Wheel技术博客:
https://blog.mthreads.com/blog/AI/2026-07-27-mooncake-transfer-engine-musa/
▼ mooncake-transfer-engine-musa on PyPI:
https://pypi.org/project/mooncake-transfer-engine-musa/
▼ Mooncake MUSA Release Workflow:
https://github.com/kvcache-ai/Mooncake/blob/v0.3.12.post1/.github/workflows/release-musa.yaml