摩尔线程开源高性能MATE算子库 释放全功能GPU算力潜能

摩尔线程MATE(MUSA AI Tensor Engine)是面向生成式AI的开源高性能算子库 ,聚焦大模型训练与推理的核心计算路径,为上层模型与推理框架提供高性能、易集成、强兼容的GPU算子能力,显著降低开发者接入主流开源算子生态的工程成本。

目前,MATE已作为关键后端能力落地vLLM与SGLang等主流推理框架,为其在摩尔线程MUSA统一系统架构上的原生运行提供核心算子层支撑,加速大模型在摩尔线程全功能GPU平台上的高效部署与性能释放。

算子效率是GPU性能释放的关键

大模型竞争正从单一模型能力,进入模型、系统与算力协同优化的新阶段。随着DeepSeek、Qwen、GLM、Kimi、MiniMax等新一代模型持续演进,模型的计算模式日趋复杂:模型架构从传统Transformer拓展至多头潜在注意力(MLA)、稀疏注意力(Sparse Attention)、混合专家(MoE)等多样化设计,计算精度也向FP8、FP4等低精度方向演进,GPU承担的计算任务持续快速变化。

对大模型训练和推理而言,GPU性能并不只取决于硬件峰值算力,核心算子的实际执行效率,以及算子与模型、推理框架之间的协同程度,正越来越直接地决定最终的模型性能。

与此同时,AI开源生态也已形成高度成熟的算子体系,FlashAttention、DeepGEMM、FlashMLA、SageAttention等项目正不断成为主流推理框架和模型的重要依赖。如何同时做到充分发挥硬件性能、快速跟进模型演进、兼容成熟开源生态、降低开发者迁移成本,是构建完整GPU AI软件栈的关键命题。

MATE高性能算子库

针对上述挑战,摩尔线程MATE算子库提供高性能的Attention、GEMM、MoE及稀疏/量化计算等算子能力。

**▼**底层通过Assembly、MUTLASS、TileLang-MUSA等多种实现后端进行针对性优化。

**▼**上层通过Wrapper兼容FlashAttention、DeepGEMM、FlashMLA、SageAttention等主流开源项目,并进一步连接vLLM、SGLang等推理生态。

MATE并非简单的算子集合,而是连接上层应用与底层硬件、贯通摩尔线程全功能GPU与生成式AI软件生态的高性能计算基础设施。为此,MATE从性能优化、生态兼容、工程体验三个维度构建了核心能力。

1. 高性能优化

MATE针对大模型真实工作负载进行优化,而非仅关注单一Kernel的理论性能。通过多种Kernel后端的协同设计,MATE在追求极致性能的同时,亦保持了针对快速算法迭代的敏捷响应能力。

**在Attention方向:**覆盖FlashAttention-3 Fwd/Bwd、FlashMLA、SageAttention、DeepSeek稀疏注意力(HCA/CSA)、GDN、KDA、MSA等。

**在GEMM与MoE方向:**覆盖Dense GEMM、Grouped GEMM、Mixed-DType MoE GEMM(S4FP8/FP4FP8等)以及DeepGEMM MQA Logits/mHC。

2. AI生态兼容

在生态兼容上,MATE的设计理念是:**让开发者尽可能复用已有代码,无需为迁移GPU而重新开发。**目前,MATE已为主流开源算子项目提供兼容Wrapper,开发者可沿用原有API使用方式,底层由MATE算子执行。

**FlashAttention-3:**兼容原生package、import及API使用方式,支持SGLang/vLLM FA3 fork场景。

**DeepGEMM:**兼容原生API,覆盖Grouped GEMM、MQA Logits、mHC等能力。

**FlashMLA:**兼容原生使用方式,覆盖Dense/Sparse场景。

**SageAttention:**提供标准sageattn接口,支持FP8/INT8等量化计算模式。

FlashKDA、MSA等Wrapper也已支持前沿大模型的推理需求。

基于上述能力,MATE已落地vLLM与SGLang推理框架,提供核心Attention与GEMM算子的底层执行能力,支撑广泛的大模型推理场景。

3. 完整工程能力

除了关注算子性能,MATE同样重视开发者的实际使用体验,让算子不仅性能高,更易用、易集成、易调试。

**JIT编译:**MATE算子全面支持JIT编译,可根据运行环境与Workload灵活编译。

**TVM-FFI ABI:**解耦Torch版本依赖,降低环境变动带来的影响。

**▼****MATE CLI:**提供mate show-config、mate env等命令,帮助开发者快速查看环境、版本与调试配置。

**Guard Allocator:**用于定位GPU illegal memory access等问题。

**mate-mubin:**管理汇编Kernel,同时支持在线与离线部署场景。

性能实测:从算子到模型

在Kernel层面,MATE核心算子在真实工作负载下表现出极高效率(以SOL即Speed-of-Light衡量,代表实际性能占硬件峰值算力或者峰值带宽的比例):

在模型层面,MATE作为底层算子引擎,与vLLM-MUSA、SGLang-MUSA推理框架深度协同,已支撑DeepSeek-V4、Kimi K3、GLM-5.3、Qwen3.8、MiniMax H3/M3等前沿大模型的Day-0部署与性能优化。在部分推理场景中,基于MATE的摩尔线程全功能GPU单卡吞吐量已达到国际高端GPU的40%以上。

开源共建

摩尔线程将持续深耕开源生态,不断丰富MATE高性能算子矩阵。MATE当前版本为v0.2.6,开发者可前往摩尔线程GitHub官方仓库获取MATE最新版本、安装指南、API文档、Tutorial、Benchmark、Release Notes、Issue与Discussion。

摩尔线程诚挚邀请广大开发者参与共建,共同推动高性能算子引擎持续演进,繁荣国产AI算力生态,让国产算力在更多AI商业化核心场景中释放价值。

了解摩尔线程MATE高性能算子库更多信息,请访问链接或点击下方"阅读原文":

MATE开源地址

https://github.com/MooreThreads/mate

MATE技术文档

https://mate-docs.mthreads.com/latest/

*以上测试数据来自摩尔线程实验室。

阅读原文

相关推荐
分布式存储与RustFS2 小时前
把 RustFS 当 ClickHouse 的 S3 存储盘:冷热分层落对象存储
云原生·开源·对象存储·分布式存储·s3·rustfs·性能基准
芷栀夏2 小时前
开源菜谱工具 cook 实践:按食材筛选菜谱、随机推荐,并用 Docker 部署到本地
docker·容器·开源
zzzzzz3103 小时前
Claude Code:把 AI 放进终端,真正值得关注的是什么
人工智能·开源·命令行
冬奇Lab14 小时前
一天一个开源项目(第210篇):herdr - AI 编程 Agent 的运行时底座
人工智能·开源·资讯
a11177615 小时前
Shirone 二次元博客主题 开源
前端·开源
嘟嘟嘟952717 小时前
Kubernetes 引入 KYAML:更安全的 YAML 子集
人工智能·架构·开源
hui-梦苑17 小时前
[OpenSource]LabPress 正式开源:面向科研实验室的轻量内容管理系统
开源·cms·科研·轻量化·内容管理系统
阿里云云原生18 小时前
阿里云亮相开源 AI 三大顶会!我们上海见
开源