一句话定位:一套统一 AI 开发与部署的平台,包含一门新语言(Mojo)和一个推理框架(MAX),目标是让开发者用 Python 的写法获得接近 C++ 的性能。

为什么需要关注这个项目?
先看两个数字:28,238 颗星星 ,3,019 个 fork。
这在 AI 开发工具的开源项目中,已经是一个相当有影响力的规模。但更值得关注的不是数字本身,而是背后的人和野心。
这个项目的创始人是 Chris Lattner ------LLVM 编译器基础设施的创始人、Swift 语言的创造者、前苹果和特斯拉的高级工程主管。简单说,这个人过去二十年一直在做一件事:让底层编程变得更容易。
LLVM 改变了整个编译器行业,Swift 让 iOS 开发从 Objective-C 的复杂中解放出来。现在,他想做第三次改变------针对 AI 时代。
Github:
它由什么组成?
Modular 平台由两大核心组成:
一、Mojo 语言
Mojo 是一门Python 的超集。这句话的意思是:你可以在 Mojo 里写 Python 代码,它完全兼容,但同时它增加了系统级编程的能力------比如手动管理内存、调用 GPU 指令、编译时优化。
用一个类比:如果说 Python 是一辆自动挡轿车,那 Mojo 就是一辆既有自动挡又有手动挡的赛车。日常开自动挡就行,需要极致性能的时候可以切手动挡。
Mojo 最初是闭源的,2026 年 8 月刚刚开源。目前最新版本是 Mojo 1.0.0(2026 年 8 月 11 日发布),标志着它正式进入稳定阶段。
从代码占比看:仓库中 47.7% 是 Mojo 代码,31.8% 是 Python,12.7% 是 C++。这说明 Mojo 不只是一个概念,它已经在实际的大规模项目中被使用了。
二、MAX 推理框架

MAX 是一个 AI 模型推理和部署框架,核心能力包括:
- MAX 加速器库 (
max/kernels):手写优化的 GPU 和 CPU 内核,针对 AI 常见运算做了极致优化 - MAX 推理服务器 (
max/python/max/serve):提供 OpenAI 兼容的 API 端点,意味着你可以用 MAX 替代 OpenAI 的接口,部署自己的模型 - MAX 模型流水线 (
max/python/max/pipelines):Python 实现的模型图,支持多种主流架构
MAX 的核心卖点是硬件无关性:同一份模型代码,可以在 NVIDIA GPU、AMD GPU、Intel GPU、Apple Silicon、甚至 CPU 上运行,无需修改。底层的适配由 MAX 自动完成。
它解决了什么问题?
问题一:Python 太慢,C++ 太难
AI 开发的核心矛盾是:Python 是事实上的标准语言,但它太慢了。训练一个大模型,Python 本身的执行开销可以占到总时间的 30% 以上。C++ 快,但写起来太痛苦,调试成本极高。
Mojo 试图同时解决这两个问题:语法上像 Python,性能上像 C++。
Chris Lattner 在多次演讲中提到:Mojo 在 CPU 上可以比 Python 快 68,000 倍。这个数字虽然有特定测试条件,但量级上的差异是真实的。
问题二:AI 推理的硬件碎片化
今天部署一个 AI 模型,你面临的选择是:NVIDIA 的 CUDA、AMD 的 ROCm、Intel 的 oneAPI、Google 的 TPU、AWS 的 Inferentia......每种硬件都有自己的编程接口,切换成本极高。
MAX 的策略是:在框架层屏蔽硬件差异。开发者只需要写一份模型代码,MAX 负责把它编译成目标硬件的最优执行路径。底层用的是 MLIR(一种编译器中间表示),这也是 Chris Lattner 的老本行。
问题三:AI 工具链的割裂
目前 AI 开发的工具链是割裂的:训练用 PyTorch、推理用 ONNX 或 TensorRT、部署用 Triton 或 vLLM、优化用 TensorRT......每个环节都有不同的工具,集成成本很高。
Modular 的野心是统一整个链路:用 Mojo 写高性能算子,用 MAX 做模型编译和推理,用一个推理服务器对外提供服务。一条链路,从模型到部署。
竞品对比
| 维度 | Modular(Mojo + MAX) | PyTorch | vLLM | Triton(OpenAI) | JAX |
|---|---|---|---|---|---|
| GitHub Stars | 28,238 | 102,505 | 89,605 | 15,000+ | 30,000+ |
| 核心定位 | 统一开发+部署平台 | 训练框架 | 高性能推理引擎 | GPU 内核编程语言 | 函数式数值计算 |
| 编程语言 | Mojo(Python 超集) | Python | Python + C++/CUDA | Python + C++ | Python + XLA |
| 硬件支持 | GPU/CPU/TPU/Apple Silicon | GPU(CUDA 为主) | NVIDIA/AMD/TPU | NVIDIA GPU | TPU/GPU/CPU |
| 模型兼容 | PyTorch/ONNX/TF 模型 | 原生 PyTorch 模型 | HuggingFace 模型 | 自定义内核 | JAX 模型 |
| 推理服务器 | OpenAI 兼容 API | 无(需第三方) | OpenAI 兼容 API | 无(需集成) | 无(需第三方) |
| 性能优化层级 | 编译时优化 + 运行时优化 | 运行时优化 | 运行时优化 | 编译时优化(内核级) | XLA 编译优化 |
| 开源时间 | 2026年8月 | 2016年 | 2023年 | 2023年 | 2018年 |
| 社区成熟度 | 早期(423 贡献者) | 成熟(3000+ 贡献者) | 成熟 | 早期 | 成熟 |
| 许可证 | Apache 2.0 + Modular 社区许可 | BSD 3-Clause | Apache 2.0 | Apache 2.0 | Apache 2.0 |
关键差异总结
vs PyTorch :PyTorch 是训练领域的绝对王者,生态无可比拟。Modular 的野心不在训练,而在推理部署------这是 PyTorch 生态相对薄弱的环节。Mojo 可以作为 PyTorch 模型的高性能部署后端,而非替代品。
vs vLLM:vLLM 是目前最流行的 LLM 推理引擎,专注于大语言模型的服务化。MAX 的范围更广,覆盖所有类型的 AI 模型(视觉、语音、推荐等),且提供了从语言到推理的完整链路。vLLM 更像是 MAX 的一个子集对标。
vs Triton:Triton 是 OpenAI 开发的 GPU 内核编程语言,专注于手写高性能算子。Mojo 与 Triton 有相似的底层理念(编译时优化),但 Mojo 是通用语言,而 Triton 更像是 DSL(领域特定语言)。
vs JAX:JAX 用函数式编程范式做数值计算,学术界很流行。Modular 的定位更工程化------它不仅要好算,还要好部署。
为什么它值得持续关注?
理由一:创始人背景极强
Chris Lattner 不是一个普通的开源爱好者。LLVM 和 Swift 已经证明了他在编程语言和编译器领域的顶级能力。当这样的人说"我要为 AI 重新设计一门语言",认真对待是明智的。
理由二:Mojo 刚刚开源,潜力巨大
Mojo 在 2026 年 8 月才开源,目前还处于非常早期的阶段。但从代码提交记录看(53,766 次提交),内部开发强度极高。这种规模的代码库在开源初期就公开,说明团队对技术有信心。
理由三:AI 推理是下一个战场
训练大模型的能力已经集中在少数巨头手中,但推理部署仍然是所有开发者都需要面对的问题。谁能提供最简单、最高效的推理方案,谁就掌握了 AI 应用落地的钥匙。MAX 的 OpenAI 兼容 API 设计,让它可以无缝替代现有的推理服务。
理由四:Mojo 1.0 发布意味着什么
语言从 0.x 到 1.0 的跨越,意味着承诺了向后兼容性。对于一个新语言来说,这是信心的信号:开发者可以开始认真在上面构建项目了,不用担心下一版 API 全变。
如何使用?
语言层面:Mojo 快速体验
bash
# 安装 Mojo
curl -fsSL https://get.modular.com | sh
# 写一个 hello world
cat > hello.mojo << 'EOF'
def main():
print("Hello from Mojo!")
EOF
# 运行
mojo hello.mojo
推理层面:MAX 快速部署
python
from max.pipelines import Pipeline
# 加载一个模型
pipeline = Pipeline("meta-llama/Llama-3.1-8B-Instruct")
# OpenAI 兼容的推理
response = pipeline.generate("Hello, world!")
print(response)
Docker 部署
MAX 也支持 Docker 一键部署,适合生产环境:
bash
docker pull modularai/max
docker run -p 8000:8000 modularai/max --model meta-llama/Llama-3.1-8B-Instruct
这个项目适合谁?
AI 框架开发者------如果你正在构建自己的 AI 工具链,Mojo 提供了一种在 Python 生态中获得系统级性能的方式。
模型部署工程师------MAX 的硬件无关性和 OpenAI 兼容 API,让它成为部署自有模型的有力选项。
性能敏感的 AI 应用------如果你的模型推理速度是瓶颈,Mojo 编写的自定义算子可以带来数量级的提升。
编程语言爱好者------Mojo 本身是一门设计精良的新语言,值得学习和研究。
对 AI 底层感兴趣的人------了解 Modular 的技术路线,有助于理解 AI 基础设施的未来走向。
Github:
总结
Modular 平台不是一个"又一个 AI 工具"。它的野心是重新定义 AI 开发的基础层:用一门新语言解决性能问题,用一个新框架解决硬件碎片化问题。
28,238 颗星星、LLVM 创始人的背书、53,000+ 次提交的代码库、刚刚发布的 1.0 版本------这些信号都指向同一个判断:这是一个值得严肃对待的项目。
当然,它也面临巨大挑战:PyTorch 和 vLLM 的生态壁垒极高,开发者迁移成本不低,Mojo 的社区还需要时间成长。但从长远看,如果 AI 开发真的需要一门比 Python 更快、比 C++ 更易用的语言,Mojo 可能是目前最有力的候选者。
我的理解
看完 Modular 的代码库,我最大的感受是:这个项目认真得可怕。
53,000 多次提交、423 个贡献者、从编译器到推理服务器的完整链路------这不是一个"先发布再看反馈"的项目,这是一个有清晰长期愿景、正在按计划推进的工程。
Mojo 的设计哲学也很打动我:不替代 Python,而是扩展 Python。这种"兼容而非取代"的策略,比从零造一门新语言要聪明得多------它让迁移成本几乎为零,让开发者可以用渐进的方式拥抱新工具。
2026 年 8 月,Mojo 1.0 发布,MAX 开源。这可能是一个重要的时间节点------不是因为它会立刻颠覆什么,而是因为一个有能力重新定义规则的人,终于把他的答案公开了。
接下来要看的,是社区能不能接住这个答案。
关注
如果你觉得这篇文章对你有帮助,欢迎关注我的公众号,获取更多优质开源项目的深度解读。