苹果这几天连续更新了 M6、M5 Pro、M5 Max、M5 Ultra 四款芯片,以及搭载它们的 Mac mini 和 Mac Studio。一句话概括:苹果正式进入 2nm 时代,Mac 本地跑大模型这件事,从"能跑"变成了"能认真跑"。新品今天起接受预购,9 月 22 日开售。
这次发布的技术本质是什么
先说硬件层面的变化。M6 是苹果首款 2nm 工艺芯片,采用 12 核 CPU、12 核 GPU 和双 16 核神经引擎,统一内存带宽最高 170GB/s,多线程性能相比 M5 提升约 1.2 倍。搭载 M6 的 Mac mini,AI 性能最高提升 4 倍、CPU 性能提升 40%,支持 Wi-Fi 7 和蓝牙 6,最高可选 32GB 统一内存;同系列另一档 M5 Pro 版最高支持 64GB 统一内存和 307GB/s 的内存带宽。一口气发四款芯片、两款机器,这个节奏本身就说明苹果把"本地 AI 算力"当成了产品主线,而不是顺带升级。
更大的看点是 M5 Ultra。据苹果官方介绍,这是苹果首个四芯片封装架构,最高 36 核 CPU、80 核 GPU,统一内存带宽达到 1.2TB/s,比 M3 Ultra 提升 50%。搭载它的 Mac Studio 最高可选 512GB 统一内存,AI 计算性能最高提升 4.3 倍,存储速度提升 2 倍,四台集群还能带来最高 3 倍的分布式 AI 推理速度提升。价格方面,Mac Studio 的 M5 Max 版起售价 19999 元,M5 Ultra 版起售价 46999 元,最高 512GB 内存版本预计 10 月底上市。苹果同时强调开发者可借助 Core ML 等框架对两款新芯片做自动优化。
为什么这些数字对 AI 开发者有意义?因为大模型推理最吃的是"内存容量 + 内存带宽",而不是单纯算力。苹果的统一内存架构让内存可以直接当显存用,M5 Ultra 的 512GB 容量加上 1.2TB/s 带宽,意味着几十 B 甚至上百 B 参数的模型可以整体装进内存里推理,不需要切片、不需要频繁换入换出。这和几年前"本地只能跑 7B、13B 小模型"是本质区别,也正好接上了开源模型一路变大的趋势------模型越做越大,苹果就把本地能装下的上限一路抬高。
没变的是什么?生态没变。本地推理还是 Ollama、MLX、llama.cpp 那一套工具链,跑的也还是那些开源模型------苹果提供的是更大的"容器",不是新的模型。工艺从 5nm、3nm 走到 2nm,改变的是能效和密度,改变的依然是"一台机器能装下多大模型"这件事,而不是模型本身。
对普通开发者意味着什么
对做 AI 应用开发的打工人来说,最实际的影响是本地调试成本降下来了。以前想试一个 70B 的开源模型,要么租云 GPU,要么在公司机器上排队;现在一台 M5 Ultra 的 Mac Studio 就能全量跑,开发、测试、部署同一台机器搞定。对医疗、金融、有私有代码的企业场景,数据不出本机这点吸引力更大,很多企业迟迟不上大模型应用,卡点不是模型能力而是数据合规,本地推理正好绕开了这一层。
但也要清醒:46999 元起步的 M5 Ultra 版不是个人消费的,是公司采购的。 普通开发者更多是"公司买、我来用"的角色,省下的云 GPU 成本进了公司的账,我们能拿到的是更顺手的开发环境。
怎么选、怎么用、有哪些坑
选配置按模型规模来,大致可以这样对号入座:
| 需求 | 建议配置 |
|---|---|
| 跑 7B-14B 小模型、日常开发 | M6 版 Mac mini(最高 32GB 统一内存) |
| 跑 32B-70B 中大型模型 | M5 Pro / M5 Max |
| 全量跑 70B-100B+ 模型 | M5 Ultra(512GB 版本) |
实际跑起来很简单,工具链都是现成的:
bash
# 用 Ollama 直接拉模型,统一内存会自动当显存用
ollama pull qwen3:32b
ollama run qwen3:32b
# 用苹果自家 MLX 框架做本地推理实验
pip install mlx
python -c "import mlx.core as mx; print(mx.array([1,2,3]))"
# llama.cpp 系工具也通用,按需编译 CPU/GPU 版本
git clone https://github.com/ggerganov/llama.cpp
几个坑值得提前知道:
- "AI 性能提升 4.3 倍"是特定工作负载下的数字,拿跑分当实际收益会失望,买之前用自己真实的模型任务测一遍。
-
- 统一内存不是无限的显存,模型超过内存容量时会走 SSD 交换,速度断崖式下跌,这是本地推理最容易踩的坑。
-
- 512GB 版本 10 月底才上市,现在预购的是 36GB-256GB 区间,真有全量跑大模型需求的得等。
-
- 本地开源模型 ≠ 云端旗舰模型 。代码生成、复杂推理这些任务上,开源模型和闭源旗舰仍有差距,本地跑主要图的是数据安全和成本,不是能力天花板。
我的建议是:先拿现有机器加 Ollama 把工作流跑通,用自己项目里的真实任务对比一下模型输出,确认能力满足需求,再决定要不要等 512GB 版本。硬件升级解决的是"跑不跑得动",解决不了"模型行不行"。
- 本地开源模型 ≠ 云端旗舰模型 。代码生成、复杂推理这些任务上,开源模型和闭源旗舰仍有差距,本地跑主要图的是数据安全和成本,不是能力天花板。
本地推理的硬件瓶颈正在一步步松绑,接下来真正拼的就是模型本身了。你怎么看 Mac 本地跑大模型这条路线,评论区聊聊。