前期准备(极简版,不用多复杂)
- 一台Mac(重点:Apple Silicon M系列芯片最佳!推理速度比Intel芯片快太多,体验翻倍)
- 足够的内存(划重点!8GB仅能跑Qwen3.5小版本,想流畅跑Gemma4,建议至少16GB,内存越大越流畅)
- 网络(仅第一次下载模型需要,后续完全本地运行,断网也能正常用)
一、第一步:先避坑!搞懂你的Mac能跑什么模型
很多新手第一次折腾本地模型,刚起步就翻车------核心原因就一个:选了个自己Mac跑不动的模型!要么内存不够直接报错,要么跑起来卡到怀疑人生,白忙活一场。
所以第一步,咱们先用水滴工具llmfit,快速扫描你的硬件,筛选出适配的模型。

这个工具会自动检测你的RAM、CPU、GPU,从几百个模型里筛选出"能跑、好用"的,还会按适配度排序,小白也能一眼看明白。
操作步骤超简单,跟着来:
- 在终端里输入命令,回车安装llmfit:
brew install llmfit; - 安装完成后,直接输入
llmfit,回车运行; - 会弹出交互界面,搜索你感兴趣的模型(google/gemma4 或 qwen/qwen3.5),看Fit一栏就好:
Perfect、Good都能流畅跑,Marginal勉强能用,Too Tight直接放弃,别给自己找罪受。

我这边选择的是qwen3.5 9b。其实我这个电脑配置,选择qwen3.5 27b也是没问题的,但是我想先用qwen3.5 9b试试水。
1.1 贴一张大概的图吧,具体你自己跑上面的命令
对照适配度选版本(部分模型可能搜索不到,以实际结果为准)。

二、第二步:安装Ollama(核心工具,新手零难度)
Ollama是咱们部署模型的"核心助手",负责模型的下载、加载和运行,还自带本地API,不用手动配置,是目前新手最省事的方案,没有之一。
以下是各种部署方式使用场景:几种本地部署模型的方式如何选择
- 命令行,执行:
brew install --cask ollama; - 当出现"ollama-app was successfully installed! ",就说明安装成功啦!
brew install --cask ollama是带图形界面的,兼具有使用命令行功能。brew install ollama,纯命令行
成功图片:

安装完成后,看Mac菜单栏右上角------会出现一个🦙图标,这是Ollama在后台运行的标志,看到它,就可以放心进入下一步啦~

三、第三步:选模型下载(2个高性价比选择,二选一即可)
四、其他
4.1 ollama 拉取qwen3.5 9b异常

原因:在 Mac 机型上运行 Ollama 拉取 qwen3.5:9b 模型时仍报 Error: EOF,说明问题已超出常规网络或磁盘空间范畴,更可能涉及系统级文件句柄锁定、Ollama 服务状态异常或模型仓库元数据损坏。
4.1.1 彻底清理残留文件并重置 Ollama 服务
这是最关键的一步。Ollama 不支持断点续传,若上次下载中断,残留的 .partial 文件会阻塞新下载。即使你之前执行过删除命令,也可能因权限或服务未重启而无效。
1.完全停止 Ollama 服务
打开"活动监视器",搜索 ollama,强制退出所有相关进程。或在终端执行:
bash
pkill -f ollama
2.手动删除所有残留文件
执行以下命令,确保彻底清除:
bash
rm -rf ~/.ollama/models/blobs/*
rm -rf ~/.ollama/models/manifests/*
find ~/.ollama -name "*.partial" -delete
3.重启 Ollama 服务
重新打开终端,执行:
bash
ollama serve &
等待几秒后,再运行:
bash
ollama run qwen3.5:9b
出现这个就成功了:
