在 32GB 内存电脑上本地搭建 Qwen3.6-35B-A3B 大模型踩坑实录
本文记录我在 红米RedBook 16 pro 2026 Intel core UltraX 7 358H, 32GB 内存电脑上,从零下载、配置、运行 Qwen3.6-35B-A3B-GGUF 本地大模型的完整过程。重点标注每一步容易踩的坑,适合想在自己电脑上跑开源大模型的朋友参考。
一、为什么选 Qwen3.6-35B-A3B
Qwen3.6-35B-A3B 是一个 MoE 架构的开源大模型,虽然总参数量达到 35B,但每次推理时实际激活的参数只有约 3B,所以对硬件的要求比同规模的稠密模型低不少。
对于只有 32GB 内存、没有高端独显 的普通电脑来说,这是一个比较友好的选择。
但"友好"不代表随便下载就能跑。模型文件版本多、量化方式多、工具链配置也多,稍不注意就会走弯路。
二、第一步:选对模型文件
在 ModelScope 或 Hugging Face 上搜索 Qwen3.6-35B-A3B-GGUF,会看到很多文件。
常见文件大致有:
| 文件 | 是否建议下载 | 说明 |
|---|---|---|
Qwen3.6-35B-A3B-Q4_K_M.gguf |
✅ 推荐 | 约 21GB,32GB 内存首选 |
Qwen3.6-35B-A3B-Q5_K_M.gguf |
⚠️ 可尝试 | 效果更好,但内存压力更大 |
Qwen3.6-35B-A3B-F16 / BF16 |
❌ 不建议 | 文件过大,普通 32GB 内存基本跑不动 |
mmproj-*.gguf |
按需 | 只有需要图片理解时才下载 |
我最终选择的是:
text
Qwen3.6-35B-A3B-Q4_K_M.gguf
这个版本大约 21.17GB,对 32GB 内存比较合适。
🚩 坑 1:不要下载 F16 / BF16 全精度版本
一开始很容易看到文件列表里有 F16、BF16 这类版本,觉得"精度越高效果越好",就直接下载。
但这类文件通常有 60GB 以上,不仅下载时间极长,而且 32GB 内存根本装不下。
建议:
普通本地部署优先选:
text
Q4_K_M
这是精度、体积、速度之间比较平衡的版本。
🚩 坑 2:下载一天没下完,不一定是网络问题
大模型文件动辄十几 GB、二十几 GB,如果用浏览器直接下载,很容易出现:
- 下载速度越来越慢
- 进度条不动
- 中断后无法续传
- 下载完发现文件大小不对
这时候不要一直等,先检查文件状态。
判断方法:
右键文件 → 属性,看文件大小。
如果目标文件应该是 21.17GB,但本地只有几个 GB,说明没有下载完整。
如果文件名带有:
text
.incomplete
.part
.tmp
说明下载还没结束,不能直接拿来运行。
建议:
大模型文件不要用浏览器下载,优先使用支持断点续传的工具,例如:
huggingface-cliaria2IDM- ModelScope 官方下载工具
🚩 坑 3:模型文件路径不要带中文、空格、特殊符号
模型加载时,路径越干净越稳。
推荐放在类似这样的目录:
text
D:\LocalAI\models\Qwen3.6-35B-A3B-Q4_K_M.gguf
不要放在:
text
D:\我的模型\Qwen 3.6\模型文件\
中文、空格、特殊符号都可能在某些工具中引发路径解析问题。
三、准备推理工具:llama.cpp
我选择使用 llama.cpp 来加载 GGUF 模型。
基本流程是:
- 克隆仓库
- 使用 CMake 配置项目
- 编译生成可执行文件
- 使用
llama-cli加载模型
示例流程:
powershell
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build
cmake --build build --config Release
编译成功后,可执行文件一般在:
text
build\bin\Release\llama-cli
🚩 坑 4:cmake 不是系统自带命令
第一次执行:
powershell
cmake -B build
很多人会遇到:
text
无法将"cmake"项识别为 cmdlet、函数、脚本文件或可运行程序的名称。
这不是 llama.cpp 的问题,而是电脑上没有安装 CMake,或者安装了但没有加入系统 PATH。
解决方法:
- 去 CMake 官网下载 Windows 安装包
- 安装时勾选:
text
Add CMake to the system PATH
- 安装完成后,关闭当前 PowerShell
- 重新打开一个新的 PowerShell
- 再执行:
powershell
cmake --version
能输出版本号,才说明配置成功。
🚩 坑 5:安装完 CMake 后,当前窗口不会立刻生效
很多人安装完 CMake 后,直接在原来的 PowerShell 里继续执行:
powershell
cmake -B build
结果还是报错。
这是因为环境变量更新后,已经打开的终端不会自动刷新。
解决方法很简单:
关闭当前 PowerShell,重新打开一个新的窗口。
🚩 坑 6:编译可能还需要 Visual Studio Build Tools
llama.cpp 在 Windows 上编译,通常依赖 C++ 编译工具链。
如果执行编译命令时报错,常见原因之一是缺少:
text
Visual Studio Build Tools
安装时需要勾选:
text
使用 C++ 的桌面开发
如果没有这个环境,cmake --build 很容易失败。
四、第一次运行模型
编译完成后,可以用下面这条命令测试模型是否能正常加载:
powershell
.\build\bin\Release\llama-cli -m D:\LocalAI\models\Qwen3.6-35B-A3B-Q4_K_M.gguf -p "你好,请简单介绍一下你自己" -n 256
这条命令的含义是:
| 参数 | 含义 |
|---|---|
-m |
指定模型文件路径 |
-p |
输入提示词 |
-n 256 |
最多生成 256 个 Token |
如果模型能正常输出中文回答,说明本地环境基本跑通。
🚩 坑 7:-n 256 不是 256 个汉字
很多人看到 -n 256,会以为模型会输出 256 个字。
其实不是。
-n 256 表示最多生成 256 个 Token。
Token 是模型处理文本时的最小单位,不等于汉字,也不等于单词。
粗略估算:
text
中文:1 个汉字 ≈ 1~1.5 个 Token
英文:1 个 Token ≈ 4 个英文字符
所以:
text
256 个 Token ≈ 170~250 个汉字
这只是粗略估算,实际数量会受标点、英文、数字、代码、特殊符号影响。
五、常用参数整理
日常测试时,可以加上这些参数:
powershell
.\build\bin\Release\llama-cli ^
-m D:\LocalAI\models\Qwen3.6-35B-A3B-Q4_K_M.gguf ^
-p "你好,请简单介绍一下你自己" ^
-n 256 ^
-c 4096 ^
-t 8 ^
-b 512 ^
--temp 0.7 ^
--repeat-penalty 1.1
常用参数含义如下:
| 参数 | 含义 | 建议 |
|---|---|---|
-m |
模型路径 | 必填 |
-p |
提示词 | 单次问答使用 |
-n |
最大生成 Token 数 | 测试时可用 256 |
-c |
上下文长度 | 32GB 内存先试 4096 |
-t |
CPU 线程数 | 根据 CPU 调整,如 8 或 12 |
-b |
批处理大小 | 可先试 512 |
--temp |
温度 | 0.7 左右较常用 |
--repeat-penalty |
重复惩罚 | 减少复读,常用 1.1 |
-i |
交互模式 | 支持连续多轮对话 |
--color |
彩色输出 | 方便区分输入和输出 |
如果想进入连续对话模式,可以加 -i:
powershell
.\build\bin\Release\llama-cli -m D:\LocalAI\models\Qwen3.6-35B-A3B-Q4_K_M.gguf -p "你好" -n 256 -c 4096 -t 8 -i --color
🚩 坑 8:上下文 -c 不要一上来开太大
很多人觉得上下文越大越好,一上来就设置:
text
-c 8192
-c 16384
-c 32768
但上下文越大,内存占用越高。
32GB 内存跑 21GB 左右的 Q4_K_M 模型时,建议先保守一点:
text
-c 4096
如果运行稳定,再尝试:
text
-c 8192
如果电脑明显变卡、内存占用接近满载,就降回来。
🚩 坑 9:生成速度特别慢,可能不是模型问题
如果模型能跑,但速度很慢,常见原因有几个:
- 没有调用 GPU
- CPU 线程数设置不合理
- 上下文太长
- 后台程序占用内存过高
- llama.cpp 版本太旧,没有适配当前模型架构
可以先做这几件事:
- 更新显卡驱动
- 降低上下文长度
- 减少后台程序
- 使用最新 llama.cpp
- 检查是否启用了 GPU 加速
如果有独立显卡或支持加速的核显,可以尝试加:
text
-ngl 99
表示尽量把模型层交给 GPU 处理。
🚩 坑 10:加载失败不一定是模型坏了
如果运行时报格式错误、版本错误、架构不支持,不要急着怀疑模型文件损坏。
更常见的原因是:
text
llama.cpp 版本太旧
开源模型更新很快,新模型架构可能需要较新的 llama.cpp 才能支持。
解决方法:
拉取最新代码,重新编译:
powershell
git pull
cmake -B build
cmake --build build --config Release
六、完整踩坑清单
下面是整个过程中最值得注意的坑:
- 不要下载 F16 / BF16 大文件版本
- 浏览器下载大模型容易中断,建议用断点续传工具
- 模型路径不要包含中文、空格、特殊符号
cmake需要单独安装,并加入系统 PATH- 安装完 CMake 后必须重新打开 PowerShell
- Windows 编译 llama.cpp 通常需要 Visual Studio Build Tools
-n 256是 256 个 Token,不是 256 个汉字- 32GB 内存不要一上来把上下文开太大
- 生成速度慢时,优先检查 GPU 加速和上下文长度
- 加载失败时,优先更新 llama.cpp 版本
七、最后总结
在本地搭建大模型,真正难的不是"下载一个模型",而是把下面几件事串起来:
- 选对模型量化版本
- 保证文件下载完整
- 配置好编译环境
- 使用正确的推理工具
- 根据内存和硬件调整参数
对于 32GB 内存电脑来说,Qwen3.6-35B-A3B-Q4_K_M.gguf 是一个比较合适的起点。
只要避开上面这些坑,本地跑通一个开源大模型并没有想象中那么复杂。
下一步可以继续尝试:
- 接入图形聊天界面
- 配置 API 服务
- 测试长文本总结
- 测试代码生成
- 尝试图片理解能力
本地大模型的乐趣就在于:所有数据都在自己电脑上,可以自由调试、自由使用。