在 32GB 内存电脑上本地搭建 Qwen3.6-35B-A3B 大模型踩坑实录

在 32GB 内存电脑上本地搭建 Qwen3.6-35B-A3B 大模型踩坑实录

本文记录我在 红米RedBook 16 pro 2026 Intel core UltraX 7 358H, 32GB 内存电脑上,从零下载、配置、运行 Qwen3.6-35B-A3B-GGUF 本地大模型的完整过程。重点标注每一步容易踩的坑,适合想在自己电脑上跑开源大模型的朋友参考。


一、为什么选 Qwen3.6-35B-A3B

Qwen3.6-35B-A3B 是一个 MoE 架构的开源大模型,虽然总参数量达到 35B,但每次推理时实际激活的参数只有约 3B,所以对硬件的要求比同规模的稠密模型低不少。

对于只有 32GB 内存、没有高端独显 的普通电脑来说,这是一个比较友好的选择。

但"友好"不代表随便下载就能跑。模型文件版本多、量化方式多、工具链配置也多,稍不注意就会走弯路。


二、第一步:选对模型文件

在 ModelScope 或 Hugging Face 上搜索 Qwen3.6-35B-A3B-GGUF,会看到很多文件。

常见文件大致有:

文件 是否建议下载 说明
Qwen3.6-35B-A3B-Q4_K_M.gguf ✅ 推荐 约 21GB,32GB 内存首选
Qwen3.6-35B-A3B-Q5_K_M.gguf ⚠️ 可尝试 效果更好,但内存压力更大
Qwen3.6-35B-A3B-F16 / BF16 ❌ 不建议 文件过大,普通 32GB 内存基本跑不动
mmproj-*.gguf 按需 只有需要图片理解时才下载

我最终选择的是:

text 复制代码
Qwen3.6-35B-A3B-Q4_K_M.gguf

这个版本大约 21.17GB,对 32GB 内存比较合适。


🚩 坑 1:不要下载 F16 / BF16 全精度版本

一开始很容易看到文件列表里有 F16、BF16 这类版本,觉得"精度越高效果越好",就直接下载。

但这类文件通常有 60GB 以上,不仅下载时间极长,而且 32GB 内存根本装不下。

建议:

普通本地部署优先选:

text 复制代码
Q4_K_M

这是精度、体积、速度之间比较平衡的版本。


🚩 坑 2:下载一天没下完,不一定是网络问题

大模型文件动辄十几 GB、二十几 GB,如果用浏览器直接下载,很容易出现:

  • 下载速度越来越慢
  • 进度条不动
  • 中断后无法续传
  • 下载完发现文件大小不对

这时候不要一直等,先检查文件状态。

判断方法:

右键文件 → 属性,看文件大小。

如果目标文件应该是 21.17GB,但本地只有几个 GB,说明没有下载完整。

如果文件名带有:

text 复制代码
.incomplete
.part
.tmp

说明下载还没结束,不能直接拿来运行。

建议:

大模型文件不要用浏览器下载,优先使用支持断点续传的工具,例如:

  • huggingface-cli
  • aria2
  • IDM
  • ModelScope 官方下载工具

🚩 坑 3:模型文件路径不要带中文、空格、特殊符号

模型加载时,路径越干净越稳。

推荐放在类似这样的目录:

text 复制代码
D:\LocalAI\models\Qwen3.6-35B-A3B-Q4_K_M.gguf

不要放在:

text 复制代码
D:\我的模型\Qwen 3.6\模型文件\

中文、空格、特殊符号都可能在某些工具中引发路径解析问题。


三、准备推理工具:llama.cpp

我选择使用 llama.cpp 来加载 GGUF 模型。

基本流程是:

  1. 克隆仓库
  2. 使用 CMake 配置项目
  3. 编译生成可执行文件
  4. 使用 llama-cli 加载模型

示例流程:

powershell 复制代码
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build
cmake --build build --config Release

编译成功后,可执行文件一般在:

text 复制代码
build\bin\Release\llama-cli

🚩 坑 4:cmake 不是系统自带命令

第一次执行:

powershell 复制代码
cmake -B build

很多人会遇到:

text 复制代码
无法将"cmake"项识别为 cmdlet、函数、脚本文件或可运行程序的名称。

这不是 llama.cpp 的问题,而是电脑上没有安装 CMake,或者安装了但没有加入系统 PATH。

解决方法:

  1. 去 CMake 官网下载 Windows 安装包
  2. 安装时勾选:
text 复制代码
Add CMake to the system PATH
  1. 安装完成后,关闭当前 PowerShell
  2. 重新打开一个新的 PowerShell
  3. 再执行:
powershell 复制代码
cmake --version

能输出版本号,才说明配置成功。


🚩 坑 5:安装完 CMake 后,当前窗口不会立刻生效

很多人安装完 CMake 后,直接在原来的 PowerShell 里继续执行:

powershell 复制代码
cmake -B build

结果还是报错。

这是因为环境变量更新后,已经打开的终端不会自动刷新。

解决方法很简单:

关闭当前 PowerShell,重新打开一个新的窗口。


🚩 坑 6:编译可能还需要 Visual Studio Build Tools

llama.cpp 在 Windows 上编译,通常依赖 C++ 编译工具链。

如果执行编译命令时报错,常见原因之一是缺少:

text 复制代码
Visual Studio Build Tools

安装时需要勾选:

text 复制代码
使用 C++ 的桌面开发

如果没有这个环境,cmake --build 很容易失败。


四、第一次运行模型

编译完成后,可以用下面这条命令测试模型是否能正常加载:

powershell 复制代码
.\build\bin\Release\llama-cli -m D:\LocalAI\models\Qwen3.6-35B-A3B-Q4_K_M.gguf -p "你好,请简单介绍一下你自己" -n 256

这条命令的含义是:

参数 含义
-m 指定模型文件路径
-p 输入提示词
-n 256 最多生成 256 个 Token

如果模型能正常输出中文回答,说明本地环境基本跑通。


🚩 坑 7:-n 256 不是 256 个汉字

很多人看到 -n 256,会以为模型会输出 256 个字。

其实不是。

-n 256 表示最多生成 256 个 Token。

Token 是模型处理文本时的最小单位,不等于汉字,也不等于单词。

粗略估算:

text 复制代码
中文:1 个汉字 ≈ 1~1.5 个 Token
英文:1 个 Token ≈ 4 个英文字符

所以:

text 复制代码
256 个 Token ≈ 170~250 个汉字

这只是粗略估算,实际数量会受标点、英文、数字、代码、特殊符号影响。


五、常用参数整理

日常测试时,可以加上这些参数:

powershell 复制代码
.\build\bin\Release\llama-cli ^
  -m D:\LocalAI\models\Qwen3.6-35B-A3B-Q4_K_M.gguf ^
  -p "你好,请简单介绍一下你自己" ^
  -n 256 ^
  -c 4096 ^
  -t 8 ^
  -b 512 ^
  --temp 0.7 ^
  --repeat-penalty 1.1

常用参数含义如下:

参数 含义 建议
-m 模型路径 必填
-p 提示词 单次问答使用
-n 最大生成 Token 数 测试时可用 256
-c 上下文长度 32GB 内存先试 4096
-t CPU 线程数 根据 CPU 调整,如 8 或 12
-b 批处理大小 可先试 512
--temp 温度 0.7 左右较常用
--repeat-penalty 重复惩罚 减少复读,常用 1.1
-i 交互模式 支持连续多轮对话
--color 彩色输出 方便区分输入和输出

如果想进入连续对话模式,可以加 -i:

powershell 复制代码
.\build\bin\Release\llama-cli -m D:\LocalAI\models\Qwen3.6-35B-A3B-Q4_K_M.gguf -p "你好" -n 256 -c 4096 -t 8 -i --color

🚩 坑 8:上下文 -c 不要一上来开太大

很多人觉得上下文越大越好,一上来就设置:

text 复制代码
-c 8192
-c 16384
-c 32768

但上下文越大,内存占用越高。

32GB 内存跑 21GB 左右的 Q4_K_M 模型时,建议先保守一点:

text 复制代码
-c 4096

如果运行稳定,再尝试:

text 复制代码
-c 8192

如果电脑明显变卡、内存占用接近满载,就降回来。


🚩 坑 9:生成速度特别慢,可能不是模型问题

如果模型能跑,但速度很慢,常见原因有几个:

  1. 没有调用 GPU
  2. CPU 线程数设置不合理
  3. 上下文太长
  4. 后台程序占用内存过高
  5. llama.cpp 版本太旧,没有适配当前模型架构

可以先做这几件事:

  • 更新显卡驱动
  • 降低上下文长度
  • 减少后台程序
  • 使用最新 llama.cpp
  • 检查是否启用了 GPU 加速

如果有独立显卡或支持加速的核显,可以尝试加:

text 复制代码
-ngl 99

表示尽量把模型层交给 GPU 处理。


🚩 坑 10:加载失败不一定是模型坏了

如果运行时报格式错误、版本错误、架构不支持,不要急着怀疑模型文件损坏。

更常见的原因是:

text 复制代码
llama.cpp 版本太旧

开源模型更新很快,新模型架构可能需要较新的 llama.cpp 才能支持。

解决方法:

拉取最新代码,重新编译:

powershell 复制代码
git pull
cmake -B build
cmake --build build --config Release

六、完整踩坑清单

下面是整个过程中最值得注意的坑:

  1. 不要下载 F16 / BF16 大文件版本
  2. 浏览器下载大模型容易中断,建议用断点续传工具
  3. 模型路径不要包含中文、空格、特殊符号
  4. cmake 需要单独安装,并加入系统 PATH
  5. 安装完 CMake 后必须重新打开 PowerShell
  6. Windows 编译 llama.cpp 通常需要 Visual Studio Build Tools
  7. -n 256 是 256 个 Token,不是 256 个汉字
  8. 32GB 内存不要一上来把上下文开太大
  9. 生成速度慢时,优先检查 GPU 加速和上下文长度
  10. 加载失败时,优先更新 llama.cpp 版本

七、最后总结

在本地搭建大模型,真正难的不是"下载一个模型",而是把下面几件事串起来:

  • 选对模型量化版本
  • 保证文件下载完整
  • 配置好编译环境
  • 使用正确的推理工具
  • 根据内存和硬件调整参数

对于 32GB 内存电脑来说,Qwen3.6-35B-A3B-Q4_K_M.gguf 是一个比较合适的起点。

只要避开上面这些坑,本地跑通一个开源大模型并没有想象中那么复杂。

下一步可以继续尝试:

  • 接入图形聊天界面
  • 配置 API 服务
  • 测试长文本总结
  • 测试代码生成
  • 尝试图片理解能力

本地大模型的乐趣就在于:所有数据都在自己电脑上,可以自由调试、自由使用。

相关推荐
南京码讯光电技术有限公司44 分钟前
How to Design an Antenna System for an Industrial WiFi Module
数据库·人工智能
秋名山码民1 小时前
AI 用过一次,下一次怎样做得更好?——拙见 AI OS 的自适应、自迭代与受控演化
人工智能
一条破秋裤1 小时前
Linux 共享内存通信:POSIX 共享内存与 mmap
linux·运维·服务器
回眸&啤酒鸭1 小时前
DeepSeek 大模型落地应用与价值实现指南
人工智能
CoderJia程序员甲1 小时前
GitHub 热榜项目 - 周榜(2026-09-26)
ai·大模型·llm·github
怕浪猫1 小时前
LLM 面试必问的 8 个问题,答不上来直接淘汰
人工智能·python·面试
deepseek231 小时前
Lathoa 拆解:让 AI 故意出错比答对更难,反向出题 harness 的三重校验与共模失效困局
人工智能·大模型·可靠性工程
贵州山魈羡民1 小时前
【玩转手机】通过 Podroid 上的 Alpine 部署 1Panel,把微型服务器装进口袋
运维·服务器
红海云1 小时前
AI抬高了职场的第一道门槛
人工智能