最近不少朋友问我本地大模型怎么搭。统一写篇文章,把我目前在用的方案完整分享出来。
这篇文章面向有一定计算机基础、想认真折腾本地 AI 的朋友。我会讲清楚硬件怎么选、软件怎么配、模型怎么挑、工作流怎么搭,以及我踩过的坑和最终的方案选型。
全文都是实战经验,没有空话。
一、硬件选型:我的配置与推荐思路
先说说我自己的主力机器配置:
- CPU:i7-13700KF
- 显卡:RTX 4090(24GB 显存)
- 内存:64GB DDR5
- 存储:2TB NVMe 固态
- 电源:1000W 金牌
这套配置当时配下来一万八左右,放在 2026 年属于高端消费级,但跑大模型非常舒服。
显卡怎么选?
优先显存,其次算力。跑大模型,显存容量比显卡性能等级重要得多。
给大家一个非常实在的选购建议:
- 预算有限:RTX 4070 Ti Super(16GB),四千多,能流畅跑 14B,性价比最高
- 主力使用:RTX 4090(24GB),能跑 32B,一步到位,三年不落后
- 专业需求:RTX A6000(48GB)或 L40S,能跑 70B,企业用户考虑
- 苹果用户:直接上 36GB 统一内存起步的 M 系列,越多越好
不建议买 8GB 显存以下的卡跑大模型,体验会很差。也没必要盲目追求旗舰卡,24GB 对个人用户来说是甜点。
CPU 和内存呢?
CPU 不重要,主流就行。大模型推理几乎全靠 GPU,CPU 只要不拖后腿就行。
内存建议 32GB 起步,64GB 更好。大模型会占一部分内存做缓存,而且你开浏览器、开 IDE 也要内存。16GB 内存的话,跑大模型的时候电脑会很卡。
存储
模型文件都很大,7B 模型大概 4-5GB,14B 约 8-10GB,32B 二十多 GB,70B 四五十 GB。多下几个模型就上百 GB 了。
建议至少 1TB 固态,有条件直接 2TB。机械盘就别想了,加载模型能等好几分钟。
二、软件栈:从底层到应用的完整方案
我的软件栈分三层:推理层、接口层、应用层。
第一层:推理引擎 ------ vLLM 为主,Ollama 为辅
主力用 vLLM。原因很简单:快。同样的硬件,vLLM 的推理速度比 Ollama 快两倍以上,并发能力更是碾压。
vLLM 的 PagedAttention 技术真的是黑科技,显存利用率极高。我用 4090 跑 Qwen2.5-14B-AWQ,速度能到每秒 80+token,非常丝滑。
缺点是安装稍微麻烦点,需要 CUDA 环境。Windows 用户建议用 WSL2 装,体验跟原生 Linux 差不多。
备用 Ollama。有时候快速试个新模型,或者临时用一下,Ollama 还是方便的,一行命令搞定。
第二层:API 网关 ------ 自建兼容 OpenAI 格式的接口
这一层很重要,很多人忽略了。
我在推理引擎前面加了个 API 网关,统一成 OpenAI 格式的接口。这样做的好处是:所有前端应用、插件、第三方工具,只要支持 OpenAI API,就能直接连我的本地模型,不用改代码。
网关还做了几件事:
- 模型路由:不同任务自动分配不同模型
- 负载均衡:多卡的时候自动分发
- 用量统计:记录调用量,心里有数
- 缓存:相同问题直接返回结果,省算力
简单点的话,直接用 vLLM 自带的 OpenAI 兼容接口也行,功能够用。
第三层:前端应用 ------ 多端适配
前端我同时用好几个,不同场景用不同的:
- Chatbot UI / Open WebUI:主力聊天界面,功能全,支持多模型切换、对话管理、提示词模板。浏览器直接访问,电脑手机都能用。
- Cursor / VS Code 插件:写代码用。把 API 地址改成本地的,代码补全、解释、重构全用本地模型。
- Obsidian + BMO 插件:笔记软件里直接调用 AI,总结笔记、生成大纲、知识问答,非常方便。
- 命令行工具:写脚本、处理文件的时候直接调用,不用切到浏览器。
整个架构就是:各种应用 → OpenAI 格式 API → vLLM 推理引擎 → 显卡算力。
这套方案的好处是标准、开放,任何支持 OpenAI 协议的工具都能接进来,以后换模型、换引擎都不用改应用层。
三、模型选型:我常用的几个模型
试了几十个模型,最后长期留在硬盘里的就这几个:
1. Qwen2.5-14B-Instruct-AWQ 绝对主力,日常 80% 的任务用它。中文理解最好,综合能力均衡,写作、推理、代码都不错。4bit 量化后 9GB 左右,24GB 显存随便跑。 个人认为是目前性价比最高的模型,没有之一。
2. Qwen2.5-32B-Instruct-AWQ 进阶版。遇到 14B 搞不定的复杂任务就上这个。能力强一截,但速度也慢一半。大概 20GB 显存,4090 刚好能塞下。
3. Llama-3.1-8B-Instruct 英文和代码场景用。虽然参数不大,但英文原生模型,处理英文资料比 Qwen 舒服。
4. MiniCPM5-2B 轻量任务专用。参数很小,速度极快,每秒能出一百多 token。简单问答、写标题、改错别字这种小事,用它就够了,省电又快。
选型原则:
- 中文用户优先 Qwen 系列,不用怀疑
- 从 14B 开始试,不够用再升更大的
- 至少保留一个小模型做简单任务
- 不要追新,稳定最重要
四、我的日常工作流
分享几个我用本地 AI 的典型工作流,给大家参考。
场景一:写文章 / 方案
- 打开 Obsidian,新建笔记
- 调用本地模型生成大纲
- 边写边让 AI 润色段落、调整结构
- 写完后让 AI 整体优化、起标题
- 全程不用离开笔记软件,数据全在本地
场景二:代码开发
- 用 Cursor 打开项目
- 代码补全、错误检查、函数解释全程本地
- 遇到复杂问题,一键切换到云端大模型
- 核心代码不会泄露,效率也有保障
场景三:文档处理
- 把 PDF、Word 文档拖进去
- 让 AI 提取要点、总结摘要、找风险点
- 多份文档让 AI 交叉对比分析
- 敏感文档放心处理,不用脱敏
场景四:批量任务
- 写个简单的 Python 脚本
- 循环调用本地 API 批量处理数据
- 不用考虑 Token 费用,想处理多少处理多少
- 跑一晚上也多花不了几度电
五、踩坑与经验总结
最后说几个实打实的经验教训,都是踩坑踩出来的。
1. 不要一开始就买最贵的硬件 先用现有电脑试试水,确认自己真的需要再升级。很多人新鲜劲过了就不用了,浪费钱。
2. AWQ 量化格式是目前的甜点 同样的 bit 数,AWQ 比 GPTQ 质量好,比 GGUF 速度快。N 卡用户优先选 AWQ 格式的模型。
3. 上下文不是越大越好 很多人追求 128K 大上下文,实际根本用不上,还巨费显存。日常使用 8K-16K 足够了。真要处理长文档,用 RAG 方案更合理。
4. 一定要做模型分层 不要所有任务都用最大的模型。简单任务用小模型,又快又省。复杂任务再上大模型。
5. 备份好你的提示词和配置 本地环境都是自己搭的,崩了就得重来。提示词模板、配置文件、插件设置,定期备份。
6. 不要排斥云端 本地不是万能的。该用云端的时候就用云端,混合才是最优解。
写在最后
搭建本地 AI 环境是个挺有意思的过程。从最开始的好奇,到一步步搭起来,再到融入日常工作,这个过程本身就很有收获。
它不像云端 AI,注册个账号就能用。但你花的每一分钱、每一分钟,最终都会变成完全属于你自己的能力。你的数据、你的模型、你的工作流,全部掌控在自己手里。
如果你也想折腾,建议从小处开始,慢慢迭代。不用追求一步到位,边用边优化,乐趣就在其中。