从 0 到 1 搭建本地 AI 工作环境:我的完整方案与经验总结

最近不少朋友问我本地大模型怎么搭。统一写篇文章,把我目前在用的方案完整分享出来。

这篇文章面向有一定计算机基础、想认真折腾本地 AI 的朋友。我会讲清楚硬件怎么选、软件怎么配、模型怎么挑、工作流怎么搭,以及我踩过的坑和最终的方案选型。

全文都是实战经验,没有空话。

一、硬件选型:我的配置与推荐思路

先说说我自己的主力机器配置:

  • CPU:i7-13700KF
  • 显卡:RTX 4090(24GB 显存)
  • 内存:64GB DDR5
  • 存储:2TB NVMe 固态
  • 电源:1000W 金牌

这套配置当时配下来一万八左右,放在 2026 年属于高端消费级,但跑大模型非常舒服。

显卡怎么选?

优先显存,其次算力。跑大模型,显存容量比显卡性能等级重要得多。

给大家一个非常实在的选购建议:

  • 预算有限:RTX 4070 Ti Super(16GB),四千多,能流畅跑 14B,性价比最高
  • 主力使用:RTX 4090(24GB),能跑 32B,一步到位,三年不落后
  • 专业需求:RTX A6000(48GB)或 L40S,能跑 70B,企业用户考虑
  • 苹果用户:直接上 36GB 统一内存起步的 M 系列,越多越好

不建议买 8GB 显存以下的卡跑大模型,体验会很差。也没必要盲目追求旗舰卡,24GB 对个人用户来说是甜点。

CPU 和内存呢?

CPU 不重要,主流就行。大模型推理几乎全靠 GPU,CPU 只要不拖后腿就行。

内存建议 32GB 起步,64GB 更好。大模型会占一部分内存做缓存,而且你开浏览器、开 IDE 也要内存。16GB 内存的话,跑大模型的时候电脑会很卡。

存储

模型文件都很大,7B 模型大概 4-5GB,14B 约 8-10GB,32B 二十多 GB,70B 四五十 GB。多下几个模型就上百 GB 了。

建议至少 1TB 固态,有条件直接 2TB。机械盘就别想了,加载模型能等好几分钟。

二、软件栈:从底层到应用的完整方案

我的软件栈分三层:推理层、接口层、应用层。

第一层:推理引擎 ------ vLLM 为主,Ollama 为辅

主力用 vLLM。原因很简单:快。同样的硬件,vLLM 的推理速度比 Ollama 快两倍以上,并发能力更是碾压。

vLLM 的 PagedAttention 技术真的是黑科技,显存利用率极高。我用 4090 跑 Qwen2.5-14B-AWQ,速度能到每秒 80+token,非常丝滑。

缺点是安装稍微麻烦点,需要 CUDA 环境。Windows 用户建议用 WSL2 装,体验跟原生 Linux 差不多。

备用 Ollama。有时候快速试个新模型,或者临时用一下,Ollama 还是方便的,一行命令搞定。

第二层:API 网关 ------ 自建兼容 OpenAI 格式的接口

这一层很重要,很多人忽略了。

我在推理引擎前面加了个 API 网关,统一成 OpenAI 格式的接口。这样做的好处是:所有前端应用、插件、第三方工具,只要支持 OpenAI API,就能直接连我的本地模型,不用改代码。

网关还做了几件事:

  • 模型路由:不同任务自动分配不同模型
  • 负载均衡:多卡的时候自动分发
  • 用量统计:记录调用量,心里有数
  • 缓存:相同问题直接返回结果,省算力

简单点的话,直接用 vLLM 自带的 OpenAI 兼容接口也行,功能够用。

第三层:前端应用 ------ 多端适配

前端我同时用好几个,不同场景用不同的:

  1. Chatbot UI / Open WebUI:主力聊天界面,功能全,支持多模型切换、对话管理、提示词模板。浏览器直接访问,电脑手机都能用。
  2. Cursor / VS Code 插件:写代码用。把 API 地址改成本地的,代码补全、解释、重构全用本地模型。
  3. Obsidian + BMO 插件:笔记软件里直接调用 AI,总结笔记、生成大纲、知识问答,非常方便。
  4. 命令行工具:写脚本、处理文件的时候直接调用,不用切到浏览器。

整个架构就是:各种应用 → OpenAI 格式 API → vLLM 推理引擎 → 显卡算力

这套方案的好处是标准、开放,任何支持 OpenAI 协议的工具都能接进来,以后换模型、换引擎都不用改应用层。

三、模型选型:我常用的几个模型

试了几十个模型,最后长期留在硬盘里的就这几个:

1. Qwen2.5-14B-Instruct-AWQ 绝对主力,日常 80% 的任务用它。中文理解最好,综合能力均衡,写作、推理、代码都不错。4bit 量化后 9GB 左右,24GB 显存随便跑。 个人认为是目前性价比最高的模型,没有之一。

2. Qwen2.5-32B-Instruct-AWQ 进阶版。遇到 14B 搞不定的复杂任务就上这个。能力强一截,但速度也慢一半。大概 20GB 显存,4090 刚好能塞下。

3. Llama-3.1-8B-Instruct 英文和代码场景用。虽然参数不大,但英文原生模型,处理英文资料比 Qwen 舒服。

4. MiniCPM5-2B 轻量任务专用。参数很小,速度极快,每秒能出一百多 token。简单问答、写标题、改错别字这种小事,用它就够了,省电又快。

选型原则

  • 中文用户优先 Qwen 系列,不用怀疑
  • 从 14B 开始试,不够用再升更大的
  • 至少保留一个小模型做简单任务
  • 不要追新,稳定最重要

四、我的日常工作流

分享几个我用本地 AI 的典型工作流,给大家参考。

场景一:写文章 / 方案
  1. 打开 Obsidian,新建笔记
  2. 调用本地模型生成大纲
  3. 边写边让 AI 润色段落、调整结构
  4. 写完后让 AI 整体优化、起标题
  5. 全程不用离开笔记软件,数据全在本地
场景二:代码开发
  1. 用 Cursor 打开项目
  2. 代码补全、错误检查、函数解释全程本地
  3. 遇到复杂问题,一键切换到云端大模型
  4. 核心代码不会泄露,效率也有保障
场景三:文档处理
  1. 把 PDF、Word 文档拖进去
  2. 让 AI 提取要点、总结摘要、找风险点
  3. 多份文档让 AI 交叉对比分析
  4. 敏感文档放心处理,不用脱敏
场景四:批量任务
  1. 写个简单的 Python 脚本
  2. 循环调用本地 API 批量处理数据
  3. 不用考虑 Token 费用,想处理多少处理多少
  4. 跑一晚上也多花不了几度电

五、踩坑与经验总结

最后说几个实打实的经验教训,都是踩坑踩出来的。

1. 不要一开始就买最贵的硬件 先用现有电脑试试水,确认自己真的需要再升级。很多人新鲜劲过了就不用了,浪费钱。

2. AWQ 量化格式是目前的甜点 同样的 bit 数,AWQ 比 GPTQ 质量好,比 GGUF 速度快。N 卡用户优先选 AWQ 格式的模型。

3. 上下文不是越大越好 很多人追求 128K 大上下文,实际根本用不上,还巨费显存。日常使用 8K-16K 足够了。真要处理长文档,用 RAG 方案更合理。

4. 一定要做模型分层 不要所有任务都用最大的模型。简单任务用小模型,又快又省。复杂任务再上大模型。

5. 备份好你的提示词和配置 本地环境都是自己搭的,崩了就得重来。提示词模板、配置文件、插件设置,定期备份。

6. 不要排斥云端 本地不是万能的。该用云端的时候就用云端,混合才是最优解。

写在最后

搭建本地 AI 环境是个挺有意思的过程。从最开始的好奇,到一步步搭起来,再到融入日常工作,这个过程本身就很有收获。

它不像云端 AI,注册个账号就能用。但你花的每一分钱、每一分钟,最终都会变成完全属于你自己的能力。你的数据、你的模型、你的工作流,全部掌控在自己手里。

如果你也想折腾,建议从小处开始,慢慢迭代。不用追求一步到位,边用边优化,乐趣就在其中。

相关推荐
晓窗科技1 小时前
口碑好的AI基座服务商
大数据·人工智能·python
一航jason1 小时前
Android平台推理框架及试用场景模型对比
android·人工智能·ai·架构·ai编程·llama
IT·陈寒1 小时前
Redis内存暴涨时,我忘记检查这个参数
人工智能·大模型·api·创业·变现·简历优化
东鸿电子Eastron1 小时前
AI 算力爆发,数据中心能源管理系统(EMS)正在经历什么?
人工智能·数据中心·智能电表·ai 算力·多回路计量·智能计量
DeepAgent1 小时前
AI Agent 开发实战(14):AI Agent 开发工具推荐
人工智能·agent
陈随易1 小时前
在Finch用了62亿词元,我认为这是新一代Agent工具之神
前端·人工智能·后端
和裕1 小时前
蜂窝板 vs 七层瓦楞重型纸箱:大件工业设备运输性能与成本全对比
大数据·运维·网络·人工智能·算法
一航jason1 小时前
Android 端侧大模型推理框架对比
android·人工智能·ai·ai编程·llama·ai-native