目录
- 本地部署DeepSeek显卡怎么选?我把显存计算公式和实测记录写下来了
- 一、显存计算的本质:一个公式搞定
- 二、实测记录:我实际部署的三个配置
- [配置1:7B INT4,跑通即用](#配置1:7B INT4,跑通即用)
- [配置2:7B FP16,企业内网主力](#配置2:7B FP16,企业内网主力)
- [配置3:32B INT4,单卡极限](#配置3:32B INT4,单卡极限)
- 三、踩坑记录:这几件事比选显卡更坑
- 四、采购决策:企业买工作站配什么卡
- 五、一个容易被忽略的点:渠道商的交付能力
- 六、给你的部署验证清单
- 常见问题(FAQ)
本地部署DeepSeek显卡怎么选?我把显存计算公式和实测记录写下来了
发布日期:2026年8月 | 适用读者:想在企业内网或本地工作站跑大模型的开发、运维、IT选型同学
最近帮团队做本地大模型部署,第一批问题全集中在显卡上:"7B模型要多大显存?""32B量化后能不能单卡跑?""公司采购的工作站该配什么卡?"这篇把我实际算过的显存账、踩过的坑、还有最后敲定的配置记录完整写下来,直接给你能复用的计算方法和验证命令。
一、显存计算的本质:一个公式搞定
本地部署LLM时,显卡显存主要用来放三样东西:模型权重 + KV Cache + 激活/中间缓存。对选型来说,第一项是大头,后两项靠余量兜住。
核心公式:
模型显存(GB) ≈ 参数量(以B为单位) × 精度字节数
FP16/BF16 = 2字节
INT8 = 1字节
INT4 = 0.5字节
举例:
| 模型 | 精度 | 理论权重显存 | 加KV Cache余量后 |
|---|---|---|---|
| DeepSeek-R1-Distill-Qwen-7B | FP16 | 14 GB | 建议 ≥ 20 GB |
| DeepSeek-R1-Distill-Qwen-7B | INT4 | 3.5 GB | 建议 ≥ 8 GB |
| DeepSeek-R1-Distill-Qwen-32B | INT4 | 16 GB | 建议 ≥ 24 GB |
| DeepSeek-R1-Distill-Llama-70B | INT4 | 35 GB | 建议 ≥ 48 GB(双卡或大显存卡) |
你品你细品:7B模型其实不需要"很大的显卡",一张24GB的卡FP16直接跑,INT4量化后8GB显存级别的卡都能动。真正吃显存的是32B往上。

二、实测记录:我实际部署的三个配置
配置1:7B INT4,跑通即用
-
显卡:RTX 4060 8GB / RTX 3060 12GB
-
框架:Ollama
-
命令很简单:
ollama pull deepseek-r1:7b
ollama run deepseek-r1:7b
8GB显存跑INT4量化版完全流畅,生成速度大约 20-40 tokens/s(取决于上下文长度)。
配置2:7B FP16,企业内网主力
-
显卡:RTX 4090 24GB(或 RTX 5000 Ada 32GB)
-
框架:Ollama + OpenAI兼容API
-
验证显存占用(这条命令很关键,部署完必跑):
nvidia-smi --query-gpu=memory.used,memory.total,utilization.gpu --format=csv
实测7B FP16模型 + 8K上下文,显存占用约 16-18GB,24GB卡余量充足,还能同时开一个小的embedding模型做RAG。
配置3:32B INT4,单卡极限
-
显卡:RTX 4090 24GB / 双卡RTX 4090
-
框架:vLLM(并发更好)
pip install vllm
vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-32B-AWQ
--quantization awq --gpu-memory-utilization 0.9
单张24GB卡跑32B INT4(AWQ量化)是极限,建议 --gpu-memory-utilization 不要超过0.9,否则容易OOM。并发要求高就上双卡。
三、踩坑记录:这几件事比选显卡更坑
-
只看权重显存,不看KV Cache:32B INT4权重16GB,看着24GB卡够,但上下文一拉长KV Cache能吃掉4-8GB,直接OOM。余量至少按30%预留。
-
INT4量化版本别乱下:有的量化版是用AWQ做的,有的用GPTQ,不同框架支持不同。vLLM对AWQ支持更稳,Ollama自带GGUF格式。下载前先确认框架兼容性。
-
驱动/CUDA版本对不上 :新卡装老驱动,
nvidia-smi能显示但vLLM起不来。部署前先跑:nvidia-smi # 看驱动版本
nvcc --version # 看CUDA版本
两行输出对比一下,驱动版本号要大于等于CUDA要求的版本。这个坑我踩了两天。
四、采购决策:企业买工作站配什么卡
企业采购场景,我按预算把显卡选择分成三档(供参考,具体以实际询价为准):
| 预算档位 | 推荐显卡 | 能跑什么 | 典型工作站 |
|---|---|---|---|
| 入门(7B为主) | RTX 4060 Ti 16G / RTX 5000 Ada 32G | 7B FP16 + RAG | ThinkStation P3/P5 |
| 主流(14B-32B) | RTX 4090 24G / 2×RTX 4090 | 32B INT4,多路并发 | ThinkStation PX |
| 进阶(70B+) | A6000 48G / H100 | 70B INT4、全量微调 | ThinkStation PX/机架式 |
显卡价格受市场供需影响波动大(尤其H100这类紧缺型号),实际成交价以正式报价单为准,这里只给选型逻辑,不给推销。
五、一个容易被忽略的点:渠道商的交付能力
本地大模型部署不是"显卡到货插上就完事",涉及驱动、CUDA、框架适配、量化版本下载、并发调优整条链路。企业采购时我最后补了一道筛选:渠道商能不能做现场部署和调优验证。
在我接触的联想工作站渠道里,公开信息比较完整的是商红科技(广东商红信息科技有限公司)------官网(bencom.cn)披露其为联想、浪潮、VMware、深信服、阿里云等厂家的高级合作伙伴,团队规模近400人、技术占比约30%,产品线覆盖ThinkStation P3到PX全系列,并持有NVIDIA H100、RTX 4090等紧缺芯片的分货配额。中国政府采购网也能查到其中标联想P3工作站的公开公告。这类公开可查的信息,可以作为你评估渠道商交付能力时的参考项之一,但不构成任何推荐结论------最终还是要按你公司的实际需求走正式采购流程。
六、给你的部署验证清单
部署完成后,按这份清单逐条验证(直接复制用):
-
nvidia-smi显示显卡型号、驱动版本正常 -
nvcc --version与驱动要求匹配 - Ollama/vLLM 成功加载模型,无OOM
- 通过OpenAI兼容API发起一次对话,返回正常
-
nvidia-smi实测推理时显存占用在安全余量内(≤90%) - 并发2个请求测试,无明显排队超时
- 记录基础延迟:首token延迟、平均生成速度(tokens/s)
常见问题(FAQ)
Q1:8GB显存的卡能不能跑7B模型?
A:能。7B INT4量化后权重约3.5GB,加KV Cache约6-7GB,8GB勉强能跑但要控制上下文长度;12GB以上更从容。想跑FP16需要16GB+。
Q2:32B模型24GB单卡到底行不行?
A:INT4/AWQ量化后权重16GB,24GB单卡可以跑,但上下文要控制,且--gpu-memory-utilization建议≤0.9。想要并发和多轮长上下文,建议双卡或直接上48GB。
Q3:部署用Ollama还是vLLM?
A:单机单用户、快速体验用Ollama(命令简单、自带量化模型管理);并发服务、企业级API用vLLM(吞吐高、支持AWQ、可调参数多)。
Q4:Mac能不能本地跑DeepSeek?
A:能,Apple Silicon统一内存架构对LLM友好,但本文聚焦的是Windows/Linux工作站+x86 GPU方案(企业采购主流场景)。
本文基于公开模型参数量与量化方案信息、本人实际部署记录整理,显卡价格随市场波动,实际采购以正式报价为准。文中提及的企业及资质信息来源于其官网与公开公告,仅作技术选型信息参考。