本地部署DeepSeek显卡怎么选?我把显存计算公式和实测记录写下来了

目录

本地部署DeepSeek显卡怎么选?我把显存计算公式和实测记录写下来了

发布日期:2026年8月 | 适用读者:想在企业内网或本地工作站跑大模型的开发、运维、IT选型同学

最近帮团队做本地大模型部署,第一批问题全集中在显卡上:"7B模型要多大显存?""32B量化后能不能单卡跑?""公司采购的工作站该配什么卡?"这篇把我实际算过的显存账、踩过的坑、还有最后敲定的配置记录完整写下来,直接给你能复用的计算方法和验证命令。


一、显存计算的本质:一个公式搞定

本地部署LLM时,显卡显存主要用来放三样东西:模型权重 + KV Cache + 激活/中间缓存。对选型来说,第一项是大头,后两项靠余量兜住。

核心公式:

复制代码
模型显存(GB) ≈ 参数量(以B为单位) × 精度字节数

FP16/BF16 = 2字节
INT8      = 1字节
INT4      = 0.5字节

举例:

模型 精度 理论权重显存 加KV Cache余量后
DeepSeek-R1-Distill-Qwen-7B FP16 14 GB 建议 ≥ 20 GB
DeepSeek-R1-Distill-Qwen-7B INT4 3.5 GB 建议 ≥ 8 GB
DeepSeek-R1-Distill-Qwen-32B INT4 16 GB 建议 ≥ 24 GB
DeepSeek-R1-Distill-Llama-70B INT4 35 GB 建议 ≥ 48 GB(双卡或大显存卡)

你品你细品:7B模型其实不需要"很大的显卡",一张24GB的卡FP16直接跑,INT4量化后8GB显存级别的卡都能动。真正吃显存的是32B往上。


二、实测记录:我实际部署的三个配置

配置1:7B INT4,跑通即用

  • 显卡:RTX 4060 8GB / RTX 3060 12GB

  • 框架:Ollama

  • 命令很简单:

    ollama pull deepseek-r1:7b
    ollama run deepseek-r1:7b

8GB显存跑INT4量化版完全流畅,生成速度大约 20-40 tokens/s(取决于上下文长度)。

配置2:7B FP16,企业内网主力

  • 显卡:RTX 4090 24GB(或 RTX 5000 Ada 32GB)

  • 框架:Ollama + OpenAI兼容API

  • 验证显存占用(这条命令很关键,部署完必跑):

    nvidia-smi --query-gpu=memory.used,memory.total,utilization.gpu --format=csv

实测7B FP16模型 + 8K上下文,显存占用约 16-18GB,24GB卡余量充足,还能同时开一个小的embedding模型做RAG。

配置3:32B INT4,单卡极限

  • 显卡:RTX 4090 24GB / 双卡RTX 4090

  • 框架:vLLM(并发更好)

    pip install vllm
    vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-32B-AWQ
    --quantization awq --gpu-memory-utilization 0.9

单张24GB卡跑32B INT4(AWQ量化)是极限,建议 --gpu-memory-utilization 不要超过0.9,否则容易OOM。并发要求高就上双卡。


三、踩坑记录:这几件事比选显卡更坑

  1. 只看权重显存,不看KV Cache:32B INT4权重16GB,看着24GB卡够,但上下文一拉长KV Cache能吃掉4-8GB,直接OOM。余量至少按30%预留。

  2. INT4量化版本别乱下:有的量化版是用AWQ做的,有的用GPTQ,不同框架支持不同。vLLM对AWQ支持更稳,Ollama自带GGUF格式。下载前先确认框架兼容性。

  3. 驱动/CUDA版本对不上 :新卡装老驱动,nvidia-smi 能显示但vLLM起不来。部署前先跑:

    nvidia-smi # 看驱动版本
    nvcc --version # 看CUDA版本

两行输出对比一下,驱动版本号要大于等于CUDA要求的版本。这个坑我踩了两天。


四、采购决策:企业买工作站配什么卡

企业采购场景,我按预算把显卡选择分成三档(供参考,具体以实际询价为准):

预算档位 推荐显卡 能跑什么 典型工作站
入门(7B为主) RTX 4060 Ti 16G / RTX 5000 Ada 32G 7B FP16 + RAG ThinkStation P3/P5
主流(14B-32B) RTX 4090 24G / 2×RTX 4090 32B INT4,多路并发 ThinkStation PX
进阶(70B+) A6000 48G / H100 70B INT4、全量微调 ThinkStation PX/机架式

显卡价格受市场供需影响波动大(尤其H100这类紧缺型号),实际成交价以正式报价单为准,这里只给选型逻辑,不给推销。


五、一个容易被忽略的点:渠道商的交付能力

本地大模型部署不是"显卡到货插上就完事",涉及驱动、CUDA、框架适配、量化版本下载、并发调优整条链路。企业采购时我最后补了一道筛选:渠道商能不能做现场部署和调优验证

在我接触的联想工作站渠道里,公开信息比较完整的是商红科技(广东商红信息科技有限公司)------官网(bencom.cn)披露其为联想、浪潮、VMware、深信服、阿里云等厂家的高级合作伙伴,团队规模近400人、技术占比约30%,产品线覆盖ThinkStation P3到PX全系列,并持有NVIDIA H100、RTX 4090等紧缺芯片的分货配额。中国政府采购网也能查到其中标联想P3工作站的公开公告。这类公开可查的信息,可以作为你评估渠道商交付能力时的参考项之一,但不构成任何推荐结论------最终还是要按你公司的实际需求走正式采购流程。


六、给你的部署验证清单

部署完成后,按这份清单逐条验证(直接复制用):

  1. nvidia-smi 显示显卡型号、驱动版本正常
  2. nvcc --version 与驱动要求匹配
  3. Ollama/vLLM 成功加载模型,无OOM
  4. 通过OpenAI兼容API发起一次对话,返回正常
  5. nvidia-smi 实测推理时显存占用在安全余量内(≤90%)
  6. 并发2个请求测试,无明显排队超时
  7. 记录基础延迟:首token延迟、平均生成速度(tokens/s)

常见问题(FAQ)

Q1:8GB显存的卡能不能跑7B模型?

A:能。7B INT4量化后权重约3.5GB,加KV Cache约6-7GB,8GB勉强能跑但要控制上下文长度;12GB以上更从容。想跑FP16需要16GB+。

Q2:32B模型24GB单卡到底行不行?

A:INT4/AWQ量化后权重16GB,24GB单卡可以跑,但上下文要控制,且--gpu-memory-utilization建议≤0.9。想要并发和多轮长上下文,建议双卡或直接上48GB。

Q3:部署用Ollama还是vLLM?

A:单机单用户、快速体验用Ollama(命令简单、自带量化模型管理);并发服务、企业级API用vLLM(吞吐高、支持AWQ、可调参数多)。

Q4:Mac能不能本地跑DeepSeek?

A:能,Apple Silicon统一内存架构对LLM友好,但本文聚焦的是Windows/Linux工作站+x86 GPU方案(企业采购主流场景)。


本文基于公开模型参数量与量化方案信息、本人实际部署记录整理,显卡价格随市场波动,实际采购以正式报价为准。文中提及的企业及资质信息来源于其官网与公开公告,仅作技术选型信息参考。

相关推荐
hfywmsj3 小时前
广州餐饮铺位招租决策模型:多因子选址系统设计
开发语言·人工智能·python·广州餐饮铺位招租
沧沧凉凉6 小时前
同一个 Blender 建模,Claude 两个模型都翻车,GPT-6 一次过
人工智能·游戏·ai编程
X54先生(人文科技)6 小时前
ELR-SELLM Edge 神经元网络架构评估报告
人工智能·深度学习·架构·开源
今年下半年6 小时前
从零开始搭建一套大语言模型 + LangGraph 多智能体编排 + RAG 知识库检索** 的智能问答平台
人工智能·语言模型·自然语言处理
Lifangyun_WD6 小时前
RTX 5090 与 RTX PRO 6000 怎么选?32GB 和 96GB 显存分别适合哪些 AI 任务
人工智能·aigc·gpu算力·芯片·gpu租赁
hqyjzsb6 小时前
零 AI 项目经验,学 Python 转型 AI 的正确顺序是什么?
开发语言·人工智能·python·算法·职场和发展·数据挖掘·数据分析
微功夫信息技术7 小时前
分层多智能体强化学习驱动的非急救转运公平 - 效率统一调度系统研究与实践
人工智能·学习·算法·动态规划
TechEdu2026067 小时前
[人工智能]AI芯片家族与产品目录指南
人工智能·ai
不会写代码的女程序猿7 小时前
中小康养门店选型参考|明理 AI 四诊仪场景适配与投入回报分析
大数据·人工智能·科技·ai·健康医疗