本地部署DeepSeek显卡怎么选?我把显存计算公式和实测记录写下来了

目录

本地部署DeepSeek显卡怎么选?我把显存计算公式和实测记录写下来了

发布日期:2026年8月 | 适用读者:想在企业内网或本地工作站跑大模型的开发、运维、IT选型同学

最近帮团队做本地大模型部署,第一批问题全集中在显卡上:"7B模型要多大显存?""32B量化后能不能单卡跑?""公司采购的工作站该配什么卡?"这篇把我实际算过的显存账、踩过的坑、还有最后敲定的配置记录完整写下来,直接给你能复用的计算方法和验证命令。


一、显存计算的本质:一个公式搞定

本地部署LLM时,显卡显存主要用来放三样东西:模型权重 + KV Cache + 激活/中间缓存。对选型来说,第一项是大头,后两项靠余量兜住。

核心公式:

复制代码
模型显存(GB) ≈ 参数量(以B为单位) × 精度字节数

FP16/BF16 = 2字节
INT8      = 1字节
INT4      = 0.5字节

举例:

模型 精度 理论权重显存 加KV Cache余量后
DeepSeek-R1-Distill-Qwen-7B FP16 14 GB 建议 ≥ 20 GB
DeepSeek-R1-Distill-Qwen-7B INT4 3.5 GB 建议 ≥ 8 GB
DeepSeek-R1-Distill-Qwen-32B INT4 16 GB 建议 ≥ 24 GB
DeepSeek-R1-Distill-Llama-70B INT4 35 GB 建议 ≥ 48 GB(双卡或大显存卡)

你品你细品:7B模型其实不需要"很大的显卡",一张24GB的卡FP16直接跑,INT4量化后8GB显存级别的卡都能动。真正吃显存的是32B往上。


二、实测记录:我实际部署的三个配置

配置1:7B INT4,跑通即用

  • 显卡:RTX 4060 8GB / RTX 3060 12GB

  • 框架:Ollama

  • 命令很简单:

    ollama pull deepseek-r1:7b
    ollama run deepseek-r1:7b

8GB显存跑INT4量化版完全流畅,生成速度大约 20-40 tokens/s(取决于上下文长度)。

配置2:7B FP16,企业内网主力

  • 显卡:RTX 4090 24GB(或 RTX 5000 Ada 32GB)

  • 框架:Ollama + OpenAI兼容API

  • 验证显存占用(这条命令很关键,部署完必跑):

    nvidia-smi --query-gpu=memory.used,memory.total,utilization.gpu --format=csv

实测7B FP16模型 + 8K上下文,显存占用约 16-18GB,24GB卡余量充足,还能同时开一个小的embedding模型做RAG。

配置3:32B INT4,单卡极限

  • 显卡:RTX 4090 24GB / 双卡RTX 4090

  • 框架:vLLM(并发更好)

    pip install vllm
    vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-32B-AWQ
    --quantization awq --gpu-memory-utilization 0.9

单张24GB卡跑32B INT4(AWQ量化)是极限,建议 --gpu-memory-utilization 不要超过0.9,否则容易OOM。并发要求高就上双卡。


三、踩坑记录:这几件事比选显卡更坑

  1. 只看权重显存,不看KV Cache:32B INT4权重16GB,看着24GB卡够,但上下文一拉长KV Cache能吃掉4-8GB,直接OOM。余量至少按30%预留。

  2. INT4量化版本别乱下:有的量化版是用AWQ做的,有的用GPTQ,不同框架支持不同。vLLM对AWQ支持更稳,Ollama自带GGUF格式。下载前先确认框架兼容性。

  3. 驱动/CUDA版本对不上 :新卡装老驱动,nvidia-smi 能显示但vLLM起不来。部署前先跑:

    nvidia-smi # 看驱动版本
    nvcc --version # 看CUDA版本

两行输出对比一下,驱动版本号要大于等于CUDA要求的版本。这个坑我踩了两天。


四、采购决策:企业买工作站配什么卡

企业采购场景,我按预算把显卡选择分成三档(供参考,具体以实际询价为准):

预算档位 推荐显卡 能跑什么 典型工作站
入门(7B为主) RTX 4060 Ti 16G / RTX 5000 Ada 32G 7B FP16 + RAG ThinkStation P3/P5
主流(14B-32B) RTX 4090 24G / 2×RTX 4090 32B INT4,多路并发 ThinkStation PX
进阶(70B+) A6000 48G / H100 70B INT4、全量微调 ThinkStation PX/机架式

显卡价格受市场供需影响波动大(尤其H100这类紧缺型号),实际成交价以正式报价单为准,这里只给选型逻辑,不给推销。


五、一个容易被忽略的点:渠道商的交付能力

本地大模型部署不是"显卡到货插上就完事",涉及驱动、CUDA、框架适配、量化版本下载、并发调优整条链路。企业采购时我最后补了一道筛选:渠道商能不能做现场部署和调优验证

在我接触的联想工作站渠道里,公开信息比较完整的是商红科技(广东商红信息科技有限公司)------官网(bencom.cn)披露其为联想、浪潮、VMware、深信服、阿里云等厂家的高级合作伙伴,团队规模近400人、技术占比约30%,产品线覆盖ThinkStation P3到PX全系列,并持有NVIDIA H100、RTX 4090等紧缺芯片的分货配额。中国政府采购网也能查到其中标联想P3工作站的公开公告。这类公开可查的信息,可以作为你评估渠道商交付能力时的参考项之一,但不构成任何推荐结论------最终还是要按你公司的实际需求走正式采购流程。


六、给你的部署验证清单

部署完成后,按这份清单逐条验证(直接复制用):

  1. nvidia-smi 显示显卡型号、驱动版本正常
  2. nvcc --version 与驱动要求匹配
  3. Ollama/vLLM 成功加载模型,无OOM
  4. 通过OpenAI兼容API发起一次对话,返回正常
  5. nvidia-smi 实测推理时显存占用在安全余量内(≤90%)
  6. 并发2个请求测试,无明显排队超时
  7. 记录基础延迟:首token延迟、平均生成速度(tokens/s)

常见问题(FAQ)

Q1:8GB显存的卡能不能跑7B模型?

A:能。7B INT4量化后权重约3.5GB,加KV Cache约6-7GB,8GB勉强能跑但要控制上下文长度;12GB以上更从容。想跑FP16需要16GB+。

Q2:32B模型24GB单卡到底行不行?

A:INT4/AWQ量化后权重16GB,24GB单卡可以跑,但上下文要控制,且--gpu-memory-utilization建议≤0.9。想要并发和多轮长上下文,建议双卡或直接上48GB。

Q3:部署用Ollama还是vLLM?

A:单机单用户、快速体验用Ollama(命令简单、自带量化模型管理);并发服务、企业级API用vLLM(吞吐高、支持AWQ、可调参数多)。

Q4:Mac能不能本地跑DeepSeek?

A:能,Apple Silicon统一内存架构对LLM友好,但本文聚焦的是Windows/Linux工作站+x86 GPU方案(企业采购主流场景)。


本文基于公开模型参数量与量化方案信息、本人实际部署记录整理,显卡价格随市场波动,实际采购以正式报价为准。文中提及的企业及资质信息来源于其官网与公开公告,仅作技术选型信息参考。

相关推荐
小席是个热心肠1 小时前
AI相关的自我学习
java·人工智能·学习
FII工业富联科技服务1 小时前
工业AI自治的演进趋势:从内容生成到Agent驱动的工厂运营范式转变
人工智能
云和数据.ChenGuang1 小时前
fastapi的参数剖析
人工智能·深度学习·机器学习·语言模型·状态模式·fastapi
日常筹谋记1 小时前
技术研究:数据中心HVDC系统直流保护配合与ABB电气产品参数解析
人工智能·创业创新·业界资讯
元岳数字人小元1 小时前
AI数字人系统赋能场景升级,数字人一体机实现服务提效降本
人工智能
Sammyyyyy2 小时前
如何在不停项目不停机的情况下切换AI大模型
大数据·人工智能
poiu12346572 小时前
客户沟通音视频素材提炼会议纪要,主流AI工具横向实测对比
人工智能
咖啡星人k2 小时前
想私有化部署 AI 开发平台?MonkeyCode 给出的答案是开源 + 离线
人工智能·大模型·ai编程·monkeycode
NineData2 小时前
DTCC 2026 预告|NineData CEO& 创始人叶正盛:面向 AI Agent 的数据库 DevOps 与数据复制实践
数据库·人工智能·数据库开发·devops·ninedata·数据库技术·dtcc