显存和算力的关系

我们在模型的使用过程中,经常会发现一些模型显存够用但是算力跟不上,这时就会出现有关显存和算力之间的关系,尤其是有些模型会出现不吃显存但是很吃算力的情况,需要具体情况具体进行分析。

1、显存和算力的关系
概念 通俗理解 决定因素
显存(Memory) GPU 上存数据的"仓库" 模型参数大小、KV cache、大批量输入、激活值等
算力(Compute) GPU/CPU 执行矩阵乘法的"发动机" AICore/SM 数量、主频、算力峰值(TFLOPS)

显存不是抽象的"容量",而是由独立的存储芯片提供的,焊在 GPU 板卡上,常见的显存芯片是HBM和GDDR:

  • GDDR6/GDDR6X:常见于消费级显卡(RTX 系列),容量一般 8GB~24GB
  • HBM2e/HBM3:用于数据中心级(A100、H100、Ascend 910B),容量 40GB~192GB,带宽更高

决定显存大小的物理因素:

  • 显存芯片颗数与容量(比如 8 颗 × 8GB = 64GB)
  • 显存总线宽度与带宽(影响数据读写速度)
  • GPU 控制器支持的最大寻址容量

A100(80GB)用的是 HBM2e,显存芯片总容量物理就是 80GB,没法通过软件"变大"。如果模型 + KV cache 超过了 80GB,就只能拆分(分布式)或换更大显存的卡。

算力的载体是GPU 核心(SM/AI Core),算力来自 GPU 内部的计算单元(CUDA Core、Tensor Core 或 NPU AICore)。它们负责执行矩阵乘法、向量加法等浮点操作。

算力大小的主要物理决定因素:

硬件指标 含义 对算力的影响
核心数量 (SM / AICore 数量) 并行计算单元多少 决定并行能力
每核心算力 (FLOPs per core) 单核每秒能算多少次浮点 决定单位核心性能
时钟频率 (MHz/GHz) 工作频率 频率越高,算力越强
数据类型支持 (FP32 / FP16 / BF16 / INT8) 不同精度对应不同吞吐 混合精度可大幅提升算力

类似CPU的计算原则,算力 = 核心数 × 每核每周期操作数 × 主频 × (是否使用 Tensor Core 等加速单元)

2、硬件是显存和算力的根本制约
限制对象 来自硬件的物理约束
显存容量 显存芯片数量、单颗容量、控制器寻址范围
显存带宽 显存接口位宽、时钟频率
算力上限 SM/AICore 总数、主频、工艺制程、功耗散热能力
数据精度支持 硬件是否支持 FP16/BF16/INT8 等指令集

软件无法"创造"更多显存或算力,只能更高效地利用现有资源(比如通过量化节省显存,或通过并行提升利用率)。总的来说1、显存是容量限制,由 GPU 上的存储芯片决定,决定你能"装下"什么。2、算力是计算能力,由核心数量和频率决定,决定你能"算得多快"。

3、HBM

HBM(High Bandwidth Memory) 是一种专为高性能计算(HPC、AI、大模型)设计的显存技术,它最大的特点就是:

  • 带宽极高(是 GDDR6 的 3~5 倍)
  • 封装紧凑(垂直叠层 TSV 封装,距离 GPU 核心极近)
  • 功耗更低(同样带宽下耗电远小于 GDDR)
    简单说:GDDR 就像是「在主板上插内存条」;HBM 就像是「把内存直接焊在 CPU 上」,离核心更近、传得更快。
相关推荐
高洁0120 小时前
Teacher Forcing技术解析
人工智能·python·深度学习·transformer·知识图谱
LadiesAndGentlemen20 小时前
GeoX 论文解读:不用人工标注,如何训练会空间推理的遥感大模型
人工智能·深度学习·机器学习
TAN-90°-21 小时前
Deep Learning for Computer Vision——Attention and Transformers
人工智能·深度学习·神经网络·机器学习·计算机视觉·cnn·机器翻译
OpenBayes1 天前
Qwen3.8-27B-FP8 降低大模型部署门槛,开启高效多模态智能体验;MiniMax H3-1K 发布千段视频测试数据集,全面评估 AI 视频生成能力
人工智能·深度学习·计算机视觉·自然语言处理·语音识别·多模态大模型
Easy_API1 天前
OpenAI三周内第二次降价,GPT-5.6 Sol砍了20%到33
大数据·前端·人工智能·gpt·深度学习
张人玉1 天前
基于 Python + PyQt5 的水果目标检测与分割可视化系统——水果深度学习识别可视化大屏
python·深度学习·qt·目标检测·sqlite·echarts
十三画者1 天前
【文献分享】CancerCellNet:评估癌症模型转录保真度的计算工具
人工智能·深度学习·数据挖掘·数据分析·数据可视化
咖啡星人k1 天前
2026 AI Agent 记忆系统:让智能体告别“三秒失忆“,像人类一样越用越懂你(MonkeyCode 实战)
人工智能·深度学习·机器学习·语言模型·自然语言处理
断眉的派大星1 天前
TensorRT 基础与核心流程完整学习笔记
人工智能·深度学习
薛定e的猫咪1 天前
(NeurIPS 2021)MatNet:面向矩阵型关系数据的神经组合优化编码器
人工智能·深度学习·线性代数·算法·矩阵