NVIDIA GPU 架构演进学习笔记(GPT-5.6 Terra 生成)

更新:2026-09-04

范围:以 NVIDIA 近代独立 GPU 的架构演进为主,重点解释 GeForce RTX 4090、RTX 50 系列,以及专业卡中容易混淆的 "RTX 6000" 命名。

先说结论

  • GeForce RTX 4090 是 Ada Lovelace(Ada)架构 ,GPU 芯片代号为 AD102
  • 消费级的后继旗舰 GeForce RTX 5090 是 Blackwell 架构 ,芯片代号为 GB202
  • "RTX 6000" 不能单独用于判断架构:
    • NVIDIA RTX 6000 Ada GenerationAda 架构。
    • NVIDIA RTX PRO 6000 Blackwell Workstation EditionBlackwell 架构。
  • "RTX" 是 NVIDIA 的光线追踪与 AI 图形技术/产品品牌;不是单一架构名称,也不直接等同于某一代产品

1. 如何理解 NVIDIA 的命名

判断一张 NVIDIA 显卡的代际,至少分清四层:

层级 示例 含义
架构 Ada Lovelace、Blackwell 一代 GPU 的总体微架构设计
芯片代号 AD102、GB202、GB100 该架构下的具体 GPU die;同一架构可有多颗
产品系列 GeForce RTX 40、GeForce RTX 50、RTX PRO 面向消费级、专业级或数据中心的商业产品线
具体产品 RTX 4090、RTX 5090、RTX PRO 6000 Blackwell 最终显卡/SKU,规格由核心、显存、功耗和功能共同决定

所以,正确的判断链条是:

text 复制代码
GeForce RTX 4090 -> RTX 40 系列 -> Ada Lovelace -> AD102
GeForce RTX 5090 -> RTX 50 系列 -> Blackwell -> GB202

同一架构中的不同产品不一定使用同一颗芯片;即使芯片相同,CUDA 核心启用数量、显存容量、功耗和 BIOS 也可能不同。因此不能只看架构名称推断实际性能。

2. 近代架构时间线

架构 首发时间 消费级代表 专业级/数据中心代表 主要意义
Fermi 2010 GeForce GTX 400/500 Tesla M 系列 强化可编程计算能力,奠定早期 CUDA 通用计算基础
Kepler 2012 GeForce GTX 600/700 Tesla K 系列 能效提升,引入动态并行等 CUDA 能力
Maxwell 2014 GeForce GTX 900 部分 Quadro 产品 架构效率显著提高
Pascal 2016 GeForce GTX 10 系列 Tesla P100、Quadro P 系列 16nm;P100 使用 HBM2,面向 HPC/深度学习
Volta 2017 无主流 GeForce 对应代 Tesla V100 首次引入 Tensor Core,成为深度学习加速的重要转折点
Turing 2018 GeForce RTX 20 系列 Quadro RTX、T4 首次将 RT Core 与 Tensor Core 带入 RTX 产品,实时光追走向消费市场
Ampere 2020 GeForce RTX 30 系列 A100、RTX A6000 第二代 RT Core、第三代 Tensor Core;AI/HPC 与游戏产品线并行发展
Ada Lovelace 2022 GeForce RTX 40 系列 RTX 6000 Ada Generation 第三代 RT Core、第四代 Tensor Core;GeForce 端引入 DLSS 3 帧生成
Blackwell 2024/2025 GeForce RTX 50 系列 B200、RTX PRO 6000 Blackwell 第四代 RT Core、第五代 Tensor Core;FP4、DLSS 4 多帧生成等

表中的"首发时间"按该架构首次公开/产品推出的大致年份记录。数据中心、专业卡和 GeForce 的上市节奏并不总是一致。

3. RTX 时代:从 Turing 到 Blackwell

3.1 Turing:RTX 的起点

Turing 架构让消费级 RTX 20 系列具备三类专用/通用计算资源:

  • CUDA Core:传统着色、通用计算等。
  • RT Core:加速光线与三角形求交、边界体层次结构(BVH)遍历等光线追踪工作。
  • Tensor Core:矩阵乘加等 AI 运算,可用于 DLSS 一类神经网络工作负载。

实时光追并不意味着"画面完全由光线追踪生成"。现代游戏通常采用混合渲染:传统光栅化负责主体画面,RT Core 处理反射、阴影、全局光照等特定效果。

3.2 Ampere:AI 与光追继续迭代

Ampere 对应 RTX 30 系列。消费级重点是光栅化性能、第二代 RT Core 和第三代 Tensor Core;数据中心的 A100 则主要面向模型训练、推理和 HPC。两者共享架构代际,但产品定位、显存技术和软件特性不同。

3.3 Ada Lovelace:RTX 4090 所在的一代

Ada 对应 GeForce RTX 40 系列。其代表性能力包括:

  • 第三代 RT Core;
  • 第四代 Tensor Core;
  • 新一代 Optical Flow Accelerator(光流加速器);
  • 支持 DLSS 3 Frame Generation 的硬件基础。
RTX 4090 官方关键规格
项目 RTX 4090
架构/芯片 Ada Lovelace / AD102
CUDA Core 16,384
显存 24GB GDDR6X
显存接口 384-bit
Total Graphics Power(参考) 450W
RT Core 第三代
Tensor Core 第四代

这些是产品规格,不应简单理解为所有应用的性能比例。实际游戏帧率还受分辨率、CPU、游戏引擎、光追设置、驱动、显存占用以及是否启用 DLSS 等因素影响。

DLSS 3 帧生成应如何理解

DLSS Super Resolution 的基本思路是以较低内部渲染分辨率为基础,借助 AI 重建输出画面。DLSS 3 的 Frame Generation 会利用前后帧信息、运动矢量和光流等生成插帧。

  • 它可以提高显示端呈现的帧率和流畅感。
  • 不等同于游戏引擎原生渲染出了同等数量的帧。
  • 它不能从根本上消除 CPU 瓶颈,也会引入工作流和延迟方面的取舍;通常应搭配 NVIDIA Reflex 等低延迟机制使用。

3.4 Blackwell:RTX 50 系列与新一代专业卡

Blackwell 是 Ada 之后的一代架构。它首先以数据中心产品 B200/GB200 等形式出现,之后进入 GeForce RTX 50 系列和 RTX PRO 工作站产品。

面向 RTX 图形与本地 AI 的核心变化包括:

  • 第五代 Tensor Core:支持更低精度的 AI 数据格式,包括 FP4;这主要服务于高吞吐 AI 推理等场景。
  • 第四代 RT Core:继续改进光线追踪和神经渲染相关能力。
  • DLSS 4 Multi Frame Generation:在支持的 RTX 50 系列硬件和游戏中,AI 可在传统渲染帧之间生成多个额外帧。
  • GDDR7:RTX 50 系列部分型号采用;例如 RTX 5090 使用 32GB GDDR7、512-bit 显存接口。

这里要特别克制地理解官方的倍数宣传:它通常是在指定游戏、指定画质、指定 DLSS/多帧生成模式及特定测试条件下的结果。购买或比较时,应同时看原生渲染、DLSS 超分、帧生成开启后的表现与延迟,而不是只看单个"最高倍数"。

4. 消费级、专业级、数据中心产品的关系

4.1 GeForce:游戏与创作者桌面显卡

例如 RTX 4090、RTX 5090。主要看游戏、视频创作、3D 渲染和本地 AI 体验,通常使用 GDDR 显存。驱动与功能重点偏向游戏兼容性、DLSS、NVENC 编码等。

4.2 RTX PRO:专业图形与工作站

例如 RTX 6000 Ada GenerationRTX PRO 6000 Blackwell Workstation Edition。典型特征是更大显存、ECC 支持、面向专业应用的认证和企业/专业驱动支持。适用于 CAD、DCC、数字孪生、可视化、渲染和本地 AI 等工作负载。

4.3 数据中心 GPU:训练、推理与 HPC

例如 A100、H100、B200。数据中心产品强调大规模集群互联、HBM 高带宽显存、MIG、多实例/虚拟化能力、FP8/FP4 等 AI 计算格式以及高密度部署。它们与 GeForce 不应按游戏跑分或单一 TFLOPS 指标直接比较。

5. "RTX 6000" 为什么最容易被误解

完整名称 架构 定位 显存
NVIDIA RTX 6000 Ada Generation Ada Lovelace 专业工作站 48GB GDDR6 ECC
NVIDIA RTX PRO 6000 Blackwell Workstation Edition Blackwell 专业工作站 96GB GDDR7 ECC

因此,听到"RTX 6000"时应立即追问:完整型号是否含 Ada GenerationBlackwellRTX PRO

这也解释了为什么"RTX 6000 比 4090 新/旧"不是一个可以直接回答的问题:它们可能来自不同架构,也服务于不同目标市场。

6. 速查表

text 复制代码
GeForce GTX 10 系列  -> Pascal
GeForce RTX 20 系列  -> Turing
GeForce RTX 30 系列  -> Ampere
GeForce RTX 40 系列  -> Ada Lovelace
GeForce RTX 50 系列  -> Blackwell

RTX 4090             -> Ada Lovelace / AD102
RTX 5090             -> Blackwell / GB202
RTX 6000 Ada         -> Ada Lovelace
RTX PRO 6000 Blackwell -> Blackwell

7. 学习与选购时的判断方法

  1. 先确认完整产品名称与产品线:GeForce、RTX PRO,还是数据中心 GPU。
  2. 再确认架构和芯片代号,不要只看"RTX"或数字大小。
  3. 按使用场景看指标:游戏看目标分辨率、原生与 DLSS 表现、显存、功耗和 CPU 搭配;本地模型看显存容量、量化格式、软件栈;专业工作流看应用认证、ECC、显存和驱动。
  4. 将"理论算力""AI TOPS"和厂商的"最高倍数"视作特定指标,而不是跨工作负载的总性能结论。
  5. 对跨代比较优先查具体软件的独立测试,并核对版本、画质、分辨率、是否启用超分与帧生成。

8. 官方资料

链接和产品页面会随 NVIDIA 网站改版变化。对于采购、部署或论文引用,应以对应型号的官方 Datasheet、用户手册和产品发布材料为最终依据。

相关推荐
小雪崩1 小时前
嵌入式学习 day40:数据库
数据库·学习
一条破秋裤1 小时前
17_ADC原理与转换模式
笔记·stm32·学习
知产xiao_xin1 小时前
C语言运算符的种类、运算优先级和结合性
笔记
传奇开心果编程2 小时前
【Rust入门知识点学与练】第5课:函数
开发语言·学习·rust
知产xiao_xin2 小时前
《伯尔尼公约》—— 版权保护期
经验分享·笔记·知识产权
指针常量2 小时前
【RL相关笔记】RL 效率综述
人工智能·笔记·大语言模型·后训练
留白_2 小时前
【tableau入门学习】2、柱状图、折线图、饼图、散点图
学习·tableau
STQY燊桐启元(深圳)电子科技2 小时前
5G 射频光模块场景,ST‑XDP 微波吸波导热垫片应用优势,对比 DP 导热硅胶片
经验分享·笔记·5g
AI视觉网奇2 小时前
blende 下载安装学习笔记
笔记·学习