🤖 SSD 在 AI 训练中的角色
📌 AI 训练的存储挑战
现代大模型训练对存储提出了前所未有的要求:
GPT-4 级别模型训练:
├── 训练数据集: 数十 PB 级
├── 模型参数: 数千亿参数(数百 GB ~ TB 级)
├── Checkpoint: 每隔数小时保存一次(TB 级写入)
├── 数据加载速度: 必须跟上 GPU 计算速度
└── GPU 利用率目标:> 90%(存储不能成为瓶颈)
💬 核心矛盾:GPU 算力飞速增长,存储 I/O 若跟不上,GPU 就会"饿着"等数据。
🖥️ AI 训练集群的存储架构
┌─────────────────────────────────────────────────┐
│ GPU 训练节点 │
│ ┌──────┐ ┌──────┐ ┌──────┐ ┌──────┐ │
│ │ GPU │ │ GPU │ │ GPU │ │ GPU │ │
│ └──────┘ └──────┘ └──────┘ └──────┘ │
│ ↑ 数据加载(关键路径) │
└──────────────┼──────────────────────────────────┘
│
┌──────────▼──────────────────┐
│ 存储层(三级架构) │
│ │
│ L1:本地 NVMe SSD(最快) │
│ 热数据缓存 / Checkpoint │
│ │
│ L2:NVMe-oF 共享存储池 │
│ 训练数据集 / 模型权重 │
│ │
│ L3:对象存储 / HDD 归档 │
│ 冷数据 / 历史 Checkpoint │
└──────────────────────────────┘
📊 存储性能如何影响 GPU 利用率?
场景:ResNet-50 训练,batch size = 256
存储类型 数据加载时间 GPU 等待时间 GPU 利用率
─────────────────────────────────────────────────────
HDD(7200RPM) 800 ms/batch 600 ms ~42% ❌
SATA SSD 120 ms/batch 20 ms ~83% ⚠️
NVMe SSD(D5) 18 ms/batch 0 ms ~99% ✅
NVMe-oF 存储池 22 ms/batch 0 ms ~98% ✅
💡 从 HDD 换成 NVMe SSD,GPU 利用率从 42% 提升至 99%------相当于同等算力投入多获得 2.4 倍的训练效率!
🔑 AI 训练的三大存储场景
场景一:训练数据加载(Data Ingestion)
需求:
├── 超高顺序读带宽(GB/s 级)
├── 大量小文件随机读(图片、文本 token)
├── 多 GPU 并发读取,需要高 IOPS
└── 容量优先(数据集动辄数十 PB)
最优选择:Solidigm D5-P5336(QLC,高容量低成本)
├── 单盘 122TB,大幅减少盘数
└── 顺序读带宽:7,200 MB/s
场景二:Checkpoint 保存/恢复
需求:
├── 突发大量写入(TB 级,数分钟内完成)
├── 写入延迟敏感(停止训练等待写完)
├── 高耐久性(频繁大块写入)
└── 快速恢复(故障后秒级重启训练)
最优选择:Solidigm D7 系列(TLC,高耐久)
├── 高 DWPD,应对频繁 Checkpoint
└── 低延迟写入,减少 GPU 停机时间
场景三:模型权重加载(Inference 推理)
需求:
├── 极低延迟(首个 token 生成时间)
├── 高并发随机读(多用户同时请求)
├── 模型文件通常数十至数百 GB
└── 读多写少
最优选择:D5(大容量)+ D7(低延迟)混合部署
💡 SSD vs GPU 内存:存储层级新思考
传统 AI 推理瓶颈:
模型太大(如 LLaMA-3 70B ≈ 140GB)
GPU HBM 内存不够用
↓
新思路:SSD 作为"扩展内存"
GPU HBM(80GB,带宽 3.35TB/s)
↕ PCIe 带宽(~64GB/s)
本地 NVMe SSD(数TB,带宽 ~7GB/s)
↕
NVMe-oF 存储池
→ 冷参数放 SSD,热参数放 HBM
→ 实现超大模型在有限 GPU 内存下推理
→ 成本:SSD 远低于 HBM($/GB 差距 100 倍以上)
📈 AI 时代的存储趋势
2020 GPU 算力增长 ──────────────────────────→ 持续爆炸式增长
存储 I/O 增长 ──────→ 开始跟不上
2023 存储瓶颈凸显:
├── PCIe Gen5 SSD 普及(~14GB/s)
├── NVMe-oF 存储池化成主流
└── CXL 内存扩展崭露头角
2025+ 下一步:
├── PCIe Gen6(~28GB/s)
├── CXL 3.0 共享内存池
└── 计算存储(Computational Storage)
→ SSD 内置 AI 推理加速
💡 一句话总结
在 AI 时代,SSD 不再只是"存数据的地方"------它是 GPU 算力的"粮仓",Checkpoint 的"保险箱",超大模型的"扩展内存"。存储 I/O 的速度与容量,直接决定了 AI 基础设施的投资回报率。