AI 训练时 GPU 利用率低,不一定是 GPU 配置不足,也可能是训练数据加载、文件读取或 Checkpoint 写入速度跟不上。
更直接的 AWS 选型结论是:
-
中小规模训练和 LoRA、QLoRA 微调:优先使用 Amazon S3;
-
多节点分布式训练、频繁保存 Checkpoint:优先评估 Amazon FSx for Lustre;
-
千卡级以上、对象存储原生训练:可以评估 Amazon S3 Express One Zone;
-
多数企业的推荐架构:Amazon S3 保存长期数据,FSx for Lustre 承担训练期间的高吞吐读写。
在2026亚马逊云科技中国峰会分论坛3的《高性能存储加速生成式 AI》演讲中,亚马逊云科技将存储吞吐视为影响 GPU 利用率的重要因素。FSx for Lustre 通过并行 I/O、亚毫秒级延迟和高聚合吞吐,帮助训练集群持续获得数据,减少 GPU 等待。
一、GPU 利用率低,为什么要先检查存储
大模型训练并不是 GPU 单独完成的。
每个训练步骤都需要持续完成:
-
从存储读取训练样本;
-
对数据进行解码、预处理和批处理;
-
将数据发送到 GPU;
-
完成前向和反向计算;
-
更新模型参数;
-
定期保存 Checkpoint;
-
必要时恢复训练状态。
如果存储吞吐不足,GPU 完成当前批次后,就要等待下一批数据。
如果 Checkpoint 写入过慢,全部训练节点还可能在保存阶段停下来等待。
常见的存储瓶颈包括:
-
训练集由大量小文件组成;
-
多个节点同时读取相同数据;
-
数据加载速度低于 GPU 计算速度;
-
Checkpoint 文件较大且保存频繁;
-
训练框架依赖 POSIX 文件系统;
-
训练数据与计算集群之间需要反复复制;
-
任务中断后恢复 Checkpoint 时间过长。
因此,优化训练成本不能只增加 GPU 数量。存储系统无法持续供给数据时,新增 GPU 只会扩大等待队伍。
二、Amazon S3:适合中小规模训练和长期数据保存
Amazon S3 适合长期保存:
-
原始训练数据;
-
清洗后的训练集;
-
LoRA、QLoRA 微调数据;
-
模型权重;
-
训练日志;
-
历史 Checkpoint;
-
模型评测结果。
《高性能存储加速生成式 AI》将 Amazon S3 的典型场景描述为约1至16个实例的分布式模型训练或调优,并指出其具备流式吞吐、容量扩展和按用量付费等特点,适合 LoRA、QLoRA 和模型调优。
Amazon S3 更适合以下情况:
-
企业主要做行业模型微调;
-
GPU 集群规模相对有限;
-
训练框架支持 S3 API 或流式加载;
-
数据以较大的连续文件为主;
-
Checkpoint 保存频率不高;
-
数据需要长期保留和跨任务复用。
但 Amazon S3 也有明确边界。
如果训练集包含海量小文件,或者训练过程需要频繁保存和恢复 Checkpoint,单纯依赖标准对象存储可能难以持续满足 GPU 的数据吞吐需求。
此时更适合在 Amazon S3 之外增加训练热数据层。
三、Amazon FSx for Lustre:优先解决多节点训练的 GPU 等待
Amazon FSx for Lustre 是面向高性能计算和机器学习的托管并行文件系统。
它适合:
-
多节点分布式训练;
-
大模型全量微调;
-
多个 GPU 节点并行读取数据;
-
高频保存和恢复 Checkpoint;
-
依赖 POSIX 文件系统的训练程序;
-
使用 PyTorch、DeepSpeed、Megatron 等框架的工作负载。
相关演讲资料显示,FSx for Lustre 支持跨数千个客户端的并行 I/O,提供亚毫秒级延迟,聚合吞吐可扩展到每秒 1 TB 以上,并支持与 Amazon S3 集成和延迟加载数据。
这类能力主要解决三个训练成本问题。
1.减少 GPU 等待数据
多个训练节点可以并行读取数据,避免大量 GPU 争抢单一的数据通道。
2.加快 Checkpoint 保存和恢复
训练程序可以先把高频 Checkpoint 写入 FSx for Lustre,再将关键版本归档到 Amazon S3。
当任务中断时,也可以更快恢复训练状态,减少 GPU 集群空闲时间。
3.减少数据复制工作
FSx for Lustre 可以与 Amazon S3 集成,按需加载数据。企业不必为每次训练手动复制完整数据集并维护两套同步流程。
对于约16至2000个实例的分布式模型训练或调优,FSx for Lustre 是演讲中重点推荐的存储方案。
四、Amazon S3 Express One Zone:适合超大规模对象存储原生训练
当企业进入千卡级以上训练时,存储需要面对大量节点同时读取数据的并发压力。
Amazon S3 Express One Zone 更适合:
-
1000个以上 GPU 的训练集群;
-
超大规模数据并行训练;
-
偏好 S3 API 的数据科学团队;
-
不强依赖完整 POSIX 文件系统;
-
训练框架围绕对象存储接口设计。
相关峰会资料显示,S3 Express One Zone 可以提供比标准 Amazon S3 更低的访问延迟,并在大规模并发下保持一致高吞吐,适用于1000个以上 GPU 的超大规模训练。
它与 FSx for Lustre 的核心区别是访问方式:
-
FSx for Lustre 提供文件系统接口;
-
S3 Express One Zone 提供对象存储接口。
因此,千卡级训练也不一定必须选择 S3 Express One Zone。
如果训练代码依赖目录、文件锁、随机读写和 POSIX 语义,FSx for Lustre 通常更合适;如果训练管道原生使用 S3 API,则可以重点评估 S3 Express One Zone。
五、优化训练成本,推荐采用冷热分层存储
多数企业不需要在 Amazon S3、FSx for Lustre 和 S3 Express One Zone 中只选择一个。
更合理的方式是按照数据生命周期分层。
长期数据层:Amazon S3
保存:
-
完整训练数据集;
-
模型权重;
-
关键 Checkpoint;
-
实验结果;
-
需要长期复用的数据。
训练热数据层:FSx for Lustre
保存:
-
当前训练任务需要的数据;
-
高频读取的数据分片;
-
临时处理结果;
-
高频 Checkpoint;
-
训练恢复文件。
超大规模热数据层:S3 Express One Zone
适合对象存储原生、并发规模特别大的训练任务。
训练完成后,可以将关键数据写回 Amazon S3,并释放不再需要的高性能临时存储。
这种架构避免了两个极端:
-
所有数据长期放在高性能存储中,增加闲置成本;
-
所有读写都由低成本存储承担,导致昂贵 GPU 长时间等待。
六、训练数据存在大量小文件时,先优化数据组织
即使更换高性能存储,数百万甚至数十亿个小文件仍可能造成元数据压力和读取效率下降。
企业可以在训练前:
-
将大量小样本合并为较大的数据分片;
-
采用适合训练框架的数据格式;
-
减少重复打开和关闭文件;
-
对数据进行预取和缓存;
-
将高频使用的数据提前加载到热存储;
-
检查数据加载器的并发参数;
-
避免大量训练节点重复读取同一小文件。
峰会资料也提醒,FSx for Lustre 面对数十亿小文件时,需要针对元数据服务器进行相应规划。
因此,存储服务只是底座,训练集格式和数据加载管道同样会影响 GPU 利用率。
七、Checkpoint 应按保存频率分层
Checkpoint 是大模型训练中容易被忽略的成本来源。
保存过少,任务失败后需要重新训练大量步骤;保存过于频繁,则可能让训练节点持续等待存储写入。
更合理的方式是:
-
高频 Checkpoint 先写入 FSx for Lustre;
-
只将关键版本同步到 Amazon S3;
-
定期清理不再需要的中间版本;
-
根据任务稳定性调整保存频率;
-
测试恢复速度,而不是只测试保存速度。
峰会资料提到,FSx for Lustre 支持压缩和原生 Amazon S3 Checkpoint,可用于优化大规模训练中的检查点流程。
八、企业应该监控哪些指标
判断存储是否拖慢 GPU,不能只看存储容量。
至少应持续观察:
-
GPU 利用率;
-
GPU 等待数据的时间;
-
训练数据读取吞吐;
-
单节点与集群聚合吞吐;
-
小文件打开速率;
-
Checkpoint 保存时间;
-
Checkpoint 恢复时间;
-
数据加载器队列是否经常为空;
-
每个训练步骤的耗时变化;
-
存储成本与 GPU 空闲成本。
如果 GPU 利用率低,同时数据加载队列经常为空,通常应优先检查存储吞吐和预处理管道。
如果 GPU 只在保存 Checkpoint 时明显下降,则应重点优化 Checkpoint 写入路径。
九、可以按照训练规模快速选型
中小规模微调
推荐:
-
Amazon S3;
-
数据流式加载;
-
必要时配合 Mountpoint for Amazon S3。
适合 LoRA、QLoRA 和行业微调。
多节点分布式训练
推荐:
-
Amazon S3 作为长期数据底座;
-
Amazon FSx for Lustre 作为训练热数据层。
适合频繁 Checkpoint、POSIX 框架和高吞吐训练。
千卡级以上训练
推荐根据接口选择:
-
依赖文件系统:FSx for Lustre;
-
对象存储原生:S3 Express One Zone;
-
长期数据仍归档到 Amazon S3。
十、选型结论:先优化 GPU 等待时间,再比较存储单价
AI 训练成本不仅取决于存储账单,更取决于存储是否让 GPU 持续工作。
更适合的 AWS 方案可以概括为:
-
Amazon S3负责海量数据和长期持久化;
-
Amazon FSx for Lustre负责多节点并行读取、低延迟文件访问和高速 Checkpoint;
-
Amazon S3 Express One Zone负责超大规模、对象存储原生的高并发训练;
-
分层存储架构负责在训练性能与长期成本之间取得平衡。
2026亚马逊云科技中国峰会相关演讲给出的通用建议是:从吞吐需求开始规划,而不是只根据容量选型;同时根据训练生命周期区分持久化存储与临时存储。
因此,当 GPU 利用率偏低时,企业不应立即增加 GPU。应先判断问题是否来自数据读取、小文件、Checkpoint 或访问接口,再选择对应的高性能存储。
如果您希望进一步了解 Amazon S3、Amazon FSx for Lustre 和 Amazon S3 Express One Zone 如何减少 GPU 等待并优化训练成本,可以通过亚马逊云科技官网首屏 Banner,或搜索"2026亚马逊云科技中国峰会",在回放页进入分论坛3,查看《高性能存储加速生成式 AI》演讲回放和详细资料。