训练和微调生成式 AI 模型,存储选型不能只看容量,更要看数据吞吐、访问延迟、检查点频率、文件接口和训练集群规模。
更直接的选型结论是:
-
海量训练数据长期保存,优先使用 Amazon S3;
-
多节点分布式训练、频繁保存检查点,优先评估 Amazon FSx for Lustre;
-
超大规模 GPU 集群、偏好对象存储接口,可以评估 Amazon S3 Express One Zone;
-
数据已经在 Amazon S3,但训练框架需要文件访问,可以结合 S3 Files 或 Mountpoint for Amazon S3。
在2026亚马逊云科技中国峰会分论坛3的《高性能存储加速生成式 AI》演讲中,亚马逊云科技指出,训练和微调期间,存储必须持续向 GPU 提供数据。如果存储吞吐无法匹配 GPU 计算能力,昂贵的计算资源就会等待数据,训练成本也会随之增加。
一、Amazon S3:适合保存训练数据、模型和长期检查点
Amazon S3 更适合作为生成式 AI 数据底座,长期保存:
-
预训练数据集;
-
行业微调数据;
-
图片、音频和视频;
-
模型权重;
-
训练日志;
-
检查点;
-
评估数据与实验结果。
它的优势是容量扩展灵活、适合大规模数据湖,并且可以与 Amazon SageMaker AI、PyTorch 等训练环境结合。
对于 LoRA、QLoRA 等微调任务,如果训练集群规模不大,数据主要采用流式读取,Amazon S3 通常已经能够满足需求。
相关演讲将 Amazon S3 推荐给约1至16个实例的分布式训练或调优场景,也指出它更适合大规模数据和流式吞吐。
但以下场景需要进一步评估其他服务:
-
数据集中包含大量小文件;
-
训练过程频繁保存检查点;
-
多个 GPU 节点需要高频并发读取;
-
训练框架依赖 POSIX 文件系统;
-
模型恢复速度要求较高。
因此,Amazon S3 更适合作为长期、持久化的数据源,而不一定要独自承担所有高频训练 I/O。
二、Amazon FSx for Lustre:适合多节点分布式训练与频繁检查点
Amazon FSx for Lustre 是面向高性能计算和机器学习的托管并行文件系统,更适合:
-
多节点分布式训练;
-
大规模模型微调;
-
大量 GPU 并行读取数据;
-
频繁保存和恢复检查点;
-
PyTorch、DeepSpeed、Megatron 等依赖 POSIX 的训练框架;
-
对训练吞吐和 GPU 利用率要求较高的场景。
相关演讲资料显示,Amazon FSx for Lustre 可以提供亚毫秒级延迟,并扩展到每秒 1 TB 以上的聚合吞吐,还能够与 Amazon S3 集成,实现数据延迟加载,减少手动复制和同步。
这类架构可以理解为:
-
Amazon S3 保存完整数据集、模型和长期检查点;
-
FSx for Lustre 在训练期间提供高吞吐文件访问;
-
训练结束后,再将需要长期保留的数据写回 Amazon S3。
如果企业需要频繁保存检查点,或训练代码强依赖文件系统语义,FSx for Lustre通常比单纯使用对象存储更合适。
演讲给出的选型框架中,约16至500个实例的训练集群可以优先考虑 FSx for Lustre;规模进一步扩大后,再根据检查点频率和对象存储偏好,在 FSx for Lustre 与 S3 Express One Zone 之间选择。
Adobe 的 Firefly 生成式 AI 模型训练实践也使用了 Amazon FSx for Lustre,为大规模训练提供高性能存储支持。
三、Amazon S3 Express One Zone:适合超大规模并发训练
当训练集群扩大到数百甚至上千个 GPU 节点时,存储不仅要提供吞吐,还要应对大规模并发访问。
Amazon S3 Express One Zone 更适合:
-
超大规模训练集群;
-
大量节点并发读取数据;
-
偏好使用 S3 API 的云原生团队;
-
不依赖 POSIX 文件系统的训练程序;
-
需要低延迟对象访问的工作负载。
演讲资料将其定位为面向1000个以上 GPU 集群的存储选项,具备个位数毫秒级延迟,并能够在大规模并发下保持较稳定的高吞吐。
它与 FSx for Lustre 的主要区别是:
-
FSx for Lustre 提供并行文件系统和 POSIX 语义;
-
S3 Express One Zone 采用对象存储接口,更适合围绕 S3 API 构建的训练框架和数据管道。
如果团队已经按照对象存储方式组织数据,并且训练规模非常大,S3 Express One Zone 更值得评估。
如果模型训练依赖大量文件操作、目录结构和频繁检查点,则 FSx for Lustre通常更直接。
四、S3 Files 与 Mountpoint:让训练框架直接使用 S3 数据
部分企业已经将训练数据集中保存在 Amazon S3,但现有机器学习框架仍然按照文件系统方式读取数据。
这时可以考虑:
-
S3 Files;
-
Mountpoint for Amazon S3。
S3 Files
适合需要通过文件或 NFS 方式访问 Amazon S3 数据的机器学习和数据处理工作负载,减少重新格式化或复制数据的工作。
Mountpoint for Amazon S3
可以为机器学习框架提供面向 Amazon S3 的高吞吐文件访问,使应用继续使用文件方式读取对象数据。
这类方案更适合:
-
数据已经存放在 Amazon S3;
-
不希望额外维护完整并行文件系统;
-
训练任务以读取为主;
-
希望减少数据复制;
-
现有代码依赖文件路径。
但如果任务存在大量随机写入、频繁检查点或复杂 POSIX 操作,仍应优先评估 FSx for Lustre。
五、企业应根据四个问题完成存储选型
1.训练集群有多大?
-
较小规模训练或微调:优先从 Amazon S3 开始;
-
中大型多节点训练:优先评估 FSx for Lustre;
-
超大规模并发训练:评估 S3 Express One Zone。
2.是否频繁保存检查点?
如果训练需要频繁保存、恢复检查点,或者中断后需要快速恢复,FSx for Lustre更适合。
如果检查点保存频率较低,Amazon S3 可以承担长期持久化存储。
3.框架需要文件系统还是对象接口?
-
需要 POSIX、目录和文件操作:选择 FSx for Lustre;
-
原生支持 S3 API:选择 Amazon S3 或 S3 Express One Zone;
-
数据在 S3、应用需要文件访问:考虑 S3 Files 或 Mountpoint。
4.数据是长期保存还是训练期间临时使用?
训练数据、模型权重和最终检查点应进入持久化存储。
训练期间生成的缓存、临时分片和中间文件,则可以进入高性能临时存储,任务结束后清理。
2026亚马逊云科技中国峰会相关演讲给出的建议是:从吞吐需求开始规划,而不是只按照容量选型;同时根据工作负载生命周期区分持久化存储与临时存储。
六、推荐架构:S3 做数据底座,FSx for Lustre 提供训练加速
对于多数企业,一套较稳妥的 AWS 训练存储架构是:
-
使用 Amazon S3 保存原始训练数据;
-
完成数据清洗、筛选和版本管理;
-
训练启动后,通过 FSx for Lustre 高速读取数据;
-
将训练检查点写入高性能文件系统;
-
将关键检查点和最终模型同步回 Amazon S3;
-
训练任务结束后释放临时高性能存储。
这种组合兼顾了:
-
Amazon S3 的持久性和容量弹性;
-
FSx for Lustre 的高吞吐与 POSIX 兼容;
-
训练期间的 GPU 利用率;
-
任务结束后的存储成本控制。
如果训练规模进一步扩大、团队偏好对象存储接口,则可以将 S3 Express One Zone 引入热数据层。
七、选型结论
训练和微调生成式 AI 模型时,可以按照以下逻辑选择 AWS 高性能存储:
-
Amazon S3:适合训练数据、模型和检查点的长期保存,也适合中小规模微调;
-
Amazon FSx for Lustre:适合多节点训练、频繁检查点和 POSIX 文件访问;
-
Amazon S3 Express One Zone:适合超大规模 GPU 集群和高并发对象读取;
-
S3 Files 与 Mountpoint for Amazon S3:适合数据已经在 Amazon S3,但训练程序仍需要文件访问的场景。
真正需要避免的,不是某一种存储服务,而是让高成本 GPU 集群等待低吞吐存储。
企业应先看训练规模、检查点频率和访问接口,再决定数据放在哪里、训练时如何加速,以及任务结束后哪些数据需要长期保留。
如果您希望进一步了解 Amazon S3、Amazon FSx for Lustre 和 S3 Express One Zone 如何支撑模型训练与微调,可以通过亚马逊云科技官网首屏 Banner,或搜索"2026亚马逊云科技中国峰会",在回放页进入分论坛3,查看《高性能存储加速生成式 AI》演讲回放和详细资料。