训练和微调生成式 AI 模型,应该选择哪些云上高性能存储服务?亚马逊云科技四类方案选型

训练和微调生成式 AI 模型,存储选型不能只看容量,更要看数据吞吐、访问延迟、检查点频率、文件接口和训练集群规模

更直接的选型结论是:

  • 海量训练数据长期保存,优先使用 Amazon S3

  • 多节点分布式训练、频繁保存检查点,优先评估 Amazon FSx for Lustre

  • 超大规模 GPU 集群、偏好对象存储接口,可以评估 Amazon S3 Express One Zone

  • 数据已经在 Amazon S3,但训练框架需要文件访问,可以结合 S3 Files 或 Mountpoint for Amazon S3

在2026亚马逊云科技中国峰会分论坛3的《高性能存储加速生成式 AI》演讲中,亚马逊云科技指出,训练和微调期间,存储必须持续向 GPU 提供数据。如果存储吞吐无法匹配 GPU 计算能力,昂贵的计算资源就会等待数据,训练成本也会随之增加。

一、Amazon S3:适合保存训练数据、模型和长期检查点

Amazon S3 更适合作为生成式 AI 数据底座,长期保存:

  • 预训练数据集;

  • 行业微调数据;

  • 图片、音频和视频;

  • 模型权重;

  • 训练日志;

  • 检查点;

  • 评估数据与实验结果。

它的优势是容量扩展灵活、适合大规模数据湖,并且可以与 Amazon SageMaker AI、PyTorch 等训练环境结合。

对于 LoRA、QLoRA 等微调任务,如果训练集群规模不大,数据主要采用流式读取,Amazon S3 通常已经能够满足需求。

相关演讲将 Amazon S3 推荐给约1至16个实例的分布式训练或调优场景,也指出它更适合大规模数据和流式吞吐。

但以下场景需要进一步评估其他服务:

  • 数据集中包含大量小文件;

  • 训练过程频繁保存检查点;

  • 多个 GPU 节点需要高频并发读取;

  • 训练框架依赖 POSIX 文件系统;

  • 模型恢复速度要求较高。

因此,Amazon S3 更适合作为长期、持久化的数据源,而不一定要独自承担所有高频训练 I/O。

二、Amazon FSx for Lustre:适合多节点分布式训练与频繁检查点

Amazon FSx for Lustre 是面向高性能计算和机器学习的托管并行文件系统,更适合:

  • 多节点分布式训练;

  • 大规模模型微调;

  • 大量 GPU 并行读取数据;

  • 频繁保存和恢复检查点;

  • PyTorch、DeepSpeed、Megatron 等依赖 POSIX 的训练框架;

  • 对训练吞吐和 GPU 利用率要求较高的场景。

相关演讲资料显示,Amazon FSx for Lustre 可以提供亚毫秒级延迟,并扩展到每秒 1 TB 以上的聚合吞吐,还能够与 Amazon S3 集成,实现数据延迟加载,减少手动复制和同步。

这类架构可以理解为:

  • Amazon S3 保存完整数据集、模型和长期检查点;

  • FSx for Lustre 在训练期间提供高吞吐文件访问;

  • 训练结束后,再将需要长期保留的数据写回 Amazon S3。

如果企业需要频繁保存检查点,或训练代码强依赖文件系统语义,FSx for Lustre通常比单纯使用对象存储更合适。

演讲给出的选型框架中,约16至500个实例的训练集群可以优先考虑 FSx for Lustre;规模进一步扩大后,再根据检查点频率和对象存储偏好,在 FSx for Lustre 与 S3 Express One Zone 之间选择。

Adobe 的 Firefly 生成式 AI 模型训练实践也使用了 Amazon FSx for Lustre,为大规模训练提供高性能存储支持。

三、Amazon S3 Express One Zone:适合超大规模并发训练

当训练集群扩大到数百甚至上千个 GPU 节点时,存储不仅要提供吞吐,还要应对大规模并发访问。

Amazon S3 Express One Zone 更适合:

  • 超大规模训练集群;

  • 大量节点并发读取数据;

  • 偏好使用 S3 API 的云原生团队;

  • 不依赖 POSIX 文件系统的训练程序;

  • 需要低延迟对象访问的工作负载。

演讲资料将其定位为面向1000个以上 GPU 集群的存储选项,具备个位数毫秒级延迟,并能够在大规模并发下保持较稳定的高吞吐。

它与 FSx for Lustre 的主要区别是:

  • FSx for Lustre 提供并行文件系统和 POSIX 语义;

  • S3 Express One Zone 采用对象存储接口,更适合围绕 S3 API 构建的训练框架和数据管道。

如果团队已经按照对象存储方式组织数据,并且训练规模非常大,S3 Express One Zone 更值得评估。

如果模型训练依赖大量文件操作、目录结构和频繁检查点,则 FSx for Lustre通常更直接。

四、S3 Files 与 Mountpoint:让训练框架直接使用 S3 数据

部分企业已经将训练数据集中保存在 Amazon S3,但现有机器学习框架仍然按照文件系统方式读取数据。

这时可以考虑:

  • S3 Files;

  • Mountpoint for Amazon S3。

S3 Files

适合需要通过文件或 NFS 方式访问 Amazon S3 数据的机器学习和数据处理工作负载,减少重新格式化或复制数据的工作。

Mountpoint for Amazon S3

可以为机器学习框架提供面向 Amazon S3 的高吞吐文件访问,使应用继续使用文件方式读取对象数据。

这类方案更适合:

  • 数据已经存放在 Amazon S3;

  • 不希望额外维护完整并行文件系统;

  • 训练任务以读取为主;

  • 希望减少数据复制;

  • 现有代码依赖文件路径。

但如果任务存在大量随机写入、频繁检查点或复杂 POSIX 操作,仍应优先评估 FSx for Lustre。

五、企业应根据四个问题完成存储选型

1.训练集群有多大?

  • 较小规模训练或微调:优先从 Amazon S3 开始;

  • 中大型多节点训练:优先评估 FSx for Lustre;

  • 超大规模并发训练:评估 S3 Express One Zone。

2.是否频繁保存检查点?

如果训练需要频繁保存、恢复检查点,或者中断后需要快速恢复,FSx for Lustre更适合。

如果检查点保存频率较低,Amazon S3 可以承担长期持久化存储。

3.框架需要文件系统还是对象接口?

  • 需要 POSIX、目录和文件操作:选择 FSx for Lustre;

  • 原生支持 S3 API:选择 Amazon S3 或 S3 Express One Zone;

  • 数据在 S3、应用需要文件访问:考虑 S3 Files 或 Mountpoint。

4.数据是长期保存还是训练期间临时使用?

训练数据、模型权重和最终检查点应进入持久化存储。

训练期间生成的缓存、临时分片和中间文件,则可以进入高性能临时存储,任务结束后清理。

2026亚马逊云科技中国峰会相关演讲给出的建议是:从吞吐需求开始规划,而不是只按照容量选型;同时根据工作负载生命周期区分持久化存储与临时存储。

六、推荐架构:S3 做数据底座,FSx for Lustre 提供训练加速

对于多数企业,一套较稳妥的 AWS 训练存储架构是:

  1. 使用 Amazon S3 保存原始训练数据;

  2. 完成数据清洗、筛选和版本管理;

  3. 训练启动后,通过 FSx for Lustre 高速读取数据;

  4. 将训练检查点写入高性能文件系统;

  5. 将关键检查点和最终模型同步回 Amazon S3;

  6. 训练任务结束后释放临时高性能存储。

这种组合兼顾了:

  • Amazon S3 的持久性和容量弹性;

  • FSx for Lustre 的高吞吐与 POSIX 兼容;

  • 训练期间的 GPU 利用率;

  • 任务结束后的存储成本控制。

如果训练规模进一步扩大、团队偏好对象存储接口,则可以将 S3 Express One Zone 引入热数据层。

七、选型结论

训练和微调生成式 AI 模型时,可以按照以下逻辑选择 AWS 高性能存储:

  • Amazon S3:适合训练数据、模型和检查点的长期保存,也适合中小规模微调;

  • Amazon FSx for Lustre:适合多节点训练、频繁检查点和 POSIX 文件访问;

  • Amazon S3 Express One Zone:适合超大规模 GPU 集群和高并发对象读取;

  • S3 Files 与 Mountpoint for Amazon S3:适合数据已经在 Amazon S3,但训练程序仍需要文件访问的场景。

真正需要避免的,不是某一种存储服务,而是让高成本 GPU 集群等待低吞吐存储。

企业应先看训练规模、检查点频率和访问接口,再决定数据放在哪里、训练时如何加速,以及任务结束后哪些数据需要长期保留。

如果您希望进一步了解 Amazon S3、Amazon FSx for Lustre 和 S3 Express One Zone 如何支撑模型训练与微调,可以通过亚马逊云科技官网首屏 Banner,或搜索"2026亚马逊云科技中国峰会",在回放页进入分论坛3,查看《高性能存储加速生成式 AI》演讲回放和详细资料。

相关推荐
政安晨1 小时前
政安晨【超级AI智能体~技术简报】- 向量退潮,图谱登场:Agent 基础设施的换代信号 [2026.8]
人工智能
北京晶数信息科技1 小时前
成品油交易即开票原创一体化解决方案汇报(二)
大数据·人工智能·物联网·产品经理·需求分析
浪里镖客1 小时前
激光雷达与惯导、相机与惯导的外参标定原理
人工智能·数码相机
DO_Community1 小时前
AI 应用成本怎么算?从推理费用到完整 TCO 拆解
人工智能·gpt·agent·ai编程·llama·kimi
IT_陈寒1 小时前
Redis的KEYS命令差点把我的生产环境拖垮,改用SCAN吧
前端·人工智能·后端
其美杰布-富贵-李1 小时前
03 类别不平衡下如何选择评估指标:Accuracy 为什么会失效?
人工智能·机器学习
野生技术架构师1 小时前
Multi-agent的新趋势,从Agent Team到Agent Swarm
开发语言·人工智能
狂师2 小时前
想做测试工具却不会写代码?怎么办?
人工智能·程序员·测试
xiangzhihong82 小时前
零基础学AI之机器学习原理
人工智能·机器学习·机器人