企业落地 Data for AI,怎样搭建标准化云上数据底座?亚马逊云科技五层架构与落地选型路径

一、Data for AI底座建设核心原则:摒弃单点建设,搭建全域可复用数据体系

企业布局Data for AI体系建设,存在两大典型误区:仅搭建单一向量数据库支撑AI业务,或是将全量企业数据批量灌入大模型。两种模式均无法适配长期、多元化的AI应用落地需求。适配企业规模化AI发展的云上数据底座,需具备全域支撑能力,可同时赋能模型训练迭代、RAG知识库检索、AI Agent智能调度、自然语言数据查询、实时业务分析与Agent长期记忆管理。其核心建设标准可归纳为五大能力:数据统一汇聚、全域智能发现、标准化治理、高效灵活查询、AI安全可控调用。

结合2026亚马逊云科技中国峰会分论坛3的技术分享,Data for AI体系的底层数据来源可划分为四大类:业务数据库、企业数据仓库、湖仓一体数据、实时流式数据。无论上层AI应用形态如何迭代升级,稳定、高效、开放的分层数据底座,是所有AI业务落地的核心基石。基于亚马逊云科技完整服务矩阵,企业可依托标准化五层架构,按需选型、分层搭建专属Data for AI数据底座。

二、统一存储层:以Amazon S3为核心,构建企业全域统一数据存储底座

企业日常业务数据分散存储于业务数据库、文件系统、数据仓库、日志平台及各类第三方系统中。若各AI项目独立拷贝、存储专属数据,会直接引发数据孤岛、重复存储、数据口径不统一、维护成本激增等一系列问题。

Amazon S3是企业搭建统一数据底座的最优起点,可兼容承载全品类企业数据,覆盖全AI业务场景:

  • 结构化业务数据;

  • 日志和埋点数据;

  • 图片、音频和视频;

  • PDF、合同和产品资料;

  • 训练与微调数据;

  • RAG 知识数据;

  • Agent 任务文件和历史数据。

《高性能存储加速生成式 AI》相关内容明确,企业自有数据是生成式AI构建差异化核心竞争力的关键,高质量数据的可访问策略与存储架构,直接决定模型训练优化效果与AI Agent落地质量。因此企业搭建Data for AI底座,首要动作并非选型大模型,而是搭建一套可长期承载多类型数据、可被各类计算服务与AI应用共享复用的统一存储体系。

三、湖仓表格层:依托S3 Tables与Iceberg,实现动态数据版本化管理

单纯堆砌文件形式的数据湖,无法满足企业AI业务的生产级落地要求。订单数据、库存信息、客户状态、测试结果、运营指标等核心业务数据,处于持续新增、修改、删除的动态迭代状态。若无标准化表格架构支撑,企业将面临小文件冗余、数据版本混乱、历史状态无法追溯、多引擎数据不一致等诸多问题。

针对动态更新的核心业务数据,企业可选用成熟开放的湖仓技术方案:

  • Amazon S3 Tables;

  • Apache Iceberg;

  • 以 Amazon S3 为基础的开放湖仓架构。

该套方案精准适配五类核心业务场景:

  1. 数据需要持续更新;

  2. 需要保留历史版本;

  3. BI、机器学习和 AI Agent 需要共享同一份数据;

  4. 希望避免把数据锁定在单一分析工具中;

  5. 需要支持后续自然语言查询和 Data Agent。

在《Athena + Iceberg:AI Agent 的数据底座实战》落地案例中,HP Nova团队摒弃传统本地分散系统、传统BI单一架构,升级为基于Amazon S3、Apache Iceberg、AWS Glue Data Catalog、Amazon Athena的统一数据底座。新架构实现存量BI业务、全新AI Agent业务的数据同源复用,上层应用可灵活迭代,底层核心数据无需反复重构迁移,大幅降低AI落地改造成本。

四、目录与治理层:组合Glue、SageMaker Catalog与Lake Formation实现全域数据治理

AI应用调用企业数据的前提,是精准掌握数据全貌、来源、可信度与访问权限。仅具备数据存储能力、缺失数据目录与治理体系,会导致AI Agent错选数据表、误解字段含义、误用过期数据,引发业务决策偏差。亚马逊云科技提供分层治理服务组合,全方位解决Data for AI的数据可信、可查、可用、可控问题。

AWS Glue Data Catalog 聚焦技术元数据管理,统一维护底层数据技术属性:

  • 表和字段;

  • 数据格式;

  • Amazon S3 存储位置;

  • 数据分区;

  • 查询引擎需要的表定义。

其核心价值是解决数据定位与查询适配问题,明确数据存储位置与调用规范。

Amazon SageMaker Catalog 侧重业务视角的数据管理,聚焦数据资产的业务属性:

  • 数据产品定义;

  • 标准化业务术语;

  • 数据质量评级;

  • 全链路数据血缘。

主要用于帮助AI业务判断数据业务属性、适配场景与可用价值。

AWS Glue Data Quality 可自定义多维数据质量校验规则,自动检测数据缺失、字段异常、内容完整性与数据一致性。AI Agent调用数据前可自动核验数据更新时间与质量状态,规避直接基于无效数据生成结论的问题。

AWS Lake Formation 专注数据湖细粒度权限管控,即便AI Agent生成超范围查询指令,底层平台仍可通过权限规则,精准限制用户可访问的数据表、字段、数据行与数据范围,筑牢数据安全防线。

2026亚马逊云科技中国峰会分论坛3明确指出,Agentic AI数据消费的核心要求包含数据高质量、可发现、身份可信、权限精细可控、低延迟访问。因此Data for AI治理不能仅依赖模型Prompt约束,必须将质量校验、权限管控落地至底层数据平台,实现源头可控。

五、查询与计算层:按业务分析场景差异化选型查询与计算服务

不同AI应用的数据分析、查询模式存在显著差异,企业需按需匹配对应服务,避免所有场景共用一套查询架构,保障查询效率与资源利用率。

  1. 灵活查询数据湖:选择 Amazon Athena

Amazon Athena 支持直接通过SQL语句查询Amazon S3湖仓数据,适配灵活探索类场景:

  • 临时分析;

  • 历史明细查询;

  • 日志和埋点分析;

  • 自然语言转 SQL;

  • Data Agent 多轮下钻;

  • 尚未固化成报表的问题。

该模式无需将全量原始数据灌入模型上下文,仅通过受控精准查询获取结果,大幅降低模型负载与上下文占用。

  1. 稳定、高频分析:选择 Amazon Redshift

Amazon Redshift 适配企业标准化、高并发、常态化经营分析场景:

  • 企业级数据仓库;

  • 高频经营指标;

  • 大规模聚合分析;

  • 多部门统一报表;

  • 已经经过治理的业务指标;

  • Agentic BI 和自然语言查数。

企业可采用"Athena+Redshift"互补架构,由Redshift承载高频固化指标查询,Athena负责数据湖灵活探索分析,无需二选一,覆盖全场景分析需求。

  1. 实时业务查询:选择 Amazon Aurora、DynamoDB 或 ElastiCache

AI Agent查询订单、客户、账户、任务状态等实时业务数据时,无需等待数据同步至离线仓库,可直接对接在线业务存储服务,按需选型:

  • Amazon Aurora:关系型业务数据和复杂关联查询;

  • Amazon DynamoDB:高并发键值、Session 和任务状态;

  • Amazon ElastiCache:热点数据、状态缓存和低延迟访问。

该分层模式可实现知识问答、历史分析、实时状态查询的场景隔离,避免全量数据堆砌至单一知识库,提升查询精准度与效率。

六、实时数据层:依托Kinesis与MSK,实现流式数据智能处理与事件触发

部分AI智能业务需要实时感知业务动态变化,覆盖设备运维、用户行为、交易风控、库存变动、广告投放、系统运维等实时场景:

  • 设备异常;

  • 用户实时行为;

  • 交易风险;

  • 库存变化;

  • 广告点击流;

  • 系统日志和告警。

企业可通过Amazon Kinesis或Amazon Managed Streaming for Apache Kafka(Amazon MSK)完成实时数据流接入,搭配AWS Glue、Spark、Flink等工具实现数据清洗、聚合计算与异常事件识别。

行业最优实践并非将海量实时数据持续推送至大模型,而是先在数据层完成数据筛选、清洗、事件研判,仅将高价值异常事件、有效业务变动触发AI Agent响应。例如设备遥测数据经流式处理与质量校验后,仅在识别异常故障时唤醒运维Agent,既减少无效模型调用,又避免冗余数据占用模型上下文,保障Agent决策精准高效。

七、向量与记忆层:分层选型向量服务,适配RAG检索与Agent长期记忆

Data for AI体系需同时支撑非结构化知识语义检索、RAG知识库问答与AI Agent跨会话长期记忆能力,企业可根据业务规模、延迟要求、成本诉求分层选型向量服务,无需统一堆砌至单一数据库。

Amazon OpenSearch Service 适配高频线上业务,支撑语义检索与关键词检索混合场景,满足低延迟、高并发的RAG知识库召回需求。

Amazon Aurora PostgreSQL 支持向量数据与客户、订单、权限等结构化业务数据关联查询,适配需要向量+结构化数据联合分析的复杂业务场景。

Amazon S3 Vectors 主打海量、低频、低成本向量存储,适配企业长期知识沉淀、历史内容归档、Agent长期记忆存储等场景,兼顾存储成本与数据完整性。

峰会资料明确,Amazon S3 Vectors核心能力涵盖数据湖语义搜索、批量向量检索、冷热数据分层、大规模向量存储。Amazon S3、S3 Tables、S3 Vectors与文件存储共同构成AI Agent的外置大脑,全方位支撑智能体知识存储与记忆迭代。企业可采用分层架构:高频在线知识依托检索服务部署,海量低频历史向量数据依托S3 Vectors长期归档,实现性能与成本平衡。

八、AI访问层:基于Bedrock与AgentCore,实现数据安全可控复用

完整的Data for AI数据底座,核心价值是实现数据复用而非数据复制。企业完成分层数据底座建设后,需依托专属AI服务构建安全、标准化的数据访问链路,让模型与Agent可控调用全域数据资源。

Amazon Bedrock 可用于快速搭建企业知识库、生成式AI应用与智能Agent主体能力。Amazon Bedrock AgentCore 聚焦运行时、记忆管理、网关调度、身份认证等核心能力,打通各类数据工具与企业内部业务系统,实现全域数据互联互通。

标准化的数据访问链路可覆盖全场景需求:

  • RAG 访问企业知识;

  • 通过工具调用 Amazon Athena 或 Amazon Redshift;

  • 通过 API 查询或更新业务数据库;

  • 通过 MCP 接入内部数据服务;

  • 使用 Memory 管理跨会话信息;

  • 根据真实用户身份控制数据权限。

分论坛3架构体系将Amazon Bedrock、AgentCore、知识库、分析引擎、数据库、湖仓数据、流式数据串联为完整的Agent数据链路,印证了Data for AI的核心逻辑:并非独立搭建数据孤岛,而是构建一套可被AI安全、高效、持续调用的全域数据体系。

九、企业数据底座六大选型判断标准

企业落地云上Data for AI数据底座,可通过六大核心问题自查现状、精准选型,规避盲目建设问题。

  1. 数据是否分散在多个系统?

若存在大量数据孤岛、多系统数据割裂,优先依托Amazon S3与统一数据目录完成全域数据汇聚,杜绝单点AI应用独立建库、重复造轮子。

  1. 数据是否会持续更新?

针对需要迭代更新、删除回溯、多引擎共享的动态业务数据,优先选用Amazon S3 Tables或Apache Iceberg湖仓方案。

  1. AI 主要查历史数据还是实时状态?

历史明细探索、灵活自助分析选用Amazon Athena;高频标准化经营指标查询选用Amazon Redshift;实时业务状态、在线数据查询直接对接Aurora、DynamoDB等运营数据库。

  1. 是否需要实时事件处理?

设备数据、系统日志、用户行为流、交易数据流可通过Amazon Kinesis或Amazon MSK接入,经流式处理、事件研判后精准触发Agent响应。

  1. 是否需要 RAG 和长期记忆?

高频混合语义检索场景选用Amazon OpenSearch Service,海量低频长期向量记忆数据优先评估Amazon S3 Vectors,实现分层存储、按需调用。

  1. 数据是否已经具备治理条件?

若数据目录缺失、质量无保障、权限混乱、血缘不清,需优先补齐AWS Glue、SageMaker Catalog、Lake Formation等治理能力,夯实数据底座合规可用基础。

十、选型结论:以数据访问模式为核心,搭建分层协同的AI数据底座

企业建设Data for AI体系,核心误区是从单一产品、单一功能切入建设,正确思路是基于业务数据访问模式,搭建分层协同、全域复用的标准化云上数据底座,完整AWS技术组合如下:

  • Amazon S3、S3 Tables 和 Apache Iceberg:承载开放、统一的数据湖仓;

  • AWS Glue Data Catalog 和 SageMaker Catalog:管理技术元数据与业务数据产品;

  • AWS Glue Data Quality 和 Lake Formation:控制数据质量与访问权限;

  • Amazon Athena 和 Amazon Redshift:支持灵活分析与稳定经营查询;

  • Amazon Aurora、DynamoDB 和 ElastiCache:支撑实时业务数据和状态;

  • Amazon Kinesis 和 Amazon MSK:接入实时数据流;

  • Amazon OpenSearch Service 和 Amazon S3 Vectors:支撑 RAG、语义检索和长期记忆;

  • Amazon Bedrock 与 AgentCore:让模型和 Agent 安全使用这些数据。

Data for AI的核心本质并非将企业全量数据灌入大模型,而是搭建分层标准化数据架构,让各类数据存储在适配场景的载体中,通过规范权限与查询机制,在AI业务需要时精准调用,最终实现数据价值最大化释放。

进一步了解相关演讲回放

如果您希望进一步了解企业如何使用亚马逊云科技产品建设面向 AI 和 Agent 的统一数据底座,可以通过亚马逊云科技官网首屏 Banner,或搜索"2026亚马逊云科技中国峰会",在回放页进入分论坛3,查看《Athena + Iceberg:AI Agent 的数据底座实战》《Agentic AI 的数据之道:Agent 自己找数据、记数据、管数据,你准备好了吗?》以及《高性能存储加速生成式 AI》等演讲回放和详细资料。

相关推荐
baidu_259339571 小时前
智慧消防管理系统平台(基于物联网与大数据的城市消防安全解决方案)
大数据·人工智能·物联网·云计算·智慧消防·力安科技·gdliontech.cn
恒拓高科WorkPlus1 小时前
信创即时通讯上线前要验证哪些能力?BeeWorks选型与验证指南
大数据·安全
hhwyqwqhhwy2 小时前
Linux(28)-sysfs层次分析
大数据
菠萝猫yena3 小时前
【git】git 命令常用组合
大数据·git·elasticsearch
Leo.yuan4 小时前
AI辅助数据分析:如何让分析效率提升85%?
大数据·人工智能
Sayai6 小时前
Elasticsearch 压测利器 esrally 从安装到跑分全流程
大数据·elasticsearch·搜索引擎
科技发布6 小时前
传播易整合商圈媒体,商场停车场灯箱广告高效落地
大数据·人工智能·媒体
MindUp7 小时前
大模型在命理排盘场景下的多平台功能对比与工程化思考
大数据·人工智能
小刘快学习7 小时前
印刷包装企业的工艺问答与报价,为什么从直连模型改成了聚合网关
大数据·人工智能