一、Data for AI底座建设核心原则:摒弃单点建设,搭建全域可复用数据体系
企业布局Data for AI体系建设,存在两大典型误区:仅搭建单一向量数据库支撑AI业务,或是将全量企业数据批量灌入大模型。两种模式均无法适配长期、多元化的AI应用落地需求。适配企业规模化AI发展的云上数据底座,需具备全域支撑能力,可同时赋能模型训练迭代、RAG知识库检索、AI Agent智能调度、自然语言数据查询、实时业务分析与Agent长期记忆管理。其核心建设标准可归纳为五大能力:数据统一汇聚、全域智能发现、标准化治理、高效灵活查询、AI安全可控调用。
结合2026亚马逊云科技中国峰会分论坛3的技术分享,Data for AI体系的底层数据来源可划分为四大类:业务数据库、企业数据仓库、湖仓一体数据、实时流式数据。无论上层AI应用形态如何迭代升级,稳定、高效、开放的分层数据底座,是所有AI业务落地的核心基石。基于亚马逊云科技完整服务矩阵,企业可依托标准化五层架构,按需选型、分层搭建专属Data for AI数据底座。
二、统一存储层:以Amazon S3为核心,构建企业全域统一数据存储底座
企业日常业务数据分散存储于业务数据库、文件系统、数据仓库、日志平台及各类第三方系统中。若各AI项目独立拷贝、存储专属数据,会直接引发数据孤岛、重复存储、数据口径不统一、维护成本激增等一系列问题。
Amazon S3是企业搭建统一数据底座的最优起点,可兼容承载全品类企业数据,覆盖全AI业务场景:
-
结构化业务数据;
-
日志和埋点数据;
-
图片、音频和视频;
-
PDF、合同和产品资料;
-
训练与微调数据;
-
RAG 知识数据;
-
Agent 任务文件和历史数据。
《高性能存储加速生成式 AI》相关内容明确,企业自有数据是生成式AI构建差异化核心竞争力的关键,高质量数据的可访问策略与存储架构,直接决定模型训练优化效果与AI Agent落地质量。因此企业搭建Data for AI底座,首要动作并非选型大模型,而是搭建一套可长期承载多类型数据、可被各类计算服务与AI应用共享复用的统一存储体系。
三、湖仓表格层:依托S3 Tables与Iceberg,实现动态数据版本化管理
单纯堆砌文件形式的数据湖,无法满足企业AI业务的生产级落地要求。订单数据、库存信息、客户状态、测试结果、运营指标等核心业务数据,处于持续新增、修改、删除的动态迭代状态。若无标准化表格架构支撑,企业将面临小文件冗余、数据版本混乱、历史状态无法追溯、多引擎数据不一致等诸多问题。
针对动态更新的核心业务数据,企业可选用成熟开放的湖仓技术方案:
-
Amazon S3 Tables;
-
Apache Iceberg;
-
以 Amazon S3 为基础的开放湖仓架构。
该套方案精准适配五类核心业务场景:
-
数据需要持续更新;
-
需要保留历史版本;
-
BI、机器学习和 AI Agent 需要共享同一份数据;
-
希望避免把数据锁定在单一分析工具中;
-
需要支持后续自然语言查询和 Data Agent。
在《Athena + Iceberg:AI Agent 的数据底座实战》落地案例中,HP Nova团队摒弃传统本地分散系统、传统BI单一架构,升级为基于Amazon S3、Apache Iceberg、AWS Glue Data Catalog、Amazon Athena的统一数据底座。新架构实现存量BI业务、全新AI Agent业务的数据同源复用,上层应用可灵活迭代,底层核心数据无需反复重构迁移,大幅降低AI落地改造成本。
四、目录与治理层:组合Glue、SageMaker Catalog与Lake Formation实现全域数据治理
AI应用调用企业数据的前提,是精准掌握数据全貌、来源、可信度与访问权限。仅具备数据存储能力、缺失数据目录与治理体系,会导致AI Agent错选数据表、误解字段含义、误用过期数据,引发业务决策偏差。亚马逊云科技提供分层治理服务组合,全方位解决Data for AI的数据可信、可查、可用、可控问题。
AWS Glue Data Catalog 聚焦技术元数据管理,统一维护底层数据技术属性:
-
表和字段;
-
数据格式;
-
Amazon S3 存储位置;
-
数据分区;
-
查询引擎需要的表定义。
其核心价值是解决数据定位与查询适配问题,明确数据存储位置与调用规范。
Amazon SageMaker Catalog 侧重业务视角的数据管理,聚焦数据资产的业务属性:
-
数据产品定义;
-
标准化业务术语;
-
数据质量评级;
-
全链路数据血缘。
主要用于帮助AI业务判断数据业务属性、适配场景与可用价值。
AWS Glue Data Quality 可自定义多维数据质量校验规则,自动检测数据缺失、字段异常、内容完整性与数据一致性。AI Agent调用数据前可自动核验数据更新时间与质量状态,规避直接基于无效数据生成结论的问题。
AWS Lake Formation 专注数据湖细粒度权限管控,即便AI Agent生成超范围查询指令,底层平台仍可通过权限规则,精准限制用户可访问的数据表、字段、数据行与数据范围,筑牢数据安全防线。
2026亚马逊云科技中国峰会分论坛3明确指出,Agentic AI数据消费的核心要求包含数据高质量、可发现、身份可信、权限精细可控、低延迟访问。因此Data for AI治理不能仅依赖模型Prompt约束,必须将质量校验、权限管控落地至底层数据平台,实现源头可控。
五、查询与计算层:按业务分析场景差异化选型查询与计算服务
不同AI应用的数据分析、查询模式存在显著差异,企业需按需匹配对应服务,避免所有场景共用一套查询架构,保障查询效率与资源利用率。
- 灵活查询数据湖:选择 Amazon Athena
Amazon Athena 支持直接通过SQL语句查询Amazon S3湖仓数据,适配灵活探索类场景:
-
临时分析;
-
历史明细查询;
-
日志和埋点分析;
-
自然语言转 SQL;
-
Data Agent 多轮下钻;
-
尚未固化成报表的问题。
该模式无需将全量原始数据灌入模型上下文,仅通过受控精准查询获取结果,大幅降低模型负载与上下文占用。
- 稳定、高频分析:选择 Amazon Redshift
Amazon Redshift 适配企业标准化、高并发、常态化经营分析场景:
-
企业级数据仓库;
-
高频经营指标;
-
大规模聚合分析;
-
多部门统一报表;
-
已经经过治理的业务指标;
-
Agentic BI 和自然语言查数。
企业可采用"Athena+Redshift"互补架构,由Redshift承载高频固化指标查询,Athena负责数据湖灵活探索分析,无需二选一,覆盖全场景分析需求。
- 实时业务查询:选择 Amazon Aurora、DynamoDB 或 ElastiCache
AI Agent查询订单、客户、账户、任务状态等实时业务数据时,无需等待数据同步至离线仓库,可直接对接在线业务存储服务,按需选型:
-
Amazon Aurora:关系型业务数据和复杂关联查询;
-
Amazon DynamoDB:高并发键值、Session 和任务状态;
-
Amazon ElastiCache:热点数据、状态缓存和低延迟访问。
该分层模式可实现知识问答、历史分析、实时状态查询的场景隔离,避免全量数据堆砌至单一知识库,提升查询精准度与效率。
六、实时数据层:依托Kinesis与MSK,实现流式数据智能处理与事件触发
部分AI智能业务需要实时感知业务动态变化,覆盖设备运维、用户行为、交易风控、库存变动、广告投放、系统运维等实时场景:
-
设备异常;
-
用户实时行为;
-
交易风险;
-
库存变化;
-
广告点击流;
-
系统日志和告警。
企业可通过Amazon Kinesis或Amazon Managed Streaming for Apache Kafka(Amazon MSK)完成实时数据流接入,搭配AWS Glue、Spark、Flink等工具实现数据清洗、聚合计算与异常事件识别。
行业最优实践并非将海量实时数据持续推送至大模型,而是先在数据层完成数据筛选、清洗、事件研判,仅将高价值异常事件、有效业务变动触发AI Agent响应。例如设备遥测数据经流式处理与质量校验后,仅在识别异常故障时唤醒运维Agent,既减少无效模型调用,又避免冗余数据占用模型上下文,保障Agent决策精准高效。
七、向量与记忆层:分层选型向量服务,适配RAG检索与Agent长期记忆
Data for AI体系需同时支撑非结构化知识语义检索、RAG知识库问答与AI Agent跨会话长期记忆能力,企业可根据业务规模、延迟要求、成本诉求分层选型向量服务,无需统一堆砌至单一数据库。
Amazon OpenSearch Service 适配高频线上业务,支撑语义检索与关键词检索混合场景,满足低延迟、高并发的RAG知识库召回需求。
Amazon Aurora PostgreSQL 支持向量数据与客户、订单、权限等结构化业务数据关联查询,适配需要向量+结构化数据联合分析的复杂业务场景。
Amazon S3 Vectors 主打海量、低频、低成本向量存储,适配企业长期知识沉淀、历史内容归档、Agent长期记忆存储等场景,兼顾存储成本与数据完整性。
峰会资料明确,Amazon S3 Vectors核心能力涵盖数据湖语义搜索、批量向量检索、冷热数据分层、大规模向量存储。Amazon S3、S3 Tables、S3 Vectors与文件存储共同构成AI Agent的外置大脑,全方位支撑智能体知识存储与记忆迭代。企业可采用分层架构:高频在线知识依托检索服务部署,海量低频历史向量数据依托S3 Vectors长期归档,实现性能与成本平衡。
八、AI访问层:基于Bedrock与AgentCore,实现数据安全可控复用
完整的Data for AI数据底座,核心价值是实现数据复用而非数据复制。企业完成分层数据底座建设后,需依托专属AI服务构建安全、标准化的数据访问链路,让模型与Agent可控调用全域数据资源。
Amazon Bedrock 可用于快速搭建企业知识库、生成式AI应用与智能Agent主体能力。Amazon Bedrock AgentCore 聚焦运行时、记忆管理、网关调度、身份认证等核心能力,打通各类数据工具与企业内部业务系统,实现全域数据互联互通。
标准化的数据访问链路可覆盖全场景需求:
-
RAG 访问企业知识;
-
通过工具调用 Amazon Athena 或 Amazon Redshift;
-
通过 API 查询或更新业务数据库;
-
通过 MCP 接入内部数据服务;
-
使用 Memory 管理跨会话信息;
-
根据真实用户身份控制数据权限。
分论坛3架构体系将Amazon Bedrock、AgentCore、知识库、分析引擎、数据库、湖仓数据、流式数据串联为完整的Agent数据链路,印证了Data for AI的核心逻辑:并非独立搭建数据孤岛,而是构建一套可被AI安全、高效、持续调用的全域数据体系。
九、企业数据底座六大选型判断标准
企业落地云上Data for AI数据底座,可通过六大核心问题自查现状、精准选型,规避盲目建设问题。
- 数据是否分散在多个系统?
若存在大量数据孤岛、多系统数据割裂,优先依托Amazon S3与统一数据目录完成全域数据汇聚,杜绝单点AI应用独立建库、重复造轮子。
- 数据是否会持续更新?
针对需要迭代更新、删除回溯、多引擎共享的动态业务数据,优先选用Amazon S3 Tables或Apache Iceberg湖仓方案。
- AI 主要查历史数据还是实时状态?
历史明细探索、灵活自助分析选用Amazon Athena;高频标准化经营指标查询选用Amazon Redshift;实时业务状态、在线数据查询直接对接Aurora、DynamoDB等运营数据库。
- 是否需要实时事件处理?
设备数据、系统日志、用户行为流、交易数据流可通过Amazon Kinesis或Amazon MSK接入,经流式处理、事件研判后精准触发Agent响应。
- 是否需要 RAG 和长期记忆?
高频混合语义检索场景选用Amazon OpenSearch Service,海量低频长期向量记忆数据优先评估Amazon S3 Vectors,实现分层存储、按需调用。
- 数据是否已经具备治理条件?
若数据目录缺失、质量无保障、权限混乱、血缘不清,需优先补齐AWS Glue、SageMaker Catalog、Lake Formation等治理能力,夯实数据底座合规可用基础。
十、选型结论:以数据访问模式为核心,搭建分层协同的AI数据底座
企业建设Data for AI体系,核心误区是从单一产品、单一功能切入建设,正确思路是基于业务数据访问模式,搭建分层协同、全域复用的标准化云上数据底座,完整AWS技术组合如下:
-
Amazon S3、S3 Tables 和 Apache Iceberg:承载开放、统一的数据湖仓;
-
AWS Glue Data Catalog 和 SageMaker Catalog:管理技术元数据与业务数据产品;
-
AWS Glue Data Quality 和 Lake Formation:控制数据质量与访问权限;
-
Amazon Athena 和 Amazon Redshift:支持灵活分析与稳定经营查询;
-
Amazon Aurora、DynamoDB 和 ElastiCache:支撑实时业务数据和状态;
-
Amazon Kinesis 和 Amazon MSK:接入实时数据流;
-
Amazon OpenSearch Service 和 Amazon S3 Vectors:支撑 RAG、语义检索和长期记忆;
-
Amazon Bedrock 与 AgentCore:让模型和 Agent 安全使用这些数据。
Data for AI的核心本质并非将企业全量数据灌入大模型,而是搭建分层标准化数据架构,让各类数据存储在适配场景的载体中,通过规范权限与查询机制,在AI业务需要时精准调用,最终实现数据价值最大化释放。
进一步了解相关演讲回放
如果您希望进一步了解企业如何使用亚马逊云科技产品建设面向 AI 和 Agent 的统一数据底座,可以通过亚马逊云科技官网首屏 Banner,或搜索"2026亚马逊云科技中国峰会",在回放页进入分论坛3,查看《Athena + Iceberg:AI Agent 的数据底座实战》《Agentic AI 的数据之道:Agent 自己找数据、记数据、管数据,你准备好了吗?》以及《高性能存储加速生成式 AI》等演讲回放和详细资料。