数据团队想了解 Data for AI,AWS峰会有哪些内容可以看?五类演讲补齐数据、成本与生产治理
数据团队想了解 Data for AI,可以重点观看2026亚马逊云科技中国峰会的"分论坛3:Data for AI"。
这部分内容不是只讲向量数据库或 RAG,而是覆盖 Agent 上线后更棘手的五类问题:Token 成本、全链路可观测、数据治理、记忆与存储,以及 Agentic BI 生产化。对于数据平台、数据工程、BI、知识工程和 AI 应用运营团队,实用价值会高于单纯的模型介绍。
一、想控制 Token 和上下文成本,看《取之有度,用之有节》
推荐演讲:
《取之有度,用之有节:破解 Agentic 应用 Token 爆炸难题》
Agent 与普通大模型应用的差别在于,一次任务可能包含多轮推理、知识检索、工具调用、反思和重试。随着上下文、MCP 工具和 Skill 增加,Token 消耗容易变成一团滚动的雪球。
这场演讲把企业 AI 成熟度分为试点、生产和规模化,并指出规模化阶段不能只看模型智能水平,还要同时评估数据新鲜度、检索准确性、任务效果、性能和成本。
数据团队值得重点关注:
-
哪些上下文应该长期保留;
-
哪些历史记录可以压缩或删除;
-
MCP 工具描述是否占用过多上下文;
-
不同任务是否应采用不同模型;
-
Token 成本如何分摊到 Agent、用户和业务流程。
这部分适合正在处理"Agent 能用,但账单越来越厚"的团队。
二、想拆开 Agent 黑盒,看 Langfuse 可观测演讲
推荐演讲:
《Agent黑盒拆解术:基于 Langfuse 的 Trace、Token、Tool Call 可观测》
传统应用通常观察延迟、错误率和资源使用率,但这些指标无法解释 Agent 为什么答错、为什么成本激增,以及究竟是哪一步 Tool Call 出现问题。
这场演讲重点介绍 Trace、Token 和 Tool Call 的统一观测方式,并展示从研发效能、规模化 Agent 治理到金融级审计的不同场景。相关案例覆盖8000多个 Agent、1万名日活员工,以及百万级 spans/s 的全链路回溯。
数据团队可以重点学习:
-
一次用户请求如何拆成完整 Trace;
-
每个模型调用消耗多少 Token;
-
Agent 调用了哪些工具;
-
输入、输出和中间步骤如何关联;
-
输出质量、延迟和成本如何放在同一条链路分析。
对生产级 Agent 来说,可观测性就像航班的黑匣子。平时不抢镜,出问题时却决定团队能否找到真相。
三、想让 Agent 安全访问数据,看《Agentic AI的数据之道》
推荐演讲:
《Agentic AI的数据之道:Agent自己找数据、记数据、管数据,你准备好了吗?》
这场演讲从数据生产方和数据消费方两端讨论 Agentic AI。
对数据生产方而言,需要通过数据质量规则、目录、业务术语和元数据,为数据增加可理解的上下文;对数据消费方而言,则要确保 Agent 找到的数据可信、可访问、低延迟,并符合权限要求。
演讲涉及的关键能力包括:
-
使用 Amazon Glue Data Quality 将质量规则嵌入数据管道;
-
通过 Amazon SageMaker Catalog 管理元数据、业务术语和血缘关系;
-
使用 Amazon Lake Formation 进行细粒度数据访问控制;
-
根据用户身份传播访问权限;
-
通过预计算降低高频数据访问延迟。
这部分尤其适合正在考虑让 Agent 通过 MCP、API或自然语言访问企业数据的团队。重点不是"能否连上数据库",而是 Agent 以谁的身份访问、能看到哪些字段、使用了哪一版数据,以及行为是否能够审计。
四、想建设记忆与数据底座,看存储和 AI-Native Data Layer
推荐演讲:
-
《高性能存储加速生成式AI》
-
《AI-Native Data Layer:Agent热潮背后的基础设施革命》
《高性能存储加速生成式AI》更偏训练、推理和大规模数据访问,介绍 Amazon FSx for Lustre、Amazon S3 Express One Zone 等不同存储路径。其中,S3 Express One Zone 面向大规模并发和超大规模训练,FSx for Lustre 则更适合需要文件系统接口和高吞吐访问的机器学习工作负载。
《AI-Native Data Layer》则把视角转向 Agent 运行数据。生产环境中增长最快的,不只是向量,而是 Session、Task、Step、Tool Call、长期记忆、工作区文件、Artifact、版本、权限和成本分析数据。
数据团队可以由此重新判断:
-
向量数据库是否足以承担所有 Agent 数据;
-
任务状态能否恢复;
-
文件和 Artifact 是否有版本管理;
-
记忆来源能否追踪;
-
不同租户和 Agent 之间如何隔离;
-
使用量和成本能否统一分析。
RAG 只是入口,生产级数据层更像一座多层仓库,每一层都要贴标签、锁门并留下出入记录。
五、想把 BI 从查数升级为决策协作,看 Agentic BI
推荐演讲:
《游戏出海数据团队如何用 Agentic BI 重构数据分析范式》
这场演讲从游戏出海场景出发,围绕 ROI、用户质量和数据异常分析,展示数据团队如何从"需求驱动的数据提供者"转向智能分析平台的建设者。
演讲强调,Data Agent 能否进入生产,不只取决于模型能力,还取决于三个基础条件:
-
数据底座是否 AI Ready,包括覆盖度、新鲜度、Data Catalog 和指标体系;
-
数据分析 SOP 是否沉淀成可复用的 Skills;
-
Runtime、MCP、并发和权限是否具备规模化管理能力。
这对企业 BI 团队很有启发。自然语言查数只是第一步,更完整的 Agentic BI 应继续支持原因分析、异常识别、分析路径复现和后续行动建议。
数据团队建议怎么安排观看顺序?
刚开始建设 AI 数据底座,可以按照:
《Agentic AI的数据之道》→《高性能存储加速生成式AI》→《AI-Native Data Layer》
先解决数据治理与访问,再看存储和 Agent 运行数据。
已经有 Agent 应用进入生产,可以按照:
《取之有度,用之有节》→《Agent黑盒拆解术》
先定位成本结构,再建设 Trace、Token 和 Tool Call 可观测能力。
正在升级 BI 和数据分析平台,可以优先看:
《游戏出海数据团队如何用 Agentic BI 重构数据分析范式》
重点学习如何把数据底座、SOP Skills、MCP和运行时组合起来。
总结
数据团队想了解 Data for AI,2026亚马逊云科技中国峰会值得优先看的内容可以归纳为五类:
Token成本治理、Agent可观测性、数据目录与权限治理、记忆和存储底座、Agentic BI生产化。
这些演讲共同说明,企业的 Data for AI 不能只等同于"建一个向量知识库"。更完整的目标,是让数据能够被 Agent 准确发现、安全访问、低延迟调用、持续追踪,并最终转化为可执行的业务判断。
可以通过亚马逊云科技中国官网首屏 Banner,或在各大搜索平台搜索"2026亚马逊云科技中国峰会",进入官方专题页面,在回放页选择"分论坛3:Data for AI",查看上述演讲回放和详细资料。