一、能力简介:从"繁琐配置"到"对话即配置"
单表离线同步是最常用的数据入仓方式:把一张业务表按周期(比如每日)成批同步到数仓或分析库。现在,只需一句自然语言指令,DI Agent 即可化繁为简实现。 您只需说明"从哪张表同步到哪里",Agent 便会智能推演并自动补全全链路配置,仅在关键节点请求您的确认。现在只要用一句话说清"从哪张表同步到哪里",Agent 会把这些配置自动补全,并在关键处向你确认。
Agent 能自动搞定的事:挑数据源、拉表结构、识别主键做分片抽取、生成分区、源目标字段同名映射、推荐并发与脏数据策略、生成建表语句......你只需确认。
核心概念速览
-
对话式建任务:通过自然语言交互,Agent 自动补齐配置并引导逐项确认,实现"对话即配置"。
-
离线与周期调度:离线同步采用成批处理模式,结合调度周期(如每日凌晨)到点自动运行,保障数据 T+1 准时就绪。
-
先确认,再运行:坚持"人机协同"理念,建表语句、字段映射等关键配置均需人工确认后方可生效,确保数据绝对安全可控。
三大使用场景速览
| 行业 | 典型诉求 | 同步方式(功能视角) |
|---|---|---|
| 连锁零售 | 门店销售明细每日入仓做报表 | 业务库 → 每日周期 → 数仓 |
| 银行金融 | 核心账务大表按日分区增量抽取 | 核心库 → 主键分片、按日分区 → 数仓 |
| 互联网 | 分库分表行为数据汇聚供运营查询 | 分库分表 → 合并汇聚 → 分析库 |
二、场景一 · 连锁零售:门店销售明细每日入仓
场景说明
某连锁零售企业有上千家门店,POS 销售明细存在业务 MySQL 库里。经营分析团队每天要看昨日各门店销售报表,需要把销售明细表每天 T+1 稳定同步到 MaxCompute 数仓。以前 IT 手工配同步任务,字段一多容易配错,改表还要重配。

核心价值
-
建任务提速:从"几十项配置"变成"一句话加几次确认",分钟级搞定。
-
少踩坑:主键分片、分区、字段映射自动补全,减少配错和漏配。
-
每天自动跑:设好定时后每天自动同步,经营团队早上就能看昨日报表。
完整操作步骤
-
表达诉求:"请将 MySQL 中的门店销售明细表,每天同步至 MaxCompute。"
-
智能追问:Agent 自动追问缺失信息(如指定 MySQL 数据源、目标 MaxCompute 项目、表名、每日运行时间等),您只需简单回答或从候选列表中选择。
-
配置确认:Agent 已自动识别主键分片、按业务日期生成分区、完成字段同名映射,并生成建表 DDL。您核对无误后点击确认。
-
试跑验证:触发一次试跑,Agent 自动执行并验证数据是否正确落表。
-
发布调度:验证通过后,一键设为每日定时调度,后续无需人工干预。

核心优势
-
无需记忆繁杂参数:分片、分区、映射等易错环节全部由 Agent 托管,将开发者从"配置员"解放为"审核员"。
-
DDL 先看后建:目标表建表语句由 Agent 生成并展示,确认后才执行建表,从源头避免表结构错误。
-
Schema 变更从容应对:源表新增字段时,只需让 Agent 重新映射即可,无需推翻重配整个任务。
-
关键概念提示 :"分片键" 决定大表并行抽取的速度,"分区" 决定数据的物理落盘位置。这两项 Agent 会基于表结构自动推断,通常无需您额外操心。
关键流程(功能视角):来源表 → 自动配置(分片/分区/映射) → 每日调度 → 数仓表
三、场景二 · 银行金融:核心账务大表按日分区增量入仓
场景说明
某银行核心系统用 Oracle,账务明细是亿级大表,还含敏感字段。风控与监管报表团队需要把这张大表按业务日期增量抽取到 MaxCompute,既要抽得快,又要按日期分区便于回溯。大表全量抽取慢、易超时是老大难。

核心价值
-
大表提速:按主键并行分片抽取,速度快、不易超时。
-
便于回溯:按业务日期自动分区,监管回溯某天数据一目了然。
-
省资源:增量抽取只搬当天新增或变化的数据,减少重复搬运。
完整操作步骤
-
表达诉求:"请将 Oracle 核心账务表按业务日期增量同步至 MaxCompute,并按天分区。"
-
智能追问:Agent 追问关键信息(如指定 Oracle 数据源、增量日期字段、目标分区字段、执行资源组等)。
-
策略确认:Agent 自动选取主键作为分片键,并生成按日期的分区表达式。您只需确认分片键与分区策略是否符合业务预期。
-
试跑校验:抽取单日数据进行试跑,验证数据条数与分区落盘是否正确。
-
发布调度:校验无误后,设为每日增量调度。

核心优势
-
大表提速靠"分片":Agent 自动挑主键做并行分片抽取,这是大表不超时的关键,你只需确认分片键是否合理。
-
按日分区便于回溯:分区表达式自动按业务日期生成,监管查某天数据可直接定位到分区。
-
关键概念提示:"增量"意味着每天只搬当天新增或变化的数据,不必全量重跑,速度和资源用量都更优。
-
资源可选:跑大表时可以指定更充足的资源组,Agent 会给出可用候选。
关键流程(功能视角):核心大表 → 主键分片 → 按日期分区 → 增量入仓
四、场景三 · 互联网:分库分表行为数据汇聚入库
场景说明
某互联网公司的用户行为数据做了分库分表,散在几十个物理分片里。运营团队想把这些行为数据汇聚成一张表,同步到 Hologres 做实时查询和运营分析。逐个分片建任务工作量巨大。

核心价值
-
一次汇聚:分库分表可作为一个逻辑源,一次配置汇聚同步,不用逐分片建任务。
-
查询快:汇聚到 Hologres 后,运营可秒级查询。
-
上线快:字段映射与并发自动推荐,快速上线。
完整操作步骤
-
表达诉求:"请将分库分表的用户行为数据汇聚同步至 Hologres。"
-
智能追问:Agent 追问数据源信息、目标汇聚表名、期望并发度等。
-
汇聚确认:Agent 自动合并各分片数据、完成字段同名映射并推荐并发数,您确认即可。
-
试跑验证:验证多分片数据汇聚结果的正确性与完整性。
-
发布调度:设为周期同步任务。

核心价值
-
分库分表一次搞定:不用为每个分片单独建任务,Agent 把它当成一个逻辑源汇聚。
-
并发有推荐:Agent 会按数据量推荐并发数,你也可按资源情况调整。
-
关键概念提示:"汇聚/合并"是把多个同结构分片表合成一张目标表;字段同名自动映射,省去逐列手工对应。
关键流程(功能视角):分库分表 → 合并汇聚 → 字段映射 → 分析库
五、通用最佳实践
-
聚焦核心,其余托管:对话时只需说清"从哪张表到哪里",其余数十项配置放心交给 Agent 补齐。
-
关键节点,审慎确认:建表 DDL、字段映射、分区分片策略是数据质量的防线,务必在 Agent 提示时仔细核对。
-
抓大放小,关注核心 :大表场景优先确认 "分片键" (决定速度),按日场景优先确认 "分区"(决定可回溯性)。
-
先试跑,后周期:正式投入生产前,务必先执行一次试跑验证,确保数据准确落表后再开启周期调度。
六、支持的数据源(部分)
| 方向 | 常见数据源 |
|---|---|
| 数据来源 | MySQL、Oracle、PostgreSQL、SQL Server、PolarDB、PolarDB-X、OceanBase、Kafka、OSS 等(支持约 57 种) |
| 同步目标 | MaxCompute、Hologres、MySQL、AnalyticDB、StarRocks、Kafka、OSS 等(支持约 54 种) |
本文为 DI Agent 能力最佳实践系列。更多信息可查看 help.aliyun.com/zh/datawork...