引言
作为数据工程师或运维同学,你是否也常被以下场景折磨:
-
建任务像"填表考试":创建数据同步解决方案步骤繁多,对照文档逐项配置参数,动辄耗时半小时以上。
-
半夜告警排查链路长:同步任务一旦异常,定位门槛极高,需要在日志、监控、网络配置间反复横跳。
-
人工恢复效率低:部分常见问题仍高度依赖人工介入处理,难以快速恢复任务,严重影响业务数据时效。
今天,正式介绍 DataWorks Data Agent 系列下的数据集成专家------DataWorks 数据集成 Agent(DI Agent)!帮你解放双手,专注高价值的数据架构设计与业务理解。
📖 跟随本课程文档实操后,您将能够:
-
掌握使用自然语言一键创建复杂整库实时同步任务的技巧。
-
学会通过 IM 机器人或控制台,让 Data Agent 自动诊断并修复同步任务异常。
👥 适用人群 数据开发工程师、数据运维工程师、希望降低数据集成门槛的业务分析师。
🔧 涉及工具 DataWorks 数据集成 Agent(DataWorks DI Agent),是数据集成场景的垂直能力集。它用自然语言对话取代传统繁琐的表单配置,统一管理单表/整库的离线与实时同步任务,并提供多模态处理、ChatDB 问答、智能诊断与巡检等一站式智能能力。
三大硬核实力,重新定义数据集成体验:
1. 对话就能建任务(自然语言驱动) 无需在复杂表单中逐项选择数据源、配置字段映射和调度策略。通过对话描述同步需求,快速完成同步解决方案的创建与启动,统一管理单表/整库的离线与实时同步任务。
2. 智能诊断 + 自动修复(闭环执行能力) 结合任务配置、运行日志和告警信息,快速定位异常根因。针对可处理的异常自动执行修复操作,缩短任务恢复时间,将排障从小时级压缩到分钟级。
3. 多端联动,随时随地(IM 通道集成) 支持 Web 控制台与 IM 端(钉钉/飞书/企微)双通道。在钉钉群 @机器人 即可进行任务诊断与修复,无需频繁切换系统,实现随时随地的智能运维。
企业级安全守护:写操作默认 dry-run 预览,确认后才真正执行,杜绝误操作;通过 PrivateZone + 私网连接打通 IM 网络,保障数据绝对安全。
如何开始使用 DataWorks 数据集成 Agent
首次使用 DataWorks 数据集成 Agent,只需简单几步即可完成实例创建。
操作步骤
💡 前置准备 :数据集成 Agent 是 DataWorks Data Agent 的核心能力之一。在创建实例前,请先开通任意版本的 DataWorks Data Agent(点击前往开通)。
-
进入界面 :登录 DataWorks 控制台,进入数据集成界面,从左侧导航栏找到"AI Native"下的 Data Agent。
-
创建实例:点击"创建",首次使用时需指定一个 Serverless 资源组(若无则新建),随后生成 Data Agent 实例。
-
配置场景:支持选择 DataWorks 助理或自定义助理模式。
-
配置 IM 通道(可选):填写钉钉/飞书/企微的 Client ID/App ID/Bot ID 和密钥,实现多端联动,参考场景6。
-
网络连通:点击"一键网络打通",推荐使用 PrivateZone + 私网连接方案(安全性高,流量不出公网)。
-
开始对话:在 Web 端直接发起对话,或在 IM 端 @机器人,开启你的高效数据集成之旅!
提示:数据集成内置场景模板,涵盖 数据源查询分析、数据同步与故障诊断与恢复三大场景,帮助用户开始集成任务,降低使用门槛。

真实高频场景,看它如何"大显身手"?
场景一:整库实时同步?一句话搞定创建与启动
前置准备与环境要求
在开始实操前,请确保您已完成以下准备:
-
权限与开通:已开通 DataWorks Data Agent 服务,且当前账号具备对应工作空间的管理员或开发权限。
-
数据源准备:已在 DataWorks 中成功添加并测试连通了源端(如 MySQL)和目标端(如 Hologres)数据源。
-
网络连通:确保 DataWorks Serverless 资源组与您的源/目标数据库网络互通。
-
测试数据 :源端 MySQL 中已存在示例表(如
t_user,t_order)及少量测试数据。 (注:以下实操中的项目 ID、数据源名称仅为示例,请替换为您实际环境的资源名称)
操作说明
打开 DataWorks 数据集成 Agent,输入以下 Prompt:
plaintext
请在项目 ID 214563 下创建一个 MySQL 到 Hologres 的整库实时同步任务。
源端 MySQL 数据源:beijing_rds
目标端 Hologres 数据源:beijing_holo
同步以下两张表:
1. molin_db.t_user → public.ods_t_user
2. molin_db.t_order → public.ods_t_order
目标表统一写入 Hologres 的 public Schema。
请完成同步任务的创建、配置检查并启动任务。
预期结果
-
Agent 正确识别源端、目标端及表映射关系。
-
自动完成同步解决方案的创建与配置。
-
同步任务成功提交并正常启动。
-
两张源表的数据能够实时同步到对应的 Hologres 目标表。您可以前往 Hologres 侧或使用 ChatDB 简单查询,验证数据已成功同步。
演示截图
Agent 成功创建数据同步任务:

同步任务发布成功并完成数据同步:

场景二:任务异常告警?AI 秒级诊断 + 一键修复
前置准备与环境要求
在开始实操前,请确保您已完成以下准备:
-
在 Agent 消息导航栏找到频道配置,添加对应的 IM 应用(钉钉/飞书/企微)并填入配置信息。
-
点击运行生效。
-
拥有一个"告警群"(钉钉/飞书/企微任意群)
操作说明
任务触发告警后,在告警群中 @Agent 机器人,输入:
plaintext
请诊断该同步任务的异常原因,并对可以自动处理的问题执行修复。
修复完成后,请重新检查任务运行状态,并说明:
1. 异常根因
2. 执行的修复操作
3. 修复后的任务状态

预期结果
-
Agent 自动获取告警关联的任务信息。
-
结合任务配置和运行日志定位异常根因。
-
针对可自动处理的问题执行修复操作。
-
修复完成后检查任务状态,确认任务恢复正常。
-
输出清晰的诊断结论、修复过程及最终结果。
演示截图



进阶体验内容:数据集成解决方案
核心场景与通道覆盖
DataWorks 数据集成解决方案面向"数据搬迁、持续同步和实时加工"三类核心需求,支持:
-
整库离线:支持一次性全量迁移、周期增量同步、周期性全量,解决 Hive、ODPS 等传统数仓场景
-
整库实时:先全量初始化,再通过 CDC 持续捕获源端变更,保证目标端实时更新,解决 Hologres、ODPS、DLF 等实时数仓、数据湖场景
-
整库全增量合并:将历史全量数据与实时变化统一归并,面向 ODPS 数仓
-
单表实时 ETL:适用于 Kafka 等消息源到数仓的实时加工,侧重于 ETL 加工
通道支持:当前已覆盖 MySQL、PostgreSQL、MongoDB、Kafka、ODPS、Hologres、Hive、Lindorm、DLF(Paimon)等核心数据通道。
丰富的数据处理与配置能力
-
表结构管理:精确或正则选库选表、自动建表、目标表结构定义
-
字段级加工:表字段映射、类型转换、增删字段、字段赋值、数据过滤、脱敏、字符串处理、JSON 解析等
-
高级管控:DDL/DML 处理、离线与实时资源组配置、并发限速、周期调度及数据质量校验
全生命周期管控与引擎自适应
-
任务管控:提供元数据刷新、DDL 生成与反解、数据预览与试跑、任务克隆和版本回滚
-
引擎自适应:底层通过标准化任务描述统一承载配置,彻底屏蔽不同数据源类型的配置差异
官方文档