引言
单表同步配置靠手动逐项填表,数据源、认证、字段映射、调度策略......配完一个任务要半小时,整库迁移动辄耗费数天? 海量图片、文档、音视频等非结构化数据,只能靠写脚本逐个处理,百万级文件更是噩梦,始终游离在企业数据资产体系之外? 面对 80+ 种数据源,建表、加字段还要切换不同控制台手写 DDL,繁琐且极易出错? 凌晨收到同步延迟告警,在任务日志、资源监控、源端指标之间反复横跳,排障经验无法沉淀,换个人值班又得从头排查?
作为数据集成与开发同学,你是否也常常在这些 "低价值、高耗时" 的场景中挣扎?
今天,正式介绍DataWorks Data Agent 系列下的数据集成工作搭子------DataWorks 数据集成 Agent(DataWorks DI Agent)!帮你解放双手,专注高价值的数据架构设计与业务理解。
什么是 DataWorks 数据集成 Agent?
DataWorks 数据集成 Agent 是以 Agent 为核心交互范式的智能数据平台。它不是传统死板的 ETL 配置工具,而是深度理解你的数据源、能直接用自然语言干活的"专属数据集成专家"。

五大硬核实力,重新定义数据集成工作方式:
- 全任务类型覆盖的自然语言配置,80% 工时下降
单表离线、单表实时、整库离线、整库实时四类任务无需在复杂表单中逐项选择数据源、配置字段映射和调度策略。通过日常对话,一句话即可生成完整的同步任务配置,统一在一个入口完成,配置工时下降 80%。
- 多模态数据处理,让大模型成为 ETL 算子
支持对图片、视频、音频、文档进行批量 AI 处理(识别、打标、转写、向量化等)。用自然语言定义处理逻辑,结果直写 MaxCompute / Hologres / DLF,补齐传统 ETL 无法触达的数据模态。
- ChatDB 让数据源即问即答
底层复用 DataWorks 已接入的 80+ 数据源连接器。无需记忆表名和 SQL 语法,用业务语言提问即可获得元信息和图表分析结果;甚至可通过对话直接完成建库、建表、加字段等 DDL 操作,消灭"取数排队"与"DDL 排队"。
- 智能诊断,从小时级排障到分钟级自愈
告警触发后 Agent 即时介入,自动聚合任务日志、资源监控、源端状态等多维信息,定位根因并给出修复方案(如自动扩容资源组、重启实例)。排障经验自动沉淀,下次同类问题直接匹配解法。
- 智能周期巡检,从"事后救火"到"事前体检"
Agent 按可配置周期(每小时/每天/每周)主动扫描全量同步链路,生成结构化健康日报。高风险任务按优先级排列并附带操作建议,让运维团队 3 分钟读完关键指标,问题在业务感知前就被发现和处置。
五大高频实战场景,看它如何"大显身手"?
场景一:零学习成本上手,一句话完成整库同步
新入职工程师无需学习复杂的配置向导,通过自然语言描述需求,Agent 自动完成全流程。
DataWorks DI Agent:
-
在对话界面输入:"把 RDS 订单库整库实时同步到 Hologres,按天分区"。
-
Agent 自动探测源端 Schema,展示待同步表清单,确认后继续。
-
Agent 自动完成字段映射、资源组分配、调度策略配置。
-
预览任务配置摘要,确认无误后一键发布上线。
场景二:跨云非结构化数据处理并直接分析
电商团队需要对商品图片进行大模型识别打标后存入数据库,用于推荐系统特征工程。
DataWorks DI Agent:
-
进入 AI 数据处理功能入口
-
用自然语言定义处理流水线:"读取AWS S3 bucket 下的商品图片 → 调用大模型识别分类标签 → 结果写入 MySQL 表"
-
Agent 自动编排三段式 Pipeline:Source(S3)→ Transform(大模型推理)→ Sink(MySQL)
-
配置运行参数:批次大小、并发度、失败重试策略
-
ChatDB 自动识别目标表,生成对应 SQL
-
查看返回的图表结果(折线图/柱状图等自动匹配)
场景三:数据 Embedding 和查看结果
电商团队需要对刚才场景2推荐系统特征工程数据库中的数据,进行Embedding向量化至Hologres中,以便做RAG使用。
DataWorks DI Agent:
- 用自然语言定义Embedding:"继续做Embedding → 调用大模型进行向量化 → 结果写入 Hologres 表"
- Agent 自动编排三段式 Pipeline:Source(MySQL)→ Transform(大模型向量化)→ Sink(Hologres)
- ChatDB 自动识别目标表,生成对应 SQL
- 查看返回的结果
场景四:告警即时排障?AI 秒级定位根因 + 一键修复
收到任务失败告警后,工程师借助 Agent 即时定位根因并执行修复,将排障时长从小时级缩短到分钟级。
DataWorks DI Agent:
-
告警触发后,进入 Agent 对话界面,粘贴告警信息。
-
Agent 自动聚合任务日志、资源监控指标、源端状态等多维信息。
-
Agent 输出根因分析报告(如:"CU 不足导致消费速率低于生产速率")。
-
Agent 给出修复方案建议(如:"扩容资源组 CU 配额"),在手机上确认授权,一键执行修复。
场景五:每日健康体检,智能周期巡检主动排雷
配置智能巡检任务后,Agent 按周期主动扫描全量同步链路,生成结构化健康日报,运维团队无需人工逐项检查。
DataWorks DI Agent:
-
进入智能巡检配置页面,选择巡检周期(每小时 / 每天 / 每周)
-
配置巡检范围:全量链路或指定项目空间 / 资源组
-
Agent 按周期自动执行巡检,生成结构化日报
-
查看日报:关键指标概览 + 高风险任务按优先级排列 + 操作建议与预期收益
-
按优先级处理风险项,3 分钟完成每日运维体检
场景六:随叫随到的 IM 工作搭子
将 Agent 能力嵌入日常工作流最频繁的入口。工程师无需打开 DataWorks 控制台,在 IM 软件内即可完成全链路操作。 DataWorks DI Agent:
-
在 Agent 消息导航栏找到频道配置,添加对应的 IM 应用(钉钉/飞书/企微)并填入配置信息。
-
点击运行生效。
-
直接在 IM 端与数据集成 Agent 对话,进行状态查询、故障诊断、任务启停或接收巡检报告推送
抢鲜体验,从零开启你的数据集成 Agent 搭子
首次使用 DataWorks 数据集成 Agent,只需简单几步即可完成实例创建,让 AI 成为你的得力助手。
操作步骤
💡前置准备:数据集成 Agent 是 DataWorks Data Agent 的核心能力之一。在创建实例前,请先开通任意版本的 DataWorks Data Agent。
- 进入界面:登录 DataWorks 控制台,进入数据集成界面,从左侧导航栏找到"AI Native"下的 Data Agent。
数据集成界面:dataworks.data.aliyun.com/di
-
创建实例:点击"创建",首次使用时需指定一个 Serverless 资源组(若无则新建),随后生成 Data Agent 实例。
-
配置 IM 通道(可选):填写钉钉/飞书/企微的 Client ID/App ID/Bot ID 和密钥,实现多端联动,参考场景6。
-
网络连通:点击"一键网络打通",推荐使用 PrivateZone + 私网连接方案(安全性高,流量不出公网)。
-
开始对话:在 Web 端直接发起对话,或在 IM 端 @机器人,开启你的高效数据集成之旅!
官方文档
-
DataWorks 数据集成 Agent 帮助文档:help.aliyun.com/zh/datawork...
-
DataWorks Data Agent 官方文档:help.aliyun.com/zh/datawork...