一、课程目标与适用人群
📖 跟随本课程文档实操后,您将能够:
-
用自然语言一键创建、管理数据源,全程 dry-run 预览确认,安全可控。
-
数据源连通性测试失败后,让 AI 自动诊断根因并受控修复(白名单 / 网络),修复后自动复测。
-
对已连通的数据源直接用自然语言问数,自动生成只读 SQL 并输出图表,检查和对比数据库性能状态。
👥 适用人群: 数据开发工程师、数据运维工程师、希望降低数据源接入与运维门槛的解决方案工程师。
🔧 涉及工具: DataWorks 数据集成数据源管理 AI 能力(dataworks-infra-manage + dataworks-di-datasource-ops 技能集)。它用自然语言对话取代繁琐的表单配置与网络排查,覆盖 69 种数据源类型(MySQL、PostgreSQL、Hologres、MaxCompute、Kafka、OSS 等)的数据源创建、连通性测试与智能诊断、以及只读 SQL 问数,支持 UrlMode(连接串模式) 和 InstanceMode(云实例模式) 两种接入方式。
二、场景简介
场景痛点
-
数据源类型多、连接参数各异,人工对照文档填写表单容易出错、耗时。
-
连通性问题排查链路长:白名单、安全组、VPC 路由层层依赖网络知识,常常需要跨团队沟通,定位一个"连不通"动辄半天。
-
数据源接入后,还要切换工具写 SQL 才能验证数据是否可用。
功能与价值
-
自然语言创建数据源:对话描述实例信息即可完成创建;写操作默认 dry-run 预览,确认后才真正执行,杜绝误操作。
-
连通失败自动诊断与修复:测试失败后自动进入诊断流程,从资源组侧实测 ping/telnet,结合错误特征定位根因(白名单缺失 / 路由不通 / 认证失败等),输出结构化诊断结论,修复方案先预览、确认后执行,修复后自动复测。
-
对话式只读问数:自动生成只读 SELECT,先 EXPLAIN 预检再执行,单行结果上限 200 行,数据安全有保障;查询结果可直接生成图表。
三、如何开始使用
首次使用 DataWorks 数据集成 Agent,只需简单几步即可完成实例创建。
操作步骤 💡 前置准备 :数据集成 Agent 是 DataWorks Data Agent 的核心能力之一。在创建实例前,请先开通任意版本的 DataWorks Data Agent(点击前往开通)。
-
进入界面 :登录 DataWorks 控制台,进入数据集成界面,从左侧导航栏找到"AI Native"下的 Data Agent。
-
创建实例:点击"创建",首次使用时需指定一个 Serverless 资源组(若无则新建),随后生成 Data Agent 实例。
-
配置 IM 通道(可选):填写钉钉/飞书/企微的 Client ID/App ID/Bot ID 和密钥,实现多端联动,参考场景6。
-
网络连通:点击"一键网络打通",推荐使用 PrivateZone + 私网连接方案(安全性高,流量不出公网)。
-
开始对话:在 Web 端直接发起对话,或在 IM 端 @机器人,开启你的高效数据集成之旅!
DataWorks Data Agent 开通:help.aliyun.com/zh/datawork...
数据集成界面:dataworks.data.aliyun.com/di
(注:以下实操中的项目 ID、数据源名称、实例 ID 均为示例,请替换为您实际环境的资源名称)
四、场景实践演示
场景 1:自然语言创建 MySQL 数据源
前置准备与环境要求
-
权限:当前账号具备目标工作空间的管理员或开发权限。
-
数据库实例 :已有一个 RDS MySQL 实例(如
rm-bp1xxxx)及可登录的账号密码,实例中已建好示例库(如demo_mysql_bj)。 -
资源组:工作空间已绑定 Serverless 资源组。
操作说明
在数据集成 Agent 中输入以下 Prompt:展示数据源管理
plaintext
/dataworks-infra-manage 查看mysql数据源列表;查看大数据存储类的数据源列表;
plaintext
/dataworks-infra-manage 请在工作空间 231607 下创建一个 MySQL 数据源 demo_mysql_bj,连接信息如下:
- instanceId:rm-2ze16m9amdn5fn63j
- regionId:cn-beijing
- database:sakila
- username:dwtest
- password:dwTest@123
- envType:Prod
创建完成后,测试它与通用资源组的连通性。
连通修复后,查看名字包含demo_mysql关键字的数据源配置;
预期结果
-
AI 自动识别数据源类型与连接模式,按参数规范补齐配置,先以 dry-run 展示完整数据源配置,请你确认。
-
你确认后才真正执行创建,返回新数据源 ID。
-
创建成功后自动发起连通性测试,并清晰展示测试结论。
演示截图

场景 2:连通失败自动诊断与修复
前置准备与环境要求
-
一个尚未打通网络 的数据源(可复用演示 1 的
demo_mysql:在 RDS 白名单中移除资源组 IP 段,或使用一个未配置白名单的新实例),以便复现"连通失败"场景。 -
工作空间已绑定 Serverless 资源组。
操作说明
在数据集成 Agent 中输入以下 Prompt:展示跨地域自助网络打通
mysql
/dataworks-infra-manage 请在工作空间 231607 下创建一个 MySQL 数据源 demo_mysql_sh,连接信息如下:
- instanceId:rm-uf6i8740l8za29c0m
- regionId:cn-shanghai
- database:sakila
- username:dwtest
- password:dwTest@123
- envType:Prod
创建完成后,测试它与资源组的连通性。如果失败,请自动诊断原因并给出修复方案;修复操作先让我确认再执行,修复完成后重新测试。
在数据集成 Agent 中输入以下 Prompt:展示网络拓扑
plaintext
/dataworks-infra-manage 目前dataworks资源组和数据源demo_mysql_sh建立了网络连通关系,帮我图形化梳理下这个网络连通拓扑关系,使用html刻画出来,文件名vpc_topology.html。html需要零外部依赖、不依赖 CDN、可离线直接打开。可以使用纯 HTML + 内联 CSS完整画图,使用白色背景画图,注意图表样式位置,避免遮挡。
预期结果
-
连通性测试失败后,AI 自动进入诊断流程:先按错误特征分类(网络类 / 认证类 / 参数类),网络类错误自动从资源组侧发起 ping/telnet 实测。
-
输出结构化诊断结论:异常根因(如 RDS 白名单未放行资源组 IP)、诊断证据、修复建议。
-
给出 dry-run 修复计划(比如追加白名单 IP,不影响存量配置),你确认后才执行。
-
修复完成后自动重新测试,确认连通成功。
演示截图


场景 3:连通后自然语言问数
前置准备与环境要求
-
演示 1/2 的数据源
demo_mysql_bj已连通。 -
库中已有示例表(如
demo_db.orders)及少量测试数据。

操作说明
在数据集成 Agent 中输入以下 Prompt:数据源索引性能分析:
plaintext
/dataworks-di-datasource-ops 帮我排查下这个空间下数据源demo_mysql_bj关联的库表整体有没有明显问题,重点看看表结构、索引、分区、字段设计以及潜在的慢 SQL 风险。
如果当前上下文里还没有明确的数据源、环境、库/schema 或排查范围,请不要直接开始分析,也不要只用普通文本追问;请先通过 AskUserQuestion 发起结构化追问,让我选择或补充最关键的信息。优先追问:1)要排查的数据源;2)环境是生产还是开发;3)库/schema 或排查范围;4)是否有特别关注的慢 SQL 或典型查询条件。资源组缺失时不要优先问我,请按 dataworks-di-datasource-ops 的规则先自动筛选可连通资源组。
拿到必要上下文后,请只在只读范围内继续:优先查看库表元数据、字段类型、主键、索引、分区等信息;如需分析查询风险,SELECT 先执行 EXPLAIN SELECT,SHOW、DESC、DESCRIBE 可直接按只读元数据语句处理。最后按表结构/字段设计、索引分区风险、慢 SQL 风险、优化建议和缺失证据分类输出。
在 AI 助手中输入以下 Prompt:问数和可视化
plaintext
/dataworks-di-datasource-ops 我想基于数据源 demo_mysql_bj 中 sakila 库的 payment 表做统计分析,并在需要时生成图表。这张表是影片租赁的支付流水表,核心字段包括:
- 时间字段:payment_date(支付时间)
- 指标字段:amount(支付金额)
- 维度字段:customer_id(客户)、staff_id(店员)、rental_id(租赁单)
请先帮我确认这些字段是否可用,然后给我 2~4 个最合适的分析问题供我选择,例如:
- 按月汇总支付金额趋势
- 按店员统计业绩(总金额 + 订单数)
- 支付金额 Top10 客户排行
- 单笔支付金额的区间分布
图表要求:
- 生成一个零外部依赖、不依赖 CDN、可离线直接打开的 HTML 文件,禁止引用任何外部脚本/字体/图片
- 设计品质:贴合数据主题,避免 AI 默认审美
- 图表选型:按分析性质匹配(趋势→折线/面积、对比→柱状、TopN→横向条形、分布→直方图)
我选定后,请执行只读查询,返回结果摘要,并在适合可视化时生成一个最匹配的 HTML 图表,图表要零外部依赖,任何环境离线打开都能正常渲染和交互。最终请说明是否发生结果截断,以及为什么选择这种图表。
在 AI 助手中输入以下 Prompt:数据对比:
plaintext
/dataworks-di-datasource-ops 帮我对比demo_mysql_bj、demo_mysql_sh两个数据源的内容差异,尽量让我通过结构化选择完成,少手动输入。
请先确认项目形态、对比对象和访问权限。标准项目可选择开发与生产环境,或任意两个有权限的数据源;简单项目只提供任意数据源对比。信息不完整时,请逐步帮助我选择环境、数据源、库/schema 和表。
对比时请完整覆盖四个层次,不要只返回其中一项,也不要直接跳到样例数据:数据源属性、库表清单、表结构和采样数据。请结合实际数据源类型、元数据和可用能力,自主判断每个层次中有价值的对比内容;敏感属性必须脱敏,缺少必要上下文时先补齐再继续。
请使用实际数据源、库和表名,将结果按独有项、差异项和一致项分类展示。任何层次无法对比时也要保留并说明原因。采样数据只在我明确授权且权限校验通过后执行限量只读查询,仅用于辅助分析;对比范围过大时应先缩小范围或分批处理,避免无边界扫描和敏感数据泄露。
如果我还没有指定对象,请问我:需要对比哪两个数据源,以及重点查看其中哪两张表?请提供或选择环境、数据源、库/schema 和表名。
预期结果
-
AI 自动生成只读 SELECT 语句,先执行 EXPLAIN 预检,通过后才真正执行查询。
-
查询结果最多返回 200 行,若截断会明确提示。
-
基于查询结果直接生成柱状图,完成从"数据源接入"到"数据可用"的闭环验证。
演示截图



✅ 总结
通过本次实操可以看到,数据源管理 AI 能力覆盖了数据源接入的核心生命周期:
-
创建:自然语言描述即可完成,dry-run 预览 + 确认执行,安全可控。
-
诊断:连通失败自动定位根因,修复方案受控执行、复测验证闭环。
-
使用:只读 SQL 自动生成、强制预检、结果可视化,数据即刻可用。
将原本需要对照文档填表、跨团队排查网络的流程,转化为高效的对话式数据源接入与智能运维体验。
五、进阶内容
两种连接模式
| 模式 | 适用场景 | 示例 |
|---|---|---|
| InstanceMode | 阿里云托管实例(RDS、Hologres 等) | 实例 ID + 地域,自动解析连接地址 |
| UrlMode | 自建数据库 / 已知 IP+Port | 直接填写 host、port |
丰富的数据源类型覆盖
共支持 69 种数据源类型:关系型数据库(MySQL、PostgreSQL、Oracle、PolarDB 等)、大数据引擎(MaxCompute、Hologres、Hive、ClickHouse、StarRocks 等)、NoSQL(Redis、MongoDB、Elasticsearch 等)、存储(OSS、FTP)、消息(Kafka、DataHub)及 SaaS 服务。
更多运维能力
-
批量连通性测试:一条指令摸清工作空间下全部(或指定类型)数据源的连通状态,快速发现风险数据源。
-
数据源全生命周期:列表 / 详情 / 更新 / 克隆 / 删除,均支持自然语言操作;删除前自动检查绑定引擎,防止误删。
-
实例接入对账:一键查询哪些云实例还没建数据源,避免遗漏。
安全设计
-
写操作默认 dry-run:创建 / 更新 / 删除 / 修复,均需预览确认后才真正执行。
-
修复只增不删:白名单修复仅追加 IP,绝不影响存量配置。
-
只读问数边界:仅允许 SELECT / EXPLAIN / SHOW / DESC,SELECT 强制 EXPLAIN 预检;单次最多返回 200 行。
官方文档