DataWorks Data Agent 实战课堂(四):对话式数据源管理与智能问数实操

一、课程目标与适用人群

📖 跟随本课程文档实操后,您将能够:

  • 用自然语言一键创建、管理数据源,全程 dry-run 预览确认,安全可控。

  • 数据源连通性测试失败后,让 AI 自动诊断根因并受控修复(白名单 / 网络),修复后自动复测。

  • 对已连通的数据源直接用自然语言问数,自动生成只读 SQL 并输出图表,检查和对比数据库性能状态。

👥 适用人群: 数据开发工程师、数据运维工程师、希望降低数据源接入与运维门槛的解决方案工程师。

🔧 涉及工具: DataWorks 数据集成数据源管理 AI 能力(dataworks-infra-manage + dataworks-di-datasource-ops 技能集)。它用自然语言对话取代繁琐的表单配置与网络排查,覆盖 69 种数据源类型(MySQL、PostgreSQL、Hologres、MaxCompute、Kafka、OSS 等)的数据源创建、连通性测试与智能诊断、以及只读 SQL 问数,支持 UrlMode(连接串模式) 和 InstanceMode(云实例模式) 两种接入方式。

二、场景简介

场景痛点

  • 数据源类型多、连接参数各异,人工对照文档填写表单容易出错、耗时。

  • 连通性问题排查链路长:白名单、安全组、VPC 路由层层依赖网络知识,常常需要跨团队沟通,定位一个"连不通"动辄半天。

  • 数据源接入后,还要切换工具写 SQL 才能验证数据是否可用。

功能与价值

  • 自然语言创建数据源:对话描述实例信息即可完成创建;写操作默认 dry-run 预览,确认后才真正执行,杜绝误操作。

  • 连通失败自动诊断与修复:测试失败后自动进入诊断流程,从资源组侧实测 ping/telnet,结合错误特征定位根因(白名单缺失 / 路由不通 / 认证失败等),输出结构化诊断结论,修复方案先预览、确认后执行,修复后自动复测。

  • 对话式只读问数:自动生成只读 SELECT,先 EXPLAIN 预检再执行,单行结果上限 200 行,数据安全有保障;查询结果可直接生成图表。

三、如何开始使用

首次使用 DataWorks 数据集成 Agent,只需简单几步即可完成实例创建。

操作步骤 💡 前置准备 :数据集成 Agent 是 DataWorks Data Agent 的核心能力之一。在创建实例前,请先开通任意版本的 DataWorks Data Agent(点击前往开通)。

  1. 进入界面 :登录 DataWorks 控制台,进入数据集成界面,从左侧导航栏找到"AI Native"下的 Data Agent。

  2. 创建实例:点击"创建",首次使用时需指定一个 Serverless 资源组(若无则新建),随后生成 Data Agent 实例。

  3. 配置 IM 通道(可选):填写钉钉/飞书/企微的 Client ID/App ID/Bot ID 和密钥,实现多端联动,参考场景6。

  4. 网络连通:点击"一键网络打通",推荐使用 PrivateZone + 私网连接方案(安全性高,流量不出公网)。

  5. 开始对话:在 Web 端直接发起对话,或在 IM 端 @机器人,开启你的高效数据集成之旅!

DataWorks Data Agent 开通:help.aliyun.com/zh/datawork...

数据集成界面:dataworks.data.aliyun.com/di

视频演示 >>

(注:以下实操中的项目 ID、数据源名称、实例 ID 均为示例,请替换为您实际环境的资源名称)

四、场景实践演示

场景 1:自然语言创建 MySQL 数据源

前置准备与环境要求

  1. 权限:当前账号具备目标工作空间的管理员或开发权限。

  2. 数据库实例 :已有一个 RDS MySQL 实例(如 rm-bp1xxxx)及可登录的账号密码,实例中已建好示例库(如 demo_mysql_bj)。

  3. 资源组:工作空间已绑定 Serverless 资源组。

操作说明

在数据集成 Agent 中输入以下 Prompt:展示数据源管理

plaintext 复制代码
/dataworks-infra-manage 查看mysql数据源列表;查看大数据存储类的数据源列表;
plaintext 复制代码
/dataworks-infra-manage 请在工作空间 231607 下创建一个 MySQL 数据源 demo_mysql_bj,连接信息如下:
    - instanceId:rm-2ze16m9amdn5fn63j
    - regionId:cn-beijing
    - database:sakila
    - username:dwtest
    - password:dwTest@123
    - envType:Prod
创建完成后,测试它与通用资源组的连通性。

连通修复后,查看名字包含demo_mysql关键字的数据源配置;

预期结果

  • AI 自动识别数据源类型与连接模式,按参数规范补齐配置,先以 dry-run 展示完整数据源配置,请你确认。

  • 你确认后才真正执行创建,返回新数据源 ID。

  • 创建成功后自动发起连通性测试,并清晰展示测试结论。

演示截图

场景 2:连通失败自动诊断与修复

前置准备与环境要求

  1. 一个尚未打通网络 的数据源(可复用演示 1 的 demo_mysql:在 RDS 白名单中移除资源组 IP 段,或使用一个未配置白名单的新实例),以便复现"连通失败"场景。

  2. 工作空间已绑定 Serverless 资源组。

操作说明

在数据集成 Agent 中输入以下 Prompt:展示跨地域自助网络打通

mysql 复制代码
/dataworks-infra-manage 请在工作空间 231607 下创建一个 MySQL 数据源 demo_mysql_sh,连接信息如下:
  - instanceId:rm-uf6i8740l8za29c0m
  - regionId:cn-shanghai
  - database:sakila
  - username:dwtest
  - password:dwTest@123
  - envType:Prod

创建完成后,测试它与资源组的连通性。如果失败,请自动诊断原因并给出修复方案;修复操作先让我确认再执行,修复完成后重新测试。

在数据集成 Agent 中输入以下 Prompt:展示网络拓扑

plaintext 复制代码
/dataworks-infra-manage 目前dataworks资源组和数据源demo_mysql_sh建立了网络连通关系,帮我图形化梳理下这个网络连通拓扑关系,使用html刻画出来,文件名vpc_topology.html。html需要零外部依赖、不依赖 CDN、可离线直接打开。可以使用纯 HTML + 内联 CSS完整画图,使用白色背景画图,注意图表样式位置,避免遮挡。

预期结果

  • 连通性测试失败后,AI 自动进入诊断流程:先按错误特征分类(网络类 / 认证类 / 参数类),网络类错误自动从资源组侧发起 ping/telnet 实测。

  • 输出结构化诊断结论:异常根因(如 RDS 白名单未放行资源组 IP)、诊断证据、修复建议。

  • 给出 dry-run 修复计划(比如追加白名单 IP,不影响存量配置),你确认后才执行。

  • 修复完成后自动重新测试,确认连通成功。

演示截图

场景 3:连通后自然语言问数

前置准备与环境要求

  1. 演示 1/2 的数据源 demo_mysql_bj 已连通。

  2. 库中已有示例表(如 demo_db.orders)及少量测试数据。

操作说明

在数据集成 Agent 中输入以下 Prompt:数据源索引性能分析:

plaintext 复制代码
/dataworks-di-datasource-ops 帮我排查下这个空间下数据源demo_mysql_bj关联的库表整体有没有明显问题,重点看看表结构、索引、分区、字段设计以及潜在的慢 SQL 风险。

如果当前上下文里还没有明确的数据源、环境、库/schema 或排查范围,请不要直接开始分析,也不要只用普通文本追问;请先通过 AskUserQuestion 发起结构化追问,让我选择或补充最关键的信息。优先追问:1)要排查的数据源;2)环境是生产还是开发;3)库/schema 或排查范围;4)是否有特别关注的慢 SQL 或典型查询条件。资源组缺失时不要优先问我,请按 dataworks-di-datasource-ops 的规则先自动筛选可连通资源组。

拿到必要上下文后,请只在只读范围内继续:优先查看库表元数据、字段类型、主键、索引、分区等信息;如需分析查询风险,SELECT 先执行 EXPLAIN SELECT,SHOW、DESC、DESCRIBE 可直接按只读元数据语句处理。最后按表结构/字段设计、索引分区风险、慢 SQL 风险、优化建议和缺失证据分类输出。

在 AI 助手中输入以下 Prompt:问数和可视化

plaintext 复制代码
/dataworks-di-datasource-ops 我想基于数据源 demo_mysql_bj 中 sakila 库的 payment 表做统计分析,并在需要时生成图表。这张表是影片租赁的支付流水表,核心字段包括:
- 时间字段:payment_date(支付时间)
- 指标字段:amount(支付金额)
- 维度字段:customer_id(客户)、staff_id(店员)、rental_id(租赁单)

请先帮我确认这些字段是否可用,然后给我 2~4 个最合适的分析问题供我选择,例如:
- 按月汇总支付金额趋势
- 按店员统计业绩(总金额 + 订单数)
- 支付金额 Top10 客户排行
- 单笔支付金额的区间分布

图表要求:
- 生成一个零外部依赖、不依赖 CDN、可离线直接打开的 HTML 文件,禁止引用任何外部脚本/字体/图片
- 设计品质:贴合数据主题,避免 AI 默认审美
- 图表选型:按分析性质匹配(趋势→折线/面积、对比→柱状、TopN→横向条形、分布→直方图)

我选定后,请执行只读查询,返回结果摘要,并在适合可视化时生成一个最匹配的 HTML 图表,图表要零外部依赖,任何环境离线打开都能正常渲染和交互。最终请说明是否发生结果截断,以及为什么选择这种图表。

在 AI 助手中输入以下 Prompt:数据对比:

plaintext 复制代码
/dataworks-di-datasource-ops 帮我对比demo_mysql_bj、demo_mysql_sh两个数据源的内容差异,尽量让我通过结构化选择完成,少手动输入。

请先确认项目形态、对比对象和访问权限。标准项目可选择开发与生产环境,或任意两个有权限的数据源;简单项目只提供任意数据源对比。信息不完整时,请逐步帮助我选择环境、数据源、库/schema 和表。

对比时请完整覆盖四个层次,不要只返回其中一项,也不要直接跳到样例数据:数据源属性、库表清单、表结构和采样数据。请结合实际数据源类型、元数据和可用能力,自主判断每个层次中有价值的对比内容;敏感属性必须脱敏,缺少必要上下文时先补齐再继续。

请使用实际数据源、库和表名,将结果按独有项、差异项和一致项分类展示。任何层次无法对比时也要保留并说明原因。采样数据只在我明确授权且权限校验通过后执行限量只读查询,仅用于辅助分析;对比范围过大时应先缩小范围或分批处理,避免无边界扫描和敏感数据泄露。

如果我还没有指定对象,请问我:需要对比哪两个数据源,以及重点查看其中哪两张表?请提供或选择环境、数据源、库/schema 和表名。

预期结果

  • AI 自动生成只读 SELECT 语句,先执行 EXPLAIN 预检,通过后才真正执行查询。

  • 查询结果最多返回 200 行,若截断会明确提示。

  • 基于查询结果直接生成柱状图,完成从"数据源接入"到"数据可用"的闭环验证。

演示截图

✅ 总结

通过本次实操可以看到,数据源管理 AI 能力覆盖了数据源接入的核心生命周期:

  1. 创建:自然语言描述即可完成,dry-run 预览 + 确认执行,安全可控。

  2. 诊断:连通失败自动定位根因,修复方案受控执行、复测验证闭环。

  3. 使用:只读 SQL 自动生成、强制预检、结果可视化,数据即刻可用。

将原本需要对照文档填表、跨团队排查网络的流程,转化为高效的对话式数据源接入与智能运维体验。

五、进阶内容

两种连接模式

模式 适用场景 示例
InstanceMode 阿里云托管实例(RDS、Hologres 等) 实例 ID + 地域,自动解析连接地址
UrlMode 自建数据库 / 已知 IP+Port 直接填写 host、port

丰富的数据源类型覆盖

共支持 69 种数据源类型:关系型数据库(MySQL、PostgreSQL、Oracle、PolarDB 等)、大数据引擎(MaxCompute、Hologres、Hive、ClickHouse、StarRocks 等)、NoSQL(Redis、MongoDB、Elasticsearch 等)、存储(OSS、FTP)、消息(Kafka、DataHub)及 SaaS 服务。

更多运维能力

  • 批量连通性测试:一条指令摸清工作空间下全部(或指定类型)数据源的连通状态,快速发现风险数据源。

  • 数据源全生命周期:列表 / 详情 / 更新 / 克隆 / 删除,均支持自然语言操作;删除前自动检查绑定引擎,防止误删。

  • 实例接入对账:一键查询哪些云实例还没建数据源,避免遗漏。

安全设计

  • 写操作默认 dry-run:创建 / 更新 / 删除 / 修复,均需预览确认后才真正执行。

  • 修复只增不删:白名单修复仅追加 IP,绝不影响存量配置。

  • 只读问数边界:仅允许 SELECT / EXPLAIN / SHOW / DESC,SELECT 强制 EXPLAIN 预检;单次最多返回 200 行。

官方文档

相关推荐
智能RPA1 分钟前
农业与矿业行业智能体自动化平台对比评测(计量与巡检场景)
运维·人工智能·python·自动化·agent·rpa
easyeye1232 分钟前
用开源的Toonflow和MiniMax H3一步步复刻万妖
人工智能
byte轻骑兵4 分钟前
VCP核心缩写概览
人工智能·音视频·le audio·低功耗蓝牙音频
user4465117917914 分钟前
AgentScope 2.0 框架技术解析
agent
茶杯6754 分钟前
AI重构电商视觉生产 极睿科技AGI Ecpro助力行业数字化升级
人工智能·ai重构电商·极睿科技·agi ecpro·极睿科技—agi ecpro
liferecords6 分钟前
笔记本硬跑 744B 大模型:GitHub 上的『蜂鸟』把 SSD 当显存用
人工智能·开源·大模型·推理优化
sg_knight6 分钟前
ZCode Bug 定位实战:把报错丢给 ZCode,它是怎么修的
llm·bug·agent·ai编程·glm·智谱·zcode
工业设备方案笔记7 分钟前
I3568开发板 vs X3576开发板:RK3568与RK3576到底怎么选?
人工智能
ting94520007 分钟前
深度拆解|Dif.Sh 开源特性开关(Feature Flags)技术架构与工程落地全解析
人工智能·架构·开源
2601_9623807613 分钟前
历史解说与民俗科普视频的AI自动配素材实现教程
人工智能·音视频