DataWorks Data Agent 实战课堂(四):对话式数据源管理与智能问数实操

一、课程目标与适用人群

📖 跟随本课程文档实操后,您将能够:

  • 用自然语言一键创建、管理数据源,全程 dry-run 预览确认,安全可控。

  • 数据源连通性测试失败后,让 AI 自动诊断根因并受控修复(白名单 / 网络),修复后自动复测。

  • 对已连通的数据源直接用自然语言问数,自动生成只读 SQL 并输出图表,检查和对比数据库性能状态。

👥 适用人群: 数据开发工程师、数据运维工程师、希望降低数据源接入与运维门槛的解决方案工程师。

🔧 涉及工具: DataWorks 数据集成数据源管理 AI 能力(dataworks-infra-manage + dataworks-di-datasource-ops 技能集)。它用自然语言对话取代繁琐的表单配置与网络排查,覆盖 69 种数据源类型(MySQL、PostgreSQL、Hologres、MaxCompute、Kafka、OSS 等)的数据源创建、连通性测试与智能诊断、以及只读 SQL 问数,支持 UrlMode(连接串模式) 和 InstanceMode(云实例模式) 两种接入方式。

二、场景简介

场景痛点

  • 数据源类型多、连接参数各异,人工对照文档填写表单容易出错、耗时。

  • 连通性问题排查链路长:白名单、安全组、VPC 路由层层依赖网络知识,常常需要跨团队沟通,定位一个"连不通"动辄半天。

  • 数据源接入后,还要切换工具写 SQL 才能验证数据是否可用。

功能与价值

  • 自然语言创建数据源:对话描述实例信息即可完成创建;写操作默认 dry-run 预览,确认后才真正执行,杜绝误操作。

  • 连通失败自动诊断与修复:测试失败后自动进入诊断流程,从资源组侧实测 ping/telnet,结合错误特征定位根因(白名单缺失 / 路由不通 / 认证失败等),输出结构化诊断结论,修复方案先预览、确认后执行,修复后自动复测。

  • 对话式只读问数:自动生成只读 SELECT,先 EXPLAIN 预检再执行,单行结果上限 200 行,数据安全有保障;查询结果可直接生成图表。

三、如何开始使用

首次使用 DataWorks 数据集成 Agent,只需简单几步即可完成实例创建。

操作步骤 💡 前置准备 :数据集成 Agent 是 DataWorks Data Agent 的核心能力之一。在创建实例前,请先开通任意版本的 DataWorks Data Agent(点击前往开通)。

  1. 进入界面 :登录 DataWorks 控制台,进入数据集成界面,从左侧导航栏找到"AI Native"下的 Data Agent。

  2. 创建实例:点击"创建",首次使用时需指定一个 Serverless 资源组(若无则新建),随后生成 Data Agent 实例。

  3. 配置 IM 通道(可选):填写钉钉/飞书/企微的 Client ID/App ID/Bot ID 和密钥,实现多端联动,参考场景6。

  4. 网络连通:点击"一键网络打通",推荐使用 PrivateZone + 私网连接方案(安全性高,流量不出公网)。

  5. 开始对话:在 Web 端直接发起对话,或在 IM 端 @机器人,开启你的高效数据集成之旅!

DataWorks Data Agent 开通:help.aliyun.com/zh/datawork...

数据集成界面:dataworks.data.aliyun.com/di

视频演示 >>

(注:以下实操中的项目 ID、数据源名称、实例 ID 均为示例,请替换为您实际环境的资源名称)

四、场景实践演示

场景 1:自然语言创建 MySQL 数据源

前置准备与环境要求

  1. 权限:当前账号具备目标工作空间的管理员或开发权限。

  2. 数据库实例 :已有一个 RDS MySQL 实例(如 rm-bp1xxxx)及可登录的账号密码,实例中已建好示例库(如 demo_mysql_bj)。

  3. 资源组:工作空间已绑定 Serverless 资源组。

操作说明

在数据集成 Agent 中输入以下 Prompt:展示数据源管理

plaintext 复制代码
/dataworks-infra-manage 查看mysql数据源列表;查看大数据存储类的数据源列表;
plaintext 复制代码
/dataworks-infra-manage 请在工作空间 231607 下创建一个 MySQL 数据源 demo_mysql_bj,连接信息如下:
    - instanceId:rm-2ze16m9amdn5fn63j
    - regionId:cn-beijing
    - database:sakila
    - username:dwtest
    - password:dwTest@123
    - envType:Prod
创建完成后,测试它与通用资源组的连通性。

连通修复后,查看名字包含demo_mysql关键字的数据源配置;

预期结果

  • AI 自动识别数据源类型与连接模式,按参数规范补齐配置,先以 dry-run 展示完整数据源配置,请你确认。

  • 你确认后才真正执行创建,返回新数据源 ID。

  • 创建成功后自动发起连通性测试,并清晰展示测试结论。

演示截图

场景 2:连通失败自动诊断与修复

前置准备与环境要求

  1. 一个尚未打通网络 的数据源(可复用演示 1 的 demo_mysql:在 RDS 白名单中移除资源组 IP 段,或使用一个未配置白名单的新实例),以便复现"连通失败"场景。

  2. 工作空间已绑定 Serverless 资源组。

操作说明

在数据集成 Agent 中输入以下 Prompt:展示跨地域自助网络打通

mysql 复制代码
/dataworks-infra-manage 请在工作空间 231607 下创建一个 MySQL 数据源 demo_mysql_sh,连接信息如下:
  - instanceId:rm-uf6i8740l8za29c0m
  - regionId:cn-shanghai
  - database:sakila
  - username:dwtest
  - password:dwTest@123
  - envType:Prod

创建完成后,测试它与资源组的连通性。如果失败,请自动诊断原因并给出修复方案;修复操作先让我确认再执行,修复完成后重新测试。

在数据集成 Agent 中输入以下 Prompt:展示网络拓扑

plaintext 复制代码
/dataworks-infra-manage 目前dataworks资源组和数据源demo_mysql_sh建立了网络连通关系,帮我图形化梳理下这个网络连通拓扑关系,使用html刻画出来,文件名vpc_topology.html。html需要零外部依赖、不依赖 CDN、可离线直接打开。可以使用纯 HTML + 内联 CSS完整画图,使用白色背景画图,注意图表样式位置,避免遮挡。

预期结果

  • 连通性测试失败后,AI 自动进入诊断流程:先按错误特征分类(网络类 / 认证类 / 参数类),网络类错误自动从资源组侧发起 ping/telnet 实测。

  • 输出结构化诊断结论:异常根因(如 RDS 白名单未放行资源组 IP)、诊断证据、修复建议。

  • 给出 dry-run 修复计划(比如追加白名单 IP,不影响存量配置),你确认后才执行。

  • 修复完成后自动重新测试,确认连通成功。

演示截图

场景 3:连通后自然语言问数

前置准备与环境要求

  1. 演示 1/2 的数据源 demo_mysql_bj 已连通。

  2. 库中已有示例表(如 demo_db.orders)及少量测试数据。

操作说明

在数据集成 Agent 中输入以下 Prompt:数据源索引性能分析:

plaintext 复制代码
/dataworks-di-datasource-ops 帮我排查下这个空间下数据源demo_mysql_bj关联的库表整体有没有明显问题,重点看看表结构、索引、分区、字段设计以及潜在的慢 SQL 风险。

如果当前上下文里还没有明确的数据源、环境、库/schema 或排查范围,请不要直接开始分析,也不要只用普通文本追问;请先通过 AskUserQuestion 发起结构化追问,让我选择或补充最关键的信息。优先追问:1)要排查的数据源;2)环境是生产还是开发;3)库/schema 或排查范围;4)是否有特别关注的慢 SQL 或典型查询条件。资源组缺失时不要优先问我,请按 dataworks-di-datasource-ops 的规则先自动筛选可连通资源组。

拿到必要上下文后,请只在只读范围内继续:优先查看库表元数据、字段类型、主键、索引、分区等信息;如需分析查询风险,SELECT 先执行 EXPLAIN SELECT,SHOW、DESC、DESCRIBE 可直接按只读元数据语句处理。最后按表结构/字段设计、索引分区风险、慢 SQL 风险、优化建议和缺失证据分类输出。

在 AI 助手中输入以下 Prompt:问数和可视化

plaintext 复制代码
/dataworks-di-datasource-ops 我想基于数据源 demo_mysql_bj 中 sakila 库的 payment 表做统计分析,并在需要时生成图表。这张表是影片租赁的支付流水表,核心字段包括:
- 时间字段:payment_date(支付时间)
- 指标字段:amount(支付金额)
- 维度字段:customer_id(客户)、staff_id(店员)、rental_id(租赁单)

请先帮我确认这些字段是否可用,然后给我 2~4 个最合适的分析问题供我选择,例如:
- 按月汇总支付金额趋势
- 按店员统计业绩(总金额 + 订单数)
- 支付金额 Top10 客户排行
- 单笔支付金额的区间分布

图表要求:
- 生成一个零外部依赖、不依赖 CDN、可离线直接打开的 HTML 文件,禁止引用任何外部脚本/字体/图片
- 设计品质:贴合数据主题,避免 AI 默认审美
- 图表选型:按分析性质匹配(趋势→折线/面积、对比→柱状、TopN→横向条形、分布→直方图)

我选定后,请执行只读查询,返回结果摘要,并在适合可视化时生成一个最匹配的 HTML 图表,图表要零外部依赖,任何环境离线打开都能正常渲染和交互。最终请说明是否发生结果截断,以及为什么选择这种图表。

在 AI 助手中输入以下 Prompt:数据对比:

plaintext 复制代码
/dataworks-di-datasource-ops 帮我对比demo_mysql_bj、demo_mysql_sh两个数据源的内容差异,尽量让我通过结构化选择完成,少手动输入。

请先确认项目形态、对比对象和访问权限。标准项目可选择开发与生产环境,或任意两个有权限的数据源;简单项目只提供任意数据源对比。信息不完整时,请逐步帮助我选择环境、数据源、库/schema 和表。

对比时请完整覆盖四个层次,不要只返回其中一项,也不要直接跳到样例数据:数据源属性、库表清单、表结构和采样数据。请结合实际数据源类型、元数据和可用能力,自主判断每个层次中有价值的对比内容;敏感属性必须脱敏,缺少必要上下文时先补齐再继续。

请使用实际数据源、库和表名,将结果按独有项、差异项和一致项分类展示。任何层次无法对比时也要保留并说明原因。采样数据只在我明确授权且权限校验通过后执行限量只读查询,仅用于辅助分析;对比范围过大时应先缩小范围或分批处理,避免无边界扫描和敏感数据泄露。

如果我还没有指定对象,请问我:需要对比哪两个数据源,以及重点查看其中哪两张表?请提供或选择环境、数据源、库/schema 和表名。

预期结果

  • AI 自动生成只读 SELECT 语句,先执行 EXPLAIN 预检,通过后才真正执行查询。

  • 查询结果最多返回 200 行,若截断会明确提示。

  • 基于查询结果直接生成柱状图,完成从"数据源接入"到"数据可用"的闭环验证。

演示截图

✅ 总结

通过本次实操可以看到,数据源管理 AI 能力覆盖了数据源接入的核心生命周期:

  1. 创建:自然语言描述即可完成,dry-run 预览 + 确认执行,安全可控。

  2. 诊断:连通失败自动定位根因,修复方案受控执行、复测验证闭环。

  3. 使用:只读 SQL 自动生成、强制预检、结果可视化,数据即刻可用。

将原本需要对照文档填表、跨团队排查网络的流程,转化为高效的对话式数据源接入与智能运维体验。

五、进阶内容

两种连接模式

模式 适用场景 示例
InstanceMode 阿里云托管实例(RDS、Hologres 等) 实例 ID + 地域,自动解析连接地址
UrlMode 自建数据库 / 已知 IP+Port 直接填写 host、port

丰富的数据源类型覆盖

共支持 69 种数据源类型:关系型数据库(MySQL、PostgreSQL、Oracle、PolarDB 等)、大数据引擎(MaxCompute、Hologres、Hive、ClickHouse、StarRocks 等)、NoSQL(Redis、MongoDB、Elasticsearch 等)、存储(OSS、FTP)、消息(Kafka、DataHub)及 SaaS 服务。

更多运维能力

  • 批量连通性测试:一条指令摸清工作空间下全部(或指定类型)数据源的连通状态,快速发现风险数据源。

  • 数据源全生命周期:列表 / 详情 / 更新 / 克隆 / 删除,均支持自然语言操作;删除前自动检查绑定引擎,防止误删。

  • 实例接入对账:一键查询哪些云实例还没建数据源,避免遗漏。

安全设计

  • 写操作默认 dry-run:创建 / 更新 / 删除 / 修复,均需预览确认后才真正执行。

  • 修复只增不删:白名单修复仅追加 IP,绝不影响存量配置。

  • 只读问数边界:仅允许 SELECT / EXPLAIN / SHOW / DESC,SELECT 强制 EXPLAIN 预检;单次最多返回 200 行。

官方文档

相关推荐
浪淘沙jkp1 小时前
四、实现漫剧工作流,安装comfyui插件ComfyUI Impact Pack==图像细节增强与局部修复插件包
人工智能
SelectDB1 小时前
面向 AI Agent 的数据库运维:SelectDB CLI 与 Skills 架构设计及实践
人工智能
皮皮虾❀1 小时前
典铭云赛低代码+AI智能体快速落地方法论:从“售前写方案、交付做开发各管一段”到“场景发现即交付、需求到上线一周”的完整技术方案
人工智能·低代码
杨石兴1 小时前
31、玩具MoM:用2x2矩阵串起全套流程
人工智能·算法·矩阵·电磁学
江畔柳前堤1 小时前
Function Calling 与 Tool Calling:从认知到工程的全景深度解析
开发语言·网络·人工智能·深度学习·算法·机器学习·php
宅小年1 小时前
DeepSeek Harness 发布,一切皆是插件
人工智能
努力的小Qin1 小时前
梯度下降如何实现参数优化:从线性回归到 Sigmoid 分类
人工智能·python·神经网络
甲维斯1 小时前
DeepSeekPro 依旧拉跨,配上官方Harness,还不如Flash?
人工智能
听你说322 小时前
推进具身智能安全评测:丈八科技与季华实验室达成战略合作
人工智能·科技·安全