一、课程目标与适用人群
📖 跟随本课程文档实操后,您将能够:
-
用自然语言一键创建 AI 多模态数据处理任务,支持视频、音频、图片、文档等内容提取与智能加工。
-
通过周期增量调度,自动处理每个周期新增的多模态文件,无需人工维护文件列表。
-
灵活串联多个 AI 算子(向量化、翻译、分类、多模态文件内容提取等),构建数据处理流水线。
👥 适用人群:
数据开发工程师、数据加工工程师、希望用自然语言完成多模态数据处理的业务分析师。
🔧 涉及工具:
数据集成 Agent(DataWorks DI Agent)--- AI多模态数据处理能力。用自然语言对话取代传统繁琐的表单与代码开发,覆盖视频、音频、图片、文档等多模态数据的 AI 加工任务创建、算子编排、周期调度与智能诊断全流程。
二、场景简介
场景痛点
-
多模态数据处理链路搭建复杂:从对象存储读取视频/音频/图片,调用大模型提取内容,再写入数据仓库------涉及存储对接、模型选择、Prompt设计等多个环节,手动搭建一条链路往往需要数天。
-
多算子编排门槛高:业务常需串联多个 AI 步骤(如图片提取 → 向量化 → 写入向量库),每新增一个算子都涉及列映射和模型参数配置,任一环节出错整个任务即失败。
-
异构存储与目标端碎片化:多模态数据分散在多个不同云平台,目标端涉及 MaxCompute、Hologres、DLF、向量库等多种类型,需逐一适配。
-
增量调度与失败诊断繁琐:周期增量同步需手动编写 cron 和时间窗口参数;任务失败涉及大模型调用、资源组、数据格式等多层依赖,排查链路长。
功能与价值
-
自然语言驱动全流程:一句话描述需求(如"将视频提取内容写入 MaxCompute"),Agent 自动完成数据源浏览、目标建表、算子编排和任务提交,将数天配置缩短到一次对话。
-
AI 与数据处理算子:内置通用 LLM(支持文本/图片/视频/音频多模态)、向量化、情感分析、分类、抽取、脱敏、翻译、摘要等多种模型类算子,以及 JSON 解析、字符串替换、数据过滤等数据处理类算子。
-
算子链式编排:多个 Transformer 可自由串联,Agent 自动维护数据流传递与列映射,无需手动配置中间 Schema。
-
全生命周期覆盖:Spec 构建、本地校验、自动建表、运行监控、周期调度、失败诊断与日志分析,一个 Agent 覆盖创建到运维完整闭环。
-
多云存储统一接入:支持多个云存储、MaxCompute、Hologres、DLF、MySQL、Milvus、OpenSearch、Elasticsearch 等多种数据源类型。
-
周期增量同步:自然语言设置调度周期,自动生成 cron 表达式和增量时间窗口,每周期仅处理新增文件。
三、如何开始使用
首次使用 DataWorks 数据集成 Agent,只需简单几步即可完成实例创建。
操作步骤 💡
前置准备 :数据集成 Agent 是 DataWorks Data Agent 的核心能力之一。在创建实例前,请先开通任意版本的 DataWorks Data Agent(点击前往开通)。
-
进入界面 :登录 DataWorks 控制台,进入数据集成界面,从左侧导航栏找到"AI Native"下的 Data Agent。
-
创建实例:点击"创建",首次使用时需指定一个 Serverless 资源组(若无则新建),随后生成 Data Agent 实例。
-
配置场景:支持选择 DataWorks 助理或自定义助理模式。
-
配置 IM 通道(可选):填写钉钉/飞书/企微的 Client ID/App ID/Bot ID 和密钥,实现多端联动,参考场景6。
-
网络连通:点击"一键网络打通",推荐使用 PrivateZone + 私网连接方案(安全性高,流量不出公网)。
-
开始对话:在 Web 端直接发起对话,或在 IM 端 @机器人,开启你的高效数据集成之旅!
(注:以下实操中的项目 ID、数据源名称、实例 ID 均为示例,请替换为您实际环境的资源名称)
四、场景演示
场景 1:自然语言创建视频 -> 视频内容质检 -> 阿里云MaxCompute数据处理任务
前置准备与环境要求
-
权限:当前账号具备目标工作空间的管理员或开发权限。
-
资源组:工作空间已绑定 Serverless 资源组。
-
数据源:已创建视频数据源/和阿里云MaxCompute,并确保Serverless资源组能测试联通。
操作说明
在 数据集成Agent 助手中输入以下 Prompt:创建视频->视频内容提取->MaxCompute任务
plaintext
/dataworks-di-data-processor 创建一个新的数据处理任务,将数据源上的视频文件,判断视频中有没有同时出现人两只双手在画面里,如果出现则判断为通过,否则判断为不通过,并给出判断理由,将结果写入MaxCompute表中。
数据源:yunshi_tos
MaxCompute数据源:cp_test_mc11
预期结果
-
数据集成Agent会自动获取你DataWorks项目空间下数据源信息。
-
根据自然语言需求自动进行MaxCompute建表、创建数据处理视频内容提取算子、创建数据处理任务,数据处理任务可以根据文件数调整任务的并发并行处理以提升处理性能。
-
启动运行自动替换调度变量参数,查询数据处理任务运行状态以及Token消耗。
-
在数据集成Agent中查询写入到MaxCompute表的数据。
场景 2:自然语言创建图片 -> 图片内容提取 -> Embedding向量化 -> 阿里云Hologres数据处理任务
前置准备与环境要求
-
权限:当前账号具备目标工作空间的管理员或开发权限。
-
资源组:工作空间已绑定 Serverless 资源组。
-
数据源:已创建数据源/和阿里云Hologres,并确保Serverless资源组能测试联通。
操作说明
在 数据集成Agent 助手中输入以下 Prompt:
mysql
/dataworks-di-data-processor 创建一个新的数据处理任务,提取图片内容内容中文输出,并将中文内容做Embedding向量化,将提取的内容以及Embedding向量化结果写入Hologres表中。
数据源:yunshi_cos
Hologres数据源:yunshi_holo
任务并发数为10。
预期结果
-
数据集成Agent会自动获取你的DataWorks项目空间下数据源信息。
-
根据自然语言需求自动进行Hologres建表、创建图片内容提取算子、Embedding算子、创建数据处理任务,数据处理任务可以根据文件数调整任务的并发并行处理以提升处理性能。
-
启动数据处理任务运行,查询数据处理任务运行状态以及Token消耗。
-
在数据集成Agent中查询写入到Hologres表的数据。
场景 3:自然语言创建阿里云OSS -> 音频内容提取 -> 阿里云DLF数据处理任务
前置准备与环境要求
-
权限:当前账号具备目标工作空间的管理员或开发权限。
-
资源组:工作空间已绑定 Serverless 资源组。
-
数据源:已创建阿里云OSS数据源/和阿里云DLF,并确保Serverless资源组能测试联通。
操作说明
在 数据集成Agent 助手中输入以下 Prompt:
mysql
/dataworks-di-data-processor 创建一个新的数据处理任务,将OSS上的音频文件,完整提取音频内容,将结果写入阿里云DLF表中。
OSS数据源:yunshi_oss
DLF数据源:yunshi_dlf
预期结果
-
数据集成Agent会自动获取你的DataWorks项目空间下 OSS 和 DLF 数据源信息。
-
根据自然语言需求自动进行DLF建表、创建音频内容提取算子、创建数据处理任务,数据处理任务可以根据文件数调整任务的并发并行处理以提升处理性能。
-
启动数据处理任务运行,查询数据处理任务运行状态以及Token消耗。
-
在数据集成Agent中查询写入到DLF表的数据。
演示截图
自然语言描述任务创建:

数据处理链路:

Agent查询写入到DLF的数据:

场景 4:周期性调度自动处理新增的增量多模态文件
前置准备与环境要求
-
已有数据处理任务:已创建好一个上述的多模态数据处理任务。
-
权限:当前账号具备目标工作空间的管理员或开发权限。
操作说明
在 数据集成Agent 助手中输入以下 Prompt:
mysql
/dataworks-di-data-processor 将该任务改为周期增量同步,每小时同步一次,每小时同步上一个周期新产生的视频文件
预期结果
-
Agent 自动识别上下文中的任务,将调度配置修改为每小时周期性执行。
-
源端读取路径自动适配增量模式,每次仅处理上一周期新产生的文件(通过调度变量 bizdate / yyyymmddhh24 等控制时间范围)。
-
任务详情中可以看到调度配置信息(调度周期、cron 表达式等),可以挂载 DataWorks 节点上下游依赖。
-
任务按调度周期自动触发,无需人工干预。
通过自然语言将数据处理任务改为周期增量同步,自动处理上一个周期新产生的多模态文件:

数据处理任务详情里可以看到调度配置信息,可以挂载DataWorks节点上下游依赖:

演示总结
通过本次实操可以看到,DataWorks数据集成Agent 能力覆盖了AI数据处理任务的核心生命周期:
-
创建:自然语言描述即可完成,自动浏览文件、自动建表、自动创建数据处理任务Spec。
-
运行:自动进行调度参数变量替换,运行数据处理任务。
-
周期:可以通过自然语言设置调度周期,周期性同步上一个周期新产生的增量多模态文件进行处理。
将原本需要多次页面操作和人工配置的流程,转化为更加高效的对话式任务创建与智能运维体验,为多模态文件的处理带来更多数据价值。
进阶内容
数据处理整体运行流图

丰富的 AI 数据处理算子
当前支持 多种 Transformer 算子,可自由串联构建处理流水线:
-
模型类(12 种):通用 LLM 处理(支持文本/图片/视频/音频多模态)、向量化、情感分析、文本分块、文本分类、信息抽取、语法纠正、数据脱敏、文档解析、排序打分、相似度计算、摘要、翻译。
-
数据处理类(5 种):JSON 解析展开、添加常量/表达式列、字符串替换、表/列映射路由。
广泛的数据源与多模态支持
-
源端:多云存储、MaxCompute、MySQL 等,支持数据集成任意通道类型,正在快速扩展中。
-
目标端:MaxCompute、Hologres、DLF、MySQL、Milvus、OpenSearch、Elasticsearch 等,支持向量库写入,持续扩展中。
-
多模态文件:视频、音频、图片、文档(PDF/Word/PPT)、JSON/JSONL、CSV 等内容提取与处理。
全生命周期任务管控
-
本地校验:提交前自动校验 Spec 结构、算子参数及数据流链路,避免无效提交。
-
自动建表:目标表不存在时自动生成 DDL,支持 DEV + PROD 双环境覆盖。
-
周期调度:支持配置为周期性增量处理(如每小时处理新增多模态文件),自动替换调度变量。
-
任务克隆与编辑:一键克隆已有任务,在线编辑 Spec 并增量更新。
性能调优
-
CU 与并发可调:支持灵活调整 CU 和并发数,提升数据处理性能。
-
运行监控:支持查询运行统计(Token 消耗、处理进度)、查看日志、停止任务。
在体验过程中遇到任何问题?搜索钉钉群号:120490007577 加入【DataWorks数据集成Agent用户交流群】,产品专家在线答疑,助您快速上手,在群内分享您的体验 demo ,将有机会赢取惊喜礼品!
官方文档