多模态数据处理,从写第一行代码开始。
Daft 算子市场公测来了!开箱即用的 AI 算子,覆盖 视频 / 图片 / 文本 / 音频 四大场景,搭配 Qwen3.7 大模型,零成本跑通 AI 数据处理全流程。
以训练一个能理解厨房操作的智能机器人为例,我们通常需要采集数千小时由人类佩戴摄像头拍摄的操作视频。然而,当这些视频被解码后,往往会膨胀为数亿张图像帧。更棘手的是,原始数据中充斥着静止画面、模糊镜头和无效空帧等海量"噪音"。如何从这些冗余信息中高效提取出高质量训练样本,已成为多模态技术发展的核心瓶颈。
本次实战将带您深入这一典型场景,借助 Daft 算子市场,一步步拆解并跑通从视频抽帧、数据清洗到高质量样本提取的完整链路。
🚀 10 分钟完成 demo,超简单
场景介绍:
该 Demo 面向多模态数据处理场景,将对第一视角视频进行分布式抽帧与去黑边处理,并调用 Qwen3.7-plus 多模态大模型精准识别每帧的手部交互动作,并在 Notebook 中直观呈现图文对应的动作分析结果。
EMR Serverless Daft 如何简化多模态数据处理:视频抽帧、清洗、标注全流程与具身智能实践:developer.aliyun.com/article/174...
视频讲解:
前提条件:
-
阿里云账号,开通创建 EMR Serverless Spark Workspace 和 OSS Bucket
-
已开通 EMR Serverless Spark AI 中心。
请进入 Serverless Spark 的工作空间 - AI中心,点击 "开通 AI 中心"

-
Spark 工作空间按量配额上限>20 CU


-
Spark 工作空间队列弹性并发上限>20 CU

操作步骤:
Step 1 · 下载 daft_demo.ipynb 文件,并导入您的 Spark workspace 中

Step 2 · 下载要处理的视频到本地,并上传到您的 OSS Bucket
注意:请确保您的 spark workspace 与 OSS Bucket 属于同一个 region。
Step 3 · 替换 daft_demo.ipynb 代码中的路径变量
yaml
# 抽帧之后的图片会放到该目录,<请替换为您的 oss 输入视频,以及输出目录>
INPUT_VIDEO
=
"oss://apsara-demo/dataset/P01_101_part012_299.40s_310.00s.mp4"
OUTPUT_DIR
=
"oss://apsara-demo/dataset/daft-output/"
Step 4 · 在 Spark Workspace 中,创建 Notebook Session,并运行 daft_demo notebook

注:选择 esr 版本为为 esr-4.9.0 (Spark 3.5.2, Scala 2.12, Ray 2.55.1, Daft 0.7.17)
运行效果图:

算子市场免费公测窗口
2026 年 8 月 31 日 --- 9 月 30 日
公测期间算子调用 Qwen3.7 模型 免费,无其他额外 token 费用!
⚠️ 公测须知
公测期间 SparkSQL AI Function、Daft Local、Daft on Ray 运行环境中的算子及 Qwen3.7 模型调用均免费。公测结束后按实际使用量计费,具体标准会在结束前公布,不用担心突然扣费。
公测期间不保障 SLA,但服务不降级,放心用就好。请遵守阿里云数据安全规范,不要上传敏感数据哦。
🔥 立即参与
👉 登录 EMR Serverless Spark 控制台,进入 Spark Workspace,开始你的第一个算子任务吧!