DataX从入门到精通 第1课 ETL之DataX 安装DataX

1、下载DataX源码

地址为https://github.com/alibaba/DataX.git

2、通过maven打包:

在DataX根目录执行打包命令

复制代码
mvn -U clean package assembly:assembly -Dmaven.test.skip=true

打包成功,日志显示如下:

INFO BUILD SUCCESS

INFO ------------------------------------------------------------------------

INFO Total time: 01:39 h

INFO Finished at: 2026-06-03T12:34:15+08:00

INFO ------------------------------------------------------------------------

3、DataX目录

打包成功后的DataX包位于 {DataX_source_code_home}/target/datax/datax/ ,结构如下:

4、配置示例:从stream读取数据并打印到控制台

1)第一步、创建作业的配置文件(json格式)

可以通过命令查看配置模板: python datax.py -r {YOUR_READER} -w {YOUR_WRITER},这里执行命令

复制代码
python datax.py -r streamreader -w streamwriter

2)根据模板配置json如下:

将stream2stream.json文件放到job目录下,内容如下:

复制代码
{
  "job": {
    "content": [
      {
        "reader": {
          "name": "streamreader",
          "parameter": {
            "sliceRecordCount": 10,
            "column": [
              {
                "type": "long",
                "value": "10"
              },
              {
                "type": "string",
                "value": "hello,你好,世界-DataX"
              }
            ]
          }
        },
        "writer": {
          "name": "streamwriter",
          "parameter": {
            "encoding": "UTF-8",
            "print": true
          }
        }
      }
    ],
    "setting": {
      "speed": {
        "channel": 5
       }
    }
  }
}

3)运行job

执行命令

复制代码
chcp 65001
python bin/datax.py ./job/stream2stream.json

出现乱码。

4)解决乱码

执行命令 chcp 65001后显示正常,如果不想每次都输 chcp 65001,可以写个批处理。

复制代码
chcp 65001
python bin/datax.py ./job/stream2stream.json

done!!!

下一篇文章将讲解DataX-Web安装部署。

相关推荐
RestCloud3 天前
ETL是什么?全域数据集成平台核心能力解析
数据仓库·etl·数据清洗·数据处理·etlcloud·数据集成工具
Gent_倪3 天前
万字详解:数据库、数据仓库、数据湖、湖仓一体
数据库·数据仓库·spark
Microsoft Word3 天前
把RAG从 “能跑” 做到上线
数据仓库·人工智能
Database_Cool_4 天前
数据仓库弹性扩缩容怎么实现?AnalyticDB MySQL 在线扩容 0 中断实战
数据库·数据仓库·mysql·阿里云
APItesterCris4 天前
电商口碑自动化监控方案:30 分钟搭建商品评论实时采集 + 情感分析系统(完整可运行代码)
大数据·运维·数据仓库·自动化
香山上的麻雀10086 天前
Hive内部表(MANAGED_TABLE)的“批量删除分区”特性详解
数据仓库·hive·hadoop
石像鬼₧魂石6 天前
【Y2Ksoft】贵阳枫叶控股ERP管理系统 —— 管业制造 · 全链路数字化 · 开箱即用
大数据·数据仓库·数据库开发·数据库架构
石像鬼₧魂石6 天前
钢结构ERP管理系统 —— 玻璃拟态 · 单文件HTML(系统为开发测试虚拟数据)
大数据·数据仓库·制造·数据库开发·数据库架构
jjjava2.08 天前
SpringMVC入门指南:从零掌握核心要点
数据仓库·hive·hadoop
Jay_Franklin8 天前
Python 数据处理工作流:marimo、PyCharm 与数据存储
开发语言·数据仓库·ide·python·pycharm·数据分析·开源