DataX(DataX简介、部署、同步数据)

DataX(DataX简介、部署、同步数据)

☀快乐无限 法力无边

目录

DataX(DataX简介、部署、同步数据)

1.DataX简介

1)数据采集模块:

2)数据写入模块:

2.DataX部署

1)DataX下载解压

[2)自检 执行以下命令](#2)自检 执行以下命令)

3)自检报错

4)解决方法

3.hbase2mysql

4.MySQL2Hbase

5.Mysql2Phoenix

6.HDFS2Hbase

1.DataX简介

DataX 是一种用于大数据场景下的数据同步工具,主要用于数据迁移、数据同步等场景。它是阿里巴巴开发的一款开源数据同步工具,支持各种数据源之间的数据同步任务,包括但不限于关系型数据库、NoSQL 数据库、HDFS、Hive 等。DataX 主要包含两部分:

1)数据采集模块:

负责从不同的数据源中读取数据,并将数据传输给下游处理模块。支持的数据源包括 MySQL、Oracle、SQL Server、PostgreSQL、HDFS、Hive 等。

2)数据写入模块:

负责将采集到的数据写入到目标数据源中。同样支持多种目标数据源,包括 MySQL、Oracle、HDFS、Hive 等。

DataX 的设计理念是高效、易用、可扩展。它采用了插件化的设计思路,可以通过配置文件的方式实现各种数据源之间的数据同步任务,并且可以根据实际需求扩展新的数据源和数据处理功能。DataX 提供了丰富的插件库,用户可以根据自己的需求选择合适的插件来完成数据同步任务。

总的来说,DataX 是一个功能强大、灵活性高的数据同步工具,适用于各种大数据场景下的数据同步需求。

2.DataX部署

1)DataX下载解压

下载地址:

http://datax-opensource.oss-cn-hangzhou.aliyuncs.com/datax.tar.gz

解压datax.tar.gz到/usr/local/soft/

2)自检 执行以下命令
java 复制代码
python /usr/local/soft/datax/bin/datax.py /usr/local/soft/datax/job/job.json
3)自检报错

当我们执行上面的自检命令时 可能会出现以下报错信息

java 复制代码
DataX (DATAX-OPENSOURCE-3.0), From Alibaba !
Copyright (C) 2010-2017, Alibaba Group. All Rights Reserved.


2024-06-06 08:53:29.406 [main] WARN  ConfigParser - 插件[streamreader,streamwriter]加载失败,1s后重试... Exception:Code:[Common-00], Describe:[您提供的配置文件存在错误信息,请检查您的作业配置 .] - 配置信息错误,您提供的配置文件[/usr/local/soft/datax/plugin/reader/._drdsreader/plugin.json]不存在. 请检查您的配置文件.
2024-06-06 08:53:30.410 [main] ERROR Engine -

经DataX智能分析,该任务最可能的错误原因是:
com.alibaba.datax.common.exception.DataXException: Code:[Common-00], Describe:[您提供的配置文件存在错误信息,请检查您的作业配置 .] - 配置信息错误,您提供的配置文件[/usr/local/soft/datax/plugin/reader/._drdsreader/plugin.json]不存在. 请检查您的配置文件.
        at com.alibaba.datax.common.exception.DataXException.asDataXException(DataXException.java:26)
        at com.alibaba.datax.common.util.Configuration.from(Configuration.java:95)
        at com.alibaba.datax.core.util.ConfigParser.parseOnePluginConfig(ConfigParser.java:153)
        at com.alibaba.datax.core.util.ConfigParser.parsePluginConfig(ConfigParser.java:125)
        at com.alibaba.datax.core.util.ConfigParser.parse(ConfigParser.java:63)
        at com.alibaba.datax.core.Engine.entry(Engine.java:137)
        at com.alibaba.datax.core.Engine.main(Engine.java:204)
4)解决方法

删除plugin目录下的reader文件夹和writer文件夹下的 ._xxx 文件

再次执行自检命令

python /usr/local/soft/datax/bin/datax.py /usr/local/soft/datax/job/job.json

自检成功

3.hbase2mysql

4.MySQL2Hbase

5.Mysql2Phoenix

6.HDFS2Hbase

相关推荐
啃火龙果的兔子几秒前
Java 学习路线及学习周期
java·开发语言·学习
永霖光电_UVLED3 分钟前
Navitas 与 Cyient 达成合作伙伴关系,旨在推动氮化镓(GaN)技术在印度的普及
大数据·人工智能·生成对抗网络
跨境摸鱼4 分钟前
TikTok多账号风控:找对安全支点,解锁规模化运营
大数据·安全·矩阵·重构·跨境电商
梦里不知身是客115 分钟前
spark的统一内存管理机制
java·大数据·spark
Thexhy6 分钟前
CentOS7安装Redis全攻略
linux·经验分享·redis·学习
华阙之梦8 分钟前
【仅公网互通的 Spark 集群通信与配置实战方案】
大数据·ajax·spark
Evan芙8 分钟前
基于Nginx和Python的动态站点安装配置
数据库·python·nginx
大白的编程日记.8 分钟前
【计算网络学习笔记】TCP套接字介绍和使用
网络·笔记·学习
PS1232329 分钟前
桥梁与隧道安全守护者 抗冰冻型风速监测方案
大数据·人工智能
CES_Asia14 分钟前
资本赋能实体智能——2026 CES Asia机器人产业投资峰会定档北京
大数据·人工智能·microsoft·机器人