分布式ETL工具Sqoop实践

Mysql数据准备

1、在node02节点登录Mysql。

复制代码
mysql -uroot -proot

2、新建数据库testdb。

复制代码
create database testdb;

3、新建数据表ts。

复制代码
use testdb;
create table ts(id int, name varchar(10), age int, sex char(1));

4、向表中插入数据。

复制代码
insert into ts values(10001,'张三',18,'m');
insert into ts values(10002,'李四',20,'m');
insert into ts values(10003,'王小姐',18,'w');

Sqoop基本使用

1、查看MySQL中的所有数据库。

复制代码
sqoop list-databases --connect jdbc:mysql://node02:3306/ --username root --password root

2、在/root目录下新建sqoop_file目录用于存放作业配置文件。

复制代码
mkdir /root/sqoop

3、在/root/sqoop_file目录编写配置文件list_dbs.conf,减少重复参数配置。

复制代码
vim list_dbs.conf
# 添加以下内容
list-databases
--connect
jdbc:mysql://node02:3306/
--username
root
--password
root

4、使用配置文件启动sqoop作业。

复制代码
sqoop --options-file list_dbs.conf

5、查看testdb中所有表,使用非明文方式,手动输入密码。

复制代码
sqoop list-tables \
   --connect jdbc:mysql://node02:3306/testdb \
   --username root \
   -P

6、在Mysql中执行SQL并将结果展示在控制台。

复制代码
sqoop eval \
  --connect jdbc:mysql://node02:3306/testdb \
  --query "SELECT * FROM ts LIMIT 10" \
  --username root \
  -P

7、将testdb.ts表中所有数据全量导入到hdfs的/tmp/sqoop/testdb/ts目录中。

复制代码
sqoop import \
   --connect jdbc:mysql://node02:3306/testdb \
   --username root \
   --query "select * from ts where \$CONDITIONS" \
   --target-dir /tmp/sqoop/testdb/ts \
   --fields-terminated-by "," \
   --hive-drop-import-delims \
   --split-by id \
   -m 1\
   -P

8、查看最终结果。

复制代码
hadoop fs -ls /tmp/sqoop/testdb/ts
hadoop fs -cat /tmp/sqoop/testdb/ts/part-m-00000

9、在MySQL中新增一条数据。

复制代码
insert into ts values(10004,'张飞',28,'m');

9、使用append增量方式将新增数据导入到/tmp/sqoop/testdb/ts/目录中。

复制代码
sqoop import \
   --connect jdbc:mysql://node02:3306/testdb \
   --username root \
   --password root \
   --query "select * from ts where \$CONDITIONS" \
   --target-dir /tmp/sqoop/testdb/ts/ \
   --split-by id \
   -m 1  \
   --incremental append \
   --check-column id \
   --last-value 10003

11、查看导入结果。

复制代码
hadoop fs -ls /tmp/sqoop/testdb/ts
hadoop fs -cat /tmp/sqoop/testdb/ts/part-m-00001

Sqoop Job操作

将sqoop任务编写为sqoop job,能够减少每次作业执行前,进行的参数配置工作。

  1. 将增量导入任务制作为sqoop job。

    sqoop job --create im_ts
    -- import
    --connect jdbc:mysql://node02:3306/testdb
    --username root
    --password root
    --query "select * from ts where $CONDITIONS"
    --target-dir /tmp/sqoop/testdb/ts/
    --split-by id
    -m 1
    --incremental append
    --check-column id
    --last-value 10004

  2. 查看所有作业。

    sqoop job --list

  3. 查看指定作业的详细信息。

    sqoop job --show im_ts

  4. 在MySQL中新增数据。

    insert into ts values(10005,'赵子龙',27,'m');

  5. 运行作业,增量导入数据,这里需要手动输入数据库密码,Sqoop job默认不保存。

    sqoop job --exec im_ts

  6. 查看导入结果。

    hadoop fs -cat /tmp/sqoop/testdb/ts/part-m-00002

  7. 再次在MySQL中新增数据。

    insert into ts values(10006,'悟空',5000,'m');

  8. 运行作业,此时不需要手动修改--last-value,作业会自动根据上次的结果进行更新。

    sqoop job --exec im_ts

  9. 修改$SQOOP_HOME/conf/sqoop-site.xml配置文件,可以使sqoop job自动保存密码。

    <property> <name>sqoop.metastore.client.record.password</name> <value>true</value> <description>If true, allow saved passwords in the metastore. </description> </property>
相关推荐
R-sz14 小时前
使用Redisson实现同一业务类型串行执行的分布式锁方案,解决并发问题
分布式
哈哈哈笑什么19 小时前
蜜雪冰城1分钱奶茶秒杀活动下,使用分片锁替代分布式锁去做秒杀系统
redis·分布式·后端
哈哈哈笑什么20 小时前
高并发分布式Springcloud系统下,使用RabbitMQ实现订单支付完整闭环的实现方案(反向撤销+重试+补偿)
分布式·spring cloud·rabbitmq
哈哈哈笑什么21 小时前
分布式高并发Springcloud系统下的数据图同步断点续传方案【订单/商品/用户等】
分布式·后端·spring cloud
LDG_AGI21 小时前
【推荐系统】深度学习训练框架(十三):模型输入——《特征索引》与《特征向量》的边界
人工智能·pytorch·分布式·深度学习·算法·机器学习
回家路上绕了弯1 天前
多线程开发最佳实践:从安全到高效的进阶指南
分布式·后端
少许极端1 天前
Redis入门指南:从零到分布式缓存(一)
redis·分布式·缓存·微服务
爬山算法1 天前
Redis(161)如何使用Redis实现分布式锁?
数据库·redis·分布式
边缘计算社区1 天前
云边协同推理再突破:新型分布式解码框架吞吐量提升近 10%
分布式
大猫子的技术日记1 天前
[后端杂货铺]深入理解分布式事务与锁:从隔离级别到传播行为
分布式·后端·事务