hivePB级迁移方案

1、评估磁盘空间大小、调整副本数、设置heapsize大小

2、distcp -i -skipcrccheck 源端到目标端,迁移

3、元数据迁移,建表,替换location地址,或者导出db

4、表分区修复

5、配置增量T-1迁移或者T-2

6、校验历史分区脚本,表结构,大小,文件数

7、根据ditcp不对的,进行补数脚本,删分区,重拉

8、任务校验,客户跑完任务后,校验指定分区的count数和内容的md5

9、任务改造,如果md5不一样,说明此表需要做任务改造

10、任务改造,找到md5不同的那一条,对比原表和目标表的值,看哪个字段值不一样

11、二次校验任务

12、校验成功后,切任务,跑当天的数据。

注意如果删除了数据,需要删除分区,可以最后,去Hive源数据库关联每个表的分区和内容与源端比对,然后删除对应的分区,在整体Msck修复一下。

相关推荐
计算机毕设残哥3 小时前
【Spark+Hive+hadoop】人类健康生活方式数据分析
大数据·hive·hadoop·python·数据分析·spark·dash
心止水j8 小时前
hive的安装
数据仓库·hive·hadoop
大数据CLUB19 小时前
基于hive和mapreduce的地铁数据分析及可视化
大数据·hive·hadoop·分布式·数据分析·mapreduce
想去的远方19 小时前
hive调优系列-3.HQL语法和运行参数层面
大数据·数据仓库·hive·hadoop
想去的远方1 天前
hive调优系列-1.调优须知
大数据·数据仓库·hive·hadoop
嘉禾望岗5032 天前
hive架构及搭建
hive·hadoop·架构
孟意昶2 天前
Spark专题-第二部分:Spark SQL 入门(2)-算子介绍-Scan/Filter/Project
大数据·hive·分布式·sql·spark
Yuyang_Leo2 天前
Hive的优化:
数据仓库·hive·hadoop
boonya2 天前
Apache Hive 如何在大数据中发挥能量
hive·hadoop·apache
boonya2 天前
Apache Hive 能否脱离开Hadoop集群工作
hive·hadoop·apache