hivePB级迁移方案

我要用代码向我喜欢的女孩表白2025-02-28 16:20

1、评估磁盘空间大小、调整副本数、设置heapsize大小

2、distcp -i -skipcrccheck 源端到目标端，迁移

3、元数据迁移，建表，替换location地址，或者导出db

4、表分区修复

5、配置增量T-1迁移或者T-2

6、校验历史分区脚本，表结构，大小，文件数

7、根据ditcp不对的，进行补数脚本，删分区，重拉

8、任务校验，客户跑完任务后，校验指定分区的count数和内容的md5

9、任务改造，如果md5不一样，说明此表需要做任务改造

10、任务改造，找到md5不同的那一条，对比原表和目标表的值，看哪个字段值不一样

11、二次校验任务

12、校验成功后，切任务，跑当天的数据。

注意如果删除了数据，需要删除分区，可以最后，去Hive源数据库关联每个表的分区和内容与源端比对，然后删除对应的分区，在整体Msck修复一下。