hivePB级迁移方案

1、评估磁盘空间大小、调整副本数、设置heapsize大小

2、distcp -i -skipcrccheck 源端到目标端,迁移

3、元数据迁移,建表,替换location地址,或者导出db

4、表分区修复

5、配置增量T-1迁移或者T-2

6、校验历史分区脚本,表结构,大小,文件数

7、根据ditcp不对的,进行补数脚本,删分区,重拉

8、任务校验,客户跑完任务后,校验指定分区的count数和内容的md5

9、任务改造,如果md5不一样,说明此表需要做任务改造

10、任务改造,找到md5不同的那一条,对比原表和目标表的值,看哪个字段值不一样

11、二次校验任务

12、校验成功后,切任务,跑当天的数据。

注意如果删除了数据,需要删除分区,可以最后,去Hive源数据库关联每个表的分区和内容与源端比对,然后删除对应的分区,在整体Msck修复一下。

相关推荐
桂成林6 小时前
Hive UDF 开发实战:MD5 哈希函数实现
hive·hadoop·哈希算法
王小王-1231 天前
基于Hadoop的餐饮大数据分析系统的设计与实现
hive·hadoop·flask·sqoop·pyecharts·hadoop餐饮大数据分析·hadoop美食数据分析
張萠飛11 天前
hive集群优化和治理常见的问题答案
数据仓库·hive·hadoop
fpcc13 天前
c++26新功能—hive容器
c++·hive
liuze40815 天前
在VMware虚拟机集群中,完成Hive的安装部署
数据仓库·hive·hadoop
雷神乐乐15 天前
Hive优化详细讲解
数据仓库·hive·hadoop
Edingbrugh.南空15 天前
Hudi 与 Hive 集成
数据仓库·hive·hadoop
Edingbrugh.南空16 天前
Hive集成Paimon
数据仓库·hive·hadoop
雷神乐乐16 天前
Hive的分区表(静态分区、动态分区)、分桶表、四种排序方式和数据加载方式
数据仓库·hive·hadoop
Edingbrugh.南空17 天前
SeaTunnel与Hive集成
数据仓库·hive·hadoop