hivePB级迁移方案

1、评估磁盘空间大小、调整副本数、设置heapsize大小

2、distcp -i -skipcrccheck 源端到目标端,迁移

3、元数据迁移,建表,替换location地址,或者导出db

4、表分区修复

5、配置增量T-1迁移或者T-2

6、校验历史分区脚本,表结构,大小,文件数

7、根据ditcp不对的,进行补数脚本,删分区,重拉

8、任务校验,客户跑完任务后,校验指定分区的count数和内容的md5

9、任务改造,如果md5不一样,说明此表需要做任务改造

10、任务改造,找到md5不同的那一条,对比原表和目标表的值,看哪个字段值不一样

11、二次校验任务

12、校验成功后,切任务,跑当天的数据。

注意如果删除了数据,需要删除分区,可以最后,去Hive源数据库关联每个表的分区和内容与源端比对,然后删除对应的分区,在整体Msck修复一下。

相关推荐
IT成长日记3 小时前
【Hive入门】Hive分区与分桶深度解析:优化查询性能的关键技术
数据仓库·hive·hadoop·分区·分桶
Faith_xzc4 小时前
Hive 数据同步到 Doris 最佳实践方案:从场景适配到性能调优全解析
大数据·数据仓库·hive·hadoop·doris
酷爱码4 小时前
hive默认的建表格式
数据仓库·hive·hadoop
Hadoop_Liang4 小时前
Hive 多表查询案例
数据仓库·hive·hadoop
和算法死磕到底1 天前
ubantu18.04(Hadoop3.1.3)Hive3.1.2安装指南
大数据·数据库·hive·hadoop·mysql·hdfs·dubbo
IT成长日记2 天前
【Hive入门】Hive架构与组件深度解析:从核心组件到生态协同
hive·hadoop·架构·架构与组件
D愿你归来仍是少年3 天前
使用 PySpark 批量清理 Hive 表历史分区
大数据·数据仓库·hive·spark
大肚晓东3 天前
DBeaver连接hive
hive
火龙谷7 天前
【hive】Hive对数据库,对表的操作(一)
数据库·hive·hadoop
houzhizhen7 天前
Hive null safe的用法
hive