hivePB级迁移方案

1、评估磁盘空间大小、调整副本数、设置heapsize大小

2、distcp -i -skipcrccheck 源端到目标端,迁移

3、元数据迁移,建表,替换location地址,或者导出db

4、表分区修复

5、配置增量T-1迁移或者T-2

6、校验历史分区脚本,表结构,大小,文件数

7、根据ditcp不对的,进行补数脚本,删分区,重拉

8、任务校验,客户跑完任务后,校验指定分区的count数和内容的md5

9、任务改造,如果md5不一样,说明此表需要做任务改造

10、任务改造,找到md5不同的那一条,对比原表和目标表的值,看哪个字段值不一样

11、二次校验任务

12、校验成功后,切任务,跑当天的数据。

注意如果删除了数据,需要删除分区,可以最后,去Hive源数据库关联每个表的分区和内容与源端比对,然后删除对应的分区,在整体Msck修复一下。

相关推荐
IvanCodes3 小时前
九、HQL DQL七大查询子句
大数据·数据库·hive
火龙谷10 小时前
【hadoop】sqoop案例 hive->mysql
hive·hadoop·sqoop
IvanCodes2 天前
六、Hive 分桶
大数据·hive
IvanCodes2 天前
七、深入 Hive DDL:管理表、分区与洞察元数据
数据仓库·hive·hadoop
若兰幽竹2 天前
【HBase整合Hive】HBase-1.4.8整合Hive-2.3.3过程
数据库·hive·hbase
多多*3 天前
Java反射 八股版
java·开发语言·hive·python·sql·log4j·mybatis
yyf9601263 天前
hiveserver2与beeline进行远程连接hive配置及遇到的问题
数据仓库·hive
yyf9601263 天前
hive在配置文件中添加了hive.metastore.uris之后进入hive输入命令报错
hive
jiedaodezhuti3 天前
hive两个表不同数据类型字段关联引发的数据倾斜
数据仓库·hive·hadoop
IvanCodes3 天前
五、Hive表类型、分区及数据加载
大数据·数据仓库·hive