Hive中parquet压缩格式分区表的跨集群迁移记录

文章目录

环境与需求

集群环境

华为FushionInsight A

华为FushionInsight B

华为集群管理机 local

Hive 3.1.0

HDFS 3.3.1

需求描述

华为A集群中将我们的数据迁移到华为B集群,其中数据经过华为集群管理机local跳转。

数据样例:分区表 外部表 .parquet压缩

操作步骤

STEP 1

记下表所在华为A集群的HDFS位置,使用命令desc formatted 'tablename';获取,如'hdfs://hacluster/user/hive/warehouse/bigdata.db/tablename'

记下建表语句,使用命令show create table 'tablename;'

STEP 2

查看表在华为A集群的HDFS占用空间,使用命令hdfs dfs -du -h 'hdfs://hacluster/user/hive/warehouse/bigdata.db/tablename',稍后将表大小记录,并判断存储是否满足要求。

STEP 3

STEP 2条件满足,使用命令hdfs dfs -get '粘贴在STEP 1中复制的位置',将表完整内容get到本地管理机local。

此时如果表存储过大,我们根据要迁移的表的分区进行get操作也可以,将对应分区名跟在位置后,如'hdfs://hacluster/user/hive/warehouse/bigdata.db/tablename/2023',一般表示2023年的分区。

STEP 4

在华为B集群中创建迁移的表,STEP 1中我们已经拿到了建表语句,需要修改位置:'hdfs://hacluster/user/hive/warehouse/bigdata.db/tablename',请修改位置为默认Hive默认数据库的位置。

STEP 5

将STEP 3 中的文件put到华为集群B的'hdfs://hacluster/user/hive/warehouse/bigdata.db/tablename/2023'目录下。

在华为集群B执行hdfs dfs -du -h hdfs://hacluster/user/hive/warehouse/bigdata.db/tablename,确认数据成功上传。

STEP 6

在建表语句中可以看到分区的字段date,再执行HQL语句alter table tablename add partition(date='2023')

相关推荐
isfox9 小时前
Google GFS 深度解析:分布式文件系统的开山之作
大数据·hadoop
鼠鼠我捏,要死了捏11 小时前
Hadoop NameNode内存泄漏与GC停顿问题排查与解决方案
hadoop·问题排查·jvm优化
嘉禾望岗50314 小时前
Yarn介绍与HA搭建
大数据·hadoop·yarn
IT研究室15 小时前
大数据毕业设计选题推荐-基于大数据的国家药品采集药品数据可视化分析系统-Spark-Hadoop-Bigdata
大数据·hadoop·信息可视化·spark·毕业设计·数据可视化·bigdata
Lx35215 小时前
Hadoop性能瓶颈分析:从JVM到磁盘IO的全链路优化
大数据·hadoop
DashingGuy16 小时前
数仓建模理论
数据仓库
BYSJMG18 小时前
计算机毕业设计选题:基于Spark+Hadoop的健康饮食营养数据分析系统【源码+文档+调试】
大数据·vue.js·hadoop·分布式·spark·django·课程设计
励志成为糕手19 小时前
Hadoop进程:深入理解分布式计算引擎的核心机制
大数据·hadoop·分布式·mapreduce·yarn
像豆芽一样优秀20 小时前
Hive和Flink数据倾斜问题
大数据·数据仓库·hive·hadoop·flink
计算机毕业设计木哥1 天前
计算机毕业设计 基于Python+Django的医疗数据分析系统
开发语言·hadoop·后端·python·spark·django·课程设计