HIVE-17824,删除hdfs分区信息,清理metastore元数据

**当手动删除HDFS 分区数据时,但是并没有清理 Hive 中的分区元数据,删除操作无法自动更新hive分区表元数据。**也就是从hdfs中删除大量分区数据,并没有执行如下命令:

alter table drop partition commad

从hive 3.0.0开始可以使用MSCK的方法发现新分区或删除丢失的分区;

MSCK [REPAIR] TABLE table_name [ADD/DROP/SYNC PARTITIONS]

这种方式是在HIVE-17824中实现的。

若手动删除 HDFS 上多个分区文件夹,且快速刷新分区,则需要在存在external表执行如下操作:

  • 删除表(DROP TABLE table_name)

  • 重新创建表(CREATE EXTERNAL TABLE table_name ...)

  • 修复它(MSCK REPAIR TABLE table_name)

如果分区数量较多,需要执行的时间很长。另外一种解决方案是对每个已删除的分区文件夹使用ALTER TABLE DROP PARTITION (...),但如果删除了多个分区,这可能会很乏味。

用户可用修复表option选项运行metastore检查命令:

bash 复制代码
MSCK [REPAIR] TABLE table_name [ADD/DROP/SYNC PARTITIONS];

对于不存在元数据的分区,会更新到Hive metastore。

bash 复制代码
1.MSC命令的默认选项是"ADD PARTITIONS"。通过这个选项,它会将所有HDFS上存在但不存在metastore的分区添加到metastore中。
2.DROP PARTITIONS选项将从metastore中删除已经从HDFS中删除的分区信息。
3.SYNC PARTITIONS选项相当于同时调用ADD和DROP PARTITIONS。

详情请参阅HIVE-874和HIVE-17824。当有大量未跟踪的分区时,运行MSCK REPAIR TABLE批处理避免OOME(内存不足错误)。通过为属性hive.msck.repair.batch.size提供配置的批大小,它可以在内部的批中运行。属性的默认值是0,这意味着它将一次执行所有分区。

不带REPAIR选项的MSCK命令可用于查找元数据mismatch metastore的详细信息。

相关推荐
_清浅12 分钟前
大数据平台基础(Hadoop大数据原理与应用)
大数据·hadoop·分布式
The Sheep 202310 小时前
WPF自定义路由事件
大数据·hadoop·wpf
还是大剑师兰特19 小时前
Hadoop面试题及详细答案 110题 (86-95)-- Hadoop生态系统工具
hadoop·大剑师·hadoop面试题
yumgpkpm19 小时前
CMP (类Cloudera) CDP7.3(400次编译)在华为鲲鹏Aarch64(ARM)信创环境中的性能测试过程及命令
大数据·hive·hadoop·python·elasticsearch·spark·cloudera
Q264336502320 小时前
大数据实战项目-基于K-Means算法与Spark的豆瓣读书数据分析与可视化系统-基于python的豆瓣读书数据分析与可视化大屏
大数据·hadoop·机器学习·数据分析·spark·毕业设计·kmeans
大数据CLUB21 小时前
基于spark的抖音短视频数据分析及可视化
大数据·hadoop·分布式·数据分析·spark
yumgpkpm21 小时前
大数据综合管理平台(CMP)(类Cloudera CDP7.3)有哪些核心功能?
hive·hadoop·elasticsearch·zookeeper·big data
板凳坐着晒太阳1 天前
Hive 删除分区语句卡死问题
数据仓库·hive·hadoop
Q26433650231 天前
【有源码】基于Hadoop生态的大数据共享单车数据分析与可视化平台-基于Python与大数据的共享单车多维度数据分析可视化系统
大数据·hadoop·python·机器学习·数据分析·spark·毕业设计
计算机毕业设计木哥1 天前
计算机毕设选题推荐:基于Hadoop和Python的游戏销售大数据可视化分析系统
大数据·开发语言·hadoop·python·信息可视化·spark·课程设计