hive 刷新数据适用场景

sunxunyong2024-12-12 18:01

1、MSCK REPAIR TABLE

msck repair table 作用是检查HDFS目录下存在（不存在）但表的metastore中不存在（存在）的元数据信息，更新到metastore中。

MSCK适合一次导入很多分区，需要将这些分区都更新到元数据信息中！

每次执行msck repair这个命令，都会检查所有分区的目录是否在元数据中存在，如果是每次新增一个分区的任务,那么使用这个语句将会越来越耗费时间，

建议使用ALTER TABLE ADD PARTITION 命令。

2、REFRESH TABLE

REFRESH是用于重新整理某个分区的文件，重用之前的表元数据信息，能够检测到表的字段的增加或者减少。

主要用于表中元数据未修改，表的数据修改,例如INSERT INTO、LOAD DATA、ALTER TABLE ADD PARTITION、LLTER TABLE DROP PARTITION等