检查HIVE分区是否连续

检查HIVE分区是否连续

我们经常可能会有这样的诉求,需要对一张目标表进行分区检查,查看是否存在不连续的情况,该诉求频繁且重要,因此以下语句可以实现我们的诉求

场景描述

我们有一张表,表名 t_user_info,分区字段 ds,分区字段数据类型 String,分区数据格式 yyyyMMdd

分区连续性检查语句

sql 复制代码
SELECT  ds
       ,rn
       ,date_sub(ds_format, rn)
FROM
(
    -- 对分区数据进行类型转换
    SELECT  ds
           ,from_unixtime(unix_timestamp(ds, 'yyyyMMdd'), 'yyyy-MM-dd') as ds_format
           ,row_number() over(order by ds asc) rn -- 排序分区,按照ds升序
    FROM
    (
       -- 获取表中的所有分区数据 
       SELECT  ds
       FROM t_user_info
       -- 指定分区检查的时间段
       WHERE ds between '20221231' and '20230924'
       group by ds
    ) ds_info
) diff_ds_info
limit 1000
;
相关推荐
Timer_Cooker1 天前
Hive Sum(null)编译报错分析
数据仓库·hive·hadoop
之歆2 天前
Hadoop MapReduce 详解
大数据·hadoop·mapreduce
沃达德软件3 天前
电信诈骗预警平台功能解析
大数据·数据仓库·人工智能·深度学习·机器学习·数据库开发
大数据基础3 天前
基于 Hadoop MapReduce + Spring Boot + Vue 3 的每日饮水数据分析平台
大数据·vue.js·hadoop·spring boot·数据分析·maven·mapreduce
workflower3 天前
多变量时间序列预测
java·hadoop·nosql·需求分析·big data·结对编程
docsz4 天前
Rocky Linux 9.4部署Hadoop 3.4.2 高可用集群
hadoop
AI_56784 天前
Hive SQL优化:分区表+分桶表提升查询效率
人工智能·hive·ai
礼拜天没时间.4 天前
Docker 部署分布式 Hadoop(超详细实战版)
linux·hadoop·分布式·docker·容器
莫叫石榴姐5 天前
数据开发需求工时如何评估?
大数据·数据仓库·人工智能·数据分析·产品运营
xutSwIpZotzM5 天前
量产HX711电子秤采集模块全套资料,包含原理图、PCB文件、BOM以及源码HEX,支持串口波...
hadoop