Hive难点

数据倾斜

在使用Hive进行大数据处理时,数据倾斜是一个常见的问题,它会导致计算资源的不均匀使用,从而影响整个作业的执行效率。数据倾斜通常发生在MapReduce计算框架的Map端和Reduce端,尤其是在Reduce阶段更为常见。数据倾斜的直观表现是任务进度长时间停留在99%,而实际上只有少数任务在运行,这些任务处理的数据量远大于其他任务

原因:

  • Key分布不均匀:某些key的数据量过大,导致这部分数据被分配到同一个Reduce任务上
  • 业务数据本身特性:业务数据中某些值的分布不均匀,如大量空值或特定值。
  • 表结构设计不合理:在建表时没有考虑到数据分布的均匀性。
  • 某些SQL语句本身就可能引起数据倾斜,如包含大量count(distinct)的语句。

解决方案:

  • 负载均衡:通过设置hive.groupby.skewindata=true,开启负载均衡,使得MapReduce进程生成额外的MR Job,从而达到负载均衡的目的。
  • 小表与大表的Join:使用MapJoin优化,将小表加载到内存中,避免Reduce阶段的数据倾斜。可以通过设置hive.auto.convert.join=true和hive.mapjoin.smalltable.filesize来自动开启MapJoin优化。
  • 空值处理:对于大量空值的情况,可以通过给空值分配随机的key值,将其分散到不同的Reduce任务中处理,从而避免数据倾斜。
  • 数据类型统一:确保Join操作中关联字段的数据类型一致,避免不同数据类型引起的数据倾斜。
  • Count Distinct优化:避免直接使用count(distinct)进行去重统计,可以通过其他方式替换,如使用子查询进行去重后再进行统计。
相关推荐
云器科技1 天前
无需CDP:基于现有数据仓库构建高效用户画像系统
数据仓库·湖仓一体·lakehouse·无需 cdp
xerthwis1 天前
HDFS:那座正在云化与解构的“古老高墙”
大数据·数据仓库·人工智能·hdfs·数据库开发·数据库架构
xerthwis2 天前
Hadoop:大数据世界的“古老基石”与“沉默的共生者”
大数据·人工智能·hadoop
yumgpkpm2 天前
Cloudera CDH5|CDH6|CDP7.1.7|CDP7.3|CMP 7.3的产品优势分析(在华为鲲鹏 ARM 麒麟KylinOS、统信UOS)
大数据·人工智能·hadoop·深度学习·spark·transformer·cloudera
ghgxm5202 天前
EXCEL使用VBA代码实现按条件查询数据库--简单实用
开发语言·数据仓库·笔记·excel·数据库开发
yumgpkpm2 天前
Hadoop如何用Flink支持实时数据分析需求
大数据·hadoop·分布式·hdfs·flink·kafka·cloudera
喻师傅3 天前
Hive 中 NULL 值在逻辑判断中的“陷阱”(踩坑复盘)
数据仓库·hive·hadoop
涤生大数据3 天前
放弃Canal后,我们用Flink CDC实现了99.99%的数据一致性
大数据·数据仓库·flink·大数据开发·flink cdc·数据开发·实时数据
jinxinyuuuus4 天前
订阅指挥中心:数据可移植性、Schema设计与用户数据主权
数据仓库·人工智能
老徐电商数据笔记4 天前
技术复盘第四篇:Kimball维度建模在电商场景的实战应用
大数据·数据仓库·技术面试