Hive面试问题

1.hive如何自定义函数

2.hive优化

3.hive数据倾斜

1.数据倾斜的表现

数据倾斜是由于数据分布不均匀,造成数据大量的集中到一点,造成数据热点的现象。 主要表现:任务进度长时间维持在 99%或者 100%的附近,查看任务监控页面Yarn(8088),发现只有少量 reduce 子任务未完成,因为其处理的数据量和其他的 reduce 差异过大。 单一 reduce 处理的记录数和平均记录数相差太大,通常达到好几倍之多,最长时间远大于平均时长。

2.出现的原因

1)数据类型不一致造成数据倾斜

2)数据中出现大量的null值

3)单表group by 出现数据倾斜

第一种方案:使用参数优化

第二种方案:增加Reduce数量

4)多表join出现数据倾斜

解决方案一:使用参数解决

解决方案二:大小表join

解决方案三:大表大表join

4.hive中的mapjoin、commonjoin、smbjoin

5.datax同步数据的策略

相关推荐
莫叫石榴姐2 小时前
SQL百题斩:从入门到精通,一站式解锁数据世界
大数据·数据仓库·sql·面试·职场和发展
IT森林里的程序猿6 小时前
基于Hadoop的京东电商平台手机推荐系统的设计与实现
大数据·hadoop·智能手机
秃头菜狗7 小时前
十四、运行经典案例 wordcount
大数据·linux·hadoop
Java战神7 小时前
Hadoop
大数据·hadoop·分布式
lifallen10 小时前
从Apache Doris 学习 HyperLogLog
java·大数据·数据仓库·算法·apache
doll ~CJ12 小时前
数据仓库与数据挖掘基础知识
数据仓库·数据挖掘
智海观潮13 小时前
HBase高级特性、rowkey设计以及热点问题处理
大数据·hadoop·hbase
数据要素X1 天前
寻梦数据空间 | 架构篇:从概念到落地的技术实践与突破性创新
大数据·运维·数据仓库·微服务·数据治理·数据中台·可信数据空间
MeyrlNotFound1 天前
Hadoop YARN 与 MapReduce 基础关系及 YARN 核心架构细化解析
hadoop·架构·mapreduce
IT学长编程1 天前
计算机毕业设计 基于EChants的海洋气象数据可视化平台设计与实现 Python 大数据毕业设计 Hadoop毕业设计选题【附源码+文档报告+安装调试】
大数据·hadoop·python·毕业设计·课程设计·毕业论文·海洋气象数据可视化平台