Hive面试问题

1.hive如何自定义函数

2.hive优化

3.hive数据倾斜

1.数据倾斜的表现

数据倾斜是由于数据分布不均匀,造成数据大量的集中到一点,造成数据热点的现象。 主要表现:任务进度长时间维持在 99%或者 100%的附近,查看任务监控页面Yarn(8088),发现只有少量 reduce 子任务未完成,因为其处理的数据量和其他的 reduce 差异过大。 单一 reduce 处理的记录数和平均记录数相差太大,通常达到好几倍之多,最长时间远大于平均时长。

2.出现的原因

1)数据类型不一致造成数据倾斜

2)数据中出现大量的null值

3)单表group by 出现数据倾斜

第一种方案:使用参数优化

第二种方案:增加Reduce数量

4)多表join出现数据倾斜

解决方案一:使用参数解决

解决方案二:大小表join

解决方案三:大表大表join

4.hive中的mapjoin、commonjoin、smbjoin

5.datax同步数据的策略

相关推荐
闯闯桑1 小时前
Hive 中用于小文件合并的配置参数
数据仓库·hive·hadoop
月亮月亮要去太阳14 小时前
Hadoop、Hive、Spark的关系
hive·hadoop·spark
Dragon--Z19 小时前
本地部署Hive集群
数据仓库·hive·hadoop
Arbori_2621520 小时前
大数据 spark hive 总结
大数据·hive·spark
想做富婆1 天前
面试:hive的优化, 4个by, 存储过程和自定义函数
数据仓库·hive·hadoop
qq_257379591 天前
Sqoop和Hive数据仓库速查笔记
数据仓库·hive·sqoop
昨天今天明天好多天1 天前
【Hadoop】
大数据·hadoop·分布式
m0_748254881 天前
Python大数据可视化:基于Python的王者荣耀战队的数据分析系统设计与实现_flask+hadoop+spider
hadoop·python·flask
对许2 天前
Hadoop的运行模式
大数据·hadoop·分布式
向日葵花子(* ̄︶ ̄)2 天前
hive sql limit offset不起作用
hadoop