Hive面试问题

1.hive如何自定义函数

2.hive优化

3.hive数据倾斜

1.数据倾斜的表现

数据倾斜是由于数据分布不均匀,造成数据大量的集中到一点,造成数据热点的现象。 主要表现:任务进度长时间维持在 99%或者 100%的附近,查看任务监控页面Yarn(8088),发现只有少量 reduce 子任务未完成,因为其处理的数据量和其他的 reduce 差异过大。 单一 reduce 处理的记录数和平均记录数相差太大,通常达到好几倍之多,最长时间远大于平均时长。

2.出现的原因

1)数据类型不一致造成数据倾斜

2)数据中出现大量的null值

3)单表group by 出现数据倾斜

第一种方案:使用参数优化

第二种方案:增加Reduce数量

4)多表join出现数据倾斜

解决方案一:使用参数解决

解决方案二:大小表join

解决方案三:大表大表join

4.hive中的mapjoin、commonjoin、smbjoin

5.datax同步数据的策略

相关推荐
磁场转动100万匹8 小时前
大数据入门:Hadoop 与 MapReduce 学习路线
大数据·hadoop·mapreduce
崖边看雾8 小时前
Hadoop —— HDFS 写数据流程
大数据·hadoop·hdfs
陈年老古董8 小时前
Python模拟MapReduce分治思想 | 从单文件统计到大文件拆分聚合 学习笔记
开发语言·hadoop·笔记·python·学习
崖边看雾9 小时前
Hadoop —— HDFS 读流程
大数据·hadoop·hdfs
磁场转动100万匹9 小时前
HDFS 与 MapReduce 核心原理详解
hadoop·hdfs·mapreduce
RestCloud17 小时前
飞书多维表格落地新思路:ETL做数据导入,豆包做业务智能分析
数据仓库·飞书·etl·数据传输·api对接·豆包
BYSJMG1 天前
计算机毕设选题推荐:基于大数据的公共交通运营数据分析与可视化,Spark+K-Means聚类城市运营模式
大数据·hadoop·信息可视化·数据分析·spark·kmeans·课程设计
Gl�ria1 天前
Hadoop MapReduce/Hive 数据倾斜完整排查
hive·hadoop·mapreduce
AgentMaster1 天前
元数据、血缘、质量、安全四大模块能力拆解,数据治理方案对比:4 种技术路线深度评测
大数据·数据库·数据仓库·人工智能·原型模式
Gl�ria1 天前
Hadoop Hive 和 YARN 的关系
数据仓库·hive·hadoop