Hive的优化:

1、开启本地模式,这样可以缩短小任务和执行时间

2、使用explain关键字来分析sql语句,然后根据执行结果来对SQL语句进行动态的调整,其中explain只有对hql也就是Hive SQL的解释,而Explain extened 不仅可以对hql语句进行解释,还有抽象表达式树的生成

3、修改hive中的fetch操作为more,减少不必要的mr操作(比如查询某字段,limit,*)

4、开启sql的严格模式这样的话可以防止写的很烂的sql语句影响了集群

5、开启JVM的重新使用,这样的话JVM就可以执行多个Tesk任务,效率就会提升

6、分区、分桶以及压缩

7、根据computeSliteSize(Math.max(minsize,Math.min(maxsize,blocksize)))=blocksize=128M的公式,调整Max的最大值来设置合理的map数量,开启小文件的合并,以及设置相对合理的reucer数

8、因为hive每次执行只会执行一个阶段,而且阶段之间都不是串行的,所以可以通过设置并行执行,这样hive可以同时执行多个stage阶段,提高了效率

9、CBO优化也就是成本优化器,开启之后会将hive执行前的执行计划自动优化,让hive的效率更高,且该功能默认开启

10、谓词下推:简单来说就是将where条件提前给执行了,然后再关联表,这样数据量就变小了

先更新这十条,其他的后续会再补上

相关推荐
小欣加油1 天前
Hadoop开发环境搭建
大数据·数据库·hadoop
段一凡-华北理工大学1 天前
工业领域的Hadoop架构学习~系列文章01:Hadoop与工业4.0深度融合
大数据·hadoop·学习·架构·知识图谱·高炉炼铁·工业智能体
宽海智能仓储物流1 天前
从状态检查到数据备份:仓储PLC控制器保养周期与实操清单
大数据·数据仓库·自动化
A130160986712 天前
精准商机赋能,助力金融助贷业务拓展
大数据·数据仓库·人工智能·机器人·信息与通信
小欣加油2 天前
Hive综合应用案例——用户学历查询
数据仓库·hive·hadoop
至此流年莫相忘2 天前
CentOS 部署 Hadoop 环境指导文档
linux·hadoop·centos
yumgpkpm2 天前
Hadoop(CDH6、CDP7)在Qwen3.7大模型训练中的作用,(含部署、运行操作步骤)
大数据·hive·hadoop·分布式·zookeeper·spark·kafka
Irene19913 天前
正确停止 Sqoop 任务:yarn application -kill(直接 kill 进程会触发重启,且可能导致状态不一致)
hadoop·sqoop
南屹川3 天前
【大数据】大数据处理技术栈:从采集到分析的完整链路
大数据·人工智能·hadoop·flink·spark·数据处理
juniperhan4 天前
Flink 系列第25篇:Flink SQL 集成 Hive 实践:流批一体下的实时数仓利器
大数据·数据仓库·hive·分布式·sql·flink