【大数据面试题】012 谈谈 Hive 性能优化常用的方法

一步一个脚印,一天一道面试题

  • 数据分区和分桶:合适的分区和分桶能减少数据量的输入

  • 合适的数据格式:Parquet,ORC 是可以减少 I/O ,网络传输速率等的

  • 列裁剪:一般不要使用 SELECT *,只获取真正需要的列

  • 文件合并 :使用 INSERT OVERWRITE 可以减少小文件数量,提高效率

  • 数据过滤 :使用 WHERE 过滤,简单却有效

  • 并行度设置:合理的并行度设置可以更好的利用集群性能,否则可能会"有力使不出"或"杀鸡用牛刀"的情况

  • 数据本地化和 JOIN 化:尽量在本地节点做更多的操作,减少网络传输等开销,比如使用 mapjoin;

  • 定期收集统计信息ANALYZE TABLE 收集表的信息,可以让优化器更可能做出更好的查询计划;

相关推荐
诗旸的技术记录与分享8 分钟前
Flink-1.19.0源码详解10-Flink计算资源的申请与调度
大数据·flink
Lenyiin15 分钟前
makefile
java·大数据·前端
资深web全栈开发1 小时前
一文讲透 MySQL 崩溃恢复方案设计
大数据·人工智能
山峰哥1 小时前
现代 C++ 的最佳实践:从语法糖到工程化思维的全维度探索
java·大数据·开发语言·数据结构·c++
努力搬砖的咸鱼1 小时前
API 网关:微服务的大门卫
java·大数据·微服务·云原生
Xinstall渠道统计平台1 小时前
开发者怎么平衡变现模式与用户体验
大数据
金叶科技智慧农业2 小时前
科技如何守护每一株幼苗?苗情生态监测系统带来田间新视角
大数据·人工智能
TDengine (老段)3 小时前
人力减 60%:时序数据库 TDengine 助力桂冠电力实现 AI 智能巡检
java·大数据·数据库·人工智能·时序数据库·tdengine·涛思数据
TG:@yunlaoda360 云老大3 小时前
阿里云国际站代理商ECS跨境有什么优势呢?
大数据·阿里云·云计算
zhixingheyi_tian3 小时前
Hadoop 之 Uber 模式
大数据·hadoop·eclipse