【大数据面试题】012 谈谈 Hive 性能优化常用的方法

一步一个脚印,一天一道面试题

  • 数据分区和分桶:合适的分区和分桶能减少数据量的输入

  • 合适的数据格式:Parquet,ORC 是可以减少 I/O ,网络传输速率等的

  • 列裁剪:一般不要使用 SELECT *,只获取真正需要的列

  • 文件合并 :使用 INSERT OVERWRITE 可以减少小文件数量,提高效率

  • 数据过滤 :使用 WHERE 过滤,简单却有效

  • 并行度设置:合理的并行度设置可以更好的利用集群性能,否则可能会"有力使不出"或"杀鸡用牛刀"的情况

  • 数据本地化和 JOIN 化:尽量在本地节点做更多的操作,减少网络传输等开销,比如使用 mapjoin;

  • 定期收集统计信息ANALYZE TABLE 收集表的信息,可以让优化器更可能做出更好的查询计划;

相关推荐
雪碧聊技术20 分钟前
中国可重复使用火箭首次成功着陆——航天“降本时代”正式开启
大数据·人工智能
Geoffwo1 小时前
通用动作意念脑电信号高度相似的理论依据
大数据·人工智能
科技圈快迅1 小时前
新工科保研机构怎么选?垂直辅导与综合型服务模式差异解析
大数据·人工智能
大模型丫丫1 小时前
Agent开发的难点是什么呢?
大数据·人工智能·学习
在深圳创业的何仙姑2 小时前
2026 深圳跨境财税服务商筛选参考|行业风险规避实操指南
大数据·人工智能·跨境电商·财税
大模型丫丫2 小时前
Skill-Agent 如何实践:从概念到落地的完整指南
java·大数据·人工智能
问商十三载2 小时前
2026大模型GEO优化体系:3层链路提收录,零成本提34%引用率附工具包
大数据·前端·人工智能
qiten_0072 小时前
LangChain核心组件深入理解第四篇 -- Tool Agent运行的手和脚
大数据·人工智能·langchain
数智化管理手记2 小时前
全面预算管理执行偏差大?全面预算管理全流程落地步骤是什么
大数据·网络·数据库·人工智能·数据挖掘
大模型码小白3 小时前
Milvus 架构设计:从向量索引到分布式检索,AI 原生存储引擎的内部机制
java·大数据·人工智能·分布式·深度学习·milvus