Hive 中 sort by 和 order by 的区别

order by会对输入做全局排序,因此只有1个reducer(多个reducer无法保证全局有序),会导致当输入规模较大时,需要较长的计算时间。

sort by不是全局排序,其在数据进入 reducer 前完成排序。

因此,如果用 sort by 进行排序,并且设置 mapred.reduce.tasks>1, 则 sort by 只保证每个 reducer 的输出有序,不保证全局有序


我们下期见,拜拜!

相关推荐
橘子编程2 天前
Hive大数据实战指南:从入门到精通
大数据·hive·hadoop
橘子编程3 天前
Apache Hadoop知识全解析
大数据·hive·hadoop·apache
dovens3 天前
Spring Boot 从 2.7.x 升级到 3.3注意事项
数据库·hive·spring boot
Joy T5 天前
【大数据】离线数仓核心组件:Hive 架构解析与进阶操作指南
大数据·数据仓库·hive·hadoop·架构
jasnet_u5 天前
在Hadoop3.3.6上搭建Hive3.1.2
hive·hadoop
二进制_博客6 天前
使用Datax批量将mysql数据导入hive
数据库·hive·mysql
talen_hx2966 天前
《零基础入门Spark》学习笔记 Day 10
大数据·hive·笔记·学习·spark
二进制_博客6 天前
Spark On Hive 系统整合
大数据·hive·spark
蓝眸少年CY10 天前
Hive - 函数、压缩与优化
数据仓库·hive·hadoop
zhojiew13 天前
[INFRA] EMR集群中Hive和Spark集成Glue Data Catalog过程的深入分析
hive·hadoop·spark·aws·bigdata