spark sort shuffer 和 hash shuffer 图解对比

sort shuffer 和 hash shuffer 图解对比

Hash Shuffle(Spark 1.x 已废弃)------ 文件数 = M * R

如果是:

复制代码
1000 map * 1000 reduce = 100 万个文件

这就是 Hash Shuffle 最大问题:小文件爆炸

sort shuffle

上图可见 data 下 p0 p1 p2各自连续存储,即reduce0过来拉p0内所有数据.

对比

Hash Shuffle:每个 map 为每个 reduce 写一个文件,小文件多。

Sort Shuffle:每个 map 写一个 data 文件和一个 index 文件,reduce 按 index 读取对应分区数据。

相关推荐
AbandonForce1 小时前
简谈线程池
开发语言·c++·算法
智购科技智能售货柜1 小时前
2026自动售货机商品掉落声学计数方案:从麦克风到频谱识别的工程实践~YH
人工智能·算法
土司大王1 小时前
LeetCode hot100——实现 Trie (前缀树)
java·算法·leetcode
水龙吟啸2 小时前
华为研发岗AI方向9.9机考题复盘&分析
人工智能·python·算法·华为
小七在进步2 小时前
类和对象(一)
java·数据结构·算法
Y_Bk2 小时前
2026 ICPC EC网络预选赛第一场
算法
CarIise2 小时前
C语言字符串基础:从char数组到双指针反转算法
算法
佳児素花痴╮2 小时前
C++速通2
开发语言·c++·算法
麻瓜code2 小时前
【LeetCode】相交链表:双指针法,一次遍历找到交点
算法·leetcode·链表