spark sort shuffer 和 hash shuffer 图解对比

sort shuffer 和 hash shuffer 图解对比

Hash Shuffle(Spark 1.x 已废弃)------ 文件数 = M * R

如果是:

复制代码
1000 map * 1000 reduce = 100 万个文件

这就是 Hash Shuffle 最大问题:小文件爆炸。

sort shuffle

上图可见 data 下 p0 p1 p2各自连续存储,即reduce0过来拉p0内所有数据.

对比

Hash Shuffle:每个 map 为每个 reduce 写一个文件,小文件多。

Sort Shuffle:每个 map 写一个 data 文件和一个 index 文件,reduce 按 index 读取对应分区数据。

相关推荐
longlongzihan5 小时前
LeetCode 17电话号码的字母组合:回溯算法(DFS)详解
c++·算法·leetcode·深度优先
封印师请假去地球钓鱼5 小时前
边解边变的问题:从“决策依赖“一词出发
人工智能·算法
今晚打老虎6 小时前
c++之提高A(前缀和)(第三课)
数据结构·c++·算法
不会就选b7 小时前
算法日常・每日刷题--<贪心>26
数据结构·算法
hetao17338378 小时前
2026-09-29 hetao1733837 的刷题记录
c++·算法
欣欣之王来了9 小时前
AI合规专项:AI算法透明度的合规要求
人工智能·算法
wzdark9 小时前
分块思想在算法优化中的实践与应用4
算法
Because_of_Her19 小时前
dfs-洪水填充技巧
笔记·算法·深度优先·洪水填充
小静AI工程实验室9 小时前
RSA 算法详解:从模幂原理到 OAEP 加密、PSS 签名与 Python 实验
python·算法
xzal1210 小时前
GESP Python笔记
笔记·python·算法