sort shuffer 和 hash shuffer 图解对比
Hash Shuffle(Spark 1.x 已废弃)------ 文件数 = M * R

如果是:
1000 map * 1000 reduce = 100 万个文件
这就是 Hash Shuffle 最大问题:小文件爆炸。
sort shuffle

上图可见 data 下 p0 p1 p2各自连续存储,即reduce0过来拉p0内所有数据.


对比

Hash Shuffle:每个 map 为每个 reduce 写一个文件,小文件多。
Sort Shuffle:每个 map 写一个 data 文件和一个 index 文件,reduce 按 index 读取对应分区数据。
