408 数据结构|外部排序优化:怎么减少时间开销

对应章节:排序 → 外部排序优化

1. 外部排序时间花在哪里

外部排序时间主要包括:

复制代码
读写外存时间
+
内部排序时间
+
内部归并时间

其中最关键的一般是:

复制代码
外存 I/O

因为磁盘读写比内存运算慢得多。

2. 优化方向一:增大归并路数 k

归并趟数:

复制代码
S = ceil(log_k r)

所以:

复制代码
k 越大
→ 每趟合并更多归并段
→ 归并趟数越少

例如:

复制代码
r=16

2路归并:
16 → 8 → 4 → 2 → 1
共4趟

4路归并:
16 → 4 → 1
共2趟

3. 增大 k 的代价

不能无限增大。

代价1:占更多内存

k 路归并需要:

复制代码
k个输入缓冲区 + 1个输出缓冲区

所以:

复制代码
k越大
→ 内存需求越大

代价2:选最小记录更麻烦

如果直接从 k 个候选记录中选最小值:

复制代码
一次选择大约需要 k-1 次关键字比较

因此:

复制代码
k越大
→ 直接比较的成本越高

4. 优化方向二:减小初始归并段数量 r

因为:

复制代码
S = ceil(log_k r)

所以:

复制代码
r越小
→ 归并趟数越少
→ 外存读写次数越少

5. 为什么"少一趟"很重要

每一趟归并通常都要:

复制代码
把数据从外存读入
↓
完成归并
↓
再写回外存

所以多一趟,就意味着又多一轮大规模磁盘读写。

6. 做题时直接这样反应

看到:

复制代码
减少归并趟数

想到:

复制代码
增大 k
减小 r

看到:

复制代码
k路归并

想到:

复制代码
k个输入缓冲区
1个输出缓冲区

看到:

复制代码
增大k的代价

想到:

复制代码
更多缓冲区
更多候选记录比较

7. 一句话速记

复制代码
外部排序想变快:
核心是减少归并趟数

减少归并趟数:
增大k
或
减小r
相关推荐
小白说大模型1 小时前
Hermes 全配置指南:从裸版到 AI Agent 天花板
大数据·人工智能·学习·算法·机器学习·数据挖掘
a187927218311 小时前
【算法】动态规划入门:从打家劫舍到状态设计的三堂课
算法·leetcode·动态规划·dp·回溯·暴力
淡海水11 小时前
07-04-并发-ConcurrentBag-T-工作窃取WorkStealing算法
开发语言·算法·c#·bag·concurrent·workstealing
leobertlan11 小时前
好玩系列:训练一个神经网络模型指导小孩玩游戏2-大局观教练
算法
Tisfy12 小时前
LeetCode 3876.构造奇偶一致的数组 II:三种情况分类讨论(其实还是脑筋急转弯)
算法·leetcode·题解·脑筋急转弯
乐迪信息12 小时前
智慧港口船舶AI算法实现在线状态监测
大数据·人工智能·深度学习·算法·计算机视觉
kiracrimson13 小时前
从缓存的角度看链表与线性表的差异
数据结构·链表·缓存
木井巳14 小时前
【BFS/DFS 解决 FloodFill 算法】太平洋大西洋水流问题
java·算法·leetcode·深度优先·广度优先·宽度优先·推荐算法
心抵鹊14 小时前
归并排序之翻转对(hard)
数据结构·算法