本题采用哈希表统计频次结合桶排序(Bucket Sort)算法解决前 K 个高频元素的查找问题。其核心本质是将元素出现频率抽象为桶数组的物理下标,利用频率的自然连续性与有序性实现无比较排序与线性检索。当前提供的源码实现了在时间复杂度 O(n) 和额外空间复杂度 O(n) 条件下的全局最优频次收集,最终走向是精准输出出现频率最高的前 k 个元素的集合。
一、 问题本质与数据模型
对于长度为 n 的整数数组 nums,题目要求找出出现频率最高的前 k 个元素。该问题面临两个核心数据特性与拓扑约束:
-
频次有界性:任何元素在数组中出现的频次必定处于整数区间 1, n 内,频次最大值不会超过数组物理长度 n。
-
频率到数值的单对多映射:不同数值的元素可能具有相同的出现频次,因此一个特定的频次可能对应一个或多个数值。
如果采用常规的排序算法对频次进行排序,时间复杂度至少为 O(n log n);如果使用优先队列(小顶堆),时间复杂度为 O(n log k)。这两种方法均未充分利用"频次上限受限于数组长度"这一重要的先验条件。
为了打破对数阶时间复杂度的限制,算法引入了"频次索引化桶模型"。首先利用哈希表在 O(n) 时间内完成元素到频次的映射统计;接着以"出现频次"作为物理数组的下标建立桶列表(即下标 i 的桶装载所有出现频次恰好为 i 的元素)。由于数组下标天然有序,算法只需从最高频次对应的桶开始逆序扫描并提取元素,直到凑齐 k 个元素为止,从而将 Top-K 检索的耗时降至线性阶。
二、 算法演进对比
在解决 Top-K 高频元素选择问题时,不同算法在时空开销及逻辑结构上存在如下差异:
| 解法名称 | 时间复杂度 | 空间复杂度 | 核心原理 | 物理瓶颈 / 缺陷 |
|---|---|---|---|---|
| 全排序法 | O(n log n) | O(n) | 哈希表统计频次后,对频次数组执行快速排序或归并排序 | 完全忽略了频次的有界性,对所有不同元素进行了非必要的全量排序 |
| 小顶堆法 (Min-Heap) | O(n log k) | O(n) | 哈希表统计频次,维护大小为 k 的小顶堆,遍历频次并实时维护堆顶 | 堆调整操作引入了 log k 因子,在 k 较大时性能不如线性解法 |
| 桶排序法(当前解法) | O(n) | O(n) | 以频次作为数组下标构建桶,逆序扫描收集前 k 个高频元素 | 需要根据最大频次开辟额外的桶空间,但在时间效率上达到了理论下界 |
三、 核心分支控制逻辑与决策证明
当前源码的控制流完全依赖于哈希表频次搜集、动态桶初始化以及逆序双重循环提取,其内部决策分支证明如下:
1. 频次分布搜集:map.put(num, map.getOrDefault(num, 0) + 1)
-
执行:遍历原数组 nums,将元素作为 key,出现次数作为 value 存入哈希表。
-
物理意义:完成全局频次的线性收集,将无序的原始数组归纳为非重复元素的频次映射集合。
2. 动态桶边界开辟:int max = Collections.max(...) 与 buckets 初始化
-
执行:获取哈希表中的最大频次 max,并实例化大小为 max + 1 的列表数组。
-
数学证明:最大频次 max 明确了桶数组的上限。开辟 max + 1 个桶可以确保索引范围涵盖 0, max,避免开辟多余的空桶,同时防止数组下标越界(ArrayIndexOutOfBoundsException)。
3. 频次到桶的归类映射:buckets.get(e.getValue()).add(e.getKey())
-
执行 :遍历哈希表的键值对,将元素数值
e.getKey()放入索引为频次e.getValue()的桶中。 -
数学证明:利用数组下标作为隐式的排序依据,将频次相同的元素归入同一个动态列表中,实现了无比较操作下的频次分组归类。
4. 逆序高频提取控制:for (int i = max; j < k; i--)
-
执行:从最高频次下标 max 开始向 0 递减扫描,依次提取桶内的元素写入结果数组 ans,当提取元素总量达到 k 时停止。
-
数学证明 :因为数组下标按自然数严格递增,从 max 开始倒序扫描优先保证了被访问到的元素具备更高的出现频率。外层循环判断
j < k确保了一旦收集满 k 个元素便立即触发终止,完成了 Top-K 集合的构建。
四、 算法执行状态机步进示例
以输入数组 nums = [1, 1, 1, 2, 2, 3],k = 2 为例(规模 n = 6),状态机的演进过程如下表所示:
| 步骤 | 处理逻辑 / 状态阶段 | 内部变量状态 | 作用与物理状态说明 |
|---|---|---|---|
| 初始 | 频次统计 | map = {1: 3, 2: 2, 3: 1} |
完成全图频次映射,不同元素种数为 3 |
| 1 | 桶容量测算与创建 | max = 3, 建立 4 个空桶 buckets[0...3] |
确定频次天花板为 3,准备分配元素 |
| 2 | 元素入桶分装 | buckets[1] = [3] buckets[2] = [2] buckets[3] = [1] |
元素依频次归类:3 出现 1 次,2 出现 2 次,1 出现 3 次 |
| 3 | 逆序提取 (i = 3) | 访问 buckets[3],提取元素 1 ans[0] = 1, j = 1 |
提取最高频元素 1,当前已收集 1 个元素(未满 k = 2) |
| 4 | 逆序提取 (i = 2) | 访问 buckets[2],提取元素 2 ans[1] = 2, j = 2 |
提取次高频元素 2,当前已收集 2 个元素(满足 j == k) |
| 终止 | 退出循环并返回 | 返回结果 ans = [1, 2] |
条件 j < k 不再满足,提取终止,输出最终结果 |
五、 源码实现
import java.util.ArrayList;
import java.util.Collections;
import java.util.HashMap;
import java.util.List;
import java.util.Map;
class Solution {
public int[] topKFrequent(int[] nums, int k) {
// 第一阶段:使用哈希表统计数组中各个元素的出现频次
Map<Integer, Integer> map = new HashMap<>();
for (int num : nums) {
map.put(num, map.getOrDefault(num, 0) + 1);
}
// 第二阶段:获取最大频次,用于精准开辟桶数组的物理边界
int max = Collections.max(map.values());
List<List<Integer>> buckets = new ArrayList<>();
for (int i = 0; i <= max; i++) {
buckets.add(new ArrayList<>());
}
// 第三阶段:以频次为下标,将元素归类装入对应的桶中
for (Map.Entry<Integer, Integer> e : map.entrySet()) {
buckets.get(e.getValue()).add(e.getKey());
}
// 第四阶段:从最高频次的桶开始逆序收集元素,直到凑齐 k 个高频元素
int[] ans = new int[k];
int j = 0;
for (int i = max; j < k; i--) {
for (int x : buckets.get(i)) {
ans[j] = x;
j++;
// 边界保护:若已经收集满 k 个元素,直接中断当前桶的遍历
if (j == k) {
break;
}
}
}
return ans;
}
}
六、 复杂度分析
1. 时间复杂度:O(n)
-
分析:
-
哈希表统计:遍历长度为 n 的数组 nums,每次哈希表读写为常数阶 O(1),耗时 O(n)。
-
确定最大值与初始化桶:哈希表中不同元素的数量记为 m(m <= n)。求解 max 耗时 O(m),创建 max + 1 个桶耗时 O(max)。由于 max <= n,此阶段耗时不超过 O(n)。
-
填充桶与逆序收集:遍历 m 个键值对充填桶耗时 O(m)。逆序扫描桶时,外层循环执行次数为 max,内层循环遍历桶内元素。因为所有桶中累加的元素总数恰好等于 m,所以内层循环在整个过程中累计执行次数仅为 m 次。
-
-
结论:算法各项操作的时间消耗均为线性阶,整体时间复杂度严格收敛于 O(n),完全优于 O(n log n) 的要求。
2. 空间复杂度:O(n)
-
分析:算法申请的额外物理内存主要来自于哈希表和桶结构。哈希表中最多装载 m 个独立键值对,空间复杂度为 O(m);桶列表中包含 max + 1 个 List 对象,且所有 List 中装载的元素总量为 m,空间复杂度为 O(max + m)。因为 m <= n 且 max <= n,两部分空间消耗之和与 n 呈线性正比关系。
-
结论:整体额外空间复杂度定性为 O(n)。