hot100 前 K 个高频元素(347)

本题采用哈希表统计频次结合桶排序(Bucket Sort)算法解决前 K 个高频元素的查找问题。其核心本质是将元素出现频率抽象为桶数组的物理下标,利用频率的自然连续性与有序性实现无比较排序与线性检索。当前提供的源码实现了在时间复杂度 O(n) 和额外空间复杂度 O(n) 条件下的全局最优频次收集,最终走向是精准输出出现频率最高的前 k 个元素的集合。

一、 问题本质与数据模型

对于长度为 n 的整数数组 nums,题目要求找出出现频率最高的前 k 个元素。该问题面临两个核心数据特性与拓扑约束:

  • 频次有界性:任何元素在数组中出现的频次必定处于整数区间 1, n 内,频次最大值不会超过数组物理长度 n。

  • 频率到数值的单对多映射:不同数值的元素可能具有相同的出现频次,因此一个特定的频次可能对应一个或多个数值。

如果采用常规的排序算法对频次进行排序,时间复杂度至少为 O(n log n);如果使用优先队列(小顶堆),时间复杂度为 O(n log k)。这两种方法均未充分利用"频次上限受限于数组长度"这一重要的先验条件。

为了打破对数阶时间复杂度的限制,算法引入了"频次索引化桶模型"。首先利用哈希表在 O(n) 时间内完成元素到频次的映射统计;接着以"出现频次"作为物理数组的下标建立桶列表(即下标 i 的桶装载所有出现频次恰好为 i 的元素)。由于数组下标天然有序,算法只需从最高频次对应的桶开始逆序扫描并提取元素,直到凑齐 k 个元素为止,从而将 Top-K 检索的耗时降至线性阶。

二、 算法演进对比

在解决 Top-K 高频元素选择问题时,不同算法在时空开销及逻辑结构上存在如下差异:

解法名称 时间复杂度 空间复杂度 核心原理 物理瓶颈 / 缺陷
全排序法 O(n log n) O(n) 哈希表统计频次后,对频次数组执行快速排序或归并排序 完全忽略了频次的有界性,对所有不同元素进行了非必要的全量排序
小顶堆法 (Min-Heap) O(n log k) O(n) 哈希表统计频次,维护大小为 k 的小顶堆,遍历频次并实时维护堆顶 堆调整操作引入了 log k 因子,在 k 较大时性能不如线性解法
桶排序法(当前解法) O(n) O(n) 以频次作为数组下标构建桶,逆序扫描收集前 k 个高频元素 需要根据最大频次开辟额外的桶空间,但在时间效率上达到了理论下界

三、 核心分支控制逻辑与决策证明

当前源码的控制流完全依赖于哈希表频次搜集、动态桶初始化以及逆序双重循环提取,其内部决策分支证明如下:

1. 频次分布搜集:map.put(num, map.getOrDefault(num, 0) + 1)

  • 执行:遍历原数组 nums,将元素作为 key,出现次数作为 value 存入哈希表。

  • 物理意义:完成全局频次的线性收集,将无序的原始数组归纳为非重复元素的频次映射集合。

2. 动态桶边界开辟:int max = Collections.max(...)buckets 初始化

  • 执行:获取哈希表中的最大频次 max,并实例化大小为 max + 1 的列表数组。

  • 数学证明:最大频次 max 明确了桶数组的上限。开辟 max + 1 个桶可以确保索引范围涵盖 0, max,避免开辟多余的空桶,同时防止数组下标越界(ArrayIndexOutOfBoundsException)。

3. 频次到桶的归类映射:buckets.get(e.getValue()).add(e.getKey())

  • 执行 :遍历哈希表的键值对,将元素数值 e.getKey() 放入索引为频次 e.getValue() 的桶中。

  • 数学证明:利用数组下标作为隐式的排序依据,将频次相同的元素归入同一个动态列表中,实现了无比较操作下的频次分组归类。

4. 逆序高频提取控制:for (int i = max; j < k; i--)

  • 执行:从最高频次下标 max 开始向 0 递减扫描,依次提取桶内的元素写入结果数组 ans,当提取元素总量达到 k 时停止。

  • 数学证明 :因为数组下标按自然数严格递增,从 max 开始倒序扫描优先保证了被访问到的元素具备更高的出现频率。外层循环判断 j < k 确保了一旦收集满 k 个元素便立即触发终止,完成了 Top-K 集合的构建。

四、 算法执行状态机步进示例

以输入数组 nums = [1, 1, 1, 2, 2, 3]k = 2 为例(规模 n = 6),状态机的演进过程如下表所示:

步骤 处理逻辑 / 状态阶段 内部变量状态 作用与物理状态说明
初始 频次统计 map = {1: 3, 2: 2, 3: 1} 完成全图频次映射,不同元素种数为 3
1 桶容量测算与创建 max = 3, 建立 4 个空桶 buckets[0...3] 确定频次天花板为 3,准备分配元素
2 元素入桶分装 buckets[1] = [3] buckets[2] = [2] buckets[3] = [1] 元素依频次归类:3 出现 1 次,2 出现 2 次,1 出现 3 次
3 逆序提取 (i = 3) 访问 buckets[3],提取元素 1 ans[0] = 1, j = 1 提取最高频元素 1,当前已收集 1 个元素(未满 k = 2)
4 逆序提取 (i = 2) 访问 buckets[2],提取元素 2 ans[1] = 2, j = 2 提取次高频元素 2,当前已收集 2 个元素(满足 j == k)
终止 退出循环并返回 返回结果 ans = [1, 2] 条件 j < k 不再满足,提取终止,输出最终结果

五、 源码实现

复制代码
import java.util.ArrayList;
import java.util.Collections;
import java.util.HashMap;
import java.util.List;
import java.util.Map;

class Solution {
    public int[] topKFrequent(int[] nums, int k) {
        // 第一阶段:使用哈希表统计数组中各个元素的出现频次
        Map<Integer, Integer> map = new HashMap<>();
        for (int num : nums) {
            map.put(num, map.getOrDefault(num, 0) + 1);
        }
        
        // 第二阶段:获取最大频次,用于精准开辟桶数组的物理边界
        int max = Collections.max(map.values());
        List<List<Integer>> buckets = new ArrayList<>();
        for (int i = 0; i <= max; i++) {
            buckets.add(new ArrayList<>());
        }
        
        // 第三阶段:以频次为下标,将元素归类装入对应的桶中
        for (Map.Entry<Integer, Integer> e : map.entrySet()) {
            buckets.get(e.getValue()).add(e.getKey());
        }
        
        // 第四阶段:从最高频次的桶开始逆序收集元素,直到凑齐 k 个高频元素
        int[] ans = new int[k];
        int j = 0;
        for (int i = max; j < k; i--) {
            for (int x : buckets.get(i)) {
                ans[j] = x;
                j++;
                // 边界保护:若已经收集满 k 个元素,直接中断当前桶的遍历
                if (j == k) {
                    break;
                }
            }
        }
        
        return ans;
    }
}

六、 复杂度分析

1. 时间复杂度:O(n)

  • 分析

    • 哈希表统计:遍历长度为 n 的数组 nums,每次哈希表读写为常数阶 O(1),耗时 O(n)。

    • 确定最大值与初始化桶:哈希表中不同元素的数量记为 m(m <= n)。求解 max 耗时 O(m),创建 max + 1 个桶耗时 O(max)。由于 max <= n,此阶段耗时不超过 O(n)。

    • 填充桶与逆序收集:遍历 m 个键值对充填桶耗时 O(m)。逆序扫描桶时,外层循环执行次数为 max,内层循环遍历桶内元素。因为所有桶中累加的元素总数恰好等于 m,所以内层循环在整个过程中累计执行次数仅为 m 次。

  • 结论:算法各项操作的时间消耗均为线性阶,整体时间复杂度严格收敛于 O(n),完全优于 O(n log n) 的要求。

2. 空间复杂度:O(n)

  • 分析:算法申请的额外物理内存主要来自于哈希表和桶结构。哈希表中最多装载 m 个独立键值对,空间复杂度为 O(m);桶列表中包含 max + 1 个 List 对象,且所有 List 中装载的元素总量为 m,空间复杂度为 O(max + m)。因为 m <= n 且 max <= n,两部分空间消耗之和与 n 呈线性正比关系。

  • 结论:整体额外空间复杂度定性为 O(n)。

相关推荐
万亿少女的梦1681 小时前
基于Spring Boot、Java与MySQL的网络订餐系统设计与实现
java·spring boot·mysql·系统设计·网络订餐
To_OC9 小时前
LC 131 分割回文串:刚学回溯时,我连怎么切字符串都想不明白
javascript·算法·leetcode
咩咩啃树皮10 小时前
第40篇:Vue3组件化开发精讲——组件拆分、复用、父子通信、工程化架构
java·前端·架构
旖-旎10 小时前
LeetCode 518:零钱兑换||(完全背包)—— 题解
c++·算法·leetcode·动态规划·背包问题
鱟鲥鳚10 小时前
Spring Boot 集成 LangChain4j:从模型调用到 Tool Calling(Demo版)
java·spring boot
To_OC10 小时前
LC 42 接雨水:暴力超时卡半天?前后缀数组一用就通了
javascript·算法·leetcode
delishcomcn11 小时前
AI视觉识别+分切算法:电化铝缺陷检测与裁切一体化解锁
人工智能·算法
触底反弹12 小时前
深入理解大模型采样:Temperature、Top-K、Top-P 的原理与实战
人工智能·算法·面试
大模型码小白12 小时前
【Python零基础教程】继承、多态与魔法函数:面向对象编程三大核心特性详解
java·大数据·开发语言·人工智能·python·ai编程