结合 Leetcode 题探究KMP算法

一、题目

找出字符串中第一个匹配项的下标

二、思路

2.1 KMP的核心思想

  • 与普通的双层暴力遍历相比,KMP算法的精髓在于利用已匹配的前缀信息来优化搜索过程 。当发生不匹配时,算法不是简单地将模式串后移一位重新开始,而是根据预先计算的next数组,直接将模式串滑动到下一个可能匹配的位置。

2.2 next数组的实质

next[i] 表示在模式串的前 i 个字符组成的子串中,最长的相等真前缀与真后缀的长度。

  • 真前缀:不包含最后一个字符的前缀

  • 真后缀:不包含第一个字符的后缀

  • 核心价值 :当字符匹配失败时,next[i] 告诉我们模式串应该回溯到什么位置继续匹配

2.3 基础递推关系

next[i] 的计算基于 next[i-1] 和当前字符 pattern[i]

  1. 已知条件 :若 next[i-1] = lastNextLen,表明子串 pattern[0...lastNextLen-1] 中,前 lastNextLen 个字符与后 lastNextLen 个字符完全相等

    复制代码
    pattern[0...lastNextLen-1] == pattern[i-lastNextLen...i-1]
  2. 关键比较 :为了高效计算,利用上述 next[i-1]中已经包含的信息,比较 pattern[lastNextLen]pattern[i],就可以得到next[i]

(1) 如果相等next[i] = lastNextLen + 1(相等前后缀长度增加1)

(2) 如果不相等 :回溯到 next[lastNextLen] 继续尝试匹配

三、代码

java 复制代码
class Solution {
    public int strStr(String haystack, String needle) {
        // 使用KMP算法

        // 1、得到 next 数组
        int[] next = getNextArray(needle);

        // 2、借助 next 数组完成遍历
        int i = 0;  // 母串指针
        int j = 0;  // 子串指针
        int m = haystack.length();
        int n = needle.length();
        while(i < m && j < n){
            if(j == -1 || haystack.charAt(i) == needle.charAt(j)){
                i++;
                j++;
            }else{
                j = next[j];
            }
        }

        return j == n ? i - n : -1; // 判断子串的指针是否已经遍历完成
    }

    private int[] getNextArray(String s){
        // next数组其实是不包含当前字符的使得真前缀与真后缀相同的最大长度
        // 也就是 next[i] 要借助 next[i-1] 和 s.charAt(i) 来得到
        // 若 next[i-1] = lastNextLen 可知,s 的 [0, lastNextLen-1] 对应的字符串 == s 的 [i-1-lastNextLen, i-1]
        // 为最大地利用现有资源,所以先判断 s.charAt(lastNextLen) ?= s.charAt(i)
        // 若不等,则继续回溯进行判断
        int len = s.length();
        int[] next = new int[len];
        next[0] = -1;
        int lastNext = -1;       // 记录上一个next

        int i = 0;
        while(i < len - 1){
            // lastNext == -1:说明已经回溯到开头,没有公共前后缀,next[i+1] = 0
            // s[i] == s[lastNext]:当前字符匹配成功,最长公共前后缀长度+1
            if(lastNext == -1 || s.charAt(i) == s.charAt(lastNext)){  
                next[i + 1] = lastNext + 1;
                i++;
                lastNext++; 
            }else{  // 字符不匹配时,利用已计算的next信息进行回溯,找到更短的相同前后缀继续尝试匹配
                lastNext = next[lastNext];
            }
        }  

        return next;
    }
}
相关推荐
罗义凯2 小时前
其中包含了三种排序算法的注释版本(冒泡排序、选择排序、插入排序),但当前只实现了数组的输入和输出功能。
数据结构·c++·算法
kevien_G13 小时前
JAVA之二叉树
数据结构·算法
syt_biancheng3 小时前
Day3算法训练(简写单词,dd爱框框,3-除2!)
开发语言·c++·算法·贪心算法
二进制的Liao4 小时前
【编程】脚本编写入门:从零到一的自动化之旅
数据库·python·算法·自动化·bash
自然数e4 小时前
C++多线程【线程管控】之线程转移以及线程数量和ID
开发语言·c++·算法·多线程
云在Steven5 小时前
在线确定性算法与自适应启发式在虚拟机动态整合中的竞争分析与性能优化
人工智能·算法·性能优化
前进的李工5 小时前
LeetCode hot100:234 回文链表:快慢指针巧判回文链表
python·算法·leetcode·链表·快慢指针·回文链表
sin_hielo5 小时前
leetcode 3228
算法·leetcode
xier_ran6 小时前
力扣(LeetCode)100题:41.缺失的第一个正数
数据结构·算法·leetcode