PHP用正则把HTML中的js脚本过滤掉

要在PHP中使用正则表达式从HTML中过滤掉JavaScript脚本标签,你可以使用preg_replace函数。以下是一个示例代码,展示了如何使用正则表达式来移除HTML中的<script>标签及其内容:

php 复制代码
<?php
function removeJavaScript($html) {
    // 正则表达式模式,匹配 <script> 标签及其内容,包括 <script> 和 </script> 之间的任何内容
    $pattern = '/<script\b[^<]*(?:(?!<\/script>)<[^<]*)*<\/script>/is';
    
    // 使用 preg_replace 替换匹配的内容为空字符串
    $cleanedHtml = preg_replace($pattern, '', $html);
    
    return $cleanedHtml;
}

// 示例HTML字符串
$html = '
<!DOCTYPE html>
<html>
<head>
    <title>Example</title>
    <script type="text/javascript">
        alert("Hello, World!");
    </script>
</head>
<body>
    <h1>This is a heading</h1>
    <p>This is a paragraph.</p>
    <script>
        console.log("Another script");
    </script>
</body>
</html>
';

// 调用函数移除JavaScript
$cleanedHtml = removeJavaScript($html);

// 输出清理后的HTML
echo $cleanedHtml;
?>

解释

  1. 正则表达式模式
    • /<script\b[^<]*(?:(?!<\/script>)<[^<]*)*<\/script>/is
    • /<script\b[^<]*/:匹配以<script开头的标签,并允许标签内有属性(例如type="text/javascript")。
    • (?:(?!<\/script>)<[^<]*)*:这是一个非贪婪匹配,用于匹配<script>标签和</script>之间的任何内容,但不包括</script>
    • <\/script>/:匹配结束标签</script>
    • i:不区分大小写的匹配。
    • s:让.匹配包括换行符在内的所有字符。
  2. preg_replace函数
    • 使用上面定义的正则表达式模式,将匹配到的JavaScript脚本替换为空字符串。
  3. 示例HTML字符串
    • 包含一些示例HTML和一个<script>标签。
  4. 输出清理后的HTML
    • 调用removeJavaScript函数后,输出不包含JavaScript脚本的HTML。

这个示例代码会移除HTML中的所有JavaScript脚本标签及其内容,只留下纯HTML。如果你需要处理更复杂的HTML结构,可能需要使用更强大的HTML解析器,比如PHP的DOMDocument类,但这通常超出了正则表达式的范围。

相关推荐
摸鱼的春哥14 分钟前
惊!黑客靠AI把墨西哥政府打穿了,海量数据被黑
前端·javascript·后端
小兵张健17 分钟前
Playwright MCP 截图标注方案调研(推荐方案1)
前端·javascript·github
我叫黑大帅3 小时前
Vue3和Uniapp的爱恨情仇:小白也能懂的跨端秘籍
前端·javascript·vue.js
None3213 小时前
【NestJs】使用Winston+ELK分布式链路追踪日志采集
javascript·node.js
Qinana4 小时前
从代码到智能体:MCP 协议如何重塑 AI Agent 的边界
前端·javascript·mcp
Marshall1514 小时前
zzy-scroll-timer:一个跨框架的滚动定时器插件
前端·javascript
BingoGo6 小时前
OpenSwoole 26.2.0 发布:支持 PHP 8.5、io_uring 后端及协程调试改进
后端·php
JaguarJack6 小时前
OpenSwoole 26.2.0 发布:支持 PHP 8.5、io_uring 后端及协程调试改进
后端·php·服务端
明月_清风6 小时前
打字机效果优化:用 requestAnimationFrame 缓冲高频文字更新
前端·javascript
明月_清风6 小时前
Markdown 预解析:别等全文完了再渲染,如何流式增量渲染代码块和公式?
前端·javascript