PHP采集任意网址自动识别并提取页面主体内容

对于PHP采集很多种方式,但是都是指定dom哪个节点来采集内容,这样太麻烦了,有没有一方式可以任意网址可以自动识别主本内容呢。答案是有。
用到的组件:

  • QueryList:先用Queyrylist采集页面内容html
  • readability:把采集到的HTML原始内容给readability分析树结构,提取页面内容。

组件仓库地址:

https://querylist.cc/

https://github.com/andreskrey/readability.php

看效果:

代码:

php 复制代码
public function readability()
    {
        $param = $this->request->param();
        if($this->request->isPost())
        {
            $url = trim($param['url']);

            $ql = QueryList::get($url);
            $html = $ql->getHtml();
            //$html = file_get_contents($url);
            //$html = HttpService::request($url);

            $rules = [
                'keywords' => ['meta[name=keywords]','content'],
                'description' => ['meta[name=description]','content']
            ];
            $query =  $ql->rules($rules)->queryData();

            $readability = new Readability(new Configuration());
            $readability->parse($html);


            $data['title'] = $readability->getTitle();
            $data['seo_title'] = $readability->getTitle();
            $data['keywords'] = $query['keywords'];
            $data['description'] = '';
            $data['source'] = $url;
            $data['status'] = true;

            $content = $readability->getContent();
            $content = preg_replace("/<!--[^\!\[]*?(?<!\/\/)-->/","",$content);//删除注释
            $content = preg_replace("/<div (id|class)=('|\")(.*?)(\'|\")>/","",$content);//删除最外层idv
            $content = preg_replace("/(↵|\r\n|\n|\r)<\/div>$/","",$content);//删除最外层idv

            $data['content'] = $content;
            $data['thumb'] = $readability->getImage();
            $images = $readability->getImages();
            $photos = [];
            if(!empty($images))
            {
                foreach($photos as $v)
                {
                    $photo = [
                        'src'   => $v,
                        'alt'   => '',
                    ];
                    array_push($photos,$photo);
                }
                $data['photos'] = $photos;
            }


            return $data;
        }
        else
        {
            return $this->fetch();
        }

    }
相关推荐
蒙娜丽宁24 分钟前
Rust 性能优化指南:内存管理、并发调优与基准测试案例
开发语言·性能优化·rust
豐儀麟阁贵44 分钟前
5.2 类
java·开发语言
九皇叔叔1 小时前
Java循环结构全解析:从基础用法到性能优化(含经典案例)
java·开发语言·python
JanelSirry1 小时前
如何查看java死锁?具体怎么做,怎么避免
java·开发语言
小龙报1 小时前
《算法通关指南之C++编程篇(5)----- 条件判断与循环(下)》
c语言·开发语言·c++·算法·visualstudio·学习方法·visual studio
郝学胜-神的一滴1 小时前
C++ STL(标准模板库)深度解析:从基础到实践
linux·服务器·开发语言·c++·算法
LL_break1 小时前
线程3 JavaEE(阻塞队列,线程池)
java·开发语言·java-ee·线程·线程池·阻塞队列
Fortunate Chen1 小时前
初识C语言12. 结构体(自定义类型的核心工具)
c语言·开发语言·笔记
刚入坑的新人编程2 小时前
算法训练.17
开发语言·数据结构·c++·算法
汤姆yu2 小时前
基于python大数据深度学习的酒店评论文本情感分析
开发语言·python·深度学习