11.无代码爬虫八爪鱼采集器抓取网站信息的实操案例——选择目标网站、提取标题、发布时间、评论内容、作者昵称、点赞数量等字段

首先,多数情况下免费版本的功能,已经可以满足绝大多数采集需求,想了解八爪鱼采集器版本区别的详情,请访问这篇帖子: https://blog.csdn.net/cctv1123/article/details/139581468

八爪鱼采集器免费版和个人版、团队版下载https://affiliate.bazhuayu.com/retrieve

今天我们以采集哔哩哔哩的评论作为八爪鱼采集器的案例进行讲解,提取一级评论中的发布者昵称、发布时间、评论内容、点赞数

首先采集三板斧我们回忆一下,翻页、循环、数据采集

受官方邀请做直播讲课的时候,做了一整套的ppt,如果需要可以联系我:tktk6622 免费索取

填入网址
预登陆
设定滚动翻页

使用自动识别网页内容或者执行添加滚动循环都可以

配置一些细节
设置循环列表

自动识别网页很多时候不能正确的获取到自己要点信息字段,那就手动修改吧

添加一个循环,调整到不固定元素列表,因为评论有一级评论和二级评论的区别,为了方便讲解,我们这边只提取一级评论(二级评论其实是可以采集的,也能够有关联的方式在一起采集)

一级评论的xpath代码是这个://div[@class="root-reply-container"]

提取循环中的数据字段

昵称xpath://div[@class="user-name"]

评论://span[@class="reply-content"]

时间://span[@class="sub-reply-time"]

点赞://span[@class="reply-like"]

(*注意这是结合上一个循环的拼接xpath)

进行测试数据采集
查看导出的数据情况

采集的数据导出到表格全都正常,没有乱码。这个采集需求圆满搞定。

需要这个采集规则,可以在我的B站资源列表中下载

做个总结,这篇教程再次通过实例讲解工作流程如何设置翻页、循环、数据提取,并给出来循环列表的xpath。下一节课我们说说:二级页面数据提取与细节页面处理------点击链接进入详情


这贴是教程专栏的目录链接:

八爪鱼采集器入门基础教程,日常更新中-CSDN博客

相关推荐
TlYf NTLE16 小时前
redis分页查询
数据库·redis·缓存
程序媛徐师姐16 小时前
Python基于机器学习的就业岗位推荐系统【附源码、文档说明】
python·机器学习·python机器学习·就业岗位推荐系统·python就业岗位推荐系统·python机器学习就业推荐·就业岗位推荐
建军啊16 小时前
java审计进阶
java·开发语言·python
会飞的大可16 小时前
Docker容器项目无法访问MySQL的解决策略
mysql·docker·容器
码界筑梦坊16 小时前
329-基于Python的交通流量数据可视化分析系统
开发语言·python·信息可视化·数据分析·django·vue·毕业设计
翻斗包菜16 小时前
MySQL 全量、增量备份与恢复实战指南(含 mysqldump + binlog + XtraBackup)
数据库·oracle
llm大模型算法工程师weng16 小时前
在flomo中安放“不确定”:一款笔记产品如何让人“被看见”
笔记
sg_knight16 小时前
MinIO自带的Web Console管理后台怎么用?日常管理操作全解
前端·文件管理·minio·ftp·cos·oss
Goodwin16 小时前
TypeScript 成 AI 应用层标配?GitHub Trending 告诉你2026前端往哪走
前端·人工智能·github
今儿敲了吗16 小时前
51| 八皇后
c++·笔记·学习·算法·深度优先