【爬虫】– 抓取原创力文档数据

使用RPA工具,实现针对于原创力中不可下载文档的抓取,可延用于其他类似文库

1 使用工具、环境

影刀RPA、WPS Office、谷歌浏览器(非指定)

2 代码流程

3 关键点

  1. 此方案只适合抓取非VIP即可预览全文的文档,抓取下来的数据是图片

  2. 打开网址后,需要鼠标向下滚动一段距离才能触发"下一页"按钮:

  3. 在节点路径:"//*@id="main"/div1/div3/div2//img"下,抓取链接(src属性),注意有些是文档中间的广告图片,有效的文档其实是"//view-cache.book118.com"开头的链接,需要过滤掉非此开头的广告链接,如下:

  4. 文档图片刷新很玄学,需要上下滑动网页才能刷新出来,代码中用了无限循环滚动鼠标+等距离上下移动来解决,检测到没有刷新时打转的"待刷新"才抓取图片链接:

  5. 判断是否抓取到最后一页,是对"继续预览"文字的检测,如果不出现就说明已经是最后一页,即可退出程序:

  6. 按照原文档排序命名图片,依次再插入word文档。因为影刀中列表的排序是要等字节的才能判断,所以代码中将图片的名字和对应路径,分别构造成字典的键和值,再循环1到最大值,依次取出字典的对应值,插入word文档中,实现和原文档一样的排序效果

4 执行结果图

5 完整程序





相关推荐
nbzy8885 小时前
Python与Pandas实战:从设备图片与文本资料中提取生产能力证据并保留复核状态(附源码)
自动化·内容生成·储能压铸零部件
乱世刀疤8 小时前
Claude Code提高工作效率案例:自动化分析工作流程时效性,缩短工单流转时长
运维·自动化
wujian83118 小时前
怎么用AI做excel表格 AI导出鸭来救场
人工智能·ai·excel·豆包·deepseek·ai导出鸭
用户298698530148 小时前
React 前端处理 Excel 工作表复制的技术实践
javascript·react.js·excel
codeboss8 小时前
做网页变更监控,我在“降噪”上踩过的 7 个坑
爬虫·python
fthux9 小时前
GitHub Actions自动化运维实战:构建高效可靠的CI/CD流水线
运维·自动化·github
曦尧9 小时前
superfile:颜值驱动的现代终端文件管理器,究竟值不值得迁移?
ai·自动化
MrDJun9 小时前
长期稳定跑网页监控:TLS 指纹、代理选路与请求节流的工程实践
运维·爬虫·python·网络协议·网站监控
曦尧10 小时前
BitChat:蓝牙 Mesh + Nostr 双轨加密通讯工具深度笔记
ai·自动化
小柯南敲键盘21 小时前
图片翻译API接入与自动化实现指南
运维·python·自动化