【自动化实战】(四)时刻关注网络安全,机器人推送每日情报及安全资讯

前言

本篇博文是 《Selenium IDE 自动化实战案例》 系列的第 篇博文,主要内容是使用 requests 库来获取情报星球社区中的每日情报及安全资讯,并通过 XPATH 语法筛选出自己需要的内容,最后设置机器人定时推送 ,往期系列文章请访问博主的 自动化实战案例 专栏,博文中的所有代码全部收集在博主的 GitHub 仓库 中;

严正声明:本博文所讨论的技术仅用于研究学习,任何个人、团体、组织不得用于非法目的,违法犯罪必将受到法律的严厉制裁。

展示

实现

根据自己的需要获取页面内容,这里我们以获取漏洞情报、情报精选和安全资讯为例。

通过观察页面元素,发现我们需要获取的内容刚好在这三个 table 里面,因此,我们先通过 XPATH 语法获取到这些 <table> 标签,代码如下所示:

py 复制代码
detail_resp = requests.get(detail_url)
detail_html = etree.HTML(detail_resp.text)
tables = detail_html.xpath('//*[@id="detail-box-view"]/div/div/table')

漏洞情报获取

先通过 F12 查看我们需要获取内容的页面元素:

根据 DOM 元素编写相应的 XPATH 语法并进行验证:

由于标题里用的是 <th> 元素,而内容里用的是 <td> 元素,因此可以使用符号 * 来匹配任何元素节点。

同时出现了 <a> 标签,但是其 text 内容包含了 URL,因此可以不用去获取其 href 属性,代码如下所示:

py 复制代码
table0 = tables[0]
trs0 = table0.xpath('tbody/tr')
for tr in trs0:
    print("[1]", tr.xpath('*/text() | */a/@href'))
    print("[2]", tr.xpath('.//text()'))

在上述代码中,[1] 是从 href 属性中获取的 URL,而 [2] 则是通过文本匹配进行获取,运行结果如下所示:

情报精选获取

先分析一下这一模块的页面元素:

发现与漏洞情报的页面元素类似,因此直接构造代码如下所示:

py 复制代码
table1 = tables[1]
trs1 = table1.xpath('tbody/tr')
for tr in trs1:
    if first:
        first = False
        continue
    lst = tr.xpath('.//text()')
    print(lst)

运行结果:

安全资讯获取

虽然这个 table 与之前的看着有点不太一样,但是也可以通过 .//text() 去匹配其中的内容:

代码如下所示:

py 复制代码
table2 = tables[2]
trs2 = table2.xpath('tbody/tr')
for tr in trs2:
    lst = tr.xpath('.//text()')
    print(lst)

运行结果:

后记

通过使用 requests 库,我们成功地获取到了情报星球社区中的每日情报及安全资讯详情页,再继续分析其中的页面元素并且使用 XPATH 语法筛选出自己需要的内容,最后设置机器人定时推送相关内容。

文中每日情报及安全资讯内容来自于 情报星球 社区。

以上就是 时刻关注网络安全,机器人推送每日情报及安全资讯 的所有内容了,希望本篇博文对大家有所帮助!

严正声明:本博文所讨论的技术仅用于研究学习,任何个人、团体、组织不得用于非法目的,违法犯罪必将受到法律的严厉制裁。

📝 上篇精讲:(三)筛选活动中点赞数量 TOP5 的作品

💖 我是 𝓼𝓲𝓭𝓲𝓸𝓽,期待你的关注,创作不易,请多多支持;

👍 公众号:sidiot的技术驿站

🔥 系列专栏:Selenium IDE 自动化实战案例

相关推荐
喵手8 小时前
Python爬虫实战:针对天文历法网站(以 TimeandDate 或类似的静态历法页为例),构建高精度二十四节气天文数据采集器(附xlsx导出)!
爬虫·python·爬虫实战·零基础python爬虫教学·采集天文历法网站数据·构建二十四节气天文数据
东东5168 小时前
学院个人信息管理系统 (springboot+vue)
vue.js·spring boot·后端·个人开发·毕设
zhaotiannuo_19988 小时前
Python之2.7.9-3.9.1-3.14.2共存
开发语言·python
Keep_Trying_Go8 小时前
基于GAN的文生图算法详解ControlGAN(Controllable Text-to-Image Generation)
人工智能·python·深度学习·神经网络·机器学习·生成对抗网络·文生图
三水不滴8 小时前
Redis缓存更新策略
数据库·经验分享·redis·笔记·后端·缓存
m0_748229998 小时前
Vue2 vs Vue3:核心差异全解析
前端·javascript·vue.js
LostSpeed9 小时前
openpnp - python2.7 script - 中文显示乱码,只能显示英文
python·openpnp
C澒9 小时前
前端监控系统的最佳实践
前端·安全·运维开发
xiaoxue..9 小时前
React 手写实现的 KeepAlive 组件
前端·javascript·react.js·面试
hhy_smile9 小时前
Class in Python
java·前端·python