使用Selenium浏览器自动抓取cabrbetc网站的样品信息

from selenium import webdriver

from bs4 import BeautifulSoup

import time

'''

#根据委托编号创建查询网址

text = "BETC-HJ-2024-P-00362"

url = "http://weixin.cabr-betc.com/gjwx/wxfind/findreport?prtnum="+text

print(url)

'''

将委托单位名称转化成utf-8格式,并用%连接转化后16进制,导入cabr-betc报告的查询网址url中

text = "中寓装配(江苏)新材料有限公司"

utf8_encoded_text = text.encode('utf-8')

hex_representation = '%'.join(hex(b)[2:] for b in utf8_encoded_text)

#print(hex_representation)

url = "http://weixin.cabr-betc.com/gjwx/wxfind/findreport?prtnum=\&xmname=\&wtunit=%"+hex_representation+"\&page=1\&rows=1000"

print(url)

创建 Chrome 浏览器驱动实例

driver = webdriver.Chrome()

打开指定网址

driver.get(url)

等待页面加载完成,可根据实际情况调整等待时间

time.sleep(5)

获取页面源代码

page_source = driver.page_source

使用 BeautifulSoup 解析页面源代码

soup = BeautifulSoup(page_source, 'html.parser')

查找所有报告编号元素并打印

report_numbers = soup.find_all('div', class_='weui-cell__bd')

for number in report_numbers:

print(number.text)

关闭浏览器驱动

driver.close()

相关推荐
叫我:松哥2 小时前
基于python对抖音热门视频的数据分析与实现
开发语言·python·数据挖掘·数据分析·数据可视化·情感分析·lda主题分析
XinShun2 小时前
sqlalchemy The transaction is active - has not been committed or rolled back.
前端·数据库·python
sp_fyf_20242 小时前
Python与PyTorch的浅拷贝与深拷贝
开发语言·pytorch·python
半斤地瓜烧.3 小时前
社区版Dify实现文生视频 LLM+ComfyUI+混元视频
人工智能·python·chatgpt·ai作画·音视频
XYX的Blog3 小时前
Python基础02(Python序列结构/列表/元组/集合/字典/序列解包)
python
最好Tony4 小时前
python编程-OpenCV(图像读写-图像处理-图像滤波-角点检测-边缘检测)边缘检测
图像处理·python·opencv
小豆豆儿4 小时前
【PyCharm】远程连接Linux服务器
ide·python·pycharm
luyun0202024 小时前
PDF工具箱 PDF24 ,免费下载,非常好用
java·python·pdf
一只爬爬虫4 小时前
pycharm+pyside6+desinger实现查询汉字笔顺GIF动图
ide·python·pycharm·designer·pyside6·gif动图·汉字笔顺
码商行者4 小时前
精通Python (11)
linux·服务器·python