python(爬虫selenium)

Selenium 是一款用于模拟浏览器行为的自动化测试工具,也是爬虫领域中处理动态渲染页面(如 JS 加载、Ajax 请求、登录验证等)的核心工具。

一、导入库

python 复制代码
from selenium import webdriver
 from selenium.webdriver.edge.options import Options
 from selenium.webdriver.common.by import By
import time
 #
 edge_options =Options()
 edge_options.binary_location=r"C:\Program Files (x86)\Microsoft\Edge\Application\msedge.exe"
# ##edge浏览器的地址
 driver = webdriver.Edge(options=edge_options)

1.导入相关库的函数

from selenium import webdriver

from selenium.webdriver.edge.options import Options

from selenium.webdriver.common.by import By

2.导入edge浏览器的内核

edge_options.binary_location=r"C:\Program Files (x86)\Microsoft\Edge\Application\msedge.exe"

二、核心操作浏览器与页面控制

1.基础操作

|---------|-----------------------------------------|-------------------------|
| 打开页面 | driver.get("https://www.example.com") | 访问目标 URL |
| 刷新页面 | driver.refresh() | 刷新当前页面 |
| 前进 / 后退 | driver.forward() / driver.back() | 模拟浏览器前进 / 后退 |
| 窗口大小 | driver.set_window_size(1920, 1080) | 设置窗口尺寸 |
| 全屏 | driver.maximize_window() | 窗口最大化 |
| 关闭窗口 | driver.close() | 关闭当前标签页 |
| 退出浏览器 | driver.quit() | 关闭所有标签页并退出驱动(必写,否则进程残留) |

2.页面元素定位

定位元素是 Selenium 操作的基础,优先使用唯一标识(id/name),其次用 XPath/CSS 选择器,避免用索引(易变)。

|-------------------|----------------------------------------------|--------------------------------------------------------|-----------------|
| ID | find_element(By.ID, "id值") | driver.find_element(By.ID, "username") | 元素有唯一 ID |
| Name | find_element(By.NAME, "name值") | driver.find_element(By.NAME, "password") | 元素有 name 属性 |
| Class Name | find_element(By.CLASS_NAME, "类名") | driver.find_element(By.CLASS_NAME, "btn-submit") | 类名唯一 |
| Tag Name | find_element(By.TAG_NAME, "标签名") | driver.find_element(By.TAG_NAME, "input") | 标签唯一(如单个 input) |
| Link Text | find_element(By.LINK_TEXT, "链接文本") | driver.find_element(By.LINK_TEXT, "登录") | 精准匹配超链接文本 |
| Partial Link Text | find_element(By.PARTIAL_LINK_TEXT, "部分文本") | driver.find_element(By.PARTIAL_LINK_TEXT, "登") | 模糊匹配超链接 |
| XPath | find_element(By.XPATH, "XPath表达式") | driver.find_element(By.XPATH, '//*[@id="username"]') | 复杂定位(万能) |
| CSS Selector | find_element(By.CSS_SELECTOR, "CSS表达式") | driver.find_element(By.CSS_SELECTOR, "#username") | 高效定位(推荐) |

3.元素交互

python 复制代码
# 1. 点击元素(按钮/链接/复选框)
btn_elem = driver.find_element(By.CLASS_NAME, "submit-btn")
btn_elem.click()

# 2. 获取元素属性/文本
elem = driver.find_element(By.XPATH, '//div[@class="content"]')
print(elem.text)  # 获取元素可见文本
print(elem.get_attribute("href"))  # 获取href属性
print(elem.get_attribute("innerHTML"))  # 获取内部HTML

# 3. 输入文本(先清空再输入)
input_elem = driver.find_element(By.ID, "username")
input_elem.clear()  # 清空输入框
input_elem.send_keys("test123")  # 输入内容

执行Javascript 代码,可以将页面滚动到底部。

driver.execute_script('window.scrollTo(0,document.body.scrollHeight)')

4.等待渲染

可以通过time函数用sleep方法等待

相关推荐
想会飞的蒲公英3 小时前
计算机怎样读取中文文本:编码、清洗与标准化
人工智能·python·自然语言处理
SeaTunnel4 小时前
从 Python Script 地狱到标准化数据集成框架
大数据·开发语言·python·程序员·代码·seatunnel
深度研习笔记4 小时前
OpenCV工业视觉实战09|项目EXE打包+工控机无环境部署+后台常驻运行,彻底脱离Python环境,完成项目最终交付
python·opencv·webpack
Bright Data4 小时前
DuckDuckGo 搜索爬取器
爬虫·serp·网页数据
CCPC不拿奖不改名4 小时前
大模型推理架构与开源生态知识整理
数据库·windows·python·架构·langchain·开源·github
小小测试开发4 小时前
Playwright vs Selenium vs Cypress:从浏览器协议到 API 设计的全面对比与实测
人工智能·selenium·测试工具
Marst Code5 小时前
(python)2026Plotly 库评估:交互式可视化到底值不值得引入?
开发语言·python
databook5 小时前
当散点图不够用时:用 t-SNE 可视化多维数据
python·数据分析·数据可视化
我的xiaodoujiao7 小时前
快速学习Python基础知识详细图文教程9--函数进阶
开发语言·python·学习·测试工具
weixin_408099677 小时前
2026 图片去水印 API 接口完全指南:一键去除图片水印(附 Python/Java/PHP/C# 示例)
java·python·php·图片处理·api调用·图片去水印·石榴智能