爬虫学习4:爬取王者荣耀技能信息

爬虫:爬取王者荣耀技能信息(代码和代码流程)

代码

python 复制代码
# 王者荣耀英雄信息获取
import time
from selenium import webdriver
from selenium.webdriver.common.by import By
if __name__ == '__main__':
    fp = open("./honorKing.txt", "w", encoding='utf8')
    # 1、url
    url = "https://pvp.qq.com/web201605/herolist.shtml"#页面url
    # 2、发送请求
    driver = webdriver.Edge()#采用edge浏览器
    driver.get(url)#获取url
    time.sleep(3)#防止被检测到爬虫爬取
    # 3、获取想要的信息
    # 获取页面信息
    # driver.page_source
    # 4、数据解析
    li_list = driver.find_elements(By.XPATH, "//ul[@class='herolist clearfix']/li")#获取所有的li
    hero_url_list = []#存储所有的跳转url数据
    for li in li_list:
        hero_url = li.find_element(By.XPATH, "a").get_attribute("href")#跳转的url
        hero_url_list.append(hero_url)
    # 句柄的问题  先把所有第一个页面的东西存起来
    for url in hero_url_list:
        time.sleep(3)#防止被检测到爬虫爬取
        driver.get(url)
        hero_name = driver.find_element(By.XPATH, "//h2[@class='cover-name']").text
        div_list = driver.find_elements(By.XPATH, "//div[@class='skill-show']/div")# 拿到所有的技能信息
        fp.write(hero_name + "\n")#写入角色名称
        for div in div_list:
            js = f'document.getElementsByClassName("show-list")[{div_list.index(div)}].style.display="block"'#解除技能信息被锁
            driver.execute_script(js)
            skill_name = div.find_element(By.XPATH, "p[1]/b").text
            skill_desc = div.find_element(By.XPATH, "p[2]").text
            fp.write(skill_name + "---->" + skill_desc + "\n")
            print(skill_name, skill_desc)
        # 只爬两个看看样例
        # if hero_url_list.index(url) == 1:
        #     break
    driver.close()

代码流程:

复制代码
#### 获取页面的url

跳转到下一界面的url

找到希望得到的数据的位置

采用:f'document.getElementsByClassName("show-list")[{被锁位置}].style.display="block"',将不能同时出现的数据同时出现


相关推荐
0wioiw04 分钟前
Ubuntu基础(Python虚拟环境和Vue)
linux·python·ubuntu
xiao5kou4chang6kai414 分钟前
Python-GEE遥感云大数据分析与可视化(如何建立基于云计算的森林监测预警系统)
python·数据分析·云计算·森林监测·森林管理
rui锐rui17 分钟前
大数据学习6:Sqoop数据迁移工具
大数据·学习·sqoop
presenttttt21 分钟前
用Python和OpenCV从零搭建一个完整的双目视觉系统(四)
开发语言·python·opencv·计算机视觉
psybrain25 分钟前
脑科学圈| 利用眼动追踪评估演讲情境下焦虑障碍儿童的注视行为
学习·心理学·脑科学·课堂·焦虑·儿童青少年·眼动
序属秋秋秋2 小时前
《C++初阶之内存管理》【内存分布 + operator new/delete + 定位new】
开发语言·c++·笔记·学习
许白掰2 小时前
Linux入门篇学习——Linux 工具之 make 工具和 makefile 文件
linux·运维·服务器·前端·学习·编辑器
木头左3 小时前
逻辑回归的Python实现与优化
python·算法·逻辑回归
B1nna3 小时前
Docker学习
学习·docker·容器
quant_19864 小时前
R语言如何接入实时行情接口
开发语言·经验分享·笔记·python·websocket·金融·r语言