python爬虫试手

同事让帮忙在某个网站爬点数据,首次尝试爬虫,遇到的问题及解决思路记录下。

大体需求是需要爬取详情页内的信息,详情页有一定格式规律,但是详情页需要从列表页跳入,列表页中的每一条记录需要鼠标悬停才会弹出跳转链接,点击后才可跳转,然后将数据存在excel中,一个个解决吧。

第一步是先爬取详情页的数据,发现页面数据是js渲染出来的,直接用请求获取不到信息,于是使用selenium来模拟浏览器实际请求,然后需要的各个标签值也都没有id,就根据class来获取值的列表,具体方法为

python 复制代码
from selenium import webdriver

        strurl = 'https://xxxxxxxx?id='+stri
        browser = webdriver.Chrome()
        try:
            browser.get(strurl)
            item1 = browser.find_elements(by=By.CLASS_NAME, value="xxxxxxxx")
            item2 = browser.find_elements(by=By.CLASS_NAME, value="yyyyyyyy")
            item3 = browser.find_elements(by=By.CLASS_NAME, value="zzzzzzzz")

            # text='\n'+'基本信息:'+'\n'
            # for str1,str2 in zip(item1,item2):
            #   print(str1.text ,":",str2.text)
            #   text+=str1.text + ":"+ str2.text+'\n' #加入到字符串中,并换行
            #
            # for str in item3:
            #   text+='\n'+"使用案例:" + str.text+'\n' #加入到字符串中,并换行
            #   print(str.text+ '\n')

        finally:
            browser.close()

获取到需要的值,然后需要把值放到excel中,使用openpyxl 将获取到的值拼成一行追加到excel中,具体方法如下:

python 复制代码
from openpyxl import load_workbook

            # 打开 Excel 文件
            wb = load_workbook('test.xlsx')

            # 选择要操作的工作表
            ws = wb['Sheet2']
            new_data = []
            for str2 in item2:
                new_data.append(str2.text)

            for str in item3:
                new_data.append(str.text)
            # 在最后一行添加数据
            ws.append(new_data)

            # 保存文件
            wb.save('test.xlsx')

这样单详情页的内容可以搞到excel中了,需要搞抓所有记录的问题,因为列表页首先也是js渲染出来的,还有需要模拟悬停才能弹出跳转链接,研究了下详情页的url,都是xxx?id=aaa,这个aaa虽然是int,但是也没规律,随便找了几个值找不到对应页面的时候会报错,但是列表请求页可以看到对于列表的分页请求,相应为json格式,有个列表包含各个对象的id值,整好就是详情页的id值,那就这么搞把,列表信息通过这个请求模拟,然后从相应里取各个id,遍历跳转,一开始尝试了将列表请求跟遍历详情页拼在一个方法里,但是报"TypeError: 'WebElement' object is not callable"这个错,反正是自己用的小工具,先解决需求就行,分俩方法,把id结果集自己拼过来当参数,整合后参考代码如下,凑合看吧

python 复制代码
{
    "code": 200,
    "message": "操作成功",
    "data": {
        "pageNum": 2,
        "pageSize": 10,
        "totalPage": 10,
        "total": 100,
        "list": [
            {
                "id": aaaa,
                "logo": "6426cb.png"
            },
            {
                "id": bbbb,
                "logo": "6426cb.png"
            }]
    },
    "requestId": "abc"
}
python 复制代码
import json



with open('searchResultP3.json', encoding='utf-8') as f:
    jsondata = json.load(f)
    jsonlist = jsondata["data"]["list"]
    datalist=[]
    for objjson in jsonlist:
        strid = str(objjson["id"])
        datalist.append(strid)
    print(datalist)
python 复制代码
from selenium import webdriver
from selenium.webdriver.common.by import By
from openpyxl import load_workbook

import json

for stri in ['aaa', 'bbb', 'ccc']:

        strurl = 'https://xxx?id='+stri
        browser = webdriver.Chrome()
        try:
            browser.get(strurl)
            item1 = browser.find_elements(by=By.CLASS_NAME, value="xxxxx")
            item2 = browser.find_elements(by=By.CLASS_NAME, value="yyyyy")
            item3 = browser.find_elements(by=By.CLASS_NAME, value="zzzzz")

            # text='\n'+'基本信息:'+'\n'
            # for str1,str2 in zip(item1,item2):
            #   print(str1.text ,":",str2.text)
            #   text+=str1.text + ":"+ str2.text+'\n' #加入到字符串中,并换行
            #
            # for str in item3:
            #   text+='\n'+"使用案例:" + str.text+'\n' #加入到字符串中,并换行
            #   print(str.text+ '\n')

            # 打开 Excel 文件
            wb = load_workbook('test.xlsx')

            # 选择要操作的工作表
            ws = wb['Sheet2']
            new_data = []
            for str2 in item2:
                new_data.append(str2.text)

            for str in item3:
                new_data.append(str.text)
            # 在最后一行添加数据
            ws.append(new_data)



            # 保存文件
            wb.save('test.xlsx')

        finally:
            browser.close()
相关推荐
冷雨夜中漫步7 小时前
Python快速入门(6)——for/if/while语句
开发语言·经验分享·笔记·python
郝学胜-神的一滴7 小时前
深入解析Python字典的继承关系:从abc模块看设计之美
网络·数据结构·python·程序人生
百锦再7 小时前
Reactive编程入门:Project Reactor 深度指南
前端·javascript·python·react.js·django·前端框架·reactjs
m0_736919109 小时前
C++代码风格检查工具
开发语言·c++·算法
喵手9 小时前
Python爬虫实战:旅游数据采集实战 - 携程&去哪儿酒店机票价格监控完整方案(附CSV导出 + SQLite持久化存储)!
爬虫·python·爬虫实战·零基础python爬虫教学·采集结果csv导出·旅游数据采集·携程/去哪儿酒店机票价格监控
2501_944934739 小时前
高职大数据技术专业,CDA和Python认证优先考哪个?
大数据·开发语言·python
helloworldandy9 小时前
使用Pandas进行数据分析:从数据清洗到可视化
jvm·数据库·python
黎雁·泠崖10 小时前
【魔法森林冒险】5/14 Allen类(三):任务进度与状态管理
java·开发语言
2301_7634724611 小时前
C++20概念(Concepts)入门指南
开发语言·c++·算法
肖永威11 小时前
macOS环境安装/卸载python实践笔记
笔记·python·macos