Web爬虫-edu_SRC-目标列表爬取

免责声明:本文仅做技术交流与学习...
爬取后,结合暗黑搜索引擎等等进行进一步搜索.

edu_src.py

python 复制代码
import requests, time
from bs4 import BeautifulSoup
for i in range(1, 20):
    url = f'https://src.sjtu.edu.cn/rank/firm/0/?page={i}'
    print(f"正在获取第{i}页数据")
    s = requests.get(url).text
    # print(s)
    soup = BeautifulSoup(s, 'html.parser')
    edu1 = soup.find_all('tr')
    # print(edu1)
    for edu in edu1:
        try:
            edu_name = edu.a.text
            # print(edu_name)
            with open('edu_name.txt', 'a+',encoding='utf-8') as f:
                f.write(edu_name + '\n')
        except:
            pass
    print(f"{i}页已经写入!!!")
相关推荐
吠品21 分钟前
CSS图片模糊过渡:一个transition加filter就够
java·数据库·notepad++
XiaoMaqqqq21 分钟前
知名的IP驱动产业新场景新工具
网络·python·网络协议·tcp/ip
言乐626 分钟前
Python实现语音审核模型
开发语言·python·django·virtualenv·pygame
朝朝辞暮i1 小时前
C++ 第 21 课:struct —— 把一组相关数据打包在一起
开发语言·c++·算法
Csvn1 小时前
组合式 API(Composition API)
前端
程序员清风1 小时前
Python 数据分析环境搭建:从 Jupyter 到 pandas
python·jupyter·数据分析
梦想不只是梦与想1 小时前
对象存储服务器vs数据库
数据库·对象存储·图片存储
月光船幽幽2 小时前
加性偏移外推提升参数识别可靠性
python·算法
SHARK_pssm2 小时前
【C++——类和对象(下)】
开发语言·c++·经验分享·笔记
凯哥Java2 小时前
写代码怎么避免逻辑漏洞?
java·开发语言·人工智能·自动化