Web爬虫-edu_SRC-目标列表爬取

免责声明:本文仅做技术交流与学习...
爬取后,结合暗黑搜索引擎等等进行进一步搜索.

edu_src.py

python 复制代码
import requests, time
from bs4 import BeautifulSoup
for i in range(1, 20):
    url = f'https://src.sjtu.edu.cn/rank/firm/0/?page={i}'
    print(f"正在获取第{i}页数据")
    s = requests.get(url).text
    # print(s)
    soup = BeautifulSoup(s, 'html.parser')
    edu1 = soup.find_all('tr')
    # print(edu1)
    for edu in edu1:
        try:
            edu_name = edu.a.text
            # print(edu_name)
            with open('edu_name.txt', 'a+',encoding='utf-8') as f:
                f.write(edu_name + '\n')
        except:
            pass
    print(f"{i}页已经写入!!!")
相关推荐
sunburn-20 分钟前
Java 队列全面详解:从入门到面试实战
java·开发语言·汇编·ide·idea
AI直播技术杂谈23 分钟前
AI直播推流链路中延迟优化的通用技术方案
开发语言·人工智能·php
VALENIAN瓦伦尼安教学设备32 分钟前
激光对中仪采购要点
数据库·嵌入式硬件·算法
码农颜44 分钟前
5.2.2 隔离级别
数据库·mysql
vx-程序开发44 分钟前
springboot农产品运输服务平台---附源码75498
java·javascript·spring boot·python·eclipse·django·php
微三云 - 廖会灵 (私域系统开发)1 小时前
基于 OPC 流程控制的抖店集群 SaaS 平台设计与渠道分账系统实现
数据库
独隅1 小时前
前端离线暂停更新策略:Service Worker 与 PWA 的静默控制实践
前端
骇客野人1 小时前
MySQL 信创化迁移至 PolarDB-X 整体实施方案
数据库·mysql
妙码生花1 小时前
从 PHP 到 AI + Golang,程序员自救转型手记(五十八):后台系统配置管理实现
前端·后端·go