爬取目标网站的域名和子域名【网站子域扫描工具01】

使用 Python 的 requests 库发送 HTTP 请求,并使用 Beautiful Soup或者正则表达式来解析响应,从中提取出域名和子域名信息。

1.简单示例(Beautiful Soup)

这是一个简单的示例代码,演示如何使用 requests 和 BeautifulSoup 来获取网页中的链接:

下面是带有注释的代码,解释了每一步具体在做什么:

python 复制代码
import requests  # 导入发送 HTTP 请求的库
from bs4 import BeautifulSoup  # 导入用于解析 HTML 的库

# 定义一个函数,用于获取目标网站的子域名
def get_subdomains(url):
    # 发送一个 GET 请求到目标网站,并获取响应内容
    response = requests.get(url)
    
    # 使用 BeautifulSoup 解析响应的 HTML 内容
    soup = BeautifulSoup(response.text, 'html.parser')
    
    subdomains = set()  # 创建一个集合,用于存储提取出的子域名
    
    # 遍历所有带有 href 属性的链接
    for link in soup.find_all('a'):
        href = link.get('href')  # 获取链接的地址
        if href and href.startswith('http'):  # 如果链接以 http 开头(避免处理相对链接)
            domain = href.split('/')[2]  # 提取链接中的域名部分作为子域名
            subdomains.add(domain)  # 将提取到的子域名加入集合中
    
    return subdomains  # 返回提取到的子域名集合

target_url = 'http://www.baidu.com'  # 设置目标网站的 URL
subdomains = get_subdomains(target_url)  # 调用函数获取子域名
print(subdomains)  # 打印提取到的子域名集合

在这个示例中,我们首先发送了一个 GET 请求到目标网站,然后用 BeautifulSoup 解析响应的 HTML 内容,提取出所有带有 href 属性的链接,并从中提取出域名部分作为子域名。最后将提取到的子域名放入集合中并返回。

2.简单示例(正则表达式)

以下是一个简单的示例代码:

python 复制代码
import requests
import re

def get_subdomains(url):
    response = requests.get(url)  # 发送GET请求获取网页内容
    html_content = response.text  # 获取网页HTML内容

    # 使用正则表达式从HTML内容中提取子域名
    subdomains = re.findall(r'(https?://\w+\.\w+\.\w+)', html_content)

    return subdomains

target_url = 'http://www.baidu.com'
subdomains = get_subdomains(target_url)
print(subdomains)

在这个示例中,我们使用了requests库发送了一个GET请求到目标网站,并获取了网页的HTML内容。接着,我们使用了正则表达式来从HTML内容中提取出子域名。

3.小结

这只是一个简单的示例,实际情况可能更加复杂,需要考虑不同网页结构、链接格式等问题。

相关推荐
jaray5 小时前
PyCharm 2024.3.2 Professional 如何更换 PyPI 镜像源
ide·python·pycharm·pypi 镜像源
Psycho_MrZhang5 小时前
Neo4j Python SDK手册
开发语言·python·neo4j
web3.08889995 小时前
1688图片搜索API,相似商品精准推荐
开发语言·python
少云清6 小时前
【性能测试】15_JMeter _JMeter插件安装使用
开发语言·python·jmeter
光羽隹衡6 小时前
机器学习——TF-IDF实战(红楼梦数据处理)
python·tf-idf
2401_894828127 小时前
从原理到实战:随机森林算法全解析(附 Python 完整代码)
开发语言·python·算法·随机森林
B站计算机毕业设计超人7 小时前
计算机毕业设计Python知识图谱中华古诗词可视化 古诗词情感分析 古诗词智能问答系统 AI大模型自动写诗 大数据毕业设计(源码+LW文档+PPT+讲解)
大数据·人工智能·hadoop·python·机器学习·知识图谱·课程设计
玄同7657 小时前
Python「焚诀」:吞噬所有语法糖的终极修炼手册
开发语言·数据库·人工智能·python·postgresql·自然语言处理·nlp
johnny2337 小时前
Python管理工具:包、版本、环境
python
羽翼.玫瑰7 小时前
关于重装Python失败(本质是未彻底卸载Python)的问题解决方案综述
开发语言·python