python5

1.使用正则完成下列内容的匹配

  • 匹配陕西省区号 029-12345

  • 匹配邮政编码 745100

  • 匹配邮箱 lijian@xianoupeng.com

  • 匹配身份证号 62282519960504337X

代码如下:

python 复制代码
import re
texts = {
    "区号": "029-12345",
    "邮编": "123456",
    "邮箱": "llllll@xxhhyyzzzz.com",
    "身份证": "222333222322211121"
}
patterns = {
    "区号": r"029-\d{5}",
    "邮编": r"\d{6}",
    "邮箱": r".+@.+\..+",
    "身份证": r"\d{17}X|\d{18}"
}
for name in texts:
    result = re.search(patterns[name], texts[name])
    print(f"{name}: {result.group() if result else '没匹配到'}")

运行结果如下:

2.爬取学校官网,获取所有图片途径并将路径存储在本地文件中,使用装饰器完成

代码如下:

python 复制代码
import requests
import re
from functools import wraps
def save_to_file(filename):
    def decorator(func):
        @wraps(func)
        def wrapper(*args, **kwargs):
            result = func(*args, **kwargs)
            with open(filename, 'w', encoding='utf-8') as f:
                for item in result:
                    f.write(item + '\n')
            print(f"已保存 {len(result)} 条到 {filename}")
            return result
        return wrapper
    return decorator
def safe_request(func):
    @wraps(func)
    def wrapper(*args, **kwargs):
        try:
            return func(*args, **kwargs)
        except Exception as e:
            print(f"请求失败: {e}")
            return ""
    return wrapper
class Spider:
    def __init__(self):
        self.url = "https://www.gsau.edu.cn/"
        self.headers = {'User-Agent': 'Mozilla/5.0'}
    @safe_request
    def fetch(self):
        res = requests.get(self.url, headers=self.headers)
        return res.text
    @save_to_file(filename='images.txt')
    def get_images(self):
        html = self.fetch()
        imgs = re.findall(r'<img[^>]+src="([^"]+)"', html)
        full_urls = []
        for img in imgs:
            if img.startswith('http'):
                full_urls.append(img)
            else:
                full_urls.append("https://www.gsau.edu.cn" + img)
        return full_urls
spider = Spider()
spider.get_images()

运行结果如下:

相关推荐
SimonKing1 分钟前
线程池面试被问到怕?看完这篇让他当场沉默
java·后端·程序员
JAVA面经实录9172 分钟前
NoSQL 非关系型数据库【简洁版】
java·数据库·nosql
Web打印3 分钟前
HttpPrinter Web打印中间件 wiki.httpprinter.com 知识库内容总结
前端·中间件
2501_918126913 分钟前
一个上帝类程序作画
前端·css·css3
小蒋学算法4 分钟前
算法-计算右侧小于当前元素的个数-分治&归并思想
java·数据结构·算法
阿狸猿4 分钟前
论企业应用系统的分层架构风格
java·开发语言·架构
JAVA9654 分钟前
JAVA面试-并发篇 07-CAS底层原理是什么有什么缺陷如何解决
java·开发语言·面试
如意IT6 分钟前
浏览器CDP自动化检测技术-Error和Worker
前端·javascript·自动化·chromium·指纹浏览器
IT_陈寒8 分钟前
Python列表的+=操作符坑了我一整天
前端·人工智能·后端
右耳朵猫AI8 分钟前
React周刊2026W22 | React 13周年、React Router 7.16.0、Spoiled 0.5
前端·react.js·前端框架