Python爬网页,不确定网页的编码,不需要用第三方库

Python爬网页,不确定网页的编码,不需要用第三方库,自己写个判断,乱拳打死老师傅

detect试了,不好用

apparent_encoding试了,不好用

encoding试了,不好用

headers里get试了,不好用

最后用下面这个方法,反而是最好用的,也不是100%准确,但是在我用的过程中,这个是最好用的,反正也没有100%的,还不如用自己写的函数呢

python 复制代码
def detect_encoding(byte_text):  
    encodings_to_try = ['utf-8', 'gbk', 'gb2312', 'gb18030', 'ascii', 'latin1']  
    for encoding in encodings_to_try:  
        try:  
            return encoding  
        except UnicodeDecodeError:  
            continue  
    return None
相关推荐
weixin199701080166 分钟前
[特殊字符]️《二手ERP对接电商平台的总体方案:统一数据模型 + 事件驱动 + 灰度上线6原则》(附Python源码)
大数据·python
香菜TTT21 分钟前
大模型上下文协议(MCP):AI 应用的“USB-C”接口技术
开发语言·人工智能·经验分享
aramae31 分钟前
模拟实现strlen()函数 (C语言)
c语言·开发语言·后端
滚雪球~33 分钟前
量化交易 防止Windows电脑自动更新并重启
python·量化
jimy12 小时前
readelf 查看“派生类”的vtable符号
开发语言·c++
L@ncor2 小时前
第二章可能出现的问题
人工智能·python
y = xⁿ2 小时前
大模型基础概念
python
ctlover2 小时前
排序与查找算法详解
开发语言·python
用户8356290780512 小时前
如何使用 Python 给 Word 文档添加水印
后端·python
YYYing.2 小时前
【C++进阶系列 (七)】C++ RTTI 深度剖析:从 typeid 到 dynamic_cast 的底层之旅
开发语言·c++·c/c++·rtti