爬取m3u8视频完整教程

爬取步骤:

1.先找到网页源代码

2.从网页源代码中拿到m3u8

3.下载m3u8

4.读取m3u8文件,下载视频

5.合并视频

首先我们来爬取一个星辰影院的电影:

下面我以这个为例:

我们需要在源代码中找到m3u8这个url:

紧接着我们利用下面的方法来进行视频的爬取:

输入网站的url:

python 复制代码
url="https://www.xcyy44.com/play/16166_1.html"

打印一下看一下是否有我们要的数据:

python 复制代码
resp=requests.get(url)
print(resp.text)

在搜索框中搜索一下发现正是我们要的url:

再利用正则表达式提取一下m3u8的地址:

python 复制代码
obj=re.compile(r"url: '(?P<url>.*?)',",re.S) 

得到m3u8的地址并打印:

python 复制代码
m3u8_url=obj.search(resp.text).group("url")
print(m3u8_url) 

接下来把m3u8文件下载下来:

用resp2来接受一下m3u8的地址,并把resp2写入到test文件中:

python 复制代码
resp2=requests.get(m3u8_url)

with open("test.m3u8","wb") as f:
    f.write(resp2.content)

resp2.close()
print('下载完毕')

然后将得到的这些m3u8进行解析:

先将test文件打开读取里面的内容,在利用循环便利一下里面的内容,在利用strip()去除空白,判断是否有#,如果有就继续遍历,找到没有的写入到video中完成一个打印一个:

python 复制代码
n=1
with open('test.m3u8','r',encoding='utf-8') as f:
    for line in f:
        line = line.strip()   
        if line.startswith('#'):   
            continue
        resp3=requests.get(line)
        f=open(f'video/{n}.ts','wb')
        f.write(resp3.content)
        f.close()
        resp3.close()
        n+=1
        print('完成一个')

最后在把视频片段合并在一起就ok了

完整代码:

python 复制代码
import requests
import re

obj=re.compile(r"url: '(?P<url>.*?)',",re.S)  #用来提取m3u8的地址

url="https://www.xcyy44.com/play/16166_1.html"

resp=requests.get(url)
m3u8_url=obj.search(resp.text).group("url")  #拿到m3u8的地址
# print(resp.text)
# print(m3u8_url)
resp.close()

#下载m3u8文件
resp2=requests.get(m3u8_url)

with open("test.m3u8","wb") as f:
    f.write(resp2.content)

resp2.close()
print('下载完毕')
#
# #解析m3u8文件
n=1
with open('test.m3u8','r',encoding='utf-8') as f:
    for line in f:
        line = line.strip()   #去掉空白
        if line.startswith('#'):   #如果以#开头则会继续循环
            continue

        #下载视频片段
        resp3=requests.get(line)
        f=open(f'video/{n}.ts','wb')
        f.write(resp3.content)
        f.close()
        resp3.close()
        n+=1
        print('完成一个')
相关推荐
我的xiaodoujiao1 小时前
使用 Python 语言 从 0 到 1 搭建完整 Web UI自动化测试学习系列 38--Allure 测试报告
python·学习·测试工具·pytest
Boilermaker19927 小时前
[Java 并发编程] Synchronized 锁升级
java·开发语言
沈浩(种子思维作者)7 小时前
真的能精准医疗吗?癌症能提前发现吗?
人工智能·python·网络安全·健康医疗·量子计算
MM_MS8 小时前
Halcon变量控制类型、数据类型转换、字符串格式化、元组操作
开发语言·人工智能·深度学习·算法·目标检测·计算机视觉·视觉检测
꧁Q༒ོγ꧂8 小时前
LaTeX 语法入门指南
开发语言·latex
njsgcs8 小时前
ue python二次开发启动教程+ 导入fbx到指定文件夹
开发语言·python·unreal engine·ue
alonewolf_998 小时前
JDK17新特性全面解析:从语法革新到模块化革命
java·开发语言·jvm·jdk
io_T_T8 小时前
迭代器 iteration、iter 与 多线程 concurrent 交叉实践(详细)
python
古城小栈8 小时前
Rust 迭代器产出的引用层数——分水岭
开发语言·rust
华研前沿标杆游学8 小时前
2026年走进洛阳格力工厂参观游学
python