Python对腾讯课程视频链接自动化抓取

近期看到腾讯课堂停服的通知,心痛之余,想到啊,我还有很多课程没看完,就剩下两个月的事件,我也来不及看完了。怎么办?

索性,我研究下,怎么把视频保存下来。

接下来请听我分析。

所用技术

Python、Selenium

技术方案

简单来说,通过Selenium打开浏览器,通过课程视频播放详情页的链接,获取整个课程的标题和视频链接。

难点

腾讯课堂的视频不是mp4直接播放的,是m3u8地址。这就意味着,不能通过dom src的js方式简单获取,但通过代码接口逆向过于耗费时间和经历。

使用前,应该先通过测试监听的方式,启动浏览器

复制代码
C:
cd C:\Program Files\Google\Chrome\Application
chrome.exe --remote-debugging-port=9527 

这里的端口指的是selenium要监听的那个,这里指认了,一会自动化执行的时候才会在这个窗口。这里是必要的,因为腾讯课堂限制必须登录,才能访问页面,所以启动后要先登录。然后才能执行抓取程序。

后面的步骤

  1. 启动监听程序
  2. 抓取课程链接程序
  3. 通过课程链接抓取真正视频链接程序。(这一步是相对难的)

如何找视频真实链接?

我是通过监听Network找到m3u8的地址,逐个视频自动获取m3u8地址,然后存储到本地。

python 复制代码
opt = ChromeOptions()
opt.add_experimental_option("debuggerAddress", "127.0.0.1:9527")  # 指定端口为9527,要和启动时调试端口一样
# 通过option参数,设置浏览器不关闭
  caps = {
    "browserName": "chrome",
    'goog:loggingPrefs': {'performance': 'ALL'}  # 开启日志性能监听
  }
  # 将caps添加到options中
  for key, value in caps.items():
    opt.set_capability(key, value)

webdriver.Chrome(options=opt)
performance_log = driver.get_log('performance')
# performance_log 通过这里获取真实的m3u8地址

最后通过下载工具下载

我使用的是N_m3u8DL。

通过执行命令

cmd 复制代码
.\N_m3u8DL-CLI_v3.0.2 "下载地址uri" --workDir "下载后保存的位置" --saveName "下载后要保存的文件名" 

可以通过python执行

python 复制代码
import os
os.system("") # 在此执行命令

也可以保存到一个文件,把所有的下载命令,通过python直接执行那个脚本。

最后:欢迎各位点评,如果想要源码,可以与我联系。

相关推荐
执风挽^10 分钟前
Python基础编程题2
开发语言·python·算法·visual studio code
纤纡.25 分钟前
PyTorch 入门精讲:从框架选择到 MNIST 手写数字识别实战
人工智能·pytorch·python
大大大反派26 分钟前
CANN 生态中的自动化部署引擎:深入 `mindx-sdk` 项目构建端到端 AI 应用
运维·人工智能·自动化
kjkdd37 分钟前
6.1 核心组件(Agent)
python·ai·语言模型·langchain·ai编程
小镇敲码人43 分钟前
剖析CANN框架中Samples仓库:从示例到实战的AI开发指南
c++·人工智能·python·华为·acl·cann
萧鼎1 小时前
Python 包管理的“超音速”革命:全面上手 uv 工具链
开发语言·python·uv
缺点内向1 小时前
C#: 告别繁琐!轻松移除Word文档中的文本与图片水印
c#·自动化·word·.net
alvin_20051 小时前
python之OpenGL应用(二)Hello Triangle
python·opengl
机器视觉的发动机1 小时前
AI算力中心的能耗挑战与未来破局之路
开发语言·人工智能·自动化·视觉检测·机器视觉
铁蛋AI编程实战2 小时前
通义千问 3.5 Turbo GGUF 量化版本地部署教程:4G 显存即可运行,数据永不泄露
java·人工智能·python