制作语音数据集: 爬取B站音视频+基于whisper语音识别标注

本文以制作小学课堂音频数据集为例子

1. 搜索关键字获取音视频链接

python 复制代码
if __name__ == "__main__":
    
    with sync_playwright() as playwright:
        searcher = BLVideoSearch(playwright, headless=True)
        url = searcher.make_url(keyword=["小学公开课"])
        searcher.run(url, outfile="videos_url.txt")

得到链接列表

2. 批量下载和实时视频转音频

you-get: 根据链接下载视频文件

ffmpeg: 将视频实时转音频

subprocess: 通过子进程执行上述命令

2.1 多线程批量下载 (you-get)

you-get 子进程:

python 复制代码
command = [YOUGET, "-o", self.video_dir, "-O", utt, task]
                    subprocess.run(command, check=True, stdout=subprocess.DEVNULL, stderr=subprocess.DEVNULL)

2.2 实时视频转音频

ffmpeg 子进程:

python 复制代码
command = [FFMPEG, "-i", video_file, '-ac', '1', '-ar', '16000', audio_file]
                    subprocess.run(command, check=True, stdout=subprocess.DEVNULL, stderr=subprocess.DEVNULL)

下载视频文件信息如下:

最终保存为音频文件

3. 使用whisper进行断句和语音识别

相关推荐
随风而飘1865 小时前
R&S 罗德与施瓦茨 R&S VTC-VTE-VTS 视频测试仪
音视频
学如逆水,不进则退5 小时前
在线免费音频剪辑:NBTools 可视化波形裁剪 MP3/WAV,本地处理免上传
前端·音视频
ASKED_20199 小时前
从 ASR+LLM+TTS 到 GPT‑Live:解读语音智能新范式
人工智能·gpt·语音识别
李子红了时11 小时前
批量修改MP4视频文件名并导出标题txt文本
前端·音视频
AnyChat研究院12 小时前
全栈信创深度适配,AnyChat为多领域数智化升级夯实安全可控根基
音视频·信创·安全可控·国产化·信创国产化·信创适配·信创音视频
格尔曼Noah13 小时前
文本转音频技术选型指南:2026年主流TTS与端到端语音大模型深度对比
人工智能·语音识别
鸢惜14 小时前
菜鸟教程学习笔记——html(九)
音视频
人才瘾大15 小时前
Android录屏内部音频录制完全指南:原理、限制与方案选型
android·音视频
小柯南敲键盘15 小时前
跨境电商图片翻译与视频字幕翻译工具推荐
python·音视频
RockWang.16 小时前
【模型】MiniMax-H3 多模态参考视频生成
音视频