利用命令行从youtube下载影片,并用huggingface的大语言模型翻译成中文

今天,从网络流媒体上下载字幕,并把它翻译成各种语言是一个非常常规的操作。

我创建了一个工作流程。可以根着这个工作流程,从网上先下载影片,然后转出字幕,最后再做翻译。

https://github.com/victorspaceRMW/download-Youtube-with-yt-dlp-and-translate-with-HuggingFace-s-whisper-model/tree/main

(1), 如何下载字幕?

在这里我们使用yt-dlp工具下载字幕和youtube视频:

https://wiki.archlinux.org/title/Yt-dlp#:\~:text=To get a list of the available formats%3A,(requires FFmpeg)%3A %24 yt-dlp -x -f bestaudio URL

你可以直接一次性的运行这个.sh文件,也可以一行一行的自己去执行。

bash 复制代码
#!/bin/bash

# 安装 yt-dlp
echo "安装 yt-dlp..."
pip install yt-dlp

# 安装 ffmpeg
echo "安装 ffmpeg..."
if ! command -v ffmpeg &> /dev/null
then
    echo "ffmpeg 未安装,正在安装..."
    sudo apt-get update
    sudo apt-get install -y ffmpeg
else
    echo "ffmpeg 已安装"
fi

# 下载 YouTube 视频
VIDEO_URL=$1
OUTPUT_FILE=$2

if [ -z "$VIDEO_URL" ] || [ -z "$OUTPUT_FILE" ]; then
    echo "用法: $0 <YouTube 视频 URL> <输出文件名>"
    exit 1
fi

echo "下载视频..."
yt-dlp -f bestvideo+bestaudio "$VIDEO_URL" -o "$OUTPUT_FILE"

echo "下载完成: $OUTPUT_FILE"

(2). 我写了两个脚本:

第一个是用于从 yt-dlp 下载好的文件里面提取出字幕的。也就是extract document.py。

请参考该文件。里面有非常详细的注释。

第二个是利用hugging上的大模型来进行中英互译。

需要提前pip install transformer!

其他的参考translator.py即可。

相关推荐
szxinmai主板定制专家3 小时前
半导体设备控制器:RK3576+CODESYS+RK182X异构架构,实现晶圆视觉检测与运动联动闭环
人工智能·fpga开发·架构·视觉检测·边缘计算·codesys·rk3576
空奈qwq3 小时前
PyTorch 进阶指南:从张量操作到模型训练全流程
人工智能·pytorch·深度学习
会议咨询3 小时前
2026年计算机工程、数据处理与机器学习国际会议(CDML 2026)
人工智能·机器学习·数据处理
武乐乐~3 小时前
LLaVA1.5-7B复现
人工智能
小淮AI3 小时前
AI生成PPT工具的功能观察:百度文库、Gamma、WPS AI
人工智能·powerpoint·wps
小爷毛毛(卓寿杰)3 小时前
【Agent 意图识别】输出协议、评估与置信度
人工智能·算法·大模型·prompt·大语言模型·agent
仙人掌_lz4 小时前
3090 上的部署两种基于Qwen3.5-4B 判别模型open jev:llama.cpp和 vLLM ,谁更快、谁更准
人工智能·llm·llama·vllm·判别模型·jev
温暖小土4 小时前
Spring AI 接入通义千问向量模型
java·人工智能·spring
龙腾AI白云4 小时前
AI微调技术:让通用大模型精准适配垂直行业
数据库·人工智能·机器学习·flask·scikit-learn
武雄(小星Ai)4 小时前
Opus 5.5 降价40%、GPT-6 API腰斩:2026年9月AI编程模型选购指南(附成本计算器)
人工智能·ai·编程语言