一个将本地视频/音频转换为文字或字幕文件的命令行工具

video-to-txt

一个将本地视频/音频转换为文字或字幕文件的命令行工具。支持自动语言检测与中文简繁转换,默认在本地运行,不需要申请任何 API Key。

Github 地址: video2audio2text: https://github.com/GaloisZhou/video2audio2text

功能

  • 提取视频音频为 MP3/WAV
  • 本地转录为字幕或纯文本(基于 faster-whisper
  • 自动语言检测:中文/英语,含粤语启发式识别
  • 中文脚本转换:简体/繁体(基于 opencc
  • 备用方案:OpenAI API(可选)

环境要求

  • Python: 支持 Python 3.8+ (已在 Python 3.13 测试通过)。
  • FFmpeg : 必须安装 FFmpeg 命令行工具。
    • macOS: brew install ffmpeg
    • Windows/Linux: 请参考 FFmpeg 官网安装并添加到 PATH。

安装

  1. 克隆或下载本项目。
  2. 安装 Python 依赖:
bash 复制代码
pip install -r requirements.txt
pip install faster-whisper

使用方法

命令行接口 (CLI)

运行 main.py 即可处理视频。

基本用法

提取音频并生成字幕(默认使用 base 模型,输出 srt 格式):

bash 复制代码
python main.py path/to/your/video.mp4
仅提取音频

如果不想要生成字幕,可以加上 --audio-only 参数:

bash 复制代码
python main.py path/to/your/video.mp4 --audio-only

使用 OpenAI API (解决本地安装问题)

如果本地 openai-whisper 安装失败(如在 Python 3.13 上),您可以使用 OpenAI API Key 来生成字幕:

bash 复制代码
# 方法 1: 通过命令行参数
python main.py video.mp4 --api-key sk-xxxxxx

# 方法 2: 通过环境变量 (推荐)
export OPENAI_API_KEY="sk-xxxxxx"
python main.py video.mp4

注意:API 模式会产生费用,请参考 OpenAI 官方定价。

指定模型和格式

您可以指定 Whisper 模型大小(模型越大越准但越慢)和输出格式:

bash 复制代码
python main.py video.mp4 --model medium --format vtt
  • --model: tiny, base, small, medium, large
  • --format: srt, txt, vtt, tsv, json
相关推荐
蝉蜕日记8 小时前
视频压缩 v1.1.31:高效压缩,无损画质,释放存储空间
音视频·生活·视频编解码·视频·软件需求
开发笔记-阿牛8 小时前
解析一款有意思的产品||CK6159A语音芯片设计的儿童专注力训练机-舒尔特玩具
stm32·单片机·嵌入式硬件·音频
啦啦啦~~~2223 天前
手机音量增强工具!免root可用,打开即是专业版!
学习·智能手机·音频·开源软件·智能音箱
运营小白8 天前
2026跨境电商AI内容自动化完整解决方案:基于Seonib与Veonib的图文+视频全域运营体系
人工智能·视频·跨境电商·geo·ai搜索·seonib·veonib
哦***713 天前
最后一块拼图补齐!华为大豆包时代开启✨
华为·音频·harmonyos
xcLeigh17 天前
Unity基础:Game视图详解——游戏预览、分辨率模拟与性能显示
游戏·unity·游戏引擎·音频·视频·game·play模式
byte轻骑兵17 天前
【LE Audio】CSIP精讲[5]: 蓝牙协同设备组的安全防护体系与实战规范
算法·安全·音频·le audio·低功耗音频
林澈在路上17 天前
最新版权清晰 AI音乐写歌工具软件App推荐 商用全场景实测指南
数据库·人工智能·ai·aigc·音频
VidDown1 个月前
VidDown 工具站:免费、本地优先的开发者工具箱
javascript·编辑器·音视频·视频编解码·视频
u152109648491 个月前
S.S.Audio PRO A2音频隔离器
嵌入式硬件·音视频·实时音视频·视频编解码·视频