小电影字幕的生成(Whisper)和翻译(ChatGPT)

一. 字幕对于不同语言的电影来说都是非常重要的。

对于观看非母语电影的人群,字幕能够帮助观众更好地理解对话和情节发展。

二. 电影字幕的生成

电影字幕的生成,依赖语音转文本(Speech-to-Text,STT)的技术。

随着语音技术和机器学习的发展,语音转文本技术也取得了长足的进步。

而OpenAI的Whisper是目前识别率较高的模型。下面讲展示如何调用Whisper来得到电影的字幕.

Whisper是一种自动语音识别(ASR)系统,它是基于680,000小时的多语言和多任务监督数据进行训练的,使用了大量的多样化音频数据进行训练,并且具有多任务的能力。

Whisper可以识别的语言包括但不限于中文、英语、日语、西班牙语、法语、德语、意大利语、葡萄牙语、荷兰语、俄语和韩语等。

1. 生成电影的字幕文件

Whisper文件上传目前限制为25 MB,支持以下输入文件类型:mp3、mp4、mpeg、mpga、m4a、wav和webm。为了减少上传文件的体积,可以先提取电影的声音到mp3文件。

FFmpeg是一个开源的跨平台音视频处理工具集,它提供了丰富的功能和命令行工具,用于处理、转码、编辑和流媒体处理等任务

1.1 使用FFmpeg把视频转换成音频:

css 复制代码
ffmpeg -i input.mp4 -vn -acodec libmp3lame -q:a 6 output.mp3

这将从 input.mp4 的文件中提取音频,并将其保存为output.mp3文件。

在这个命令中,使用了libmp3lame编解码器来编码音频为MP3格式,并且通过-q:a参数指定了音频质量,值越小质量越低,一般取值范围为0-9,其中0为最高质量。

1.2 调用Whisper生成字幕文件

ini 复制代码
curl https://api.openai.com/v1/audio/transcriptions \
  -H "Authorization: Bearer {替换成你的OpenAI API KEY}" \
  -H "Content-Type: multipart/form-data" \
  -F file="@output.mp3" \
  -F model="whisper-1" \
  -F response_format="srt" > output.srt

output.mp3 是上一步生成的音频文件,output.srt 是语音识别出来的字幕文件.

如果在内网连不上OpenAI,可以通过添加 -x proxyHost:proxyProxy 参数来处理.

另外还可以通过指定语音的语言和使用ChatGPT修正字幕的错别字和标点符号.

2. 使用ChatGPT翻译电影字幕

ChatGPT不支持直接翻译文件,可以考虑通过第三方工具来翻译. 例如:

如何使用ChatGPT翻译文档(PDF/EPUB/Word/Excel/PowerPoint/SRT)?

CahtGPT翻译的优势主要在于关联上下文,就是可以根据字幕文本相邻句子来优化翻译的效果, 比起机器翻译要更精确和流程一些.

相关推荐
TENSORTEC腾视科技2 分钟前
腾视科技TS-SG-SM7系列AI算力模组:32TOPS算力引擎,开启边缘智能新纪元
人工智能·ai·算力·ai算力模组·超低功耗·超强算力·灵活扩展
Deepoch8 分钟前
Deepoc 具身模型开发板:让农业除草机器人实现更稳定的自主作业
人工智能·机器人·开发板·具身模型·deepoc·除草
云栖梦泽在9 分钟前
AI安全入门:AI系统被攻击的常见场景与应对思路
大数据·人工智能·安全
zh路西法10 分钟前
【Qwen2.5本地部署】超简单pytorch-gpu部署教程
人工智能·pytorch·python
盼兮12 分钟前
用AI编程从零搭建一个响应式数据看板
前端·人工智能·数据可视化
轻刀快马13 分钟前
从马具到 AI 智能体的“外骨骼”:扒开 Harness 的底层进化史
人工智能
羊羊小栈14 分钟前
基于「YOLO目标检测 + 多模态AI分析」的水果蔬菜病害智能检测分析预警系统
人工智能·yolo·目标检测·计算机视觉·毕业设计·大作业
皮卡丘ZPC14 分钟前
GAIA2: BENCHMARKING LLM AGENTS ON DYNAMIC AND ASYNCHRONOUS ENVIRONMENTS
人工智能·语言模型·自然语言处理
weixin_4493108417 分钟前
小满OKKICRM与轻易云数据集成平台无缝对接
人工智能·小满
victory043117 分钟前
DeepSeek LLM Scaling Open-Source Language Models with Longtermism 中文翻译
人工智能·语言模型·自然语言处理