python录音转文字

最近面试,有录音,想把录音快速转文字查漏补缺,但是找了几个小程序要花钱,不如直接写个脚本之际转
(下载FFmpeg 很重要)
访问 FFmpeg 官网:https://ffmpeg.org/download.html

找到 Windows 板块,点击 "Windows builds from gyan.dev"

下载 ffmpeg-release-full.7z

并需要配置环境变量

安装python依赖

复制代码
pip install openai-whisper
pip install ffmpeg-python

脚本

复制代码
import whisper

model = whisper.load_model("base")
result = model.transcribe("面试2.m4a", language="zh")
print(result["text"])
with open("transcript3.txt", "w", encoding="utf-8") as f:
    f.write(result["text"])

模型精度选择(免费)

  • base :最快,普通说话清晰够用

  • small :中文识别明显更好

  • medium :接近付费平台效果

  • large :最强,但需要显卡

另外由于我的电脑是有独显的,但是whisper没有调用到,直接用的cpu,导致转录很慢

修改方式,更新pytorch为可以兼容cuda显卡的

复制代码
pip uninstall -y torch torchvision torchaudio

pip install torch torchvision torchaudio -i https://pypi.tuna.tsinghua.edu.cn/simple --extra-index-url https://download.pytorch.org/whl/cu118

更新代码

复制代码
import whisper

# 加载模型,并手动移动到 GPU (cuda)
model = whisper.load_model("base").to("cuda")

# 转写时,关闭 FP16 可以避免某些兼容性警告
result = model.transcribe("面试2.m4a", language="zh", fp16=False)

print(result["text"])
with open("transcript3.txt", "w", encoding="utf-8") as f:
    f.write(result["text"])
相关推荐
NoteStream几秒前
MATLAB绘制带置信区间的折线散点图(科研绘图模板)
开发语言·matlab
卷无止境几秒前
Linux + Docker + FastAPI 工程化实践指南
后端·python·fastapi
tianyu2341 小时前
Java 正则表达式终极指南:从 Pattern 到 Matcher,从双重转义到性能优化,一篇全搞定
java·开发语言·正则表达式·group·find·pattern·matcher
caimouse3 小时前
ReactOS 窗口系统分析(23):键盘 — keyboard.c + kbdlayout.c
c语言·开发语言·计算机外设
Emily156853598703 小时前
Emerson 1C31129G03 Analog Input Module
java·开发语言·前端·plc·emerson·1c31129g03·input module
就叫_这个吧8 小时前
Java递归方法实现面包屑导航
java·开发语言
fīɡЙtīиɡ ℡8 小时前
AI 应用系统设计
java·开发语言·人工智能
聪明蛋子哟9 小时前
Stagehand v3多语言SDK:Python/Go/Rust/Java下的浏览器自动化统一方案
python·golang·rust
今天AI了吗10 小时前
Python 基础语法(一):常量、变量、输入输出与运算符
开发语言·数据库·人工智能·python·sql·深度学习·机器学习
卷无止境10 小时前
Windows 上丝滑开发 Python,并稳定构建 Docker 镜像
后端·python·docker