语音转文本python

离线本地识别(Whisper,无需联网)

基于OpenAI Whisper,完全离线,不用API密钥,支持长音频、多语种,对硬件有一定要求。

1. 环境安装

1.1 基础依赖

bash 复制代码
pip install openai-whisper
# 额外依赖(音频解码必备)
pip install ffmpeg-python
  • Windows/Mac/Linux 都需要安装 ffmpeg 并配置环境变量: 官网:ffmpeg.org/

2. 完整离线代码

python 复制代码
import whisper

# 加载模型:tiny/base/small/medium/large 越小越快、精度越低
model = whisper.load_model("base")

# 语音转文本
result = model.transcribe("test.mp3")  # 支持 mp3/wav/flac 等几乎所有音频

print("识别结果:")
print(result["text"])

模型选择参考

模型 速度 精度 适用场景
tiny 最快 一般 测试、简单场景
base 较快 良好 日常使用(推荐)
small 中等 较好 要求准确率
large 最慢 最高 专业场景、多口音

优点

  • 全程离线,无调用次数限制
  • 支持长音频、中英文混说、嘈杂环境
  • 支持 mp3、wav、flac、m4a 等绝大多数格式

实时麦克风语音转文字(在线+离线)

1. 百度API + 麦克风实时转写

需额外安装录音库:

bash 复制代码
pip install pyaudio

结合上面百度SDK,可实现边说话边转文字。

2. Whisper 实时麦克风转写

可结合 pyaudio 实时收音,分段识别。


相关推荐
花椒技术4 天前
2.46 秒生成 5 秒视频:拆解 H3 Max 的模型、推理栈与硬件协同
算法·音视频开发·视频编码
代码小学僧11 天前
从 0 到 1,记录我的第一个出海 SaaS 独立开发项目
前端·rpc·音视频开发
贾伟康12 天前
【HarmonyOS 7新能力|041】弱网直播优化工程封装:把接入逻辑放进可维护的分层结构
性能优化·harmonyos·arkts·音视频开发·直播
用户380341658829714 天前
Broadcast Extension 里的 Live Activity:一次跨进程妥协
ios·音视频开发
用户380341658829715 天前
macOS 录屏:ScreenCaptureKit 与 iOS 的分野,共用引擎的抽象层该切在哪
ios·音视频开发
用户380341658829717 天前
FFmpeg 在 iOS 上的裁剪、集成与包体控制
ios·音视频开发
花椒技术18 天前
把 AI 视频接进直播:提前生成、按次生成、持续生成怎么选?
agent·音视频开发
老孙讲技术18 天前
把连锁门店轮询抓拍和遮挡叫醒接进督导台-setDeviceSnapEnhanced与setMessageCallback
后端·物联网·音视频开发
用户380341658829721 天前
手写 fMP4 muxer:从 ISO 14496-12 到能播的文件
ios·音视频开发
字节跳动视频云技术团队23 天前
火山引擎 AI MediaKit X 懂车帝,探索汽车内容智能创作新方式
人工智能·音视频开发