语音转文本python

离线本地识别(Whisper,无需联网)

基于OpenAI Whisper,完全离线,不用API密钥,支持长音频、多语种,对硬件有一定要求。

1. 环境安装

1.1 基础依赖

bash 复制代码
pip install openai-whisper
# 额外依赖(音频解码必备)
pip install ffmpeg-python
  • Windows/Mac/Linux 都需要安装 ffmpeg 并配置环境变量: 官网:ffmpeg.org/

2. 完整离线代码

python 复制代码
import whisper

# 加载模型:tiny/base/small/medium/large 越小越快、精度越低
model = whisper.load_model("base")

# 语音转文本
result = model.transcribe("test.mp3")  # 支持 mp3/wav/flac 等几乎所有音频

print("识别结果:")
print(result["text"])

模型选择参考

模型 速度 精度 适用场景
tiny 最快 一般 测试、简单场景
base 较快 良好 日常使用(推荐)
small 中等 较好 要求准确率
large 最慢 最高 专业场景、多口音

优点

  • 全程离线,无调用次数限制
  • 支持长音频、中英文混说、嘈杂环境
  • 支持 mp3、wav、flac、m4a 等绝大多数格式

实时麦克风语音转文字(在线+离线)

1. 百度API + 麦克风实时转写

需额外安装录音库:

bash 复制代码
pip install pyaudio

结合上面百度SDK,可实现边说话边转文字。

2. Whisper 实时麦克风转写

可结合 pyaudio 实时收音,分段识别。


相关推荐
大辉狼_音频架构3 天前
AudioReach Plugin 机制问题解答
嵌入式·音视频开发
大辉狼_音频架构4 天前
AudioReach:Tinyalsa PCM Plugin 机制
嵌入式·音视频开发
老孙讲技术4 天前
凌晨三点报警全乱了:一个 callback 地址,如何把设备托管消息拆成多客户流水线?
物联网·音视频开发
ltlovezh8 天前
点播 Seek 性能优化:丢帧的原理、判定与硬解落地
音视频开发
音视频牛哥9 天前
把Android设备变成RTSP网络摄像机:SmartMediaKit 后台采集、编码与轻量级RTSP服务实践
音视频开发·视频编码·直播
木易士心12 天前
深度解析 Android 音频焦点处理与实战开发
音视频开发
字节跳动视频云技术团队16 天前
豆包视频通话背后,火山引擎重构 Agent 时代多模态传输底座
人工智能·agent·音视频开发
大辉狼_音频架构17 天前
Vol.05 VendorHAL-NXP
嵌入式·音视频开发
字节跳动视频云技术团队17 天前
不止于 4K,火山引擎画质增强让视频从清晰走向细腻
人工智能·音视频开发
字节跳动视频云技术团队19 天前
火山引擎 × 央视网 打造 2026 世界杯沉浸式观赛盛宴
人工智能·音视频开发