语音转文本python

离线本地识别(Whisper,无需联网)

基于OpenAI Whisper,完全离线,不用API密钥,支持长音频、多语种,对硬件有一定要求。

1. 环境安装

1.1 基础依赖

bash 复制代码
pip install openai-whisper
# 额外依赖(音频解码必备)
pip install ffmpeg-python
  • Windows/Mac/Linux 都需要安装 ffmpeg 并配置环境变量: 官网:ffmpeg.org/

2. 完整离线代码

python 复制代码
import whisper

# 加载模型:tiny/base/small/medium/large 越小越快、精度越低
model = whisper.load_model("base")

# 语音转文本
result = model.transcribe("test.mp3")  # 支持 mp3/wav/flac 等几乎所有音频

print("识别结果:")
print(result["text"])

模型选择参考

模型 速度 精度 适用场景
tiny 最快 一般 测试、简单场景
base 较快 良好 日常使用(推荐)
small 中等 较好 要求准确率
large 最慢 最高 专业场景、多口音

优点

  • 全程离线,无调用次数限制
  • 支持长音频、中英文混说、嘈杂环境
  • 支持 mp3、wav、flac、m4a 等绝大多数格式

实时麦克风语音转文字(在线+离线)

1. 百度API + 麦克风实时转写

需额外安装录音库:

bash 复制代码
pip install pyaudio

结合上面百度SDK,可实现边说话边转文字。

2. Whisper 实时麦克风转写

可结合 pyaudio 实时收音,分段识别。


相关推荐
用户38034165882972 小时前
手写 fMP4 muxer:从 ISO 14496-12 到能播的文件
ios·音视频开发
字节跳动视频云技术团队2 天前
火山引擎 AI MediaKit X 懂车帝,探索汽车内容智能创作新方式
人工智能·音视频开发
老孙讲技术4 天前
【监控开发】把车间未戴帽和烟火报警接进安监值班群:workwearDetect 对图与 setMessageCallback 订 smokeAlarm
后端·物联网·音视频开发
字节跳动视频云技术团队7 天前
豆包视频通话升级,火山引擎多模态传输系统提供技术支撑
人工智能·音视频开发
搬砖记录员8 天前
录屏总黑屏?90% 的人没关这个开关——浏览器硬件加速冲突排查指南
前端·音视频开发
老孙讲技术10 天前
把工地遮挡和掉线接进项目部:setMessageCallback 订 alarm 与 deviceStatus
后端·物联网·音视频开发
老孙讲技术10 天前
关店后有人进门,监控值班群却没响:用 setMessageCallback 订 human,再用 aiHuman 打开人形
后端·物联网·音视频开发
老孙讲技术10 天前
把园区几百路摄像头收进值班台账:bindDevice 入账与 listDeviceDetailsByPage 翻页
后端·物联网·音视频开发
老孙讲技术10 天前
把没网没电的户外点位接进出画值班台:unBindDeviceInfo 核 SIMCard 与 bindDeviceLive
后端·物联网·音视频开发
字节跳动视频云技术团队10 天前
从出片到出海:AI MediaKit 重塑短剧全链路生产力
人工智能·音视频开发