树莓派5:使用SenseVoice进行语音识别

首先声明,树莓派上跑这个项目仅是演示其可行性,性能上别太较真。实测10分钟的英语MP3,从开始识别到出结果返回到UI上大约需要2分钟。作为对比,同样的文件在我PC上用了不到30秒。

SenseVoice的一些操作依赖于ffmpeg,因此需要先sudo apt install ffmpeg。使用最新版的Raspberry OS应该已经自带了。

我是使用Anaconda维护python环境的。树莓派下可以先把Anaconda装了:

bash 复制代码
cd
wget https://repo.anaconda.com/archive/Anaconda3-2025.12-1-Linux-aarch64.sh
sh Anaconda3-2025.12-1-Linux-aarch64.sh

一路yes,除非默认no。(当然全部打yes也不是不可以,只是每次重启后默认都会进conda环境)

启动conda环境:

bash 复制代码
source ~/anaconda3/bin/activate

创建名为sv的虚拟环境并安装SenseVoice:

bash 复制代码
conda create -n sv python=3.10 -y
conda activate sv

git clone https://github.com/FunAudioLLM/SenseVoice.git
cd SenseVoice

pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple

#如果在有N卡的PC上装(以CUDA 12.4 为例),
pip install -r requirements.txt \
  -i https://pypi.tuna.tsinghua.edu.cn/simple \
  --extra-index-url https://download.pytorch.org/whl/cu124

成功装完后运行很简单:python webui.py 即可。第一次运行时会继续下载一些必备的组件和模型。

但这样只能在树莓派本机上开浏览器操作。如果想在别的PC上访问这个树莓派,可以在启动webui前先修改一下webui.py打开webui.py,找到快结束的地方的"demo.launch()",修改为:

demo.launch(server_name="0.0.0.0",server_port=7860)

这样就可以让任意一台IP可达的PC访问了。SenseVoice使用起来也超简单的:浏览器里输入网址(http://树莓派的IP:7860)、上传mp3文件、选择语言、按下"Start"。稍等片刻后在Result框中复制文本就行了。

后台可以监视到活动。

经测试,x86_64的windows和linux也同样支持。

相关推荐
iwgh13 小时前
OddASR v2.5.5 版本更新:支持指定最大说话人分离数量、优化时延
语音识别·asr·语音转写·stt·oddasr
小影译片1 天前
什么是克隆配音(AI 语音克隆)
人工智能·自然语言处理·语音识别
浪潮BB机1 天前
2026年语音识别软件实测横评及准确率排名
人工智能·语音识别·效率工具·ai工具·录音转写·会议纪要
浪潮BB机2 天前
2026主流采访录音转文字工具实测横评记者该怎么选
语音识别·效率工具·ai工具·录音转写·会议纪要
math_hongfan2 天前
鸿蒙多模态AI交互高级:图文+语音+手势融合交互/多模态大模型端侧适配/跨模态检索高阶实战
人工智能·学习·华为·交互·语音识别·harmonyos·鸿蒙
新知图书3 天前
4.3 链接速读
人工智能·语音识别·ai助手·千问
合调于形3 天前
Bianfchheng (Baf) 《边城(八)》全文汉语拼音字母标调实测案例
人工智能·自然语言处理·人机交互·语音识别·学习方法
shxjnpl4 天前
2026年常见AI会议助手使用观察:飞书、腾讯会议、讯飞、通义、钉钉与熙瑾会悟有哪些差异?
人工智能·语音识别·智能硬件
HySpark4 天前
语音输入法实践:Rust 集成 Paraformer 推理引擎踩坑与优化过程
人工智能·后端·语音识别·熙瑾会悟
DLYSB_5 天前
博灵智能语音通知终端落地应用指南
人工智能·语音识别·报警灯