FunASR的Java实现Paraformer实时语音识别 | 一款无需联网的本地实时字幕软件

0. 开发背景

我们在看直播时,没有视频字幕,可能看惯了视频字幕,来到直播中缺少字幕会感觉不习惯,特别是对于听力障碍的人群,只能依赖于字幕,那么这个软件可以解决直播,在线会议等场景中无字幕的情况。此外,我们还可以用于人机交互中,以及智能呼叫中心系统中(实时语音质检)。因此,开发一款可以运行在普通CPU中的实时字幕软件很有必要。

1. 使用技术栈

该软件使用JavaFX开发,为何是使用Java来开发桌面应用软件,因此作者我熟悉Java,对于其它开发语言没那么熟悉,所以选择了Java作为开发语言。

为了能够在内网或者是断开网络的情况下使用,这里不是调用云API方式实现,而是采用了本地电脑算力进行推理,并且不要求使用GPU,只需普通的CPU就可以进行实时语音识别,同时占用的资源很低。

模型采用国内大厂阿里巴巴达摩院开源的Paraformer-Streaming流式模型,导出为onnx格式,然后使用onnxruntime推理框架来推理。可以对模型进行int8规格的量化,使得占用的资源更少,推理的速度更快,关键是量化后模型精度基本不受影响。

2. 功能介绍

具体功能:

  1. 可以背景颜色透明,防止遮挡其它窗口。当鼠标停留在上面时,会显示半透明状态,方便用户设置软件。
  2. 可以设置显示的字体大小和字体颜色。
  3. 可以拖动显示的位置,默认在主屏幕的下方居中显示,如果你还有副屏,可以把字体显示拖动到副屏中。

3. 软件效果演示

Java开发的实时语音识别项目 | 实时语音识别 | 内网可用实时语音识别项目 | 开源的实时语音识别模型 | FunASR

4. 其它

项目已经开源,点击这里访问项目源码,如果无法访问,可以点击这里

博客:点击这里

相关推荐
电商API&Tina5 分钟前
【电商API接口】开发者一站式电商API接入说明
大数据·数据库·人工智能·云计算·json
湘美书院--湘美谈教育17 分钟前
湘美谈教育湘美书院网文研究:人工智能与微型小说选集
人工智能·深度学习·神经网络·机器学习·ai写作
uzong23 分钟前
Harness Engineering 是什么?一场新的 AI 范式已经开始
人工智能·后端·架构
墨有66625 分钟前
FieldFormer:基于物理场论的极简AI大模型底层架构,附带源码
人工智能·架构·电磁场算法映射
Mountain and sea44 分钟前
从零搭建工业机器人激光切割+焊接产线:KUKA七轴协同+节卡AGV+视觉检测实战复盘
人工智能·机器人·视觉检测
左左右右左右摇晃1 小时前
Java并发——synchronized锁
java·开发语言
K姐研究社1 小时前
阿里JVS Claw实测 – 手机一键部署 OpenClaw,开箱即用
人工智能·智能手机·aigc·飞书
卷积殉铁子1 小时前
从“手动挡”到“自动驾驶”:OpenClaw如何让AI开发变成“说话就行”
人工智能
机器之心1 小时前
扎克伯格正在打造自己的「AI分身」,并计划裁掉1.6万人
人工智能·openai
机器之心1 小时前
必看!Sebastian Raschka新博客盘点了所有主要注意力机制
人工智能·openai