基于fastapi和faster-whisper打造在线语音识别文字

语音转录文字,faster-whisper 效果是很不错的,不过部署、安装、配置问题不少,尤其是需要CUDA加速时,不仅要安装CUDA 还需要额外安装cuDNN和cuBLAS等,在安装之前还要升级显卡驱动,这难到不少小白用户。基于此,利用 fastAPI和faster-whipser 搞了一个在线语音识别文字网站。使用简单,直接上传 音频、视频等即可开始识别,无需注册无需登录。

在线免费语音转文字 stt.pyvideotrans.com

实现原理

fastAPI搭建路由服务,起一个模板页面,前端使用Layui做个简单样式。

直接上传 音频、视频文件,后端将使用ffmpeg 将文件转为 wav 格式的音频,再传递给 faster-whisper 模型处理,等待识别完成后,将结果返回给前端,前端获取到结果后,将在页面渲染显示并提供下载按钮。

使用方法

准备待识别的音频或视频

  1. 选择想要转录为文字的音频或视频,如果背景声较大,建议预先分离出背景声,只保留单纯人声,识别效果会更好。推荐背景分离工具请查看 juejin.cn/post/734161...
  2. 目前限制允许上传的文件最大尺寸为 30MB,建议预先从视频里提出音频文件,单独只上传音频,这样能大幅降低尺寸,原本100MB的视频提取出音频后,可能不到30MB。

上传进行识别

点击选择文件或者直接拖拽到上传区域,然后选择"视频里的说话语言",要特别注意,必须选择和视频里说话语言完全一致的语言,否则会出错。

选择后,点击"开始上传并识别"按钮。会自动开始上传,上传完毕后进入排队状态,右侧区域将显示当前排队情况。

识别完成后下载

当识别完成后,右侧区域将显示"已完成"字样,点击就会在下方显示当前识别出的字幕内容和字幕下载按钮。

点击可下载

特别需要注意的几点

  1. 音视频文件尽量干净,无背景噪声,如果有,尽量提前分离,确保人声足够清晰。
  2. 所选视频语言必须与视频里人类说话语言完全一致,否则无法识别
  3. 请等待前一个任务完成后再继续下一个

当前限制

很显然,免费服务必须有所限制,尤其是这类重资源消耗的AI服务,我的服务器资源非常有限,因此限制上传尺寸不大于30MB,上传后排队挨个处理。

如果你上传后在排队阶段不想识别了,请点击右侧删除按钮移除该任务,以减少排队数量。

相关推荐
zhz52141 小时前
AI数字人融合VR全景:从技术突破到可信场景落地
人工智能·vr·ai编程·ai数字人·ai agent·智能体
数据与人工智能律师1 小时前
虚拟主播肖像权保护,数字时代的法律博弈
大数据·网络·人工智能·算法·区块链
武科大许志伟2 小时前
武汉科技大学人工智能与演化计算实验室许志伟课题组参加2025中国膜计算论坛
人工智能·科技
哲讯智能科技2 小时前
【无标题】威灏光电&哲讯科技MES项目启动会圆满举行
人工智能
__Benco2 小时前
OpenHarmony平台驱动开发(十七),UART
人工智能·驱动开发·harmonyos
小oo呆2 小时前
【自然语言处理与大模型】Windows安装RAGFlow并接入本地Ollama模型
人工智能·自然语言处理
开放知识图谱2 小时前
论文浅尝 | HOLMES:面向大语言模型多跳问答的超关系知识图谱方法(ACL2024)
人工智能·语言模型·自然语言处理·知识图谱
weixin_444579302 小时前
基于Llama3的开发应用(二):大语言模型的工业部署
人工智能·语言模型·自然语言处理
一点.点2 小时前
自然语言处理的简单介绍
人工智能·深度学习·自然语言处理
CodeJourney.2 小时前
基于MATLAB的生物量数据拟合模型研究
人工智能·爬虫·算法·matlab·信息可视化