技术栈

说话人分离

独码侠
2 小时前
人工智能·音视频·语音识别·funasr·说话人分离·会议纪要·内网离线部署
FunASR语音识别生产部署实战:511MB音频47秒转写,离线落地 8 步、7 坑一次说清前面三篇分别讲了中文 ASR 选型、本机搭 FunASR 和长音频实测。这篇进入真正的内网生产环境:一台不通外网的 Ubuntu + NVIDIA GPU 服务器,把 FunASR 跑成稳定服务,再对接工作流编排实现会议纪要。
夜雨飘零1
2 年前
人工智能·pytorch·python·声纹识别·说话人分离·说话人日志
基于Pytorch实现的说话人日志(说话人分离)VoiceprintRecognition_Pytorch 是博主开源的一款声纹识别框架,该框架支持EcapaTdnn、ResNetSE、ERes2Net、CAM++等多种先进的声纹识别模型,也支持了MelSpectrogram、Spectrogram、MFCC、Fbank等多种数据预处理方法,支持AAMLoss、AMLoss、ARMLoss、CELoss等多种损失函数。该框架支持多种关于声纹识别的处理,比如声纹对,比声纹检索,以及本文章需要介绍的说话人日志(说话人分离)。
Luke Ewin
2 年前
python·开源·音视频·语音识别·说话人分离·说话人归类
开源的说话人分离项目 | 可以对指定的音频分离不同的说话人 | 通话录音中分离不同的说话人https://github.com/lukeewin/AudioSeparationGUI任意 PC 端 python version >= 3.8
我是有底线的