语音识别学习笔记

目录

开源的语音识别项目

端到端的多说话人语音识别序列化训练方法简介

[新一代 Kaldi: Two-pass 实时语音识别](#新一代 Kaldi: Two-pass 实时语音识别)


开源的语音识别项目

有哪些语音识别的开源项目? - 知乎

端到端的多说话人语音识别序列化训练方法简介

端到端的多说话人语音识别序列化训练方法简介 - 知乎

2.2 基于排列不变性训练Permutation Invariant Training (PIT)的多说话人语音识别

所谓排列不变性训练是在AED的基础之上,添加多个output分支(通常支持几个人就有几个分支),文本序列和输出序列经过排列组合,两两计算损失,如图1(b)所示。

2.3 基于SOT的多说话人语音识别

SOT方法网络结构与AED完全相同,只有一个output分支,不同的是标签序列化方式。SOT引入了一个新标签speaker change<sc>,用于标记上下文中说话人的改变,如图1(c,d)所示,标签的生成可以简单的以说话人出现的顺序作为依据,依次序列化,碰到说话人切换就添加一个<sc>特殊标签,损失依然采用交叉熵。这样一个output就能输出多个说话人识别结果,实现简单,效果提升明显。

新一代 Kaldi: Two-pass 实时语音识别

2nd-pass: 使用一个非流式模型。当 1st-pass 检测到一个 endpoint 之后,把上一个 segment 的音频送给非流式模型解码,然后把结果做为这个 segment 最终的结果.

Two-pass 既可以结合流式模型延迟小的优点,又可以利用非流式模型识别率高的优点。

新一代 Kaldi: Two-pass 实时语音识别 - 知乎

相关推荐
小雪崩12 小时前
嵌入式学习 day61-62:IMX6ULL驱动——系统移植
学习
一隅论数智13 小时前
OWL(Web Ontology Language)介绍与使用举例(二)
大数据·经验分享·笔记·学习·自然语言处理·学习方法·政务
我命由我1234513 小时前
Photoshop - Photoshop 使用内容识别填充移除对象
学习·职场和发展·产品运营·求职招聘·职场发展·学习方法·photoshop
梓雨枔14 小时前
JavaScript+快速学习,简单好用~
javascript·学习
老王爱玩车14 小时前
自定义类型:结构体
c语言·开发语言·学习
Hello_Pyhx15 小时前
VoiceStudio v0.5.6:从桌面生成到本地语音 API
ai·语音识别·克隆·声音
JWASX15 小时前
Java 转 go 学习 - GRPC(1)
学习·golang
鬼手点金16 小时前
opencode-全能开发者配置
java·linux·服务器·前端·javascript·学习·前向传播
代码山河17 小时前
Java学习路线图:2026年最新版,从入门到架构师
java·学习·架构·教程·面向对象·项目
sunoo-22917 小时前
【嵌入式Linux驱动学习】Day1-Day2 全流程梳理:环境搭建→U-Boot→内核→根文件系统→驱动基础
linux·运维·驱动开发·笔记·学习·阿里云·恩智浦