Charsiu-G2P

Charsiu-G2P

‒ 输入格式:"language关键字+文本"首先过transformer-AutoTokenizer按照letter进行编码;编码序列送入charsiug2p模型(T5ForConditionalGeneration)

‒ 输出格式:输出也是来源于发音词典 & g2p 模型预测结果两个部分

输入文本 g2p
德语 words = 'Deutsche', 'aktuelle', 'politische', 'Nachrichten', 'und', 'öffentliche', 'Topthemen' 'ˈdɔøʧə', 'ʔaktuɛllə', 'ˈpoːlitɪʃə', 'ˈnaxˌɾɪçtən', 'ˈʔʊnt', 'ʔœfˈfɛntlɪçə', 'ˈtɔptəmən' (--输出结果有问号??)
英语 words = 'Char', 'siu', 'is', 'a', 'Cantonese', 'style', 'of', 'barbecued', 'pork' 'ˈtʃɑɹ', 'ˈʃu', 'ˈɪs', 'ˈeɪ', 'ˌkæntəˈniz', 'ˈstaɪɫ', 'ˈəf', 'ˈbɑɹbɪkˌjud', 'ˈpɔɹk'
中文words = '高', '德', '地', '图' (一个中文对应6个byte-encoding) 'kɑʊ˥˥', 'tɤ˧˥', 'ti˥˩', 'tʰu˧˥'
日文words = 'こんにちは' 'koɴnitɕiha'

基于CharsiuG2P结果的TTS工作

XPhoneBERT-2023 interspeech

  • abstract
    • 爬取wiki上多个语言的文本,使用RoBert训练的方法和模型,随机mask文本,进行预测(取消预测下一句的任务);得到多语言phone-bert encoding;(330M phonemic description sentences, over 100+ language)
    • 这个encoder作为TTS 的text-encoder,效果比单独使用phone-encoding的VITS ,自然度有明显提升;
  • 步骤;
    • 文本数据清洗;
    • CharsiuG2P将文本转成phone,但是由于CharsiuG2P本身不会对单词对应的phone进行分界(输入一个单词返回一个序列结果;输入一句话,也是只有一个序列结果),所以使用音素结果分词工具 对CharsiuG2P的结果拆分;不同单词的phone结果之间用"symbol _ (U+2581)"进行分隔;----这一步整体的操作,作者做成了一个python包-text2phonemesequence,
    • white-space level tokenizer 得到1960 音素单元;(transformer不同的tokenizer方式
相关推荐
biter down30 分钟前
基于 Pywinauto 的 QQ 音乐 GUI 自动化测试实践
python
人道领域32 分钟前
【LeetCode刷题日记】669.修剪二叉搜索树
开发语言·python·算法
EntyIU2 小时前
mineru从安装部署到测试使用完整指南
python·ocr
安替-AnTi2 小时前
厚朴 APK 搜索接口分析
python·apk·解析·taobao
山川湖海3 小时前
AI时代快速学编程语言的陷阱(以Python为例)
大数据·人工智能·python
H Journey3 小时前
Supervisor 进程管理工具介绍
python·supervisor·linux 运维
春日见3 小时前
5分钟入门强化学习之动态规划算法与实现
大数据·人工智能·python·算法·机器学习·计算机视觉
DeniuHe4 小时前
sklearn 中所有交叉验证数据集划分方式完整总结
人工智能·python·sklearn
DeniuHe4 小时前
sklearn中不同交叉验证方法的场景适配
人工智能·python·sklearn
隐于花海,等待花开5 小时前
16.Python 常用第三方库概览 深度解析
python