Charsiu-G2P

Charsiu-G2P

‒ 输入格式:"language关键字+文本"首先过transformer-AutoTokenizer按照letter进行编码;编码序列送入charsiug2p模型(T5ForConditionalGeneration)

‒ 输出格式:输出也是来源于发音词典 & g2p 模型预测结果两个部分

输入文本 g2p
德语 words = 'Deutsche', 'aktuelle', 'politische', 'Nachrichten', 'und', 'öffentliche', 'Topthemen' 'ˈdɔøʧə', 'ʔaktuɛllə', 'ˈpoːlitɪʃə', 'ˈnaxˌɾɪçtən', 'ˈʔʊnt', 'ʔœfˈfɛntlɪçə', 'ˈtɔptəmən' (--输出结果有问号??)
英语 words = 'Char', 'siu', 'is', 'a', 'Cantonese', 'style', 'of', 'barbecued', 'pork' 'ˈtʃɑɹ', 'ˈʃu', 'ˈɪs', 'ˈeɪ', 'ˌkæntəˈniz', 'ˈstaɪɫ', 'ˈəf', 'ˈbɑɹbɪkˌjud', 'ˈpɔɹk'
中文words = '高', '德', '地', '图' (一个中文对应6个byte-encoding) 'kɑʊ˥˥', 'tɤ˧˥', 'ti˥˩', 'tʰu˧˥'
日文words = 'こんにちは' 'koɴnitɕiha'

基于CharsiuG2P结果的TTS工作

XPhoneBERT-2023 interspeech

  • abstract
    • 爬取wiki上多个语言的文本,使用RoBert训练的方法和模型,随机mask文本,进行预测(取消预测下一句的任务);得到多语言phone-bert encoding;(330M phonemic description sentences, over 100+ language)
    • 这个encoder作为TTS 的text-encoder,效果比单独使用phone-encoding的VITS ,自然度有明显提升;
  • 步骤;
    • 文本数据清洗;
    • CharsiuG2P将文本转成phone,但是由于CharsiuG2P本身不会对单词对应的phone进行分界(输入一个单词返回一个序列结果;输入一句话,也是只有一个序列结果),所以使用音素结果分词工具 对CharsiuG2P的结果拆分;不同单词的phone结果之间用"symbol _ (U+2581)"进行分隔;----这一步整体的操作,作者做成了一个python包-text2phonemesequence,
    • white-space level tokenizer 得到1960 音素单元;(transformer不同的tokenizer方式
相关推荐
lupai6 小时前
手机在网状态接口实测效果与质量评估
大数据·python·智能手机·api接口
荷蒲7 小时前
【小白量化Qbuddy】用AI设计miniQMT指标公式计算量化平台
人工智能·python·机器人
阿童木写作7 小时前
跨境电商图片翻译工具,批量翻译视频字幕一键抠图
人工智能·python·音视频
何以解忧,唯有..8 小时前
Pydantic 介绍与使用:Python 数据校验的现代方案
数据库·python·microsoft
又幸福了哥9 小时前
Python入门到高级(知识点七)
python
又幸福了哥10 小时前
Python入门到高级(知识点六)
python
维克兜率天10 小时前
【维克】动量指标家族:RSI、ROC、CCI、Momentum全面解析
python·算法
XZ-07000110 小时前
week2-1-可视化
开发语言·python
Java后端的Ai之路11 小时前
14、Python - 责任链模式
服务器·开发语言·人工智能·python·责任链模式
张人玉11 小时前
基于 Python 机器学习 与 PyQt5 桌面框架开发的可视化分析系统——基于大数据的网上购物消费行为分析可视化大屏
python·qt·机器学习·echarts·three.js