使用 F5 TTS 文字转音频

F5 TTS 支持 ZeroShot 音频克隆,只有将需要音频传给模型,模型既可以生成以对应声音生成的音频,F5 最强大的地方就是可以使用定制的人声。F5 使用了 DIT 架构进行训练,结构如下:

本地使用 F5 TTS

F5 使用很简单,本地进行安装,我使用 ModelScope 的镜像,免去了一些环境的配置与安装。通过命令行生成音频,这里使用了默认的系统的人声,如果需要使用定制人声添加两个参数即可 --ref_audio "ref_audio.wav" \ --ref_text "The content, subtitle or transcription of reference audio." \, ref_text 不是必须的。

复制代码
## 安装 F5
pip install git+https://github.com/SWivid/F5-TTS.git

## 运行
f5-tts_infer-cli --model "F5-TTS"   --gen_text "新疆阿尔金山作为中国四大无人区之一,平均海拔四千五百八十米,那里人烟稀少,却有一群维护着格库铁路通信畅通的年轻通信工。二十四岁的辛晓雨常年工作在浩渺无垠的戈壁上,用认真负责 的态度悉心维护着通信基站的设施设备,保障着铁路安全运行。"

总结

F5 TTS 效果还不错,可以使用定制的人声,不需要进行训练,中文无法识别数字,可以先通过LLM 进行转换将数字转为中文。

相关推荐
ZHW_AI课题组4 天前
调用通义千问实现语音合成并将合成的音频通过扬声器播放
python·音视频·语音合成·通义千问·tts
背水7 天前
Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback论文学习
人工智能·学习·多模态·tts
天命小猪1 个月前
FishSpeech应用篇——专属朗读人
语音合成·tts
猪萌萌1 个月前
使用iOS个人声音与SoVITS训练个人AI语音(10分钟快速上手)
人工智能·ios·tts·文字转语音·sovits
AI完全体2 个月前
【AI应用】免费的文本转语音工具:微软 Edge TTS 和 开源版 ChatTTS 对比
人工智能·机器学习·edge·tts·文本转语音·chattts·ai 应用
AI云极2 个月前
OpenAI-Edge-TTS:本地化 OpenAI 兼容的文本转语音 API,免费高效!
开源·tts·文字转语音
MavenTalk3 个月前
音频合成的常见问题
ffmpeg·音视频·语音识别·tts
浩哥依然3 个月前
【论文笔记之 Mega-TTS2】Boosting Prompting Mechanisms For Zero-Shot Speech Synthesis
tts·语音生成·音频大模型·语音生成大模型·mega-tts2
Luke Ewin3 个月前
解决安装pynini和WeTextProcessing报错问题
python·大模型·llm·语音识别·语音合成·tts·asr
MavenTalk3 个月前
微信小程序TTS解决方案
人工智能·微信小程序·小程序·tts·ai语音合成