支持零样本和少样本的文本到语音48k star的配音工具：GPT-SoVITS-WebUI

skywalk81632025-07-07 11:42

零样本文本到语音 (TTS): 输入 5 秒的声音样本, 即刻体验文本到语音转换.
少样本 TTS: 仅需 1 分钟的训练数据即可微调模型, 提升声音相似度和真实感.
跨语言支持: 支持与训练数据集不同语言的推理, 目前支持英语、日语、韩语、粤语和中文.
WebUI 工具: 集成工具包括声音伴奏分离、自动训练集分割、中文自动语音识别(ASR)和文本标注, 协助初学者创建训练数据集和 GPT/SoVITS 模型.

可以直接在这里体验一下：AI Hobbyist TTS

只需要上传一段3-10秒的wav录音，即可进行声音的克隆。

安装

官方提供了一些非常易操作的软件包，方便用户直接使用。

咱们还是使用常规的安装方法

复制代码

sudo apt install ffmpeg
sudo apt install libsox-dev

复制代码

https://github.com/RVC-Boss/GPT-SoVITS
cd GPT-SoVITS

复制代码

pip install -r extra-req.txt --no-deps
pip install -r requirements.txt

复制代码

python GPT_SoVITS/inference_webui.py <language(optional)>
# 或
python webui.py

具体细节还需要再学习实践一下。