想在本地做语音克隆,很多人第一反应就是找参数更大的模型,随后又被显存占用劝退。老王最近试了 LuxTTS,思路恰好反过来:不靠堆硬件,先把本地生成的速度和门槛压下来。显存不大,也能把语音克隆跑起来。
LuxTTS 是开源语音克隆模型。公开给出的速度可达到其他类型语音克隆的 10 倍;在显卡上运行时,实时速度能到 150 倍左右,占用显存约 1GB。纯 CPU 也能跑得很快,声音效果可以和体积更大的模型相比。对电脑配置一般、又想把生成放在本地完成的人来说,确实省心不少。
先看运行方式
软件支持 Windows 运行。安装或放置程序时,路径尽量别用中文,能少掉一类启动问题。启动后会出现黑色窗口,偶尔看着像卡住了,不用急着关掉,按几下回车键,等程序正常读条即可。
读条开始后,窗口里能看到当前是 CPU 在跑,还是 GPU 在跑;下方会给出本地运行地址。把地址放进浏览器打开,就能进入操作页面。黑色窗口是整个程序的后台,操作页面开着时也别把它关掉。

生成流程
操作页面没有太多绕弯的地方。先在"待合成文本"里输入要生成的内容,再导入一段参考音频;不想提前准备音频,也可以直接录一段。参考声音准备好后,音量、音色和语速都能按需求调整。设置完成,点生成就行。
平时做视频配音,往往不是只生成一句话。内容稍长时,更看得出速度差。老王用大约 200 字的文字测试过,纯 CPU 也能较快完成;换成显卡后,生成速度会更快。生成结束后,可以直接试听,再和参考音频对比,判断成品是否接近想要的声音。

相似度怎么调
实际试听下来,生成结果和参考音频的音色会有细微区别。页面里的"音色偏置"会影响相似度。老王把数值设为 0.9 时,已经能听出参考声音的特点;调到 1 后,相似度会更高。语速同样可以自由调整,适合根据文案节奏慢慢找合适的状态。
语音克隆不是把一段声音丢进去就结束,参考音频、音色偏置和语速都会影响最终听感。LuxTTS 把常用调节项放在页面里,试听后再改一两处参数,整个过程比较直观,不需要反复折腾复杂设置。

适合哪些需求
需要给视频配音、做不同角色的口播,或者想保留自己的声音风格时,本地语音克隆会方便不少。尤其是显卡显存不大的电脑,LuxTTS 约 1GB 的显存占用,能让不少人先用起来,不必一上来就上很重的大模型。
我自己更看重的是本地运行带来的连贯感:写好文本,导入或录入参考声音,调好音量、音色和语速,再试听成品。流程顺下来后,配音工作会清楚很多。老王建议先用短文本跑一遍,把音色偏置和语速调到顺耳,再处理更长的内容。
老王的体验
LuxTTS 不是靠复杂功能取胜,重点在于速度、显存占用和本地操作门槛。Windows 能运行,纯 CPU 有速度,显卡运行又能把效率拉高。对于需要多次生成、反复试听的人来说,少等一会儿,整个制作节奏就会轻松不少。
如果你手头电脑显存不大,又有本地语音克隆的需求,可以从 LuxTTS 开始试试。启创网还有不少适合做内容、提升效率的工具,按自己的需求慢慢挑就行。
如果内容对你有帮助,相关资料会整理在评论区,按需查看就行。
免责声明:本文分享的所有内容均来源于网络,仅供学习交流使用,请勿用于商业用途。如有侵权,请联系我们删除。使用过程中请遵守相关法律法规,因使用不当造成的任何后果,本账号不承担任何责任。