第026章:从坑里上来了!ComfyUI文生音频IndexTTS2+Qwen3-TTS本地部署!

从7月6号的下午开始,一直到7月10号的下午,整整花费了一周的时间。我终于从IndexTTS2模型的本地部署的坑里爬上来了!不容易呀!给自己点个赞!

最核心的原因是"TensorFlow"这个东西一直在搞鬼,TensorFlow 是一个深度学习框架,和 PyTorch 是同一类东西,是由Google 开发的框架,过去几年非常流行,现在更多用于一些老项目或特定领域。

而对我们学习ComfyUI来说用处不是特别大,可以不用。

既然用处不大,我们用的ComfyUI-V9.5的集合包里为什么会有这个东西呢?是因为我们的集合包里有"ComfyUI-HAIGC-QwenTTS"这个插件,这个插件需要 TensorFlow,在加载这个插件时会把TensorFlow带进去。

下来我把我最终成功的方法,整理出来分享给大家!

第一步:先去custom_nodes文件夹里面把"ComfyUI-HAIGC-QwenTTS"和"ComfyUI-TD-Qwen3TTS"两个插件给删掉(如下图)。

第二步:启动ComfyUI,打开第021-023章我们搭建的"Qwen3音色设计和克隆"的工作流。

这个时候会发现我们的工作流变成了下图这样:

这是因为,这个工作流里我们用的是"ComfyUI-TD-Qwen3TTS"插件里面的节点,我们把"ComfyUI-TD-Qwen3TTS"删掉以后,会导致节点丢失。

第三步:把models文件夹下面的"Qwen3-TTS-Models"文件夹里面的内容复制到"qwen-tts"文件夹里面,复制完成后删除"Qwen3-TTS-Models"文件夹。

第四步 :我们用"ComfyUI-Qwen-TTS"里面的节点把Qwen3-TTS的工作流重新搭建一下,这搭建起来更简单。

搜索" Qwen3-TTS 语音设计",如下图,参数含义和"第022章"里面 是一样的,不太清楚的同学可以去去看看"第022章"的内容。

再加一个"保存音频"就可以了,一个音色设计的工作流就好了,就两个组件,如下图:

至于我们再"第023章"中的Qwen3-TTS的语音克隆的工作流我们就不搭建了,我们后面直接用Index-TTS2的语音克隆(如果想搭建的同学只要搜"🎭 Qwen3-TTS 语音克隆"这个组件就行)。

第五步:接下来我们部署Index-TTS2,GitHub搜索"ComfyUI-Easy-IndexTTS2"

前面我们都是直接下载下来,再自己复制到"custom_nodes"的文件夹下面,今天我们换个方法,复制下图的链接:

然后打开ComfyUI的插件安装窗口(如下图),将上面复制到的链接,粘贴到最下面的输入框中。点安装就Ok(偶尔可能会因为网络的问题导致安装失败)。

第六步:等"ComfyUI-Easy-IndexTTS2"的插件安装完成以后,重启ComfyUI你再去运行刚刚你搭建的"Qwen3-TTS语音设计"的工作流,你会发现刚刚还能正常运行的工作流,报错了(如下图),这个错误我们先放着,不去管他。

第七步:我们继续搭建Index-TTS2的工作流,先搭建一个单人的音色克隆,我们搜索"Index-TTS",如下图,主要是添加"IndexTTS 模型加载器"和"IndexTTS 简单生成"两个组件。

再加一个"音频加载"和"音频保存"的组件就ok了,这个就和我们在"第023章"搭建的"Qwen3-TTS的语音克隆"的工作流几乎是一样的(完整的工作流如下图)。

但是此时你去运行这个工作流,你会发现他会报错,如下图:

第八步:关闭ComfyUi"终止进程",然后如下图打开ComfyUI的Dos窗口。

执行"python -m pip uninstall tensorflow tensorflow-intel keras tf-keras -y",

作用是卸载"tensorflow"。

第九步:等卸载完成以后,你再打开ComfyUI运行刚刚搭建的Index-TTS2的工作流,会发现还是报错,不过错误变了(如下图)。

这个错误的原因是因为我们缺少CUDA Toolkit,IndexTTS2 需要编译 CUDA ,但是我的系统没有找到 CUDA Toolkit 路径。

关闭ComfyUI。

第十步:安装CUDA Toolkit,打开下面这个链接:

https://developer.nvidia.com/cuda-downloads?utm_source=chatgpt.com

按上图所示,进行下载安装。

安装完成以后,再打开ComyUI的启动界面,高级选项》启动命令提示符

分别执行下面的语句:

(1)set CUDA_HOME=C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v13.3

(2)set PATH=%CUDA_HOME%\bin;%PATH%

特别注意一下C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v13.3这路径是安装CUDA Toolkit的默认路径,你最好自己确认一下路径是否正确。

第十一步:再次重启ComfyUI,运行你的Index-TTS2的工作流,你会发现可以成功运行了。然后你再运行一下Qwen3-TTS的语音设计的工作流,也成功了!

至此我们Qwen3-TTS和Index-TTS2两个声音模型,我们就在本地的ComfyUI部署成功了。

第十二步:搭建Index-TTS声音克隆+情绪控制的工作流。

(1)单人声音克隆+情绪控制,这里面着重注意一个名为""音色情感向量"的组件。

这里面大家注意下,如果一次给等多个情绪赋值的话,值之和不要超过1.5。

完整的工作流如下图:

(2)单人声音克隆+情绪参考,有时候我们需要个他一段有情绪的音频,让他参考这个音频的情绪,主要是添加一个"音色情感音频"的组件。

完整的工作流如下:

3)多人声音克隆+情绪参考/控制,这里主要注意的是一个"合并音色情感"的组件,用来接收多个参考音频。

完整的工作流如下:

这里面大家需要注意的是,音色名称,就是我们可以给每个参考音频一个名词(如下图):

这样我们在输入音频文本的时候,就可以用自定义的名称去区分,切记名称需要要英文的中括号括起来,如下图:

有时候我们多人声音克隆,不需要情绪控制,就按正常声音克隆就可以。这个时候是不需要加情绪控制的组件的,那就没有输入音色名称的地方。如下图的工作流:

这个时候。第一个就是s1,第二个就是s2.......

---------结束线---------

至此我们的文生音频模型的本地部署和工作流搭建就全部完成了,从下一章开始我们就开始啃用LTX视频模型来生成数字人动画。

我建了一个群,方便大家在学习的过程中相互交流。有兴趣的朋友可以加一下,平时也会在群里分享一些资料。

今天的文章发布后,我会在群里把整个"(Qwen3+IndexTTS2文生音频)"的工作流放到群分享文件里,大家可以自己去下载,参考一下。

如果大家在阅读文章的时候有什么困惑,可以再文章的底部留言,我看到的第一时间就会进行回复。

再一个也可以在赞赏文章后,针对所赞赏文章的内容,有不明白的地方,可以和我约个时间,进行一对一的实时交流,赞赏金额不限制,多少都可以!

相关推荐
Android系统攻城狮14 小时前
Linux Gstreamer深度解析之gst_audio_encoder_get_frame_samples_min调用流程与实战(六十)
linux·运维·服务器·音视频·gstreamer音视频·音视频进阶·gstreamer音视频进阶
黑妹天下第一乖14 小时前
第09讲 · 多媒体与音频 SDK:硬件编解码与端侧语音
人工智能·嵌入式硬件·深度学习·机器人·音视频·iot
ken223216 小时前
(aaa) piper TTS 文字转语音 安装、使用;与 calibre 电子书朗读 (****)
音视频
开开心心就好19 小时前
本地文件搜索工具推荐,占用小速度还快
智能手机·ffmpeg·ocr·word·音视频·网络攻击模型·安全架构
阿明副业观察20 小时前
动漫AI视频创作工具在哪找到的?2026年最新动漫AI视频平台与软件指南
人工智能·ai作画·aigc·音视频·ai写作
Eric.4621 小时前
ComfyUI 本地部署 AI 漫剧与 AI 视频流水线:消费级显卡显存优化、角色一致性工程实战
人工智能·自动化·音视频·comfyui·ai漫剧
指针向南21 小时前
视频截图发黑先检查透明区域
图像处理·人工智能·计算机视觉·音视频
daad7771 天前
手写一个 LPC 语音 Codec:从一帧真实音频看编码到解码的全过程
人工智能·音视频·语音识别
我就是不信1 天前
用 C 语言实现一个支持 HTML 与视频的 HTTP(S) 服务器
c语言·html·音视频