IndexTTS 2.5 技术报告
摘要
在前期工作中,我们提出了IndexTTS 2,这是一款零样本神经文本转语音基础模型,包含两大核心模块:基于Transformer的文本转语义(T2S)模块、非自回归语义转梅尔谱(S2M)模块。二者配合,能够高度还原情感,同时构建了首个自回归、可控制时长的生成范式。基于上述成果,本文提出IndexTTS 2.5,通过四项关键改进,大幅提升多语言覆盖能力、推理速度与整体合成质量:
- 语义编解码器压缩:将语义编解码器帧率由50 Hz降低至25 Hz,序列长度减半,显著降低训练与推理阶段的计算开销;
- 架构升级:S2M模块的U‑DiT骨干网络替换为效率更高的Zipformer架构,参数量更少,梅尔频谱生成速度更快;
- 多语言扩展:提出三种显式跨语言建模策略------边界感知对齐、token级拼接、指令引导生成,为支持中文、英文、日语、西班牙语、阿拉伯语的零样本多语言情感TTS建立实用设计原则;即便目标语言没有情感训练数据,依旧可以实现可靠的情感迁移;
- 强化学习优化:在T2S模块后训练阶段采用分组相对策略优化(GRPO),提升发音准确度与自然度。
实验表明,IndexTTS 2.5不仅拓展了语言支持范围,还可以在相同零样本设定下,在未见过的语言上复现情感韵律。相比IndexTTS 2,IndexTTS 2.5实时因子(RTF)提升2.28倍,同时词错误率(WER)、说话人相似度保持相当。音频演示地址:https://index‑tts.github.io/index‑tts2‑5.github.io/。
1 引言
近年来,随着生成式框架持续发展,大规模零样本文本转语音(TTS)模型取得长足进步,尤其在模型架构创新1‑7、音频质量提升8、情感表现力9,10、语音克隆11,12、多语言覆盖13,14等方向成果显著。当前,受框架能力与目标应用场景之间权衡取舍的驱动,主流大规模TTS模型分化出多种技术范式,核心差异主要体现在模型架构设计、中间表征建模方案的选择。

如图1所示,现代大规模零样本TTS架构通常包含核心组件:基于Transformer的语言模型、基于扩散或流匹配的生成模块、语音编解码器、神经声码器。与此同时,中间表征的选择也发生显著演变:从早期梅尔频谱,到离散语音token,进一步分化成语义token、声学token、连续隐空间表征。
早期大规模TTS模型,例如VALL‑E1,率先使用残差向量量化(RVQ)15,16将语音离散化为声学token;借鉴大语言模型的成功经验,以文本与参考语音提示为条件,利用语言模型生成上述离散token17。该工作验证了大语言模型用于零样本TTS的有效性,搭建起一套可扩展生成框架,深刻影响后续神经语音合成研究。以此为基础,衍生出多条模型演进路线。
例如IndexTTS 16完全舍弃编解码器,转而训练能力更强的声码器18,直接从离散token重建更丰富的声学细节19,20。与之相对,Seed‑TTS8、MiniMax‑Speech14采用两阶段方案:先用语言模型生成粗糙语音token,再通过扩散/流匹配模块学习细粒度连续隐表征,最后由声学声码器转为波形。
近期,研究将语音token显式拆分为语义token 与声学token :语义token编码高层语言内容、韵律、语音信息;声学token刻画底层声学特征。当下主流架构:语言模型生成语义token,后续要么使用另一语言模型预测声学token5,21,要么使用扩散/流匹配模块直接生成梅尔频谱2,3,9,13,21,该范式成为现代零样本TTS系统的主流方案。
此外F5‑TTS4、ZipVoice23,24等轻量模型,采用完全非自回归方案,直接对文本‑语音对齐关系建模,兼顾快速推理、高自然度与音频质量。
最近,学界深入分析离散token与连续表征在信息保真度、建模效率、泛化能力之间的权衡,越来越多工作转向直接建模连续语音表征25‑27。该范式旨在摆脱对语音编解码技术的依赖,缓解离散化带来不可避免的信息损失。
为更好解耦情感与说话人特征,IndexTTS 2采用经典三阶段流水线:首先语言模型生成离散语义token,编码发音、韵律等情感相关属性;再通过流匹配模块与神经声码器重建说话人专属声学细节。但该模型多语言覆盖有限、推理速度慢,难以部署到真实跨语言、低延迟场景。
针对上述局限,本文提出IndexTTS 2.5,一款多语言零样本TTS模型。支持中文、英文、日语、西班牙语、阿拉伯语,同时保留高保真情感表达。通过系统性架构改进与编解码器压缩,大幅降低推理延迟与计算开销,显著提升实际部署能力。
本文主要实用改进总结如下:
- 为拓展IndexTTS 2支持的语种,搭建多语言数据处理流水线。基于该流水线提出三种面向零样本跨语言TTS建模策略:边界感知对齐、token级拼接、指令引导生成。综合评估证实三种策略各自有效,且能力互补,为后续多语言语音合成系统提供实用设计准则。
- 联合开展效率优化:语义编解码器帧率从50 Hz降至25 Hz;流匹配模块中将U‑DiT替换为Zipformer架构28。RTF降低至原来的1/2.28,音频质量无感知下降。
- 使用GRPO29对用于生成语义token的语言模型做后训练,持续提升韵律自然度,降低WER。
2 多语言数据处理流水线

为提升IndexTTS 2跨语言泛化能力,我们搭建多语言数据处理流水线(图2),可以从在线视频、有声书等公开来源高效获取高质量语音‑文本配对数据。流水线包含关键模块:语音活动检测(VAD)与切分、自动语音识别(ASR)、说话人分轨、声源分离、片段合并、样本质量过滤。
- 语音活动检测与切分:具备事件分类增强能力的VAD模型。对每段音频,估计语音、歌唱、伴奏、背景噪声占比。
- 自动语音识别:集成式ASR系统,同时完成语音识别、说话人分轨、标点恢复。每个短片段输出内容:转录文本、说话人ID,二元标记用于标记是否多说话人、是否存在歌唱、音乐伴奏。
- 声源分离:标记包含伴奏的音频片段,使用开源Demucs工具包30提取人声轨道。为避免音频退化,仅在必要时执行声源分离。
- 片段合并:依据说话人一致性、文本连贯性、片段间静音,把短ASR片段合并为长语句;合并后片段仅限单说话人,最大时长25秒。
- 样本质量过滤:两级过滤模块保障数据质量:音频质量过滤使用预训练音频质量评估模型;文本质量过滤利用ASR转录结果,检测并丢弃保真度低、错误的转录样本。
3 IndexTTS 2.5
IndexTTS 2.5 保留了 IndexTTS 2 的整体生成流程,但在四个关键组件方面进行了优化:多语言文本到语义模型的转换、语义编解码器帧率压缩、基于改进主干网络的高效语义到声音转换机制,以及基于强化学习的技术在训练后的合成质量提升。以下各部分将详细介绍每个模块的设计与实现细节。
3.1 多语言文本‑语义模块

IndexTTS 2.5的文本转语义模块沿用IndexTTS 2架构。输入结构化输入:
c , p , e B T , E t e x t , e B A , E s e m \] \[c, p, e_{BT},\\ E_{text},\\ e_{BA},\\ E_{sem}\] \[c,p,eBT, Etext, eBA, Esem
其中:
c c c:全局条件向量,捕获说话人身份或情感属性;
p p p:细粒度时长控制辅助嵌入;
文本表示为嵌入序列 E t e x t E_{text} Etext;
目标语义token由语义编解码器对真实语音编码得到,嵌入为 E s e m E_{sem} Esem;
为方便跨模态对齐,特殊前缀token e B T e_{BT} eBT、 e B A e_{BA} eBA分别加到文本序列、语义序列头部。
多语言场景下,不同语言之间字符重叠(例如日语大量使用汉字),会造成零样本语音合成时跨语言混淆。如图3,针对该问题,我们提出三种策略:边界感知对齐、token级拼接、指令引导生成。
3.1.1 边界感知对齐策略
边界感知对齐策略旨在让T2S模块学习多语言场景下正确发音,缓解跨语言共用字符带来的混淆。具体做法:在每一句输入语句前后插入语种边界token,例如中文使用<ZH>、</ZH>,显式标记语言片段起止。输入序列构造为:
c , p , e B T , e L I D , E t e x t , e L I D , e B A , E s e m \] \[c, p, e_{BT}, e_{LID}, E_{text}, e_{LID}, e_{BA}, E_{sem}\] \[c,p,eBT,eLID,Etext,eLID,eBA,Esem
该策略简单有效,训练与推理时提供清晰语言边界信号。但自回归生成固有的幻觉问题,长句条件下发音控制能力下降,偶尔出现发音错误。
3.1.2 token级拼接策略
本文提出严格token级拼接策略:每一个输入文本token嵌入,与语种专属类别嵌入做融合。为每个token提供显式语言监督信号,模型可以依据token所属语种消除发音歧义,对跨语言同形字导致的读错问题抑制效果明显。
但实际部署需要前端模块完成细粒度token级语种识别,相比边界感知对齐,系统集成复杂度更高。
3.1.3 指令引导生成策略
为充分利用底层语言模型的文本理解能力,采用指令引导生成策略:在输入文本前拼接结构化自然语言指令,显式为模型指定目标语种。
为提升训练多样性、增强上下文感知,我们设计一批prompt模板(如图3示例);训练阶段随机采样一个模板作为前缀。输入序列格式:
c , p , e B T , e i n s t r , e E O T , E t e x t , e B A , E s e m \] \[c,p,e_{BT},\\ e_{instr},\\ e_{EOT},\\ E_{text},\\ e_{BA},\\ E_{sem}\] \[c,p,eBT, einstr, eEOT, Etext, eBA, Esem
e i n s t r e_{instr} einstr为指令嵌入,EOP标记prompt结束。该方案推理阶段不需要外部语种标注模块,实现完全自包含的多语言生成。但遇到混合语种的代码切换场景,部分指令作用有限,输入序列会引入轻微冗余。
3.2 面向效率的系统设计
为降低语音生成的计算开销与延迟,流水线中引入两项互补优化:
- 语义编解码器压缩:帧率从50 Hz降低至25 Hz,目标语义token序列长度减半;
- 架构精简:S2M模块中将U‑DiT骨干网络替换为参数量更高效的Zipformer架构28。
缩短后的token序列降低训练、推理时内存占用与计算负载;紧凑的Zipformer进一步降低模型复杂度。上述设计共同提升推理效率,同时对合成质量影响极小。
3.3 强化学习后训练
基于偏好目标,使用GRPO对文本‑语义模型微调。针对每条输入文本prompt(尤其多语言、代码切换场景),通过随机解码生成4条不同语音候选样本。
使用奖励信号对候选样本排序:奖励由两部分构成,冻结ASR系统输出的词错误率衡量可懂度;说话人验证模型输出衡量说话人相似度。
在GRPO框架下,更新策略,提升高奖励(低WER、高说话人相似度)生成结果的相对概率,压低低奖励样本概率。
3.4 字形转发音(G2P)策略
扩展原始G2P框架,适配中文、英文、日语。中文、英文仅保留发音无歧义的词条;英文使用CMU发音词典。日语汉字通过fugashi31随机转为片假名。
日语汉字读音高度依赖上下文,直接替换偶尔会产生不自然发音。将转换操作在文本分段单元内部执行,而不是整句一次性转换,可缓解该问题。
4 实验与评估
4.1 训练与评估数据集
训练支持普通话、英语、日语、西班牙语的多语言TTS模型,总语音数据约10万小时。语料分布:普通话3万小时,英语2.5万小时,日语4.2万小时,西班牙语2.29万小时,阿拉伯语2万小时。
普通话、英语主要来自Emilia数据集32,辅以有声书与商业授权录音。日语数据中1700小时来自Emilia32,其余来自商业授权。西班牙语聚合多个公开数据源:Common Voice33、阿根廷西班牙语语音数据集34、TEDx西班牙语语料35、众包高质量西班牙语语音数据集36、多语言LibriSpeech37、LEMAS38。阿拉伯语全部来自商业授权。
为支持富有表现力的合成,额外加入135小时情感语音,包含29小时ESD情感语音数据集39,以及106小时商业授权高质量情感录音。
评估多语言建模方案时,中文、英文采用Seed‑TTS‑Eval基准集;日语、西班牙语使用内部测试集。零样本、跨语言性能在多语言CV3‑Eval基准上评测。阿拉伯语没有公开标准基准,我们构建自研零样本、跨语言测试集;同时自建西班牙语跨语言测试集。
4.2 评估指标与基线模型
从四个维度开展综合评估:词错误率(WER)、说话人相似度(SS)、情感相似度(ES)、平均意见分(MOS)。
- WER:语种专属ASR模型计算;中文使用FunASR40,其余语种使用Whisper‑large‑v341。
- 说话人相似度:FunASR预训练说话人验证模型40提取参考音频、生成音频的说话人embedding,计算余弦相似度。
- 情感相似度:emotion2vec42提取情感embedding,计算余弦相似度。
- MOS:主观听音测试,母语使用者按照1‑5打分(1差,5优秀)评估自然度。
对比的SOTA零样本多语言TTS系统:CosyVoice313、FireRedTTS‑221、Fish Audio S2 Pro43、Qwen3‑TTS44、VoxCPM245、Moss‑TTS46、原始IndexTTS 29。
4.3 多语言建模方法对比分析
保证公平对比:三种多语言策略(边界感知对齐、token级拼接、指令引导生成)在完全相同条件训练:相同多语言数据集、batch大小、优化器、学习率调度、硬件资源,训练步数终止于100K步。
在覆盖普通话、英语、日语、西班牙语的4套测试集上全面评测。表1结果显示:token级拼接策略在全部语种上说话人相似度均最高,说明跨语言合成时保留说话人身份能力很强。原因在于逐token语言条件,实现输入文本与说话人特征细粒度对齐。
token级拼接在普通话、英语、西班牙语测试集取得所有策略中最低WER:Seed‑TTS‑eval test‑zh为1.119%;Seed‑TTS‑eval test‑en为3.253%;IndexTTS test‑es为5.200%。但IndexTTS test‑ja日语集上WER略高于指令引导生成,说明形态复杂语言上,严格拼接会带来轻微对齐偏差。
与之相对,指令引导生成在日语取得最低WER,原因是结构化prompt带来上下文线索,更好消除语音歧义。
值得注意:边界感知对齐在普通话、英语表现尚可,日语、西班牙语上性能下滑,WER表现较差;说明该策略处理形态丰富、非拉丁脚本语言存在局限。
token级拼接同时提升SS与WER指标,证明其在零样本多语言TTS任务鲁棒、有效。指令引导生成推理阶段灵活性更高,但性能受prompt设计影响,工程实现需要精细调优;token级拼接结果更稳定可靠,额外开销可控。
4.4 语音克隆评估
表2为零样本TTS评测结果,报告WER(%)、说话人相似度SS。
尽管参数量仅0.8B,IndexTTS 2.5在对比模型中综合性能最优:平均WER 6.75,平均说话人相似度73.18。CosyVoice3‑0.5B部分语种SS更高,Fish Audio S2 Pro平均WER更低,但IndexTTS 2.5性能更加均衡,全部测试语种WER持续维持较低水平。
经过RL微调后的IndexTTS2.5‑RL,平均WER从6.75下降到6.00,平均说话人相似度由73.18提升至73.63;英语、日语、阿拉伯语均获得一致增益。
进一步做跨语言TTS评测:中文参考语音,目标文本为英语、西班牙语、日语、阿拉伯语。结果见表3。IndexTTS 2.5跨语言综合性能最优,平均WER 6.22,平均说话人相似度68.62。虽然CosyVoice3‑0.5B在中文转英语任务WER最低,但IndexTTS 2.5在不同目标语种表现更稳定,日语、阿拉伯语上优势明显。RL微调后平均WER下降至6.17,平均说话人相似度提升到70.20,跨语言语音克隆获得进一步提升。
4.5 多语言情感TTS评估
使用自研情感语音基准集、CV3‑Eval Emotion‑ZeroShot基准评估情感克隆能力,对比IndexTTS2.5与CosyVoice3。
表4结果:日语、西班牙语内部情感测试集上,IndexTTS2.5情感相似度ES持续更高,WER、SS保持有竞争力,MOS得分高于CosyVoice3。阿拉伯语评测缺少匹配参考数据,使用日语语音作为prompt音频。该跨语言设定会降低说话人相似度,但模型MOS仍达到4.18,证明可以跨语种有效迁移情感特征。
注:阿拉伯语实验使用日语作为prompt,会造成SS分数偏低。值得注意:模型仅用中文、英文情感训练数据,依旧可以在未见过语种上实现强大零样本情感迁移。
CV3‑Eval Emotion‑ZeroShot情感感知评测结果如表5。中文、英文全部指标上IndexTTS 2.5均优于CosyVoice3。中文总体准确率从0.467提升到0.713,英文从0.567提升至0.673;加权F1中文由0.585提升至0.790,英文由0.670提升至0.759。文中还按照情感类别、情感强度等级拆解各项增益。
4.6 语义转梅尔谱(S2M)架构消融实验
在留出测试子集上,针对S2M模块U‑DiT与Zipformer骨干网络开展主观偏好评测。听音人员对比成对生成音频,从语音质量、说话人相似度、韵律自然度三个维度打分。
图4主观偏好对比:Zipformer骨干方案在56%对比用例中被优先选择;U‑DiT版本占40%;4%样本无明显偏好。
该结果说明Zipformer架构可以生成更自然、说话人特征一致性更强的语音;得益于对长距离依赖高效建模,训练动态更加稳定。实验证明,虽然设计更简单,基于Zipformer的流匹配模块,在零样本多语言TTS任务主观感知性能优于复杂度更高的U‑DiT,模型容量与合成质量之间取得很好权衡。
4.7 推理性能对比
表6在相同硬件环境(NVIDIA A10 GPU + Intel Xeon Platinum 8350C CPU)对比IndexTTS2系列推理效率。相比IndexTTS2,IndexTTS2.5的T2S、S2M模块RTF显著下降。
T2S模块RTF由0.232降至0.119,来源于神经编解码器帧率压缩:语义token序列缩短,语言信息保真度不受损失。与此同时S2M模块架构升级,采用Zipformer骨干网络,S2M的RTF下降至0.017。
以上优化实现更快推理,合成质量没有退化。
| 模型 | T2S模块RTF | S2M模块RTF |
|---|---|---|
| IndexTTS 2 | 0.232 | 0.078 |
| IndexTTS 2.5 (U‑DiT) | 0.119 | 0.081 |
| IndexTTS 2.5 (Zipformer) | 0.119 | 0.017 |
5 结论
IndexTTS 2.5通过四项核心改进增强零样本多语言情感文本转语音合成能力:语义编解码器压缩、基于Zipformer优化S2M架构、跨语言建模策略、针对T2S的强化学习优化。
实验表明,上述改进共同实现中文、英文、日语、西班牙语高质量合成;在未见过语种上同时保留说话人身份与情感韵律。RTF实现2.28倍提升,同时维持较低WER与高说话人相似度。实验证明IndexTTS2.5在推理效率与合成质量之间实现有效平衡,适合表现力丰富的多语言语音合成真实场景部署。