智普GLM-TTS开源:可控且富含情感的零样本语音合成模型

GLM-TTS 是智谱 AI(Zhipu AI)CogAudio 团队开发的开源文本到语音(TTS)合成系统,是 GLM 系列的语音扩展,于 2025 年发布。

GLM-TTS 的核心目标是解决传统 TTS 在情感表达、发音准确性和实时性上的瓶颈:早期模型虽高效但缺乏自然韵律,而 GLM-TTS 通过多奖励强化学习(GRPO)实现人类级别的表达力和稳定性,支持从 3-10 秒参考音频克隆声音。

开源地址:

|-------------|---------------------------------------------------------------------------------------------------------------------------------------------|
| github | https://github.com/zai-org/GLM-TTS |
| huggingface | https://huggingface.co/zai-org/GLM-TTS |
| modelscope | https://modelscope.cn/models/ZhipuAI/GLM-TTS |

在线体验: https://audio.z.ai/

1.部署环境

|-----------------------|-----------------------------------|
| 环境 | 版本 |
| ubuntu-24.04.3 Server | release 10.0 |
| Cuda | 12.8 |
| 显卡 RTX 2080 Ti 22G | 驱动 NVIDIA-Linux-x86_64-580.105.08 |
| uv | 0.9.13 |
| 内存 | 32G |

请提前安装好 显卡驱动,cuda版本最好是 12.8。

复制代码
# 我使用 python 3.12 没有成功
# 因为 Python 3.12 环境中 很多扩展包还没有预编译 wheel,需要从源码 build。
# 而 pynini 多数情况下 不支持 Python 3.12,官方 wheel 最多到 Python 3.10。
conda create -n glmtts python=3.10
conda activate glmtts

# 接下来会使用pip安装依赖,所以添加国内加速
(glmtts) pip config set global.index-url https://mirrors.huaweicloud.com/repository/pypi/simple/

# 设置全局代理
git config --global http.proxy http://192.168.6.120:7897 
git config --global https.proxy http://192.168.6.120:7897
# 查看配置
git config -l
# 克隆源码
git clone https://github.com/zai-org/GLM-TTS.git
cd GLM-TTS

92.168.6.120 是一台windows机器,安装了 Class Verge ,通过它加速访问github。

git 代理指向了这个机器,要通过192.168.6.120 代理到github, Class Verge 必须要允许局域网连接(默认是关闭的)

2.安装依赖

复制代码
cd ~/GLM-TTS
# 编译 pynini 的时候,会用到 Cython
pip install --upgrade pip setuptools wheel Cython soxr
pip install -r requirements.txt

# 安装强化学习相关依赖(可选)
cd grpo/modules
git clone https://github.com/s3prl/s3prl
git clone https://github.com/omine-me/LaughterSegmentation

# 从 modelscope下载
pip install modelscope

# 下载 wavlm_large_finetune.pth 并放置在 grpo/ckpt 目录
cd ~/GLM-TTS
mkdir -p ckpt
modelscope download --model ZhipuAI/GLM-TTS --local_dir ckpt

3.启动交互式Web界面

复制代码
python -m tools.gradio_app

启动后,会开启服务器 8048 端口: http://192.168.6.133:8048/

  • 上传声音样本
  • 输入要转换的文本
  • 生成音频
相关推荐
梦想很大很大17 小时前
让 AI 成为“报表配置员”:BI 低代码平台的 Schema 实践路径
前端·人工智能·低代码
隔壁大炮17 小时前
Day07-RNN层(循环网络层)
人工智能·pytorch·python·rnn·深度学习·神经网络·计算机视觉
小饕17 小时前
从 Word2Vec 到多模态:词嵌入技术的演进全景
人工智能·算法·机器学习
上海云盾第一敬业销售17 小时前
生成式AI催生深度伪造攻击,WAF如何识别“假流量“?
人工智能
ykjhr_3d17 小时前
数字工具AI智能学伴,助力教育数字化转型
大数据·人工智能·ai·ai人工智能·华锐视点·华锐云空间
LIUAWEIO17 小时前
鸽鸽工具网:免费在线工具大全,打开网页即用
人工智能·安全·ai·json
饭后一颗花生米17 小时前
养马养虾助手免费下载免费安装教程,一键部署永久使用
ai
动恰客流管家17 小时前
动恰3DV3丨客流统计系统:旺季人手不够淡季闲人太多?客流统计帮你科学优化人力成本
大数据·运维·人工智能·3d
吻等离子17 小时前
机器学习基本概念篇(含思维导图)
人工智能·机器学习
乐维_lwops17 小时前
智变2026:中国IT运维管理软件行业全景洞察——从AI重塑到信创深水区
运维·人工智能