深度学习系列84:使用kokoros生成tts语音

1. 介绍

Kokoro TTS 以其轻量级设计和高效性能脱颖而出。作为一个仅有82M参数的文本转语音(TTS)模型,Kokoro 在 TTS Spaces Arena 中击败了许多参数规模更大的竞争对手,成为语音合成领域的一颗新星。最新1.1版本安装如下:

复制代码
Usage:
1.
    Install uv from https://docs.astral.sh/uv/getting-started/installation
2.
    Copy this file to new folder
3.
    Run
    uv venv -p 3.12
    uv pip install -U kokoro-onnx soundfile 'misaki[zh]'
3.
    Download these files
    https://github.com/thewh1teagle/kokoro-onnx/releases/download/model-files-v1.1/kokoro-v1.1-zh.onnx
    https://github.com/thewh1teagle/kokoro-onnx/releases/download/model-files-v1.1/voices-v1.1-zh.bin
    https://huggingface.co/hexgrad/Kokoro-82M-v1.1-zh/raw/main/config.json
3. Run
    uv run main.py

2. 测试代码

复制代码
import soundfile as sf
from misaki import zh
from kokoro_onnx import Kokoro
g2p = zh.ZHG2P(version="1.1")
text = "千里之行,始于足下。"
voice = "zf_001"
kokoro = Kokoro("kokoro-v1.1-zh.onnx", "voices-v1.1-zh.bin", vocab_config="config.json")
phonemes, _ = g2p(text)
samples, sample_rate = kokoro.create(phonemes, voice=voice, speed=1.0, is_phonemes=True)
sf.write("audio.wav", samples, sample_rate)
print("Created audio.wav")

可以使用如下代码查看语音清单,其中zf开头是中文女声,zm开头是中文男声:

复制代码
for k in kokoro.voices.keys():
    print(k)
相关推荐
红姐跨境书7 小时前
亚马逊广告接入 ChatGPT 后,卖家该如何布局 AI 电商营销?
人工智能·chatgpt
田里的水稻7 小时前
IL_策略训练---Mamba\SSM神经网络种类六
人工智能·深度学习·神经网络·机器学习
天天代码码天天7 小时前
把老动画带给新一代孩子:用 C# WinForms、APISR 和 Vulkan 做一个视频超分工具
人工智能
空堂与归7 小时前
清华VPP2登顶RoboDojo:凭预测解耦突围GPT-6
人工智能·gpt·ai·具身智能
AliCloudROS7 小时前
MiniMax-H3 视频生成模型 — 一键部署与使用指南
人工智能·音视频
云端设计台7 小时前
技术方案评审画图难?AI文本可视化工具实测
人工智能
见闻小天地7 小时前
数据中心柴发出口保护怎么选?Emax 与 Tmax XT 的定位与分工
大数据·运维·人工智能·业界资讯
IT_陈寒7 小时前
为什么我的React组件一直在意外重渲染?
前端·人工智能·后端
Su米苏7 小时前
基于 Token 预算的上下文压缩控制器(Context Compaction Controller)
前端·数据库·人工智能
AI日报派送佬7 小时前
2026年10月9日AI行业日报|谷歌推出企业级Gemini通用智能体、Claude双功能重磅更新、AI视频创作成本低至0.09元/秒
人工智能·openai·claude·ai视频·anthropic·ai日报·workbuddy