如果你想自己搭建一个语音克隆、AI 配音、语音转文字、有声书和视频配音 工具,debpalash/VoiceStudio 是一个比较完整的开源方案。
它原名 OmniVoice-Studio ,现在已经更名为 VoiceStudio。项目目前支持 Windows、macOS、Linux,并提供 Docker 运行方式;核心工作流可以完全在本机完成,也支持把界面连接到远程后端。
一、VoiceStudio 是做什么的?
它可以理解成一个集成式 AI 音频工作站:

VoiceStudio
│
┌───────────────┼────────────────┐
↓ ↓ ↓
Voice Clone TTS ASR
│ │ │
↓ ↓ ↓
克隆声音 文字转语音 语音转文字
│
├──────────────┐
↓ ↓
视频配音 有声书
│
↓
音频生成
当前项目包含:
- AI Voice Cloning
- Voice Design
- Text-to-Speech
- Speech-to-Text
- 视频配音
- Stories
- Audiobook
- 批量生成
- MCP Server
- OpenAI-compatible Audio API
官方目前列出了 16 个 TTS 引擎、11 个 ASR 引擎以及 646 种语言目录,不过具体语言覆盖和效果取决于所选择的模型/引擎。
二、最重要的特点:可以自己部署
VoiceStudio 和很多在线语音平台最大的区别在于:
传统在线服务:
音频
↓
第三方服务器
↓
AI
↓
返回结果
而 VoiceStudio 可以:
你的设备
↓
VoiceStudio
↓
本地模型
↓
生成音频
项目 README 明确强调,核心工作流默认本地运行,声音、录音、项目和输出默认保存在本机。
所以如果你有自己的:
录音
声音样本
项目素材
有声书
视频
本地部署会更容易控制数据。
三、VoiceStudio 对服务器的要求比普通 Web 项目高
这里是搭建时最需要注意的地方。
官方当前给出的推荐配置为:
RAM:16GB+
GPU:8GB+ VRAM
CPU:现代 64 位 CPU
磁盘:20GB+
最低配置则是:
RAM:8GB
VRAM:4GB
磁盘:10GB
GPU 不是硬性要求,CPU 也可以运行,只是生成速度会明显慢一些。官方支持 NVIDIA CUDA、Linux AMD ROCm,以及 CPU;macOS 则可以使用 Apple Silicon 的 MPS/MLX。
四、为什么推荐 8GB 显存?
语音生成本身涉及模型推理。
如果:
CPU
↓
AI TTS
↓
生成
当然可以运行。
但是:
NVIDIA GPU
↓
CUDA
↓
模型推理
↓
TTS
通常会快很多。
官方推荐:
RTX 3060
8GB VRAM+
作为比较合适的 GPU 起点。
因此如果你想长期运行 VoiceStudio:
GPU 比单纯堆 CPU 更重要。
五、它也支持远程后端
这是 VoiceStudio 非常适合云服务器的一点。
项目目前支持:
本地 UI
↓
Remote Backend
↓
云服务器 GPU
↓
TTS / ASR
官方 README 已经明确提供 Remote Backend,并提到支持 Tailscale 和 bearer authentication。
也就是说:
你的电脑
│
│ 浏览器 / VoiceStudio UI
│
↓
远程服务器
│
├── VoiceStudio Backend
├── TTS Models
├── ASR Models
└── GPU
这其实比单纯在云服务器上部署一个网页更有价值。
六、莱卡云可以放在什么位置?
如果你有一台带 GPU 的莱卡云服务器,可以考虑:
你的电脑
│
VoiceStudio UI
│
HTTPS / VPN
↓
莱卡云 GPU Server
│
VoiceStudio Backend
│
┌───────────┼───────────┐
↓ ↓ ↓
TTS ASR Voice Clone
│
↓
GPU
这种方式比较适合:
- 本地电脑配置一般;
- 希望模型统一放服务器;
- 多台电脑访问同一个后端;
- 希望 GPU 集中使用;
- 不想每台电脑都重复下载模型。
这里莱卡云只是作为一种 GPU 云服务器环境,满足 CUDA/ROCm 或 CPU 运行条件的其他服务器同样可以使用。
七、如果没有 GPU,也能部署
VoiceStudio 官方明确支持 CPU。
所以:
4~8 核 CPU
+
16GB RAM
也可以运行。
只是:
CPU
↓
模型推理
↓
等待时间更长
特别是:
长文本
大量语音
视频配音
批量生成
时差距会更加明显。
因此:
只是测试
可以 CPU。
经常使用
建议 GPU。
大量生成
建议独立 GPU。
八、Docker 是云服务器上更推荐的方式
官方目前已经提供 Docker 安装方式,而且明确针对:
headless server
dedicated GPU
one-command deployment
进行了设计。
官方 Docker 镜像包括:
ghcr.io/debpalash/omnivoice-studio
以及 Docker Hub 上对应镜像:
palashdeb/omnivoice-studio
项目当前还提供:
CPU
CUDA
ROCm
worker-only GPU
等不同运行配置。
九、CPU Docker 部署
如果只是先测试,可以使用 CPU 环境。
基本思路:
Linux
↓
Docker
↓
VoiceStudio
↓
CPU
官方 Docker 文档提供了对应的 CPU profile。
部署前建议先检查:
docker --version
docker compose version
然后根据官方 Docker 文档的当前 Compose 配置启动。
由于项目 Docker 标签持续更新,建议直接使用官方文档当前给出的 stable 标签,而不是复制网上旧教程中的镜像版本号。
十、GPU Docker 部署
如果服务器有 NVIDIA GPU:
Linux
↓
NVIDIA Driver
↓
NVIDIA Container Toolkit
↓
Docker
↓
VoiceStudio
↓
CUDA
↓
TTS
首先检查:
nvidia-smi
应该能够看到:
GPU
Driver Version
CUDA Version
VRAM
然后再启动 CUDA 对应的 VoiceStudio 容器。
这样模型就可以直接利用服务器 GPU。
十一、GPU 服务器推荐配置
如果准备长期使用:
入门
4 vCPU
16GB RAM
8GB VRAM
80GB SSD
更舒服
8 vCPU
32GB RAM
12~16GB VRAM
100GB+ SSD
批量语音 / 视频
8~16 vCPU
32GB+ RAM
16GB+ VRAM
150GB+ SSD
实际需求取决于你使用的 TTS/ASR 引擎和模型。
十二、为什么磁盘不能太小?
第一次启动时,VoiceStudio 会:
创建 Python 环境
↓
下载模型
↓
建立缓存
官方最低只列:
10GB
但推荐:
20GB+
而如果安装多个模型:
TTS Model A
TTS Model B
TTS Model C
ASR Model A
ASR Model B
磁盘很容易增长。
因此如果准备作为长期语音工作站,我更建议:
100GB SSD 起步。
十三、模型数量会直接影响磁盘
例如:
VoiceStudio
│
├── TTS
│ ├── Model A
│ ├── Model B
│ └── Model C
│
├── ASR
│ ├── Model A
│ └── Model B
│
└── Cache
如果频繁切换模型:
模型
+
缓存
+
生成文件
都会占用磁盘。
所以:
20GB
适合测试。
80~100GB
更适合长期使用。
十四、直接运行 Linux AppImage 也可以
如果不是服务器,而是 Linux 桌面电脑,官方推荐 AppImage。
下载后:
chmod +x VoiceStudio.Studio_*.AppImage
然后:
./VoiceStudio.Studio_*.AppImage
如果系统没有 FUSE:
./VoiceStudio.Studio_*.AppImage \
--appimage-extract-and-run
官方当前 Linux 文档把 AppImage 作为 Linux 的主要安装方式。
十五、为什么服务器更适合 Docker?
因为普通云服务器一般没有桌面环境。
AppImage 的要求是:
X11
或者
Wayland
+
Desktop Session
而 Docker 后端则可以:
Linux Server
↓
Docker
↓
VoiceStudio
↓
HTTP
官方 Docker 文档就是针对 headless server / dedicated GPU 场景设计的。
所以:
个人 Linux PC
→ AppImage
云服务器
→ Docker
是更合理的选择。
十六、Windows 电脑也非常容易使用
Windows 当前支持:
Windows 10/11 x64
官方提供:
MSI
安装包。
最低大约:
8GB RAM
10GB Disk
GPU 可选。
因此如果你只是自己使用:
Windows
↓
VoiceStudio
↓
本地 GPU
是最简单的方式。
十七、真正有意思的是"本地 UI + 云端 GPU"
如果你已经有性能不错的电脑:
Windows / macOS / Linux
但是没有 GPU,完全可以采用:
本地
VoiceStudio UI
│
│ HTTPS / Tailscale
↓
莱卡云 GPU
│
VoiceStudio Backend
│
↓
TTS / ASR / Clone
例如:
笔记本
│
├── 浏览器
├── VoiceStudio
└── 音频输入
│
↓
Remote Backend
│
↓
莱卡云 GPU Server
│
├── Voice Clone
├── TTS
└── ASR
这样本地电脑不用承担大量模型推理。
十八、Remote Backend 还能用于 OpenAI-Compatible API
VoiceStudio 当前还提供:
OpenAI-compatible audio API
以及本地 REST/SSE/WebSocket API。
这意味着你可以把它进一步接入其他应用:
你的应用
↓
OpenAI-compatible API
↓
VoiceStudio
↓
TTS
例如:
AI Chatbot
↓
生成文字
↓
VoiceStudio API
↓
生成语音
↓
播放
这样 VoiceStudio 就不仅仅是一个桌面软件了。
十九、还支持 MCP
当前版本还提供:
MCP Server
因此可以和:
Claude
Cursor
Codex
其他 MCP Client
进行集成。
架构可以变成:
AI Agent
↓
MCP
↓
VoiceStudio
↓
TTS / ASR
↓
Audio
这对于自动化工作流很有意思。
例如:
Agent
↓
写文章
↓
VoiceStudio
↓
生成旁白
↓
视频制作
可以把整个流程串起来。
二十、视频配音是一个比较实用的功能
VoiceStudio 当前已经支持:
Video Dubbing
完整流程可以:
视频
↓
语音识别
↓
文本
↓
翻译
↓
Voice Clone / TTS
↓
重新配音
↓
时间对齐
↓
MP4
官方 README 的示例就是将视频中的多个片段进行转录、翻译、重新配音和时间调整后导出 MP4。
所以它可以用来做:
教程视频
课程视频
多语言视频
演示视频
有声内容
等。
二十一、长文本也可以生成
普通 TTS 经常遇到:
输入太长
↓
失败
VoiceStudio 当前支持:
sentence-chunked generation
+
streaming via WebSocket
也就是将长文本拆分成句子或块,再逐步生成。
因此:
小说
↓
章节
↓
句子
↓
TTS
↓
合并
↓
有声书
也是比较自然的使用方式。
二十二、声音克隆要注意授权
这是使用 VoiceStudio 时最需要强调的一点。
技术上:
3 秒左右声音样本
就可以开始进行 Voice Cloning,官方也说明 5~15 秒的干净样本通常可以获得更好的 prompt。
但:
能够克隆 ≠ 可以随意克隆。
例如不要未经授权使用:
明星声音
他人声音
配音演员声音
公众人物声音
制作容易造成身份误认的内容。
最稳妥的方式是:
自己的声音
或者
获得明确授权的声音
二十三、模型许可证也要单独检查
VoiceStudio 本身是:
AGPL-3.0
但项目中的不同模型、引擎有自己的许可证。
官方 Security Policy 还特别强调:
模型应该来自公开、可验证的来源,例如 Hugging Face 仓库或官方项目 Release。
不要随便从陌生网站下载所谓:
"破解版模型"
"完整版模型"
"增强版模型"
因为模型文件本身也可能携带恶意内容或者经过修改。
二十四、如果用于商业项目,需要注意 AGPL
这是自部署时很容易忽略的问题。
VoiceStudio 当前项目许可证是:
AGPL-3.0。
因此如果你准备:
商业 SaaS
收费语音平台
对外提供 VoiceStudio 服务
不要只看:
"代码可以免费使用"
而应该认真确认 AGPL 对你的具体使用方式产生什么义务。
另外:
TTS Engine
Model
Voice
还可能分别拥有不同的授权。
所以:
VoiceStudio License
≠
所有模型 License
≠
所有声音 License
这三层需要分别检查。
二十五、服务器安全不要直接开放语音后端
如果使用:
莱卡云 VPS
不建议:
Internet
↓
:3900
↓
VoiceStudio
直接暴露。
官方的本地语音平台文档显示,后端涉及:
HTTP / WebSocket :3900
Rust control :3902
等服务。
更建议:
Internet
↓
HTTPS
↓
Nginx / Caddy
↓
Authentication
↓
VoiceStudio
或者:
Tailscale
↓
VoiceStudio
这样安全性更好。
二十六、如果是自己使用,我更推荐 Tailscale
例如:
笔记本
│
│ Tailscale
↓
莱卡云
│
VoiceStudio
│
↓
GPU
这样不用:
开放语音服务端口
+
公网裸奔
尤其是 Voice Clone / ASR 服务涉及:
音频文件
声音样本
生成结果
更应该限制访问范围。
二十七、推荐的完整架构
如果让我给一个比较实用的自部署方案,我会选择:
Internet
│
Tailscale
│
┌────────────┴────────────┐
↓ ↓
本地电脑 莱卡云 GPU
│ │
VoiceStudio UI VoiceStudio Backend
│ │
└───────────┬─────────────┘
↓
┌───────────────┐
│ AI Engines │
├───────────────┤
│ TTS │
│ ASR │
│ Voice Clone │
│ Translation │
└───────────────┘
│
↓
Audio / Video
这个架构的优点是:
- 本地操作方便;
- GPU 集中在服务器;
- 模型不用重复下载;
- 可以多台设备使用;
- 不需要把后端直接暴露公网。
二十八、如果只有一台机器
那就更简单:
莱卡云 GPU
│
├── Docker
│
├── VoiceStudio
│
├── Models
│
└── Nginx
然后:
浏览器
↓
HTTPS
↓
VoiceStudio
↓
GPU
即可。
二十九、CPU 云服务器适不适合?
可以,但是我建议分情况。
轻度测试
2~4 核
8GB
可以尝试。
正常使用
4~8 核
16GB
比较合适。
大量语音生成
CPU 会比较吃力。
尤其:
Voice Clone
+
长文本
+
批量生成
+
视频配音
建议直接使用 GPU。
所以如果你选择莱卡云部署 VoiceStudio,真正值得优先考虑的是有没有合适的 GPU,而不是单纯把 CPU 从 4 核升级到 16 核。
三十、VoiceStudio 很适合做一个私人 AI 配音工作站
例如:
VoiceStudio
│
┌────────────────┼────────────────┐
↓ ↓ ↓
文章 视频 有声书
│ │ │
↓ ↓ ↓
TTS Dubbing TTS
│ │ │
└────────────────┼────────────────┘
↓
Audio
再配合:
MCP
+
OpenAI-compatible API
就可以进一步做成:
AI Agent
↓
写稿
↓
VoiceStudio
↓
生成旁白
↓
视频工具
↓
最终视频
对于内容创作和内部自动化,这种组合的扩展空间比较大。
三十一、当前项目仍然处于 Beta
这一点不要忽略。
官方 README 明确标注:
Active beta。
也就是说:
版本更新
↓
引擎变化
↓
模型变化
↓
功能变化
都有可能导致兼容性问题。官方建议需要最新修复时可以从源码运行。
所以生产环境建议:
stable
↓
固定版本
↓
测试
↓
再升级
不要直接:
latest
↓
自动更新
↓
生产环境
三十二、最终推荐部署方案
如果你是个人使用:
方案 A:本地 GPU
Windows / Linux
+
RTX 3060 8GB+
+
VoiceStudio
最简单。
方案 B:云端 GPU
本地电脑
↓
Tailscale
↓
莱卡云 GPU VPS
↓
Docker
↓
VoiceStudio
更适合电脑没有 GPU 的情况。
方案 C:纯 CPU
莱卡云 Linux
↓
Docker
↓
VoiceStudio
↓
CPU
适合测试和轻度使用,但不要期待和 GPU 一样的生成速度。
总结
debpalash/VoiceStudio 是一个比较完整的开源 AI 语音工作室,目前已经从原来的 OmniVoice-Studio 更名为 VoiceStudio。它可以完成:
🎙️ Voice Cloning
🗣️ TTS
🎧 ASR
🎬 Video Dubbing
📚 Audiobook
🎵 Stories
🔊 Batch Generation
🤖 MCP
🔌 OpenAI-compatible Audio API
目前官方列出 16 个 TTS 引擎、11 个 ASR 引擎和 646 种语言目录,支持 Windows、Linux、macOS,同时提供 Docker、远程后端以及 GPU/CPU 多种运行方式。