VoiceStudio 怎么搭建?开源本地 AI 语音克隆、配音与语音工作室

如果你想自己搭建一个语音克隆、AI 配音、语音转文字、有声书和视频配音 工具,debpalash/VoiceStudio 是一个比较完整的开源方案。

它原名 OmniVoice-Studio ,现在已经更名为 VoiceStudio。项目目前支持 Windows、macOS、Linux,并提供 Docker 运行方式;核心工作流可以完全在本机完成,也支持把界面连接到远程后端。


一、VoiceStudio 是做什么的?

它可以理解成一个集成式 AI 音频工作站:

复制代码
                    VoiceStudio
                        │
        ┌───────────────┼────────────────┐
        ↓               ↓                ↓
     Voice Clone      TTS             ASR
        │               │                │
        ↓               ↓                ↓
      克隆声音        文字转语音       语音转文字
        │
        ├──────────────┐
        ↓              ↓
     视频配音        有声书
        │
        ↓
      音频生成

当前项目包含:

  • AI Voice Cloning
  • Voice Design
  • Text-to-Speech
  • Speech-to-Text
  • 视频配音
  • Stories
  • Audiobook
  • 批量生成
  • MCP Server
  • OpenAI-compatible Audio API

官方目前列出了 16 个 TTS 引擎、11 个 ASR 引擎以及 646 种语言目录,不过具体语言覆盖和效果取决于所选择的模型/引擎。


二、最重要的特点:可以自己部署

VoiceStudio 和很多在线语音平台最大的区别在于:

复制代码
复制代码
传统在线服务:

音频
 ↓
第三方服务器
 ↓
AI
 ↓
返回结果

而 VoiceStudio 可以:

复制代码
复制代码
你的设备
 ↓
VoiceStudio
 ↓
本地模型
 ↓
生成音频

项目 README 明确强调,核心工作流默认本地运行,声音、录音、项目和输出默认保存在本机。

所以如果你有自己的:

复制代码
复制代码
录音
声音样本
项目素材
有声书
视频

本地部署会更容易控制数据。


三、VoiceStudio 对服务器的要求比普通 Web 项目高

这里是搭建时最需要注意的地方。

官方当前给出的推荐配置为:

复制代码
复制代码
RAM:16GB+
GPU:8GB+ VRAM
CPU:现代 64 位 CPU
磁盘:20GB+

最低配置则是:

复制代码
复制代码
RAM:8GB
VRAM:4GB
磁盘:10GB

GPU 不是硬性要求,CPU 也可以运行,只是生成速度会明显慢一些。官方支持 NVIDIA CUDA、Linux AMD ROCm,以及 CPU;macOS 则可以使用 Apple Silicon 的 MPS/MLX。


四、为什么推荐 8GB 显存?

语音生成本身涉及模型推理。

如果:

复制代码
复制代码
CPU
 ↓
AI TTS
 ↓
生成

当然可以运行。

但是:

复制代码
复制代码
NVIDIA GPU
 ↓
CUDA
 ↓
模型推理
 ↓
TTS

通常会快很多。

官方推荐:

复制代码
复制代码
RTX 3060
8GB VRAM+

作为比较合适的 GPU 起点。

因此如果你想长期运行 VoiceStudio:

GPU 比单纯堆 CPU 更重要。


五、它也支持远程后端

这是 VoiceStudio 非常适合云服务器的一点。

项目目前支持:

复制代码
复制代码
本地 UI
   ↓
Remote Backend
   ↓
云服务器 GPU
   ↓
TTS / ASR

官方 README 已经明确提供 Remote Backend,并提到支持 Tailscale 和 bearer authentication。

也就是说:

复制代码
复制代码
你的电脑
│
│ 浏览器 / VoiceStudio UI
│
↓
远程服务器
│
├── VoiceStudio Backend
├── TTS Models
├── ASR Models
└── GPU

这其实比单纯在云服务器上部署一个网页更有价值。


六、莱卡云可以放在什么位置?

如果你有一台带 GPU 的莱卡云服务器,可以考虑:

复制代码
复制代码
                  你的电脑
                     │
                VoiceStudio UI
                     │
                 HTTPS / VPN
                     ↓
              莱卡云 GPU Server
                     │
              VoiceStudio Backend
                     │
         ┌───────────┼───────────┐
         ↓           ↓           ↓
        TTS         ASR       Voice Clone
         │
         ↓
       GPU

这种方式比较适合:

  • 本地电脑配置一般;
  • 希望模型统一放服务器;
  • 多台电脑访问同一个后端;
  • 希望 GPU 集中使用;
  • 不想每台电脑都重复下载模型。

这里莱卡云只是作为一种 GPU 云服务器环境,满足 CUDA/ROCm 或 CPU 运行条件的其他服务器同样可以使用。


七、如果没有 GPU,也能部署

VoiceStudio 官方明确支持 CPU。

所以:

复制代码
复制代码
4~8 核 CPU
+
16GB RAM

也可以运行。

只是:

复制代码
复制代码
CPU
 ↓
模型推理
 ↓
等待时间更长

特别是:

复制代码
复制代码
长文本
大量语音
视频配音
批量生成

时差距会更加明显。

因此:

只是测试

可以 CPU。

经常使用

建议 GPU。

大量生成

建议独立 GPU。


八、Docker 是云服务器上更推荐的方式

官方目前已经提供 Docker 安装方式,而且明确针对:

复制代码
复制代码
headless server
dedicated GPU
one-command deployment

进行了设计。

官方 Docker 镜像包括:

复制代码
复制代码
ghcr.io/debpalash/omnivoice-studio

以及 Docker Hub 上对应镜像:

复制代码
复制代码
palashdeb/omnivoice-studio

项目当前还提供:

复制代码
复制代码
CPU
CUDA
ROCm
worker-only GPU

等不同运行配置。


九、CPU Docker 部署

如果只是先测试,可以使用 CPU 环境。

基本思路:

复制代码
复制代码
Linux
 ↓
Docker
 ↓
VoiceStudio
 ↓
CPU

官方 Docker 文档提供了对应的 CPU profile。

部署前建议先检查:

复制代码
复制代码
docker --version
docker compose version

然后根据官方 Docker 文档的当前 Compose 配置启动。

由于项目 Docker 标签持续更新,建议直接使用官方文档当前给出的 stable 标签,而不是复制网上旧教程中的镜像版本号。


十、GPU Docker 部署

如果服务器有 NVIDIA GPU:

复制代码
复制代码
Linux
 ↓
NVIDIA Driver
 ↓
NVIDIA Container Toolkit
 ↓
Docker
 ↓
VoiceStudio
 ↓
CUDA
 ↓
TTS

首先检查:

复制代码
复制代码
nvidia-smi

应该能够看到:

复制代码
复制代码
GPU
Driver Version
CUDA Version
VRAM

然后再启动 CUDA 对应的 VoiceStudio 容器。

这样模型就可以直接利用服务器 GPU。


十一、GPU 服务器推荐配置

如果准备长期使用:

入门

复制代码
复制代码
4 vCPU
16GB RAM
8GB VRAM
80GB SSD

更舒服

复制代码
复制代码
8 vCPU
32GB RAM
12~16GB VRAM
100GB+ SSD

批量语音 / 视频

复制代码
复制代码
8~16 vCPU
32GB+ RAM
16GB+ VRAM
150GB+ SSD

实际需求取决于你使用的 TTS/ASR 引擎和模型。


十二、为什么磁盘不能太小?

第一次启动时,VoiceStudio 会:

复制代码
复制代码
创建 Python 环境
 ↓
下载模型
 ↓
建立缓存

官方最低只列:

复制代码
复制代码
10GB

但推荐:

复制代码
复制代码
20GB+

而如果安装多个模型:

复制代码
复制代码
TTS Model A
TTS Model B
TTS Model C
ASR Model A
ASR Model B

磁盘很容易增长。

因此如果准备作为长期语音工作站,我更建议:

100GB SSD 起步。


十三、模型数量会直接影响磁盘

例如:

复制代码
复制代码
VoiceStudio
│
├── TTS
│   ├── Model A
│   ├── Model B
│   └── Model C
│
├── ASR
│   ├── Model A
│   └── Model B
│
└── Cache

如果频繁切换模型:

复制代码
复制代码
模型
+
缓存
+
生成文件

都会占用磁盘。

所以:

复制代码
复制代码
20GB

适合测试。

复制代码
复制代码
80~100GB

更适合长期使用。


十四、直接运行 Linux AppImage 也可以

如果不是服务器,而是 Linux 桌面电脑,官方推荐 AppImage。

下载后:

复制代码
复制代码
chmod +x VoiceStudio.Studio_*.AppImage

然后:

复制代码
复制代码
./VoiceStudio.Studio_*.AppImage

如果系统没有 FUSE:

复制代码
复制代码
./VoiceStudio.Studio_*.AppImage \
  --appimage-extract-and-run

官方当前 Linux 文档把 AppImage 作为 Linux 的主要安装方式。


十五、为什么服务器更适合 Docker?

因为普通云服务器一般没有桌面环境。

AppImage 的要求是:

复制代码
复制代码
X11
或者
Wayland
+
Desktop Session

而 Docker 后端则可以:

复制代码
复制代码
Linux Server
 ↓
Docker
 ↓
VoiceStudio
 ↓
HTTP

官方 Docker 文档就是针对 headless server / dedicated GPU 场景设计的。

所以:

复制代码
复制代码
个人 Linux PC
→ AppImage

云服务器
→ Docker

是更合理的选择。


十六、Windows 电脑也非常容易使用

Windows 当前支持:

复制代码
复制代码
Windows 10/11 x64

官方提供:

复制代码
复制代码
MSI

安装包。

最低大约:

复制代码
复制代码
8GB RAM
10GB Disk

GPU 可选。

因此如果你只是自己使用:

复制代码
复制代码
Windows
 ↓
VoiceStudio
 ↓
本地 GPU

是最简单的方式。


十七、真正有意思的是"本地 UI + 云端 GPU"

如果你已经有性能不错的电脑:

复制代码
复制代码
Windows / macOS / Linux

但是没有 GPU,完全可以采用:

复制代码
复制代码
本地
VoiceStudio UI
       │
       │ HTTPS / Tailscale
       ↓
莱卡云 GPU
       │
VoiceStudio Backend
       │
       ↓
TTS / ASR / Clone

例如:

复制代码
复制代码
笔记本
│
├── 浏览器
├── VoiceStudio
└── 音频输入
        │
        ↓
    Remote Backend
        │
        ↓
  莱卡云 GPU Server
        │
        ├── Voice Clone
        ├── TTS
        └── ASR

这样本地电脑不用承担大量模型推理。


十八、Remote Backend 还能用于 OpenAI-Compatible API

VoiceStudio 当前还提供:

复制代码
复制代码
OpenAI-compatible audio API

以及本地 REST/SSE/WebSocket API。

这意味着你可以把它进一步接入其他应用:

复制代码
复制代码
你的应用
   ↓
OpenAI-compatible API
   ↓
VoiceStudio
   ↓
TTS

例如:

复制代码
复制代码
AI Chatbot
 ↓
生成文字
 ↓
VoiceStudio API
 ↓
生成语音
 ↓
播放

这样 VoiceStudio 就不仅仅是一个桌面软件了。


十九、还支持 MCP

当前版本还提供:

MCP Server

因此可以和:

复制代码
复制代码
Claude
Cursor
Codex
其他 MCP Client

进行集成。

架构可以变成:

复制代码
复制代码
AI Agent
    ↓
   MCP
    ↓
VoiceStudio
    ↓
TTS / ASR
    ↓
Audio

这对于自动化工作流很有意思。

例如:

复制代码
复制代码
Agent
 ↓
写文章
 ↓
VoiceStudio
 ↓
生成旁白
 ↓
视频制作

可以把整个流程串起来。


二十、视频配音是一个比较实用的功能

VoiceStudio 当前已经支持:

复制代码
复制代码
Video Dubbing

完整流程可以:

复制代码
复制代码
视频
 ↓
语音识别
 ↓
文本
 ↓
翻译
 ↓
Voice Clone / TTS
 ↓
重新配音
 ↓
时间对齐
 ↓
MP4

官方 README 的示例就是将视频中的多个片段进行转录、翻译、重新配音和时间调整后导出 MP4。

所以它可以用来做:

复制代码
复制代码
教程视频
课程视频
多语言视频
演示视频
有声内容

等。


二十一、长文本也可以生成

普通 TTS 经常遇到:

复制代码
复制代码
输入太长
 ↓
失败

VoiceStudio 当前支持:

复制代码
复制代码
sentence-chunked generation
+
streaming via WebSocket

也就是将长文本拆分成句子或块,再逐步生成。

因此:

复制代码
复制代码
小说
 ↓
章节
 ↓
句子
 ↓
TTS
 ↓
合并
 ↓
有声书

也是比较自然的使用方式。


二十二、声音克隆要注意授权

这是使用 VoiceStudio 时最需要强调的一点。

技术上:

复制代码
复制代码
3 秒左右声音样本

就可以开始进行 Voice Cloning,官方也说明 5~15 秒的干净样本通常可以获得更好的 prompt。

但:

能够克隆 ≠ 可以随意克隆。

例如不要未经授权使用:

复制代码
复制代码
明星声音
他人声音
配音演员声音
公众人物声音

制作容易造成身份误认的内容。

最稳妥的方式是:

复制代码
复制代码
自己的声音
或者
获得明确授权的声音

二十三、模型许可证也要单独检查

VoiceStudio 本身是:

复制代码
复制代码
AGPL-3.0

但项目中的不同模型、引擎有自己的许可证。

官方 Security Policy 还特别强调:

模型应该来自公开、可验证的来源,例如 Hugging Face 仓库或官方项目 Release。

不要随便从陌生网站下载所谓:

复制代码
复制代码
"破解版模型"
"完整版模型"
"增强版模型"

因为模型文件本身也可能携带恶意内容或者经过修改。


二十四、如果用于商业项目,需要注意 AGPL

这是自部署时很容易忽略的问题。

VoiceStudio 当前项目许可证是:

AGPL-3.0。

因此如果你准备:

复制代码
复制代码
商业 SaaS
收费语音平台
对外提供 VoiceStudio 服务

不要只看:

复制代码
复制代码
"代码可以免费使用"

而应该认真确认 AGPL 对你的具体使用方式产生什么义务。

另外:

复制代码
复制代码
TTS Engine
Model
Voice

还可能分别拥有不同的授权。

所以:

复制代码
复制代码
VoiceStudio License
≠
所有模型 License
≠
所有声音 License

这三层需要分别检查。


二十五、服务器安全不要直接开放语音后端

如果使用:

复制代码
复制代码
莱卡云 VPS

不建议:

复制代码
复制代码
Internet
 ↓
:3900
 ↓
VoiceStudio

直接暴露。

官方的本地语音平台文档显示,后端涉及:

复制代码
复制代码
HTTP / WebSocket :3900
Rust control :3902

等服务。

更建议:

复制代码
复制代码
Internet
 ↓
HTTPS
 ↓
Nginx / Caddy
 ↓
Authentication
 ↓
VoiceStudio

或者:

复制代码
复制代码
Tailscale
 ↓
VoiceStudio

这样安全性更好。


二十六、如果是自己使用,我更推荐 Tailscale

例如:

复制代码
复制代码
笔记本
   │
   │ Tailscale
   ↓
莱卡云
   │
VoiceStudio
   │
   ↓
GPU

这样不用:

复制代码
复制代码
开放语音服务端口
+
公网裸奔

尤其是 Voice Clone / ASR 服务涉及:

复制代码
复制代码
音频文件
声音样本
生成结果

更应该限制访问范围。


二十七、推荐的完整架构

如果让我给一个比较实用的自部署方案,我会选择:

复制代码
复制代码
                    Internet
                       │
                  Tailscale
                       │
          ┌────────────┴────────────┐
          ↓                         ↓
       本地电脑                 莱卡云 GPU
          │                         │
   VoiceStudio UI            VoiceStudio Backend
          │                         │
          └───────────┬─────────────┘
                      ↓
              ┌───────────────┐
              │   AI Engines  │
              ├───────────────┤
              │ TTS           │
              │ ASR           │
              │ Voice Clone   │
              │ Translation   │
              └───────────────┘
                      │
                      ↓
                 Audio / Video

这个架构的优点是:

  • 本地操作方便;
  • GPU 集中在服务器;
  • 模型不用重复下载;
  • 可以多台设备使用;
  • 不需要把后端直接暴露公网。

二十八、如果只有一台机器

那就更简单:

复制代码
复制代码
莱卡云 GPU
│
├── Docker
│
├── VoiceStudio
│
├── Models
│
└── Nginx

然后:

复制代码
复制代码
浏览器
 ↓
HTTPS
 ↓
VoiceStudio
 ↓
GPU

即可。


二十九、CPU 云服务器适不适合?

可以,但是我建议分情况。

轻度测试

复制代码
复制代码
2~4 核
8GB

可以尝试。

正常使用

复制代码
复制代码
4~8 核
16GB

比较合适。

大量语音生成

CPU 会比较吃力。

尤其:

复制代码
复制代码
Voice Clone
+
长文本
+
批量生成
+
视频配音

建议直接使用 GPU。

所以如果你选择莱卡云部署 VoiceStudio,真正值得优先考虑的是有没有合适的 GPU,而不是单纯把 CPU 从 4 核升级到 16 核。


三十、VoiceStudio 很适合做一个私人 AI 配音工作站

例如:

复制代码
复制代码
                    VoiceStudio
                         │
        ┌────────────────┼────────────────┐
        ↓                ↓                ↓
      文章              视频             有声书
        │                │                │
        ↓                ↓                ↓
       TTS              Dubbing           TTS
        │                │                │
        └────────────────┼────────────────┘
                         ↓
                       Audio

再配合:

复制代码
复制代码
MCP
+
OpenAI-compatible API

就可以进一步做成:

复制代码
复制代码
AI Agent
 ↓
写稿
 ↓
VoiceStudio
 ↓
生成旁白
 ↓
视频工具
 ↓
最终视频

对于内容创作和内部自动化,这种组合的扩展空间比较大。


三十一、当前项目仍然处于 Beta

这一点不要忽略。

官方 README 明确标注:

Active beta。

也就是说:

复制代码
复制代码
版本更新
 ↓
引擎变化
 ↓
模型变化
 ↓
功能变化

都有可能导致兼容性问题。官方建议需要最新修复时可以从源码运行。

所以生产环境建议:

复制代码
复制代码
stable
 ↓
固定版本
 ↓
测试
 ↓
再升级

不要直接:

复制代码
复制代码
latest
 ↓
自动更新
 ↓
生产环境

三十二、最终推荐部署方案

如果你是个人使用:

方案 A:本地 GPU

复制代码
复制代码
Windows / Linux
+
RTX 3060 8GB+
+
VoiceStudio

最简单。

方案 B:云端 GPU

复制代码
复制代码
本地电脑
   ↓
Tailscale
   ↓
莱卡云 GPU VPS
   ↓
Docker
   ↓
VoiceStudio

更适合电脑没有 GPU 的情况。

方案 C:纯 CPU

复制代码
复制代码
莱卡云 Linux
   ↓
Docker
   ↓
VoiceStudio
   ↓
CPU

适合测试和轻度使用,但不要期待和 GPU 一样的生成速度。


总结

debpalash/VoiceStudio 是一个比较完整的开源 AI 语音工作室,目前已经从原来的 OmniVoice-Studio 更名为 VoiceStudio。它可以完成:

复制代码
复制代码
🎙️ Voice Cloning
🗣️ TTS
🎧 ASR
🎬 Video Dubbing
📚 Audiobook
🎵 Stories
🔊 Batch Generation
🤖 MCP
🔌 OpenAI-compatible Audio API

目前官方列出 16 个 TTS 引擎、11 个 ASR 引擎和 646 种语言目录,支持 Windows、Linux、macOS,同时提供 Docker、远程后端以及 GPU/CPU 多种运行方式。

相关推荐
甲维斯1 小时前
浪费时间!DeepSeek 4.1 Flash
人工智能
tianxuanjg1 小时前
工业/协作机器人研发采购指南:如何适配新品迭代的CNC加工合作
人工智能·经验分享·机器人·无人机·材质
醍醐实验室1 小时前
视觉投影层(Projector)的几何变换:从 Linear 到 C-Abstractor 的信息压缩
人工智能·c-abstractor
举个栗子。1 小时前
Generative AI for Beginners:微软官方 21 课生成式 AI 入门教程,从零掌握 AI 应用开发
人工智能·microsoft
科技苑1 小时前
日常用的 prompt词汇集指南
人工智能·prompt
AIwenIPgeolocation2 小时前
告别“数据孤岛”:可信数据空间如何打通产业链、城市群?
大数据·人工智能
七夜zippoe2 小时前
AI Agent 工程化落地实战(01):从 ChatBot 到自主智能体的范式跃迁
人工智能·ai·agent·chatbot·自主智能体
..Dauntless..2 小时前
【Linux】权限问题——拥有者、所属组和其他用户的协调
linux·运维·服务器