VoiceStudio 是一套完全开源、跑在本地的语音工作流,想替掉 ElevenLabs 那类托管式的语音服务。它把声音克隆、配音、听写、转录、有声书制作全收进一个桌面应用。目前是活跃测试版,项目建议直接用最新 release 而不是追 main 分支。
它的工作流围绕"自己的硬件"展开。克隆声音、给视频配音、实时听写都能在本地完成。配音流程是先转录、再翻译、再合成、最后导出。有声书能从 EPUB、PDF 导入,导出成 .m4b。它把"从原文到成品音频"的链路尽量收进一个应用。
底层用 Tauri 加 React 做桌面界面。FastAPI 跑本地后端,只在环回地址通信。远程功能要手动开启,默认不对外暴露。这种隔离设计,正是它敢说"数据不出本机"的底气。
它内置了 16 个 TTS 引擎和 11 个 ASR 引擎。VoiceStudio 自有 OmniVoice、CosyVoice 3 都在列。GPT-SoVITS、VoxCPM2、IndexTTS 2.5 也都能接。引擎多到能按需挑,但首次跑得先下载模型权重。
和 ElevenLabs 比,差距不在单点音质上限。ElevenLabs 的音频文本都走供应商服务器。VoiceStudio 装好模型后能完全离线运行。README 原话是:它用本地控制权,换掉了托管云算力。
成本结构也完全不同。ElevenLabs 按量计费,用得越多越贵。VoiceStudio 免费,代价是你自供硬件。定制上它把引擎、模型、API 全打开,ElevenLabs 则受平台限制。
开源里也有老牌对手 coqui-ai/TTS。它有约 4.6 万星,是生产级深度学习 TTS 工具箱。协议是 MPL-2.0,偏底层工具而非完整应用。它适合当引擎用,不像 VoiceStudio 串成工作流。
fishaudio/fish-speech 约 3.3 万星,主打 SOTA 开源 TTS。hexgrad/Kokoro 约 8.7 千星,是 82M 的轻量小模型。Kokoro 用 Apache-2.0,适合低资源设备部署。这三家多是单点引擎,完整应用层还是 VoiceStudio 补位。
所以竞品定位很清楚。要单引擎、要嵌入自己系统,选 coqui 或 Kokoro。要开箱即用的本地全套语音,VoiceStudio 更顺手。它补的是"应用层",不是和引擎库正面拼指标。
安装命令:
git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
bun install
bun run desktop
浏览器 UI 用 bun run dev,桌面端用上面这组命令。首行超 50 字符就不塞进代码块了,上面四行都在限制内。
第一个坑是协议:应用整体 AGPL-3.0。这意味着闭源产品化要另谈商业许可。README 也提醒,部分模型另有独立条款。比如 IndexTTS 2.5 月活过亿需 Bilibili 书面授权。
模型权重要自己准备,首跑会触发下载。没显卡也能跑,但加速至少 4GB 显存。默认工作流建议 8GB 以上,大模型要 12 到 16GB。显存不够会掉回 CPU,速度和体验明显打折。
平台也有雷区。Intel Mac 跑不了本地后端,只能接远程。macOS 首次启动要右键打开,别直接双击。ROCm 只支持 Linux,Windows 的 AMD 显卡只能走 CPU。
它提供 Colab 在线笔记本做远程试用。但要注意,Colab 走远程算力,数据不留在本地。想要真正的本地闭环,还是得在自己机器上跑。远程试用方便,却和"数据不出本机"的卖点错位。
它适合看重隐私、想脱离订阅的个人用户。自托管团队、做有声书或视频本地化的人也合适。内部语音助手、批量转录都能在本地闭环。这类人最在意的是数据不离开自己机器。
不适合只想点一下就出声的轻度用户。不愿折腾环境、不想管模型的人会劝退。闭源商业产品也不能直接打包它的代码。它要的是"愿意自己运维"的使用者。
同时它的README 也提到,没有克隆能力的引擎在配音时会被拒绝。它不会悄悄换引擎,而是直接报错让你知道。这个设计减少了"以为克隆了其实没克隆"的坑。明确报错比静默降级更省后期排查时间。
对集成开发者,它留了 OpenAI 兼容 API 和 MCP。代理能把它当语音能力层直接调用。README 里也提到了代理技能(agent skill)的接入。这让它能嵌进现有的编码代理工作流里。
仓库明确标注 Active beta,main 分支可能随时变动。真要稳定用,盯住最新 release 而不是追主干。把它当 beta 工具,别直接塞进生产关键链路。
整体看,VoiceStudio 的价值在"缝合"而非"单点"。它把分散的开源语音引擎,用本地界面缝成工作流。它不追单点的极致指标,追的是自己的机器、自己的数据。第一次体验前,先留好带宽和磁盘给模型。
项目地址:https://github.com/debpalash/VoiceStudio
竞品地址:
- ElevenLabs(商业产品,目前无开源仓库):https://elevenlabs.io
- coqui-ai/TTS:https://github.com/coqui-ai/TTS
- fishaudio/fish-speech:https://github.com/fishaudio/fish-speech
- hexgrad/Kokoro:https://github.com/hexgrad/kokoro