开源 VoiceStudio,声音克隆|配音|有声书一站式本地完成

VoiceStudio 是一套完全开源、跑在本地的语音工作流,想替掉 ElevenLabs 那类托管式的语音服务。它把声音克隆、配音、听写、转录、有声书制作全收进一个桌面应用。目前是活跃测试版,项目建议直接用最新 release 而不是追 main 分支。

它的工作流围绕"自己的硬件"展开。克隆声音、给视频配音、实时听写都能在本地完成。配音流程是先转录、再翻译、再合成、最后导出。有声书能从 EPUB、PDF 导入,导出成 .m4b。它把"从原文到成品音频"的链路尽量收进一个应用。

底层用 Tauri 加 React 做桌面界面。FastAPI 跑本地后端,只在环回地址通信。远程功能要手动开启,默认不对外暴露。这种隔离设计,正是它敢说"数据不出本机"的底气。

它内置了 16 个 TTS 引擎和 11 个 ASR 引擎。VoiceStudio 自有 OmniVoice、CosyVoice 3 都在列。GPT-SoVITS、VoxCPM2、IndexTTS 2.5 也都能接。引擎多到能按需挑,但首次跑得先下载模型权重。

和 ElevenLabs 比,差距不在单点音质上限。ElevenLabs 的音频文本都走供应商服务器。VoiceStudio 装好模型后能完全离线运行。README 原话是:它用本地控制权,换掉了托管云算力。

成本结构也完全不同。ElevenLabs 按量计费,用得越多越贵。VoiceStudio 免费,代价是你自供硬件。定制上它把引擎、模型、API 全打开,ElevenLabs 则受平台限制。

开源里也有老牌对手 coqui-ai/TTS。它有约 4.6 万星,是生产级深度学习 TTS 工具箱。协议是 MPL-2.0,偏底层工具而非完整应用。它适合当引擎用,不像 VoiceStudio 串成工作流。

fishaudio/fish-speech 约 3.3 万星,主打 SOTA 开源 TTS。hexgrad/Kokoro 约 8.7 千星,是 82M 的轻量小模型。Kokoro 用 Apache-2.0,适合低资源设备部署。这三家多是单点引擎,完整应用层还是 VoiceStudio 补位。

所以竞品定位很清楚。要单引擎、要嵌入自己系统,选 coqui 或 Kokoro。要开箱即用的本地全套语音,VoiceStudio 更顺手。它补的是"应用层",不是和引擎库正面拼指标。

安装命令:

复制代码
git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
bun install
bun run desktop

浏览器 UI 用 bun run dev,桌面端用上面这组命令。首行超 50 字符就不塞进代码块了,上面四行都在限制内。

第一个坑是协议:应用整体 AGPL-3.0。这意味着闭源产品化要另谈商业许可。README 也提醒,部分模型另有独立条款。比如 IndexTTS 2.5 月活过亿需 Bilibili 书面授权。

模型权重要自己准备,首跑会触发下载。没显卡也能跑,但加速至少 4GB 显存。默认工作流建议 8GB 以上,大模型要 12 到 16GB。显存不够会掉回 CPU,速度和体验明显打折。

平台也有雷区。Intel Mac 跑不了本地后端,只能接远程。macOS 首次启动要右键打开,别直接双击。ROCm 只支持 Linux,Windows 的 AMD 显卡只能走 CPU。

它提供 Colab 在线笔记本做远程试用。但要注意,Colab 走远程算力,数据不留在本地。想要真正的本地闭环,还是得在自己机器上跑。远程试用方便,却和"数据不出本机"的卖点错位。

它适合看重隐私、想脱离订阅的个人用户。自托管团队、做有声书或视频本地化的人也合适。内部语音助手、批量转录都能在本地闭环。这类人最在意的是数据不离开自己机器。

不适合只想点一下就出声的轻度用户。不愿折腾环境、不想管模型的人会劝退。闭源商业产品也不能直接打包它的代码。它要的是"愿意自己运维"的使用者。

同时它的README 也提到,没有克隆能力的引擎在配音时会被拒绝。它不会悄悄换引擎,而是直接报错让你知道。这个设计减少了"以为克隆了其实没克隆"的坑。明确报错比静默降级更省后期排查时间。

对集成开发者,它留了 OpenAI 兼容 API 和 MCP。代理能把它当语音能力层直接调用。README 里也提到了代理技能(agent skill)的接入。这让它能嵌进现有的编码代理工作流里。

仓库明确标注 Active beta,main 分支可能随时变动。真要稳定用,盯住最新 release 而不是追主干。把它当 beta 工具,别直接塞进生产关键链路。

整体看,VoiceStudio 的价值在"缝合"而非"单点"。它把分散的开源语音引擎,用本地界面缝成工作流。它不追单点的极致指标,追的是自己的机器、自己的数据。第一次体验前,先留好带宽和磁盘给模型。

复制代码
项目地址:https://github.com/debpalash/VoiceStudio

竞品地址:
- ElevenLabs(商业产品,目前无开源仓库):https://elevenlabs.io
- coqui-ai/TTS:https://github.com/coqui-ai/TTS
- fishaudio/fish-speech:https://github.com/fishaudio/fish-speech
- hexgrad/Kokoro:https://github.com/hexgrad/kokoro
相关推荐
点心的游戏开发世界4 小时前
Unity C# 脚本学习笔记:命名空间与 using
学习·unity·c#
香芋芋圆5 小时前
AI 冲击内卷之下,普通前端如何破局?WebGIS—— 低门槛突围赛道
前端·javascript·人工智能·学习·职场发展
点心的游戏开发世界5 小时前
Unity C# 脚本学习笔记:泛型
学习·unity·c#
DM今天肝到几点?6 小时前
AI 安全进入「攻防同频」:Gemini 3.8 Flash Cyber 上线、Astra 触及关键级、HiddenLayer 融资 1 亿美元
网络·人工智能·深度学习·安全·语言模型·开源·知识图谱
tju新生代魔迷7 小时前
Verilog HDL 学习笔记(十三)| 第13章 编程语言接口(PLI)
笔记·学习
冬奇Lab7 小时前
一天一个开源项目(第207篇):AirLLM - 单卡 4GB 跑 70B 大模型
人工智能·开源
行百里er8 小时前
Gateway 上别硬塞 MVC:DeferredImportSelector 看菜下锅
spring boot·后端·开源
十六年开源服务商8 小时前
2026年WordPress页面构建器终极选型指南
开源
我爱cope9 小时前
【计算机网络 | 网络层11:ICMP 协议:Ping 和 Traceroute 的底层原理】
网络·学习·计算机网络