WorkBuddy 自动化实战,TTS 配音从安装到跑通

最近我一直在筹备短视频获客自动化训练营的事。

大家好,我是小虎。

课程内容已经搭了大半,视频生成、图片生成、脚本生成都跑通了。

在筹备过程中我发现,配音这个环节虽然不复杂,但如果不提前规划好自动化方案,后面批量做视频的时候一定会拖后腿。

你想啊,一条获客短视频,画面再好,配音拉胯的话,观众三秒就划走了。声音不是最重要的,但它一定不能拖后腿。

坦白讲,我之前做视频要么自己录旁白,NG 十几遍是常态,嗓子都录哑了。

要么花钱请配音,一条视频报价两三百,批量做根本扛不住。录完还要剪辑对轨,一条两分钟的口播,光配音环节就得折腾大半天。

直到我认真测了一圈 2026 年的 TTS 工具,这事才算真正打通。

用 TTS 做配音,痛点在哪

先说说为什么不用真人配音。

自己录,最大的问题是效率低。一条两分钟的口播,写稿半小时,录音半小时,中间 NG 七八次,最后剪辑还要对轨。一天录五条就已经是极限了。

请人录,贵。而且沟通成本高,你写的文案他不一定理解到位,语气、节奏、情绪都要反复调整。

批量做视频的时候,光配音这一个环节就能把整个流程拖慢好几天

那 TTS 呢?说实话,几年前我试过几次,效果确实不行。声音机械,没有感情,一听就是机器人。

拿来做获客视频,观众第一反应就是「又是 AI 念稿」,直接划走。

2026 年的 TTS,跟以前真的不一样了

六款 TTS 工具的真实体感

我前前后后测了六款主流的 TTS 工具,说个有意思的发现,选 TTS 最重要的根本不是音质。

edge-tts,微软出品,完全免费,不需要 API Key,装好之后一行命令就能出音频。

中文语音包做得挺扎实,日常旁白完全够用。其实吧,免费加命令行调用,对自动化来说简直是天菜。

Fish Audio 的中文语音质量是我测下来最好的,还支持声音克隆,你有自己的音频样本就能复刻。

它有 REST API,免费额度也够个人创作者用一阵子。

MiniMax TTS 我也在用,中文效果不错,API 价格亲民。

它同样支持音色克隆,录一段真人音频就能生成你自己的数字声音,做个人 IP 特别实用。

接入起来也挺顺畅,文档写得比较清楚。

CosyVoice 是阿里开源的,支持本地部署和声音克隆,Python SDK 写得还算清晰。

适合想在自己机器上跑的同学,不用担心数据外泄。

ElevenLabs 的英文语音质量确实碾压级别,但中文表现一般,而且价格不便宜。

如果你主做英文内容它是首选,中文场景就别硬上了。

火山引擎 TTS 是字节跳动家的,中文语音质量在线,企业级 API 稳定性好,适合有量级需求的团队。

怎么说呢,如果你做中文短视频获客,我直接推荐 edge-tts 起步,零成本先跑通链路。

追求音质再上 Fish Audio 或者 MiniMax。

能用代码调用的工具才是生产力工具,只能手动操作的工具再好听也只是个玩具。

光说不练假把式,下面直接上手。

装好 edge-tts,零成本起步

首先你需要一个免费又好用的 TTS 引擎。edge-tts 零配置开箱即用,支持三百多种音色,中英文都覆盖到了。

打开终端跑一下安装命令。

复制代码
pip install edge-tts

装好后直接用命令行测试一段文本转语音。

arduino 复制代码
edge-tts --voice zh-CN-XiaoyiNeural --text "大家好,欢迎收看本期视频" --write-media test.mp3

跑完以后去当前目录找 test.mp3,双击播放能听到一段清晰的女声就对了。

听不到声音的话回头检查 pip 有没有装成功。

这里有个坑要注意。如果终端报「edge-tts 不是内部或外部命令」,说明 Python Scripts 目录没加到系统 PATH 里。

去环境变量设置里把 Scripts 路径加进去,加完记得重启终端再试。

edge-tts 提供好几种中文音色,我平时常用下面这几个搭配。

arduino 复制代码
 # 活泼少女音,适合短视频解说
edge-tts --voice zh-CN-XiaoyiNeural --text "你的文案" --write-media output.mp3

# 温暖女声,适合教程旁白
edge-tts --voice zh-CN-XiaoxiaoNeural --text "你的文案" --write-media output.mp3

# 年轻男声,适合科技测评
edge-tts --voice zh-CN-YunxiNeural --text "你的文案" --write-media output.mp3

选一个你喜欢的音色先用着,后面随时能换。

想升级音质?Fish Audio 接进来

说实话 edge-tts 已经够用了,但你要是追求更好的音质,可以试试 Fish Audio。

这家支持声音克隆,效果比免费方案好一个档次。

先去 fish.audio 注册一个账号,在后台拿到你的 API Key。

然后跑一段 Python 代码来测试 API 调用。

kotlin 复制代码
import requests

headers = {"Authorization": "Bearer 你的API_KEY"}
data = {
    "text": "大家好,欢迎收看本期视频",
    "reference_id": "默认音色ID",
    "format": "mp3"
}

resp = requests.post(
    "https://api.fish.audio/v1/tts",
    headers=headers,
    json=data
)

with open("fish_test.mp3", "wb") as f:
    f.write(resp.content)

跑完打开 fish_test.mp3 听听效果,再跟刚才 edge-tts 的 test.mp3 对比一下。

Fish Audio 的声音更自然,气息感更明显。对音质有要求的朋友建议上这个方案。

Fish Audio 还有个杀手锏功能就是声音克隆。你录一段三十秒的真人音频上传到平台,它就能生成一个跟你声音几乎一模一样的数字分身。

以后写好的文案直接用自己的声音输出,连录音环节都省了。做个人 IP 的朋友这个功能真的值得研究一下。

要注意 API Key 千万别泄露出去,别把带 Key 的代码直接贴到公开仓库里。

用 WorkBuddy 一键调用 TTS

接下来是关键的一步。前面我们都是手动跑命令,现在要让 WorkBuddy 帮你一键完成配音。

在 WorkBuddy 里创建一个 Skill,让它读取文案文件后自动调用 edge-tts 生成音频。

打开 WorkBuddy 的 Skill 管理面板,新建一个 Skill,描述里写清楚输入和输出的约定。

markdown 复制代码
## Skill 描述
读取指定的文案文件,调用edge-tts将文本转为mp3音频。
输入,文案文件路径
输出,同名mp3音频文件

## 执行步骤
1. 读取输入文件的全部文本
2. 调用edge-tts命令生成mp3
3. 输出文件路径供后续使用

Skill 保存后直接就能用,不需要重启 WorkBuddy。

跟 WorkBuddy 说「帮我读一下 script.txt 生成配音」,它自动就跑完了。

去输出目录确认 mp3 文件已经生成,点开听一下内容对不对。

这里有个真正需要注意的坑。Skill 里调用 edge-tts 的时候要用完整路径而不是直接写命令名。

Windows 上完整路径大概是这样的。

arduino 复制代码
C:\Users\你的用户名\AppData\Roaming\Python\Python311\Scripts\edge-tts.exe --voice zh-CN-XiaoyiNeural --text "文案内容" --write-media output.mp3

WorkBuddy 的运行环境和你终端的 PATH 不一样,直接写 edge-tts 大概率会报找不到命令。用完整路径就能解决。

FFmpeg 合成,一条命令出成片

说真的,有了音频文件以后,你需要把它和视频画面合到一起。FFmpeg 一条命令就能搞定。

css 复制代码
ffmpeg -i video.mp4 -i audio.mp3 -c:v copy -c:a aac -ar 44100 -shortest output.mp4

这条命令保持视频画面不动,把音频替换成你的配音,输出到 output.mp4。

注意我加了-ar 44100参数,这是因为 edge-tts 默认输出 24000Hz,但视频平台标准是 44100Hz,不匹配的话合成后声音会发闷。养成习惯每次都带上。

跑完打开 output.mp4 看一下,画面和声音都正常就大功告成了。

全链路跑通,一句话出片

整套流程跑通以后,你可以把全部环节串成一条流水线。

WorkBuddy 接收一句自然语言指令,自动生成文案,调用 TTS 生成配音,再用 FFmpeg 合成视频,最后输出成品。

bash 复制代码
 # WorkBuddy全链路执行流程
# 1. 根据主题生成视频文案
# 2. 调用edge-tts生成配音mp3
# 3. 调用ffmpeg合成最终视频
# 4. 输出成品视频文件

这套工作流我封装成了 WorkBuddy 的一个 Skill,每次丢一句话进去就能跑完整个流程。一句自然语言就能出片,这才是效率工具该有的样子。

搭好之前和搭好之后

搭好之前做一条带旁白的视频,要么自己录音反复 NG,要么花钱找配音等排期,前前后后折腾两个小时起步。碰到文案改几版的情况,一整天就耗在配音上了。

搭好以后呢?文案丢进去,命令一跑,五分钟搞定。而且文案随时能改,改完重新生成就行,配音质量不输付费服务。

你想想看,我自己用这套流程做了二十多条短视频,每条省下来的时间够我多写一篇稿子

批量出片的时候更明显,十条视频的配音加起来不到半小时。

做内容做到最后,拼的不是单一环节的质量,而是整条流水线的效率。

写在最后

这也是我训练营里配音模块要教的核心内容。

从 edge-tts 开始,零成本,装好就跑。配合 WorkBuddy,你的视频旁白环节可以直接从工作流里消失。

先跑通基础流程,确认整条链路没问题了再考虑升级音质。

TTS 的护城河不是声音有多像真人,而是它能不能无缝嵌入你的自动化流水线。

训练营还在筹备中,但光配音这一个环节,就已经能帮你省掉大量时间和金钱了。

如果你也在做短视频获客,建议今天就把 edge-tts 装上试一下。

别等所有人都用上了你才动手,工具红利窗口期不会太长。

想,都是问题。干,就对了。

相关推荐
小虎AI生活3 小时前
workbuddy 短视频获客的终极形态,不是做内容,是建工厂
ai编程
钱六两3 小时前
#5、Spring AI Tool Calling 深度解读(从概念>原理>定义工具>使用工具>核心接口剖析)
ai编程
AI分享猿5 小时前
重度长上下文开发怎么选?先看缓存是否吃额度
缓存·ai编程
亦暖筑序5 小时前
AgentScope-Java 入门:用 Middleware 审计 Agent 调用
java·ai编程·agentscope
子昕5 小时前
Opus 5只要Fable一半价格,我准备把Claude续上了
ai编程
aqi006 小时前
15天学会AI应用开发(十六)LangChain实现对话记忆功能
人工智能·python·大模型·ai编程·ai应用
赫媒派7 小时前
Agent 能被搜到?ARD:MCP/A2A 资源统一发现
ai编程
Pokerhead7 小时前
如何评价 DeepSeek-V4 的价格?
人工智能·大模型·ai编程·deepseek