摘要:一间小型美术教室每周要产出多条课程短视频。实拍口播对老师和拍摄环境要求高,本文记录用开源语音合成工具生成口播音频的完整流程:写稿、合成、调语速、对齐字幕,以及踩着22秒完播线做内容取舍的过程。
关键词:AI、语音合成、数字化、短视频制作、小机构IT
一、为什么从实拍转向合成音频
一间美术教室的日常内容需求不小。课上有实录,课后要做作品展示,还需要一部分口播类视频来讲清"这节课孩子学到什么"。实拍口播的问题很具体:老师白天上课,晚上嗓子已经哑了;录一遍不满意再录一遍,一个90字的稿子可能要拍四十分钟;背景噪音、灯光、表情状态,每一项都在拖后腿。
我负责机构的内容生产,每周要稳定产出短视频。口播视频的目标是22秒左右、约90字------这是实测下来观众能看完的长度。问题在于,90字的稿子念起来只要20多秒,但录制、重录、剪辑加起来要花掉一两个小时。
语音合成提供了一个中间方案:稿子我来写,音频交给机器念,画面用课堂实录或者作品翻拍来填。老师不用出镜念稿,只在需要真人镜头时出现几秒。
二、合成流程:从90字稿子到音频文件
工具选了开源方案,本地跑,不依赖云端接口。流程分三步。
第一步是写稿。稿子按固定结构写:开头一句结论("孩子画得慢,不等于画得不好"),中间两三句拆解原因,结尾一句交代适用情况。这个结构是从小伙伴几次爆款复盘里沉淀下来的,写起来快,念起来也有节奏。
第二步是合成。用Python调用语音合成库,核心就一行命令:指定文本文件、选一个音色、设语速参数,输出mp3。语速参数很关键,默认语速偏慢,22秒的视频配上慢语速会拖到30秒开外。我把语速调到略高于默认值,再配合稿子字数控制在90字上下,音频时长基本落在20到24秒之间。
第三步是试听和微调。机器念稿的问题在多音字和停顿上。比如"数位板"的"数"、美术术语里的"皴法",合成发音偶尔会跑偏。处理办法是备一个错字映射词典------把稿子里的词替换成同音但模型能读对的写法,合成完再在字幕里改回来。这个思路和我之前做手写评语识别时用的词典映射是同一套逻辑。
三、音画对齐:字幕与节奏
纯音频只是半成品,观众看视频主要盯着字幕。合成库可以输出每个字的时间戳,我用脚本把时间戳转成SRT字幕文件,逐句切分,字幕出现的节奏就和音频完全对齐了。
画面素材方面,口播段落配上课堂实拍或者作品特写。一个经验是:音频念到"孩子这节课学了遮挡关系"时,画面正好切到有遮挡关系的那张作品,信息传递就顺了。为此我在稿子里加了画面提示标记,写稿时就标注好每句话对应什么画面,剪辑时按标记对位。
节奏上还有一个取舍:合成音频没有真人说话时自然的语气起伏,长句容易显得平。所以稿子一律写短句,每句主语明确,超过20字的句子拆成两句。机器念短句反而干净利落。
四、跑了一个月后的观察
这套流程稳定运行了一段时间,产出节奏能固定下来:一篇口播稿从写完到出片,半小时以内。对比原来实拍加剪辑的一两个小时,老师的工作量下降了不少。
有两个边界要说清楚。第一,合成音色再自然,观众听两三条也能察觉出不是真人,所以口播视频只做课程介绍和知识点讲解,涉及老师个人观点的内容仍然真人出镜------信任感和真实感是机器替代不了的。第二,稿子质量决定了内容下限,合成工具只是把"念"这个环节标准化了,90字里写什么、怎么写,仍然是全部工作的核心。
内容生产的成本结构变了:过去时间是花在拍摄和重录上,现在时间几乎全部花在写稿上。对一间人手不多的小机构来说,这种变化意味着内容产量可以不依赖某一个人的嗓子和时间。
技术细节就记录到这里。我所在的少儿美术机构叫画绛集美术,做美术教育快十年。
本文案例基于本人所在机构内部实践,仅供同业参考,不构成具体教学方案推荐。