导语
一人公司做短视频内容获客,最大的瓶颈不是创意,而是每一条视频的边际制作成本。本文拆解基于 WorkBuddy 构建的短视频自动化流水线,覆盖脚本生成、画面生成、数字人口播、合成输出四个环节,展示如何将视频制作流程系统化、自动化。


背景:一人公司的生产力困境
传统短视频制作流程:编导写脚本 → 剪辑找素材 → 配音录声音 → 后期加字幕。一人操作,至少半天到一天,边际成本极高。
核心策略:不追求单条爆款,追求将单条视频生产成本降至接近零,用数量覆盖概率。

流水线架构设计
第一环:脚本生成模块
输入 :关键词 输出:结构化 JSON(含选题、hook、干货段落、引导语)
架构设计:
- 选题 Skill:输入关键词,自动生成 40 个选题方向
- 脚本 Skill:根据选中的选题,生成完整短视频脚本
- 结构固定:3 秒 hook → 干货内容 → 引导关注
- 输出格式为 JSON,供后续环节程序化读取
选择 JSON 而非文本格式,是因为后续环节对接的是工具链,工具读取 JSON 的效率远高于自然语言解析。
第二环:画面生成模块
输入 :脚本 JSON(含画面描述词) 输出:一组画面素材(图片)
对接即梦 AI API,即梦 Skill 自动读取 JSON 中的画面描述词,逐条调用 API 生成图片。策略:生成 4-6 张,从中选取最优可用素材,不追求每张精修。
第三环:数字人口播模块
输入 :脚本文案 输出:口播视频文件
解决一人公司"无人出镜"的痛点。数字人 Skill 接收文案,自动调用数字人平台 API 生成口播视频,口型、表情、动作后台渲染,只需指定数字人形象。
第四环:合成输出模块
输入 :画面素材 + 数字人口播视频 输出:最终短视频文件
基于 LibTV 做底层调度,由 WorkBuddy 合成 Skill 统一接管:
- 画面素材排成时间线
- 数字人口播视频对齐到画面轨道
- 配音文件生成字幕并压制
- 添加背景音乐
- 输出最终视频
架构核心价值
确定性优先
传统模式下,每一步都需要人工决策(脚本质量、画面适配、配音效果、字幕校对),每一步都在消耗决策能量。

自动化后,仅需决策选题,其余由 Skill 链自动执行。
决策与执行分离
一人公司最值钱的不是执行能力,而是决策能力。自动化流水线将执行层完全标准化,将人的精力集中在选题决策这一高价值环节。

总结
WorkBuddy 短视频自动化链路的本质不是技术堆叠,而是将制作流程固化为可复用的系统。一人公司做内容,不需要奇迹,需要一条能自动跑的生产线和一个能持续做决策的自己。
