用 WorkBuddy 三个 Skill 串起一条流水线:8 张随手拍照片 30 分钟变口播视频

导语

上周六我参加了一场发布会,手机里只存了 8 张图、2 段视频。回家后把这些素材丢进 WorkBuddy,30 分钟后一条完整的 9:16 口播视频就出来了------文案、画面、动画、配乐全部到位。

这篇文章不是炫耀效率,而是分享一个可复制的思路:把内容生产看作工厂流水线,用三个 Skill 分别承担"素材分析 → 口播文案 → 视频合成"三道工序。 你只需要做两件事:拍照、验收。

核心思路:内容生产 = 采集原材料 + 机器加工

传统做内容的方式是"参加活动 → 体验 → 回来做内容",其中"做"的过程最累:筛选照片、修图、写文案、排版;做视频更麻烦,写脚本、录口播、剪辑、加字幕、配乐,一条 30 秒视频可能磨半天。

但如果把内容生产看作一条工厂流水线,参加活动这个动作本质上是采集原材料。原材料采回来,后面的加工、组装、包装,全可以交给机器。

三道工序拆解

工序一:素材分析(WorkBuddy 自动分析)

AI 自动看完 8 张图,识别出产品名称、功能图标、主视觉 slogan、嘉宾头衔、场地规模。不需要手动标注,它自己提取事实。

工序二:口播文案(koubo-script-8layer)

用口播八层结构 Skill(koubo-script-8layer),钩子→信任→反转→干货→去障→路径→紧迫→升华,八层骨架自动搭好,文案直接能念。在 WorkBuddy 里说一句话就行:

bash 复制代码
用 koubo-script-8layer 帮我写一段口播文案,素材在 D:\development\0822乐一笑新品发布会,要求情绪炸裂型钩子,约 100 秒。

工序三:视频合成(HyperFrame)

HyperFrame Skill 接管。主背景 A-roll 逐句切换,画中画 B-roll 动态进出,Ken Burns 推拉效果,文字卡片自动叠加。

你不需要知道 HyperFrame 底层用的是 GSAP 动画引擎,不需要知道画中画术语叫 Picture-in-Picture,不需要知道 Ken Burns 效果是用 scale + x/y tween 实现的。Skill 把专家级的知识,变成了按钮。

三个 Skill 串起来,我只做了两件事:拍照,验收。

进阶:修改 Skill 源文件,实现永久改进

在用口播八层 Skill 的过程中,我发现一个不足:钩子库只有三种"信息差型"模板------"99% 的人不知道""扎心的""别再错误做法"。没有那种一上来就炸场的。

解决方案:直接修改 Skill 的源文件 D:/development/skills/koubo-script-8layer/SKILL.md,在钩子层定义后面新增第四类情绪炸裂型:先甩强情绪词(兄弟们/太炸了/绝了/牛啊/神了),立刻接反差结果,不铺垫、不自我介绍。

句式模板:

bash 复制代码
【兄弟们/太炸了/绝了】!我用【X】不到半小时,你看到的这条口播视频就出来了。

保存后,每次使用该 Skill 都会自动提供两套钩子供选择。这个改进是永久的。

这就是 Skill 生态的真正含义------不是"让 AI 学会一个技能",而是"把一整套 SOP 封装成普通人能直接调用的能力"。而且它不是黑盒,你可以改。改一次,受益终身。

最终成品

改完 Skill 后生成的口播文案:

兄弟们,太炸裂了!我去水杯智能机器人发布会,现场拍了 8 张图、两段视频,用 AI 工作流不到半小时,你正在看的这条视频就出来了。

很多人觉得做视频得会剪辑、得扛设备,其实只需要我们手里那点随手拍的图。

三步就可以落地:第一步,用爆款口播 Skill 写旁白文案;第二步,把图片和视频分为主背景和画中画两种;第三步,用 HyperFrame Skill 合成导出。

AI 不会替你去发布会,但会在半小时内,把你的随手拍,变成一百条内容。关注小虎,普通人也能短视频获客自动化。

实操四步走

步骤 操作 用的 Skill 耗时
1 素材归类(A-roll / B-roll) WorkBuddy 自动分析 2分钟
2 生成口播文案 koubo-script-8layer 5分钟
3 修改 Skill 钩子库(可选) 直接编辑 SKILL.md 3分钟
4 视频合成 HyperFrame 20分钟

三个关键 Skill 清单:

Skill 名称 功能 安装方式
koubo-script-8layer 口播文案八层结构生成 GitHub下载
hyperframes 9:16 视频合成(A-roll + B-roll + 动画) GitHub下载
gzh-writer-enhanced 公众号文章增强版写作 自创

总结

AI 不会替你去发布会,但会在 30 分钟内把你的随手拍变成一百条内容。你不需要会剪辑、写文案、做动画,只需要去现场拍素材,然后打开 WorkBuddy。

2026 年短视频自动化的真相:瓶颈不在制作端,在素材端。 谁拍到了素材,谁就拥有了原材料。而原材料到成品之间的那条路,Skill 已经帮你铺好了。

相关推荐
zzjyr5 小时前
AI 问答的流式响应是怎么实现的?从 fetch 到 SSE 逐字解析
前端·人工智能·ai编程
挖掘狂人7 小时前
从 LLM 到 Agent Skill:9 个底层概念,一次理清整个 AI 技术栈
llm·agent·ai编程
凭君语未可7 小时前
我把 Codex 变成了一个本地 API:Codex Proxy 配置实战
ai编程
sarasuki7 小时前
Agent 陷入死循环了怎么办?指纹 + 滑动窗口 + 分层熔断
人工智能·ai编程
宝桥南山10 小时前
DeepSeek - 尝试安装和使用一下DeepSeek Harness
人工智能·ai·aigc·ai编程
小海豚儿10 小时前
不是所有 Workflow,都值得升级成 Graph
人工智能·ai编程
王清欢Randy10 小时前
AI 时代的 “黑客与画家”
人工智能·程序人生·ai编程·程序员技能
9i编程11 小时前
20. 对SKILL进行一次全新尝试,改为框架+细节方式的实践及验证:Android 代码调试实录
人工智能·openai·ai编程
youcans_11 小时前
【嵌入式软件AI编程】08. 第一个STM32工程
stm32·单片机·ai编程·嵌入式软件·claude code