做视频这事,真不是人干的。
以前我觉得写文章就够掉头发了,直到自己开始折腾视频。写完脚本,录制时对着镜头疯狂卡壳;好不容易录完,剪辑时要一帧帧去听哪里说了"呃"、"那个";接着还要满世界找不侵权的 B-roll 画面、配背景音乐、做字幕......
一整套流程走下来,半条命都没了。
为了拯救自己的头发,我花了一周时间,把做视频的繁琐步骤拆成了 9 个可以自动运行的 AI Skill。
说白了,就是把脑力痛苦、录制尴尬和审美灾难,全部外包给 AI。
不过在聊视频流水线之前,先插播一个最近在圈子里口碑极好、能让你在图文赛道上"躺平"的实战工具------【红鸦小红书图文 Skill】。
如果你平时除了做视频,也需要高频更新小红书图文,这个工具能帮你省掉大半精力。
顺手推荐:红鸦小红书图文 Skill(redya-xiaohongshu)
这是一个由红鸦 AI 提供的专属 Skill,你可以把它无缝安装到 WorkBuddy、Codex、Claude Code 或者 Cursor 等主流 Agent 工具中。
红鸦 AI 是一款专注小红书创作的 AI 图文生成工具,适用于小红书 AI 图文生成、视频转小红书图文、公众号文章转小红书图文,以及商品种草和电商带货图文制作。**它可以从一个主题或已有内容开始,先生成整体大纲,再生成标题、发布正文、逐页图片大纲和生图提示词,最后批量生成封面与内容页。普通图文可以关联个人或品牌知识库,商品图文可以绑定商品档案并选择不同种草 Skill。用户可以在网页端创作,也可以让 Codex、Claude Code、WorkBuddy 等 Agent 调用红鸦AI。
它的核心能力非常扎实:你只需要输入一个主题,它就能自动帮你生成小红书风格的爆款标题、发布正文,以及每一页图片的详细提示词,甚至还能继续批量生成整套精美的图片。
无论你是做普通的知识分享图文,还是做带货类的商品图文,它都能轻松搞定。特别是它的商品模式,支持你上传商品资料来建立专属的"商品档案",后续创作时直接关联档案,生成的图文和画面就会非常精准。

你可以通过下面的 GitHub 仓库获取它的详细信息:
https://github.com/rnthking/redya-skills

要使用这个 Skill,你需要一个个人 API Key。你可以直接登录红鸦 AI 的官网:

https://hy.ithinkai.cn
在"红鸦 Skills"页面里就能一键获取。这个 Key 是你的个人账号凭证,记得妥善保管,不要泄露在公开的截图或代码仓库中。
拿到 API Key 之后,你可以把下面这段安装任务直接发给你的 Agent(比如 WorkBuddy、Codex、Claude Code 或 Cursor),让它帮你自动完成环境检查和配置写入:

ini
请帮我安装「红鸦小红书图文」能力到当前 AI 环境:
1. 下载 https://hy.ithinkai.cn/openapi/skill.md 的内容,保存为 ~/.claude/skills/redya-xiaohongshu/SKILL.md
2. 设置环境变量 REDYA_API_KEY=rk-你的APIKey
3. 设置环境变量 REDYA_BASE_URL=https://hy.ithinkai.cn
装好后我要用它生成小红书图文笔记。
安装完成后,你就可以在 Agent 中直接调用它了。
一种方式是"先看大纲再出图"。你可以让 Agent 先帮你生成标题、正文和图片大纲,等你检查并微调满意后,再让它批量出图。

如果你不需要逐步确认,也可以直接给它一个主题,让 Agent 一步到位,直接把文案和整套图片全部生成出来。

除了在 Agent 命令行里使用,你也可以直接登录红鸦 AI 的网页端。在可视化的界面里,你可以更直观地输入主题、修改文案,并进行批量的图片生成和微调。

如果你需要做带货或者产品推广,可以利用它的"商品图文模式"。先在后台录入商品信息和真实图片,生成图文时关联对应的商品档案,这样 AI 就能参考真实的商品细节进行创作,避免出现画面与文案对不上的尴尬情况。
值得一提的是,Agent 终端和网页端是完全打通的。它们共用同一个红鸦账号和积分,你在 Agent 里生成的历史记录,同样可以在网页端的"我的创作"里找到,方便你随时进行后续的编辑和下载。

如果你习惯在终端或开发工具里直接调用,安装 redya-xiaohongshu 是最顺手的选择;如果你更倾向于直观的可视化操作,直接使用红鸦 AI 网页端即可。
好,说回视频。
为了不让大家看得头晕,我把这 9 个视频 Skill 按创作时的"爽点"分成了三组。
来看看它们是怎么帮我们干脏活累活的。
第一组:脑力解放(选题、脚本、字幕)
写脚本和做字幕,是消耗脑细胞的重灾区。这一组 Skill 就是来帮我们省脑子的。
1. 爆款拆解器:space-video-topic
以前拆解爆款视频,流程极其恶心:先找小程序去水印下载,再导进飞书妙记转文字,最后自己苦哈哈地分析结构。
这个 Skill 把这几步直接并一步了。

你给它一个抖音、YouTube 或 B站的链接,它会自动:
- 无水印下载 (针对抖音链接,我写了模拟浏览器刷新签名的逻辑,调用
yt-dlp极稳)。 - 生成带时间戳的逐字稿。
- 拆解选题结构,顺便帮你把新标题和口播正文都重构出来。
我拿自己之前的一条视频测试,它吐出来的结构非常清晰,直接能用。

2. 去 AI 味脚本:space-video-script
AI 写脚本最大的毛病就是"不像人话"。动不动就是"在这瞬息万变的时空里",念起来能把人憋死。
这个 Skill 的核心逻辑就是"说人话"。它会把书面语自动重构成适合镜头前表达的口语。比如把那些宏大的排比句,改成"今天聊个大实话"。

同时,它会输出精确到秒的分镜脚本,告诉你每一秒该看哪、画面该放什么。
3. 呼吸感字幕:space-video-subtitle
很多自动字幕工具是死板地按照标点符号断句,一行字巨长,看着特别累。
这个 Skill 走的是"口播式断句":按照说话人的呼吸和语义停顿来切分。而且它会重点校对"在/再"、"的/得/地"这种逼死强迫症的错别字,最后输出标准的 SRT/ASS 格式。

第二组:社恐拯救(总控、剪辑、配音配乐)
录视频最怕卡壳,对着镜头说错一个字,整段就要重录。这一组 Skill 专治各种录制尴尬。
4. 导演总控:space-video
当你的 Skill 变多之后,你和 AI 都会懵:现在该用哪一个?
所以我配了一个"导演"角色。你对它说"帮我做条视频",它不会瞎写,而是先问你:口播还是录屏?横屏还是竖屏?有参考视频吗?

理清需求后,它会自己去调用对应的子 Skill,你不需要去记那些复杂的命令。
5. 无痛剪口播:space-video-edit
录口播时,我们难免会"大......大......大家哈,不对,大家好"。
这个 Skill 的处理方式非常聪明:先将视频转成文本,识别出里面的口误、语气词和静音片段。然后它采用"删前保后"的原则------因为人说错了,往往会在后面重新说一遍完整的。

它会把前面的口误和废话直接切掉,把流畅的片段拼起来,连带着把字幕也重新对齐。
6. 智能调音师:space-video-audio
如果你实在不想露声,它会调用免费的 edge-tts 把文本转成旁白。
最实用的是它的混音逻辑:它会自动去免版权曲库(比如 Pixabay)检索背景音乐,合成时还会做"压音"处理------人声一出来,背景音乐自动变小;人声停了,音乐再拉大。

最后把响度统一归一到 -14 LUFS,整个过程不重新编码视频,秒级出片。
第三组:视觉外包(动效 B-roll、手绘白板、封面)
自己剪视频,最头疼的就是画面素材。一张脸从头说到尾,观众早跑了。去素材网站找,充了会员也找不到合适的。
7. 代码动效导演:space-video-broll
既然找不到合适的素材,那就用代码现画。
这个 Skill 会根据你的口播内容,找一个视觉隐喻(比如用河流代表流量,用坍缩代表数据精简),然后用纯 HTML/CSS 排出一套 30 秒以上的连续动效,逐帧渲染成确定性的 MP4 视频。

虽然风格偏极客,但胜在绝对原创,完全没有版权风险。
8. 手绘白板图解:space-video-broll-sketch
如果你给它一篇公众号文章,它会把里面的逻辑拆解成 6 到 10 帧的手绘白板图。
白底、黑色单线条、带一处亮眼的蓝色,看起来就像有一支无形的手在屏幕上一笔笔画出来。

后台接入了火山引擎的 Seedance 和 libtv 的 Agent 通道,逐帧生成并拼接,效果很高级。

9. 模块化封面:space-video-cover
封面决定了点击率。这个 Skill 走的是"套路化"路线:固定你的主色调、字体和排版,每期只换具体的标题和强调色。

这样不仅出图快,还能保证你的主页视觉风格高度统一。它支持一键输出视频号、B站、小红书等各种尺寸。
怎么把它们跑起来?
如果你手头有 Qoder、Claude Code 或 Codex 等 Agent 终端,直接输入这行指令就能一键安装:
帮我安装这几个 Skill:github.com/SpaceZephyr/creator-buddy/tree/main/video-skills
安装完后,我平时最常跑的是这三条链路:
- 链路 A(完整口播) :
选题 (topic) -> 脚本 (script) -> 录制 -> 剪辑 (edit) -> 动效 (broll) -> 字幕 (subtitle) -> 配音配乐 (audio) -> 封面 (cover) - 链路 B(爆款模仿) :
用 topic 下载参考视频和逐字稿 -> 拆解结构 -> 重新写自己的脚本 - 链路 C(图文转视频) :
手绘图解 (broll-sketch) -> 自动配音配乐 (audio) -> 封面 (cover)
除了视频下载和视频模型生成需要配置对应的 Key 之外,其余大部分 Skill 都不需要依赖第三方的付费 API,日常白嫖完全够用。
说实话,别光看着,代码都在 GitHub 上,先去把你平时最头疼的那一个环节(比如剪口播或者找素材)配起来试试。