我用 Codex + GPT-6 Astra 搭了一条自动化剪辑流水线,从安装到批量出片全流程分享

做知识分享类视频的博主应该都有同感:剪辑是最消耗时间的环节。一条 60 秒的口播视频,从转录、挑片段、对字幕到导出,手动操作下来一两个小时就没了。
最近我把这套流程交给了 Codex(OpenAI 的终端 AI 编程助手)+ GPT-6 Astra 模型,配合 FFmpeg 这套命令行工具链,实现了「丢进素材、说出需求、自动出片」的工作流。这篇文章把完整过程拆给你看,每一步都可以直接照抄上手。
先说清楚这套方案的核心思路:
模型负责决策,工具负责执行。 Astra 来理解你的需求、分析素材、生成剪辑方案;FFmpeg、FFprobe 这些命令行工具负责真正的转码、裁剪、拼接。
步骤 1:先把工具链装齐

基础环境
- Node.js 20+ :Codex CLI 的运行环境,去 nodejs.org 下载 LTS 版本即可
- Git:版本管理,可选但强烈建议装
- Python 3.11+(可选):后面装语音转录工具 Faster-Whisper 需要
装完验证一下:
bash
node -v # 应显示 v20.x.x 或更高
python -V # 应显示 Python 3.11.x 或更高
安装 Codex CLI
macOS / Linux:
bash
curl -fsSL https://chatgpt.com/codex/install.sh | sh
或者用 npm(全平台通用):
bash
npm i -g @openai/codex@latest
Windows 用 PowerShell:
powershell
powershell -ExecutionPolicy ByPass -c "irm https://chatgpt.com/codex/install.ps1 | iex"
安装视频处理工具
bash
# macOS
brew install ffmpeg
# Ubuntu / Debian
sudo apt install ffmpeg
# Windows(用 winget)
winget install ffmpeg
可选但推荐的语音转文字工具(生成逐字稿和 SRT 字幕用):
bash
pip install faster-whisper
验证清单
-
codex --version能正常输出(需要 0.153.0 以上版本才能用 GPT-6 Astra,建议直接升到最新) - 输入
codex启动后,用/model能选到gpt-6-astra -
ffmpeg -version正常 - 建好
raw/(放原始素材)和output/(放成片)两个目录
💡 提示:ChatGPT Plus 用户在 Codex 和 ChatGPT Work 里就能用 GPT-6 Astra;普通聊天窗口里是看不到的。如果模型列表里找不到,先升级 Codex 版本再重启终端。
步骤 2:认识自动化剪辑的常用工具

真正让 Codex「动起来」的不只是模型,还有这些执行能力:
| 工具 | 干什么用 | 一句话说明 |
|---|---|---|
| FFmpeg | 转码、裁剪、拼接、烧录字幕 | 视频处理的基石 |
| FFprobe | 读取时长、分辨率、码率、音轨信息 | 精准获取视频信息 |
| Faster-Whisper | 自动转录音频,输出 txt / srt | 语音转文字利器 |
| yt-dlp(可选) | 下载你有权限使用的网络素材 | 获取素材 |
| Python / Node 脚本 | 批量重命名、切片、整理字幕 | 自动化处理流程 |
同时在 Codex 里建议开启这些能力:
- Terminal:执行命令、调用工具(核心中的核心)
- Files:读取、写入、管理文件
- Git:版本管理,协作更高效
- Web / Search(可选):获取信息、扩展素材来源
- MCP / 自定义脚本(可选):连接更多工具,打造专属能力
步骤 3:用 AGENTS.md + Skill 固化你的剪辑规范

这是整套工作流里最关键的一步,也是大部分人忽略的一步。
没有规则文件,你每次都要重新教 AI 一遍「我要竖版」「字幕不超过两行」「输出到 output 目录」。有了 AGENTS.md,这些规范一次写好,永久生效。
推荐的目录结构
video-project/
├── raw/ # 原始素材
├── assets/ # 音乐 / 字幕 / 素材
├── output/ # 输出成片
├── prompts/ # 提示词与脚本
├── AGENTS.md # 项目规则
└── skills/
└── video-editor.md # 剪辑 Skill
AGENTS.md 最小规则(可直接复制)
markdown
# 视频项目规则
1. 先读取 raw/ 并列出素材清单
2. 先转录,再生成镜头表
3. 默认输出竖版 1080×1920
4. 所有结果写入 output/
5. 每步执行前先给计划,确认后再动手
skills/video-editor.md 职责定义
markdown
# video-editor Skill
- 角色:短视频剪辑助手
- 输入:素材、脚本、平台参数
- 输出:剪辑方案、字幕、导出命令、封面文案
- 目标:减少重复操作,提高稳定出片率
整个流程就变成:
素材输入(raw/) → 按规则分析(AGENTS.md) → 执行剪辑(video-editor) → 输出成片(output/)
💡 核心原则:让 AI 按你的 SOP 工作,而不是每次重新教。
步骤 4:从素材到成片的 6 步自动化流程

记住口诀:先分析,再执行;先结构化,再导出。
① 读取素材
扫描 raw/ 目录,识别视频、音频、图片,列出清单。
② 自动转录
提取音频,用 Faster-Whisper 生成逐字稿和 SRT 字幕:
bash
ffmpeg -i raw/demo.mp4 -vn -ar 16000 -ac 1 raw/demo.wav
然后让 Codex 调用转录脚本,得到带时间轴的文本。
③ 选高能片段
根据节奏、信息密度挑片。口播视频重点看「观点密度」,混剪视频重点看「情绪变化和动作清晰度」。
④ 生成镜头表
把选中的片段整理成结构化的表格:顺序、时长、字幕、BGM 位置,一目了然,方便你审阅后再执行。
⑤ 执行粗剪
调用 FFmpeg 完成拼接、裁剪、加字幕。常用命令:
bash
# 裁剪片段(从 12 秒开始,截取 16 秒)
ffmpeg -i raw/demo.mp4 -ss 00:00:12 -t 16 -c copy output/clip1.mp4
# 烧录字幕
ffmpeg -i raw/demo.mp4 -vf "subtitles=output/out.srt" output/final.mp4
# 转竖版 1080×1920(居中裁剪)
ffmpeg -i raw/demo.mp4 -vf "crop=607:1080,scale=1080:1920" output/vertical.mp4
⑥ 复检导出
检查节奏、错别字、分辨率后输出 final.mp4。
常用指令速查
bash
# 启动 Codex 并指定模型
codex -m gpt-6-astra
# 在 Codex 里直接说
请扫描 raw/,转录全部素材并输出 srt
# FFmpeg 烧字幕
ffmpeg -i raw/demo.mp4 -vf "subtitles=output/out.srt" output/final.mp4
建议目录约定:raw/ 放原素材,assets/ 放 BGM 和贴图,output/ 放成片与字幕。
步骤 5:拿来就用的剪辑提示词模板

把需求说清楚,Astra 才能稳定帮你出片。下面三个模板是我自己实际在用的,直接复制改参数即可。
模板 A:知识分享口播
你是专业视频剪辑助手。请扫描 raw/ 中全部素材,先生成逐字稿和时间轴,
再挑出 6-8 个高信息密度片段,输出一条 60 秒竖版知识分享视频的剪辑方案。
要求:开头 3 秒有钩子,字幕每次不超过 2 行,保留关键词,
并给出可执行的 ffmpeg 命令。
模板 B:混剪 / B-roll
请从素材中提取「问题---过程---结果」结构,生成节奏更快的混剪方案。
优先保留情绪变化明显、动作清晰、画面稳定的片段,
并补充字幕建议与转场建议。
模板 C:批量处理
请对 raw/ 下每个 mp4 重复执行:转录 → 镜头表 → 字幕 → 导出,
并把所有结果写入 output/,最后生成一个 summary.md 汇总文件。
出片检查清单
- 开场 3 秒有钩子
- 字幕两行内
- BGM 不盖人声
- 导出尺寸符合平台要求
- 保留日志,方便复用
💡 会写提示词 = 会管理一个自动化剪辑流程。 提示词不是咒语,而是你对剪辑思路的结构化表达。
写在最后
这套工作流的价值不在于「AI 帮你剪视频」这个噱头,而在于三点:
- 重复劳动被消灭了:转录、切片、烧字幕这些机械操作全部自动化
- 你的经验被固化了:AGENTS.md 和 Skill 文件把你的剪辑审美变成可复用的资产
- 可以批量了:模板 C 那种批量处理,手动做是一天,自动做是喝杯咖啡的时间
从想法到成片,只需要更少的时间。省下来的时间,去做真正重要的部分------内容本身。
如果你在实操中遇到具体问题(比如 FFmpeg 报错、字幕对不上、Astra 额度不够),欢迎在评论区留言,我看到会回复。觉得有用的话,别忘了点赞收藏,我们下篇见。