我用 Codex + GPT-6 Astra 搭了一条自动化剪辑流水线,从安装到批量出片全流程分享

我用 Codex + GPT-6 Astra 搭了一条自动化剪辑流水线,从安装到批量出片全流程分享

做知识分享类视频的博主应该都有同感:剪辑是最消耗时间的环节。一条 60 秒的口播视频,从转录、挑片段、对字幕到导出,手动操作下来一两个小时就没了。

最近我把这套流程交给了 Codex(OpenAI 的终端 AI 编程助手)+ GPT-6 Astra 模型,配合 FFmpeg 这套命令行工具链,实现了「丢进素材、说出需求、自动出片」的工作流。这篇文章把完整过程拆给你看,每一步都可以直接照抄上手

先说清楚这套方案的核心思路:

模型负责决策,工具负责执行。 Astra 来理解你的需求、分析素材、生成剪辑方案;FFmpeg、FFprobe 这些命令行工具负责真正的转码、裁剪、拼接。


步骤 1:先把工具链装齐

基础环境

  • Node.js 20+ :Codex CLI 的运行环境,去 nodejs.org 下载 LTS 版本即可
  • Git:版本管理,可选但强烈建议装
  • Python 3.11+(可选):后面装语音转录工具 Faster-Whisper 需要

装完验证一下:

bash 复制代码
node -v    # 应显示 v20.x.x 或更高
python -V  # 应显示 Python 3.11.x 或更高

安装 Codex CLI

macOS / Linux:

bash 复制代码
curl -fsSL https://chatgpt.com/codex/install.sh | sh

或者用 npm(全平台通用):

bash 复制代码
npm i -g @openai/codex@latest

Windows 用 PowerShell:

powershell 复制代码
powershell -ExecutionPolicy ByPass -c "irm https://chatgpt.com/codex/install.ps1 | iex"

安装视频处理工具

bash 复制代码
# macOS
brew install ffmpeg

# Ubuntu / Debian
sudo apt install ffmpeg

# Windows(用 winget)
winget install ffmpeg

可选但推荐的语音转文字工具(生成逐字稿和 SRT 字幕用):

bash 复制代码
pip install faster-whisper

验证清单

  • codex --version 能正常输出(需要 0.153.0 以上版本才能用 GPT-6 Astra,建议直接升到最新)
  • 输入 codex 启动后,用 /model 能选到 gpt-6-astra
  • ffmpeg -version 正常
  • 建好 raw/(放原始素材)和 output/(放成片)两个目录

💡 提示:ChatGPT Plus 用户在 Codex 和 ChatGPT Work 里就能用 GPT-6 Astra;普通聊天窗口里是看不到的。如果模型列表里找不到,先升级 Codex 版本再重启终端。


步骤 2:认识自动化剪辑的常用工具

真正让 Codex「动起来」的不只是模型,还有这些执行能力:

工具 干什么用 一句话说明
FFmpeg 转码、裁剪、拼接、烧录字幕 视频处理的基石
FFprobe 读取时长、分辨率、码率、音轨信息 精准获取视频信息
Faster-Whisper 自动转录音频,输出 txt / srt 语音转文字利器
yt-dlp(可选) 下载你有权限使用的网络素材 获取素材
Python / Node 脚本 批量重命名、切片、整理字幕 自动化处理流程

同时在 Codex 里建议开启这些能力:

  • Terminal:执行命令、调用工具(核心中的核心)
  • Files:读取、写入、管理文件
  • Git:版本管理,协作更高效
  • Web / Search(可选):获取信息、扩展素材来源
  • MCP / 自定义脚本(可选):连接更多工具,打造专属能力

步骤 3:用 AGENTS.md + Skill 固化你的剪辑规范

这是整套工作流里最关键的一步,也是大部分人忽略的一步。

没有规则文件,你每次都要重新教 AI 一遍「我要竖版」「字幕不超过两行」「输出到 output 目录」。有了 AGENTS.md,这些规范一次写好,永久生效。

推荐的目录结构

复制代码
video-project/
├── raw/                  # 原始素材
├── assets/               # 音乐 / 字幕 / 素材
├── output/               # 输出成片
├── prompts/              # 提示词与脚本
├── AGENTS.md             # 项目规则
└── skills/
    └── video-editor.md   # 剪辑 Skill

AGENTS.md 最小规则(可直接复制)

markdown 复制代码
# 视频项目规则

1. 先读取 raw/ 并列出素材清单
2. 先转录,再生成镜头表
3. 默认输出竖版 1080×1920
4. 所有结果写入 output/
5. 每步执行前先给计划,确认后再动手

skills/video-editor.md 职责定义

markdown 复制代码
# video-editor Skill

- 角色:短视频剪辑助手
- 输入:素材、脚本、平台参数
- 输出:剪辑方案、字幕、导出命令、封面文案
- 目标:减少重复操作,提高稳定出片率

整个流程就变成:

素材输入(raw/) → 按规则分析(AGENTS.md) → 执行剪辑(video-editor) → 输出成片(output/)

💡 核心原则:让 AI 按你的 SOP 工作,而不是每次重新教。


步骤 4:从素材到成片的 6 步自动化流程

记住口诀:先分析,再执行;先结构化,再导出。

① 读取素材

扫描 raw/ 目录,识别视频、音频、图片,列出清单。

② 自动转录

提取音频,用 Faster-Whisper 生成逐字稿和 SRT 字幕:

bash 复制代码
ffmpeg -i raw/demo.mp4 -vn -ar 16000 -ac 1 raw/demo.wav

然后让 Codex 调用转录脚本,得到带时间轴的文本。

③ 选高能片段

根据节奏、信息密度挑片。口播视频重点看「观点密度」,混剪视频重点看「情绪变化和动作清晰度」。

④ 生成镜头表

把选中的片段整理成结构化的表格:顺序、时长、字幕、BGM 位置,一目了然,方便你审阅后再执行。

⑤ 执行粗剪

调用 FFmpeg 完成拼接、裁剪、加字幕。常用命令:

bash 复制代码
# 裁剪片段(从 12 秒开始,截取 16 秒)
ffmpeg -i raw/demo.mp4 -ss 00:00:12 -t 16 -c copy output/clip1.mp4

# 烧录字幕
ffmpeg -i raw/demo.mp4 -vf "subtitles=output/out.srt" output/final.mp4

# 转竖版 1080×1920(居中裁剪)
ffmpeg -i raw/demo.mp4 -vf "crop=607:1080,scale=1080:1920" output/vertical.mp4

⑥ 复检导出

检查节奏、错别字、分辨率后输出 final.mp4

常用指令速查

bash 复制代码
# 启动 Codex 并指定模型
codex -m gpt-6-astra

# 在 Codex 里直接说
请扫描 raw/,转录全部素材并输出 srt

# FFmpeg 烧字幕
ffmpeg -i raw/demo.mp4 -vf "subtitles=output/out.srt" output/final.mp4

建议目录约定:raw/ 放原素材,assets/ 放 BGM 和贴图,output/ 放成片与字幕。


步骤 5:拿来就用的剪辑提示词模板

把需求说清楚,Astra 才能稳定帮你出片。下面三个模板是我自己实际在用的,直接复制改参数即可。

模板 A:知识分享口播

复制代码
你是专业视频剪辑助手。请扫描 raw/ 中全部素材,先生成逐字稿和时间轴,
再挑出 6-8 个高信息密度片段,输出一条 60 秒竖版知识分享视频的剪辑方案。
要求:开头 3 秒有钩子,字幕每次不超过 2 行,保留关键词,
并给出可执行的 ffmpeg 命令。

模板 B:混剪 / B-roll

复制代码
请从素材中提取「问题---过程---结果」结构,生成节奏更快的混剪方案。
优先保留情绪变化明显、动作清晰、画面稳定的片段,
并补充字幕建议与转场建议。

模板 C:批量处理

复制代码
请对 raw/ 下每个 mp4 重复执行:转录 → 镜头表 → 字幕 → 导出,
并把所有结果写入 output/,最后生成一个 summary.md 汇总文件。

出片检查清单

  • 开场 3 秒有钩子
  • 字幕两行内
  • BGM 不盖人声
  • 导出尺寸符合平台要求
  • 保留日志,方便复用

💡 会写提示词 = 会管理一个自动化剪辑流程。 提示词不是咒语,而是你对剪辑思路的结构化表达。


写在最后

这套工作流的价值不在于「AI 帮你剪视频」这个噱头,而在于三点:

  1. 重复劳动被消灭了:转录、切片、烧字幕这些机械操作全部自动化
  2. 你的经验被固化了AGENTS.md 和 Skill 文件把你的剪辑审美变成可复用的资产
  3. 可以批量了:模板 C 那种批量处理,手动做是一天,自动做是喝杯咖啡的时间

从想法到成片,只需要更少的时间。省下来的时间,去做真正重要的部分------内容本身

如果你在实操中遇到具体问题(比如 FFmpeg 报错、字幕对不上、Astra 额度不够),欢迎在评论区留言,我看到会回复。觉得有用的话,别忘了点赞收藏,我们下篇见。

相关推荐
H0311169851 小时前
移动应用数据分析平台对比:月狐数据、七麦数据、TalkingData
人工智能
AI创界者1 小时前
Python 进阶:重构经典设计模式(四)—— 策略模式与责任链模式在 Python 3.10+ 中的函数式与解耦演进
人工智能·aigc
打工仔折腾 AI1 小时前
数据库上 K8s 之后谁来管?拆解金仓 KES-Operator 的声明式运维方案
人工智能·后端·python·性能优化·ai agent 实战
QXWZ_IA1 小时前
道路巡检高危作业的自动化替代方案
人工智能·科技·安全
艾莉丝努力练剑1 小时前
【AI大模型接入SDK】SQLite基础概念与C的API开发
网络·c++·人工智能·学习·架构
Hotchip_MEMS1 小时前
平板MEMS麦克风阵列如何赋能远程会议与远场拾音
人工智能·笔记·物联网·电脑·制造
正经教主1 小时前
【FDE系列】阶段2:Day 33:进阶查询 — 窗口函数与 CTE
人工智能·python·fde
张彦峰ZYF1 小时前
AI时代Java工程师能力地图:哪些会被替代,哪些更加值钱
人工智能·架构·被替代的不是岗位而是任务·生成成本塌陷,验证成本没降·上下文闭合度·可判定性、可逆性·责任可归属性
棣廷1 小时前
初识OpenCV——疲劳检测
人工智能·opencv·目标检测