AI 已经能够生成脚本、图片、配音和视频,但真正的视频生产流程仍然十分割裂。
我们通常需要在浏览器中查看参考视频、研究产品页面、寻找授权素材,然后手动复制字幕、时间点和文案,最后再进入剪辑软件重新整理。
问题并不是某个环节没有 AI,而是这些 AI 能力之间缺少一条连续、可验证的工作链路。
OpenAI 新推出的 Codex Chrome 插件,正在改变这个局面。
当它与开源浏览器视频编辑器 Timeline Studio,以及 edit-timeline-studio Agent Skill 结合后,可以形成一套完整的视频 Agent 架构:
text
浏览器上下文
→ 多模态素材分析
→ 剪辑决策
→ 多轨时间线
→ 可编辑工程
→ 最终视频
本文介绍这套工作流的核心思路、技术架构与实际应用场景。
项目地址:
https://github.com/MartinDelophy/ai-video-editor
在线体验:
https://video-editor.ai-creator.top/
一、Codex Chrome 插件解决了什么问题?
根据 OpenAI 官方更新日志,Codex for Chrome 于 2026 年 5 月 7 日发布。
后续版本又加入了多项适合内容生产的功能:
- 引用已经打开的 Chrome 标签页;
- 读取网页中选中的文字;
- 通过右键菜单调用 Ask ChatGPT;
- 在字幕可用时读取 YouTube 时间戳转录;
- 使用现有 Chrome 登录状态访问获准的网站;
- 在多个标签页之间处理任务;
- 通过 Developer Mode 检查 DOM、CSS、Console 和网络请求。
传统网页 Agent 通常只能读取一个孤立 URL。
Codex Chrome 则可以进入用户当前正在使用的浏览器环境,理解参考视频、产品官网、帮助文档和素材页面之间的关系。
例如,用户打开一条 YouTube 参考视频后,Agent 可以读取可用的时间戳字幕;打开产品网站后,可以整理页面中真实可见的产品能力;打开素材平台后,可以在授权范围内组织候选素材。
这让浏览器成为视频 Agent 的"感知层"。
但是,能够读取网页并不等于能够完成专业剪辑。
二、为什么浏览器自动化不等于 AI 剪辑?
剪辑并不是简单地把素材拖入时间线。
一条完整视频通常包含大量判断:
- 哪些镜头应该保留?
- 哪些停顿需要删除?
- 哪段口播应该缩短?
- 相同镜头为什么会重复出现?
- 高潮前需要多少铺垫?
- 主体在重新构图后是否仍然清晰?
- 字幕是否完整覆盖了可听语音?
- 旁白应该适应画面,还是画面应该适应旁白?
- 最终结果是否可以继续修改?
如果 Agent 只会操作鼠标和点击按钮,它只是一个速度更快的 RPA 工具。
真正的剪辑 Agent 还需要理解视频结构、叙事目标、声音节奏、主体运动和工程状态。
这就是 Timeline Studio Skill 负责解决的问题。
三、Timeline Studio 是什么?
Timeline Studio 是一个开源、本地优先、直接运行在浏览器中的 AI 视频编辑器。
它提供接近桌面剪辑软件的多轨时间线,并集成了:
- 视频、图片和音频素材管理;
- 多轨画面与音频编辑;
- 自动字幕;
- 浏览器本地 AI 配音;
- 音乐与声音控制;
- 视觉变换、遮罩与效果;
- 转场;
- WebCodecs 离线导出;
- 可移植
.timeline工程。
与很多只返回 MP4 的 AI 视频工具不同,Timeline Studio 将可编辑工程视为源文件。
Agent 完成任务后,用户仍然可以打开时间线,替换素材、移动字幕、调整配音、修改音乐并重新导出。
四、edit-timeline-studio Skill 不是一段超级提示词
Timeline Studio 仓库包含一个可安装的 Agent Skill:
text
edit-timeline-studio
它不是简单告诉 Agent"帮我生成一条有电影感的视频",而是定义了一套剪辑任务的执行规范。
Skill 会要求 Agent:
- 在剪辑前检查素材时长、尺寸、媒体类型和音频状态。
- 综合代表帧、语音、OCR、运动和主体区域分析素材。
- 判断任务属于口播整理、产品教程、多镜头集锦、多人对话、宣传片还是参考视频复刻。
- 记录每个镜头的保留、删除、缩短和重排决策。
- 保留源时间映射,避免移动素材后丢失原始时间关系。
- 将 Agent 撰写的旁白拆成自然的短呼吸组。
- 先确定完整的声音骨架,再根据真实语音安排字幕和画面。
- 检查每一条可见字幕是否存在完整的可听语音。
- 验证转场、音频边界、开头、结尾和最终导出。
- 同时交付
.timeline工程与最终视频。
因此,它更接近"视频剪辑操作规程",而不是一次性 Prompt。
五、三层视频 Agent 架构
将 Codex Chrome、Timeline Studio Skill 和 Timeline Studio 编辑器结合后,可以形成三层架构。
text
┌──────────────────────────────┐
│ Codex Chrome │
│ 标签页、登录态网页、选中文字、字幕 │
└──────────────┬───────────────┘
↓
┌──────────────────────────────┐
│ edit-timeline-studio Skill │
│ 素材分析、叙事规划、剪辑决策、验证 │
└──────────────┬───────────────┘
↓
┌──────────────────────────────┐
│ Timeline Studio │
│ 多轨时间线、字幕、配音、音乐与导出 │
└──────────────────────────────┘
各层职责十分明确。
Codex Chrome 回答:
用户当前浏览的网页中发生了什么?
Timeline Studio Skill 回答:
应该做出哪些剪辑决策,又该如何验证?
Timeline Studio 回答:
这些决策应该保存在哪里,用户如何继续编辑?
这种分层避免了两个常见问题:
- 将浏览器点击误认为专业剪辑;
- 将 AI 输出压缩成不可修改的黑盒视频。
六、场景一:从参考视频生成可执行的复刻方案
传统 AI 对参考视频的分析往往停留在内容总结:
这是一条节奏较快的宣传片,使用了丰富的转场和动效。
这样的描述没有错,但很难直接用于剪辑。
真正可执行的参考视频分析需要识别:
- 镜头和子镜头边界;
- 重复使用的画面;
- 素材拆分与复用关系;
- 加速、减速、停顿和反转;
- 转场的进入、冲击和退出过程;
- 主体中心、大小和运动路径;
- 不同镜头的滤镜与画面状态;
- 原声、旁白、字幕和音乐的关系;
- 铺垫、上升、预冲击、高潮和余波。
当参考视频在 Chrome 中打开时,Agent 可以先使用时间戳字幕和页面信息建立叙事结构,再通过本地媒体分析补充画面、运动和声音证据。
示例任务:
text
@Chrome 分析当前标签页中的参考视频,
读取可用的时间戳字幕并提取叙事结构。
然后使用 edit-timeline-studio Skill:
1. 重建镜头顺序、重复、速度变化和转场;
2. 分析主体位置、大小和运动轨迹;
3. 标记铺垫、上升、高潮与余波;
4. 只使用我提供或明确获得使用授权的素材;
5. 输出可编辑 .timeline 工程和经过验证的成片;
6. 对无法从证据确认的内容明确标记,不要猜测。
最终结果不再只是一份分析报告,而是一条由分析结果驱动的可编辑时间线。
七、场景二:将产品网站转换成叙事型宣传片
很多 AI 产品宣传片只是动态功能列表:
text
功能一出现
→ 文字飞入
→ 功能二出现
→ 继续缩放
→ 最后放 Logo
画面虽然一直在动,但没有真正的故事。
更完整的产品视频应该让每个场景形成闭环:
text
用户情境
→ 遇到的阻力
→ 产品动作
→ 可见结果
→ 对用户的意义
Codex Chrome 可以先检查获准访问的产品页面、帮助文档和实际操作流程,建立页面覆盖清单,并区分真实可见功能与未经验证的宣传描述。
Timeline Studio Skill 再把多个场景组织成完整结构:
text
问题
→ 转变
→ 证据
→ 回报
→ 行动号召
对于 Agent 创作的旁白,Skill 会优先生成多个短语音资产,而不是先生成一条很长的音频再切割。
旁白确定后,字幕、镜头和场景时长再根据声音安排,从而避免为了命中固定时长而机械加速语音。
八、场景三:浏览器编辑器开发与视觉 QA
Codex Chrome 不仅能辅助内容生产,也适合调试 Timeline Studio 自身。
开启 Developer Mode 后,Codex 可以检查:
- 时间线拖拽后的 DOM 状态;
- 控件的实际 CSS;
- WebGPU 初始化错误;
- ONNX Runtime 推理异常;
- Worker 日志;
- 模型下载与缓存请求;
- 响应式布局;
- 预览与导出性能。
Codex 同时拥有本地代码仓库和终端上下文,因此可以形成完整闭环:
text
观察页面问题
→ 收集运行时证据
→ 定位实现代码
→ 修改代码
→ 刷新页面
→ 验证结果
对于包含 WebGPU、WebCodecs、Worker、媒体解码和多轨时间线的复杂 Web 应用,这比单独根据截图调试更可靠。
九、为什么需要命令路径和浏览器路径?
Timeline Studio 没有把全部自动化都建立在 UI 点击之上。
它使用两条执行路径。
1. 命令路径
版本化命令可以直接检查和修改 .timeline 工程。
bash
npm run agent -- project.inspect /projects/demo.timeline
npm run agent -- project.diff /projects/edit-plan.json
npm run agent -- project.run /projects/edit-plan.json
其中:
project.inspect用于检查工程;project.diff用于在写入前预测语义变化;project.run用于执行通过校验的编辑计划。
命令计划包含稳定 ID、工程版本、操作 ID 和前置条件,更适合可重复执行的工程操作。
2. 浏览器路径
以下操作更适合保留在浏览器中:
- AI 生成;
- 复杂视觉效果;
- 预览;
- 丰富渲染;
- 尚未进入命令协议的编辑能力;
- 需要真实画面判断的交互。
能够确定执行的操作进入命令层,需要视觉判断的操作进入浏览器层。
系统不会把 UI 自动化错误描述为完全确定性的后台执行。
十、.timeline 为什么重要?
如果 AI 视频工具只返回 MP4,那么每次修改都可能变成一次重新生成。
Timeline Studio 的 .timeline 是一个包含项目结构和媒体的可移植工程包。
完成后,用户仍然可以:
- 调整一次剪切;
- 替换某个配音片段;
- 修改字幕;
- 更换音乐;
- 调整转场;
- 替换素材;
- 重新导出。
这让 AI 成为编辑助手,而不是最终工程的控制者。
可编辑工程保留了人的创作权,也让 Agent 的每个决定可以被检查和修改。
十一、浏览器权限与素材授权边界
浏览器 Agent 能力越强,权限边界越重要。
实际使用时建议遵循以下原则:
- 网站尽量按域名和任务授权。
- 不默认选择"允许访问所有网站"。
- 登录凭据只在浏览器中输入。
- 网页内容始终作为不可信输入处理。
- 网络素材只使用发布者或平台明确提供的下载方式。
- 保留素材水印、来源与授权信息。
- 付费生成、发布、删除和修改权限等操作由用户确认。
- 能够在本地完成的媒体处理尽量留在设备上。
浏览器能力应当成为受控工具,而不是绕过授权的入口。
十二、安装与体验
Timeline Studio 在线编辑器:
text
https://video-editor.ai-creator.top/
GitHub 仓库:
text
https://github.com/MartinDelophy/ai-video-editor
通过 skills.sh 安装:
bash
npx skills add MartinDelophy/ai-video-editor \
--skill edit-timeline-studio
通过 GitHub CLI 安装到 Codex:
bash
gh skill install MartinDelophy/ai-video-editor \
edit-timeline-studio \
--agent codex \
--scope user
安装前查看 Skill 内容:
bash
gh skill preview \
MartinDelophy/ai-video-editor \
edit-timeline-studio
总结
AI 视频剪辑的下一阶段,不应该只是生成速度更快、模型更大,或者生成按钮更加醒目。
一个真正有用的视频 Agent,需要具备以下能力:
- 进入用户真实的浏览器工作环境;
- 理解参考视频和产品页面;
- 综合画面、语音、OCR 与运动证据;
- 做出可解释的剪辑决策;
- 将决策落实到多轨时间线;
- 验证字幕、声音、镜头和最终导出;
- 交付用户可以继续修改的工程。
Codex Chrome 提供浏览器上下文,edit-timeline-studio Skill 提供剪辑方法,Timeline Studio 则负责承载真实的视频工程。
这套组合的价值,不是让 AI 取代时间线。
而是让 AI 第一次真正学会在时间线中工作。
项目地址: