Codex Chrome 插件 + Timeline Studio:构建可编辑的 AI 视频剪辑 Agent 工作流

AI 已经能够生成脚本、图片、配音和视频,但真正的视频生产流程仍然十分割裂。

我们通常需要在浏览器中查看参考视频、研究产品页面、寻找授权素材,然后手动复制字幕、时间点和文案,最后再进入剪辑软件重新整理。

问题并不是某个环节没有 AI,而是这些 AI 能力之间缺少一条连续、可验证的工作链路。

OpenAI 新推出的 Codex Chrome 插件,正在改变这个局面。

当它与开源浏览器视频编辑器 Timeline Studio,以及 edit-timeline-studio Agent Skill 结合后,可以形成一套完整的视频 Agent 架构:

text 复制代码
浏览器上下文
→ 多模态素材分析
→ 剪辑决策
→ 多轨时间线
→ 可编辑工程
→ 最终视频

本文介绍这套工作流的核心思路、技术架构与实际应用场景。

项目地址:

https://github.com/MartinDelophy/ai-video-editor

在线体验:

https://video-editor.ai-creator.top/


一、Codex Chrome 插件解决了什么问题?

根据 OpenAI 官方更新日志,Codex for Chrome 于 2026 年 5 月 7 日发布。

后续版本又加入了多项适合内容生产的功能:

  • 引用已经打开的 Chrome 标签页;
  • 读取网页中选中的文字;
  • 通过右键菜单调用 Ask ChatGPT;
  • 在字幕可用时读取 YouTube 时间戳转录;
  • 使用现有 Chrome 登录状态访问获准的网站;
  • 在多个标签页之间处理任务;
  • 通过 Developer Mode 检查 DOM、CSS、Console 和网络请求。

传统网页 Agent 通常只能读取一个孤立 URL。

Codex Chrome 则可以进入用户当前正在使用的浏览器环境,理解参考视频、产品官网、帮助文档和素材页面之间的关系。

例如,用户打开一条 YouTube 参考视频后,Agent 可以读取可用的时间戳字幕;打开产品网站后,可以整理页面中真实可见的产品能力;打开素材平台后,可以在授权范围内组织候选素材。

这让浏览器成为视频 Agent 的"感知层"。

但是,能够读取网页并不等于能够完成专业剪辑。


二、为什么浏览器自动化不等于 AI 剪辑?

剪辑并不是简单地把素材拖入时间线。

一条完整视频通常包含大量判断:

  • 哪些镜头应该保留?
  • 哪些停顿需要删除?
  • 哪段口播应该缩短?
  • 相同镜头为什么会重复出现?
  • 高潮前需要多少铺垫?
  • 主体在重新构图后是否仍然清晰?
  • 字幕是否完整覆盖了可听语音?
  • 旁白应该适应画面,还是画面应该适应旁白?
  • 最终结果是否可以继续修改?

如果 Agent 只会操作鼠标和点击按钮,它只是一个速度更快的 RPA 工具。

真正的剪辑 Agent 还需要理解视频结构、叙事目标、声音节奏、主体运动和工程状态。

这就是 Timeline Studio Skill 负责解决的问题。


三、Timeline Studio 是什么?

Timeline Studio 是一个开源、本地优先、直接运行在浏览器中的 AI 视频编辑器。

它提供接近桌面剪辑软件的多轨时间线,并集成了:

  • 视频、图片和音频素材管理;
  • 多轨画面与音频编辑;
  • 自动字幕;
  • 浏览器本地 AI 配音;
  • 音乐与声音控制;
  • 视觉变换、遮罩与效果;
  • 转场;
  • WebCodecs 离线导出;
  • 可移植 .timeline 工程。

与很多只返回 MP4 的 AI 视频工具不同,Timeline Studio 将可编辑工程视为源文件。

Agent 完成任务后,用户仍然可以打开时间线,替换素材、移动字幕、调整配音、修改音乐并重新导出。


四、edit-timeline-studio Skill 不是一段超级提示词

Timeline Studio 仓库包含一个可安装的 Agent Skill:

text 复制代码
edit-timeline-studio

它不是简单告诉 Agent"帮我生成一条有电影感的视频",而是定义了一套剪辑任务的执行规范。

Skill 会要求 Agent:

  1. 在剪辑前检查素材时长、尺寸、媒体类型和音频状态。
  2. 综合代表帧、语音、OCR、运动和主体区域分析素材。
  3. 判断任务属于口播整理、产品教程、多镜头集锦、多人对话、宣传片还是参考视频复刻。
  4. 记录每个镜头的保留、删除、缩短和重排决策。
  5. 保留源时间映射,避免移动素材后丢失原始时间关系。
  6. 将 Agent 撰写的旁白拆成自然的短呼吸组。
  7. 先确定完整的声音骨架,再根据真实语音安排字幕和画面。
  8. 检查每一条可见字幕是否存在完整的可听语音。
  9. 验证转场、音频边界、开头、结尾和最终导出。
  10. 同时交付 .timeline 工程与最终视频。

因此,它更接近"视频剪辑操作规程",而不是一次性 Prompt。


五、三层视频 Agent 架构

将 Codex Chrome、Timeline Studio Skill 和 Timeline Studio 编辑器结合后,可以形成三层架构。

text 复制代码
┌──────────────────────────────┐
│ Codex Chrome                 │
│ 标签页、登录态网页、选中文字、字幕 │
└──────────────┬───────────────┘
               ↓
┌──────────────────────────────┐
│ edit-timeline-studio Skill   │
│ 素材分析、叙事规划、剪辑决策、验证 │
└──────────────┬───────────────┘
               ↓
┌──────────────────────────────┐
│ Timeline Studio              │
│ 多轨时间线、字幕、配音、音乐与导出 │
└──────────────────────────────┘

各层职责十分明确。

Codex Chrome 回答:

用户当前浏览的网页中发生了什么?

Timeline Studio Skill 回答:

应该做出哪些剪辑决策,又该如何验证?

Timeline Studio 回答:

这些决策应该保存在哪里,用户如何继续编辑?

这种分层避免了两个常见问题:

  • 将浏览器点击误认为专业剪辑;
  • 将 AI 输出压缩成不可修改的黑盒视频。

六、场景一:从参考视频生成可执行的复刻方案

传统 AI 对参考视频的分析往往停留在内容总结:

这是一条节奏较快的宣传片,使用了丰富的转场和动效。

这样的描述没有错,但很难直接用于剪辑。

真正可执行的参考视频分析需要识别:

  • 镜头和子镜头边界;
  • 重复使用的画面;
  • 素材拆分与复用关系;
  • 加速、减速、停顿和反转;
  • 转场的进入、冲击和退出过程;
  • 主体中心、大小和运动路径;
  • 不同镜头的滤镜与画面状态;
  • 原声、旁白、字幕和音乐的关系;
  • 铺垫、上升、预冲击、高潮和余波。

当参考视频在 Chrome 中打开时,Agent 可以先使用时间戳字幕和页面信息建立叙事结构,再通过本地媒体分析补充画面、运动和声音证据。

示例任务:

text 复制代码
@Chrome 分析当前标签页中的参考视频,
读取可用的时间戳字幕并提取叙事结构。

然后使用 edit-timeline-studio Skill:

1. 重建镜头顺序、重复、速度变化和转场;
2. 分析主体位置、大小和运动轨迹;
3. 标记铺垫、上升、高潮与余波;
4. 只使用我提供或明确获得使用授权的素材;
5. 输出可编辑 .timeline 工程和经过验证的成片;
6. 对无法从证据确认的内容明确标记,不要猜测。

最终结果不再只是一份分析报告,而是一条由分析结果驱动的可编辑时间线。


七、场景二:将产品网站转换成叙事型宣传片

很多 AI 产品宣传片只是动态功能列表:

text 复制代码
功能一出现
→ 文字飞入
→ 功能二出现
→ 继续缩放
→ 最后放 Logo

画面虽然一直在动,但没有真正的故事。

更完整的产品视频应该让每个场景形成闭环:

text 复制代码
用户情境
→ 遇到的阻力
→ 产品动作
→ 可见结果
→ 对用户的意义

Codex Chrome 可以先检查获准访问的产品页面、帮助文档和实际操作流程,建立页面覆盖清单,并区分真实可见功能与未经验证的宣传描述。

Timeline Studio Skill 再把多个场景组织成完整结构:

text 复制代码
问题
→ 转变
→ 证据
→ 回报
→ 行动号召

对于 Agent 创作的旁白,Skill 会优先生成多个短语音资产,而不是先生成一条很长的音频再切割。

旁白确定后,字幕、镜头和场景时长再根据声音安排,从而避免为了命中固定时长而机械加速语音。


八、场景三:浏览器编辑器开发与视觉 QA

Codex Chrome 不仅能辅助内容生产,也适合调试 Timeline Studio 自身。

开启 Developer Mode 后,Codex 可以检查:

  • 时间线拖拽后的 DOM 状态;
  • 控件的实际 CSS;
  • WebGPU 初始化错误;
  • ONNX Runtime 推理异常;
  • Worker 日志;
  • 模型下载与缓存请求;
  • 响应式布局;
  • 预览与导出性能。

Codex 同时拥有本地代码仓库和终端上下文,因此可以形成完整闭环:

text 复制代码
观察页面问题
→ 收集运行时证据
→ 定位实现代码
→ 修改代码
→ 刷新页面
→ 验证结果

对于包含 WebGPU、WebCodecs、Worker、媒体解码和多轨时间线的复杂 Web 应用,这比单独根据截图调试更可靠。


九、为什么需要命令路径和浏览器路径?

Timeline Studio 没有把全部自动化都建立在 UI 点击之上。

它使用两条执行路径。

1. 命令路径

版本化命令可以直接检查和修改 .timeline 工程。

bash 复制代码
npm run agent -- project.inspect /projects/demo.timeline
npm run agent -- project.diff /projects/edit-plan.json
npm run agent -- project.run /projects/edit-plan.json

其中:

  • project.inspect 用于检查工程;
  • project.diff 用于在写入前预测语义变化;
  • project.run 用于执行通过校验的编辑计划。

命令计划包含稳定 ID、工程版本、操作 ID 和前置条件,更适合可重复执行的工程操作。

2. 浏览器路径

以下操作更适合保留在浏览器中:

  • AI 生成;
  • 复杂视觉效果;
  • 预览;
  • 丰富渲染;
  • 尚未进入命令协议的编辑能力;
  • 需要真实画面判断的交互。

能够确定执行的操作进入命令层,需要视觉判断的操作进入浏览器层。

系统不会把 UI 自动化错误描述为完全确定性的后台执行。


十、.timeline 为什么重要?

如果 AI 视频工具只返回 MP4,那么每次修改都可能变成一次重新生成。

Timeline Studio 的 .timeline 是一个包含项目结构和媒体的可移植工程包。

完成后,用户仍然可以:

  • 调整一次剪切;
  • 替换某个配音片段;
  • 修改字幕;
  • 更换音乐;
  • 调整转场;
  • 替换素材;
  • 重新导出。

这让 AI 成为编辑助手,而不是最终工程的控制者。

可编辑工程保留了人的创作权,也让 Agent 的每个决定可以被检查和修改。


十一、浏览器权限与素材授权边界

浏览器 Agent 能力越强,权限边界越重要。

实际使用时建议遵循以下原则:

  1. 网站尽量按域名和任务授权。
  2. 不默认选择"允许访问所有网站"。
  3. 登录凭据只在浏览器中输入。
  4. 网页内容始终作为不可信输入处理。
  5. 网络素材只使用发布者或平台明确提供的下载方式。
  6. 保留素材水印、来源与授权信息。
  7. 付费生成、发布、删除和修改权限等操作由用户确认。
  8. 能够在本地完成的媒体处理尽量留在设备上。

浏览器能力应当成为受控工具,而不是绕过授权的入口。


十二、安装与体验

Timeline Studio 在线编辑器:

text 复制代码
https://video-editor.ai-creator.top/

GitHub 仓库:

text 复制代码
https://github.com/MartinDelophy/ai-video-editor

通过 skills.sh 安装:

bash 复制代码
npx skills add MartinDelophy/ai-video-editor \
  --skill edit-timeline-studio

通过 GitHub CLI 安装到 Codex:

bash 复制代码
gh skill install MartinDelophy/ai-video-editor \
  edit-timeline-studio \
  --agent codex \
  --scope user

安装前查看 Skill 内容:

bash 复制代码
gh skill preview \
  MartinDelophy/ai-video-editor \
  edit-timeline-studio

总结

AI 视频剪辑的下一阶段,不应该只是生成速度更快、模型更大,或者生成按钮更加醒目。

一个真正有用的视频 Agent,需要具备以下能力:

  • 进入用户真实的浏览器工作环境;
  • 理解参考视频和产品页面;
  • 综合画面、语音、OCR 与运动证据;
  • 做出可解释的剪辑决策;
  • 将决策落实到多轨时间线;
  • 验证字幕、声音、镜头和最终导出;
  • 交付用户可以继续修改的工程。

Codex Chrome 提供浏览器上下文,edit-timeline-studio Skill 提供剪辑方法,Timeline Studio 则负责承载真实的视频工程。

这套组合的价值,不是让 AI 取代时间线。

而是让 AI 第一次真正学会在时间线中工作。

项目地址:

https://github.com/MartinDelophy/ai-video-editor

相关推荐
AIkk861 小时前
大文件怎么压缩变小方便传输?本地压缩+云端方案对比测评
人工智能
薛定e的猫咪1 小时前
(ICLR2026)MORL‑FB:从无奖励强化学习视角重新审视多目标强化学习
人工智能·深度学习·机器学习
行业研究员1 小时前
腾讯云ADP:智能体平台封神榜
人工智能·microsoft·腾讯云·智能体·智能体平台·腾讯云adp
问天_观心1 小时前
零基础在windows环境下的WSL使用llamafactory(一)
人工智能·windows·python·神经网络·语言模型·github·模型蒸馏
陈童学哦1 小时前
DeepSeek Harness(Cordis):打破Agent框架黑盒,一切皆插件
人工智能
小睿科技1 小时前
建筑AI睿兔大脑 | AI把工程成本测算从经验活变成算清楚的技术活
人工智能
正经教主1 小时前
AI提示词工程(高阶)第19课:提示词评估与A/B测试
人工智能
Zach_菠萝侠1 小时前
【DeepSeek Harness 研究】进化方向1:动态路由 思考、设计与实现
人工智能·深度学习·deepseek
whyutianict_vv1 小时前
从 Web 前端到 HarmonyOS ArkTS:一次 AI 鸿蒙全栈智能体开发的迁移实录
前端·人工智能·harmonyos