用Codex自动生成AI视频:从文章、配音、字幕到成片的完整教程

如何使用Codex自动生成AI视频?本文将完整介绍一套从文章改写、AI配音、字幕生成、视频分镜到最终渲染的自动化工作流。
这套方案以Codex为任务调度中心,结合TTS语音工具、HyperFrames或Remotion完成视频制作。它并不是追求"一句话生成爆款视频",而是把视频制作拆解成可以检查、修改和重复执行的标准流程。
完整流程如下:
文章或选题
→ 口播稿
→ 最终配音
→ 字幕与时间轴
→ 视频分镜
→ 15秒预览
→ 完整渲染
→ 成片检查
其中最关键的一条原则是:先确定声音,再制作画面。
一、为什么AI生成的视频经常需要反复修改
很多人第一次制作AI视频时,会直接把文章交给AI,然后要求它一次性生成完整视频。
这种方法虽然简单,却很容易遇到以下问题:
-
文案适合阅读,却不适合口播。
-
配音长度发生变化,原来的镜头全部错位。
-
字幕和声音无法准确同步。
-
产品截图被错误裁切或拉伸。
-
画面很好看,却没有展示观众真正需要看到的信息。
-
预览页面正常,导出的MP4却出现黑屏或素材丢失。
-
每次生成的视频风格差异很大,无法形成稳定栏目。
问题不一定出在AI能力上,而可能出在生产顺序上。
稳定的视频工作流不能只保留最终成片,还需要保留口播稿、音频、时间轴、字幕和分镜等中间文件。
二、Codex在AI视频工作流中负责什么
在这套方案中,Codex更像一名能够操作文件、调用工具和检查结果的"视频项目总导演"。
它可以负责:
-
读取文章、资料或选题。
-
将文章改写成口播稿。
-
调用TTS工具生成配音。
-
根据最终音频提取时间戳。
-
生成SRT字幕文件。
-
根据口播内容编写视频分镜。
-
调用HyperFrames或Remotion制作视频。
-
检查素材、代码和渲染结果。
-
根据具体反馈继续修改视频。
不同工具可以承担不同任务:
Codex:管理流程、处理文件、编写代码和执行检查。
edge-tts、CosyVoice等:生成语音。
HyperFrames:制作画面变化较多的动态视频。
Remotion:通过React代码构建可以批量复用的视频模板。
video-use:辅助分析和剪辑已经拍摄好的真人视频。
这样做的意义不是完全取消人工,而是减少重复操作,把人的精力留给选题、观点、审美和最终决策。
三、AI视频自动化的正确生产流程

推荐使用下面的生产顺序:
原始文章
→ 最终音频final.wav
→ 时间数据timing.json
→ 字幕文件captions.srt
→ 视频工程
→ 最终成片final.mp4
这套顺序中,最终音频是整条视频的真实时间基准。
例如,一条视频最终为什么是75秒?
并不是因为分镜表写了75秒,也不是因为字幕文件写了75秒,而是因为最终音频本身持续了75秒。
如果声音还没有确定就开始制作画面,后面只要修改一句口播,字幕时间、镜头长度和转场位置都可能需要重新调整。
因此,正确做法应该是:
先确定口播稿。
再生成并确认最终音频。
然后根据音频生成时间轴。
最后才开始制作画面。
四、建立标准化的视频项目目录
建议为每一期视频建立相同的目录结构:
ai-video
│
├─ sources
│ └─ article.md
│
├─ narration
│ └─ narration.md
│
├─ audio
│ └─ final.wav
│
├─ timing
│ ├─ captions.srt
│ └─ timing.json
│
├─ storyboard
│ └─ storyboard.md
│
├─ assets
├─ preview
│ └─ preview-15s.mp4
│
└─ output
└─ final.mp4
article.md用于保存原始文章。
narration.md用于保存最终口播稿。
final.wav是经过确认的最终配音。
captions.srt用于显示字幕。
timing.json用于控制镜头、动画和字幕出现时间。
storyboard.md用于记录每个场景的画面计划。
assets文件夹用于保存图片、视频、字体和截图等素材。
preview文件夹保存短预览。
output文件夹保存最终成片。
统一目录以后,Codex能够准确找到每一步的输入和输出。某个环节出现问题时,也不需要重新执行整套流程。
五、让Codex把文章改写成口播稿
文章文案和视频口播文案并不相同。
文章可以使用长句、复杂结构和补充说明,但口播文案需要更短的句子、更明确的节奏,并在开头快速告诉观众这条视频有什么价值。
可以将下面的提示词直接交给Codex:
提示词:
请读取sources/article.md,将内容改写为一篇60至90秒的中文视频口播稿,并保存到narration/narration.md。
具体要求:
-
面向对AI工具感兴趣,但没有专业视频制作经验的用户。
-
不照抄原文句子,重新组织结构和表达。
-
开头5秒提出一个明确的问题或结果,但不要使用夸张承诺。
-
正文采用"问题、原因、方法、下一步"的结构。
-
保留原文中的核心事实和必要案例。
-
删除链接、脚注以及不适合直接朗读的内容。
-
每句话尽量简短,避免连续使用复杂术语。
-
结尾给出一个可以立即执行的建议。
-
单独列出需要核实的事实,不要自行补全不确定的数据。
-
只输出最终口播稿和事实核查清单。
生成口播稿后,建议自己完整朗读一遍,重点检查:
句子是否太长。
语气是否像真人说话。
英文产品名是否难以朗读。
段落之间是否缺少停顿。
开头是否铺垫太久。
结尾是否缺少明确行动。
AI可以生成初稿,但"听起来是否自然"仍然需要人工判断。
六、先生成15秒配音样本
配音可以使用普通TTS,也可以根据自己的设备和需求选择edge-tts、CosyVoice等工具。
第一次不要直接生成完整音频。建议先制作10至15秒的样本,检查:
中文发音是否自然。
英文和数字是否读对。
语速是否适合字幕阅读。
句子之间的停顿是否合理。
声音风格是否符合账号定位。
整体音量是否稳定。
可以将下面的任务交给Codex:
提示词:
请读取narration/narration.md,先生成前15秒的中文配音样本。
要求:
-
语速自然,不要过快。
-
检查技术名词、数字和英文产品名的发音。
-
保留自然停顿,不要把所有句子连在一起。
-
将样本保存到audio/sample.wav。
-
等待我确认样本后,再生成完整音频audio/final.wav。
-
不要修改narration.md中的原文。
-
完成后报告音频时长、采样率和文件路径。
如果使用声音克隆,只能使用自己拥有授权的声音,不要在未经允许的情况下模仿他人的声线。
final.wav确认后,尽量不要再修改口播稿。如果必须修改,应重新生成音频、字幕和时间轴。
七、根据最终音频生成字幕和时间轴
有了final.wav以后,下一步不是马上制作画面,而是提取真实时间戳。
建议输出两个文件:
captions.srt:用于字幕显示和人工检查。
timing.json:用于让视频程序读取每句话的开始时间和结束时间。
可以向Codex发送:
提示词:
请以audio/final.wav为唯一时间基准,并结合narration/narration.md校正文字,生成以下两个文件:
timing/captions.srt
timing/timing.json
要求:
-
时间戳必须来自音频识别结果,不能根据文字长度估算。
-
narration.md只用于校正错别字、专有名词和标点。
-
每条字幕保持适合手机阅读的长度。
-
不要让一条字幕跨越过多语义。
-
单独列出音频识别结果与narration.md之间的差异。
-
遇到无法确认的词语时进行标记,不要猜测。
-
检查最后一条字幕是否超过音频总时长。
timing.json可以采用下面的结构:
{ "id": 1, "start": 0.00, "end": 3.42, "text": "很多人以为,AI视频只需要一条提示词。" }, { "id": 2, "start": 3.42, "end": 7.86, "text": "真正决定效率的,其实是正确的生产顺序。" }
有了结构化时间数据,字幕、标题、镜头切换和动画才能准确同步。
八、先生成分镜表,再制作视频
视频分镜不是单纯描述"画面要多漂亮",而是回答:
观众听到这句话时,画面上必须看到什么?
一条60至90秒的知识类视频,可以先规划4至8个主要场景。
每个场景至少应该包含:
开始时间。
结束时间。
对应口播。
画面目的。
使用素材。
动画方式。
字幕位置。
缺失素材说明。
storyboard.md可以采用下面的格式:
场景01
时间:00:00至00:06
口播:很多人以为,AI视频只需要一条提示词。
画面目的:制造认知反差。
画面内容:一个提示框逐渐展开为多个视频生产环节。
使用素材:流程节点和视频图标。
字幕位置:底部安全区域。
动画方式:轻微推进,节点依次出现。
可以让Codex自动生成分镜:
提示词:
请读取narration/narration.md、timing/captions.srt和timing/timing.json,生成storyboard/storyboard.md。
要求:
-
将视频拆分为4至8个主要场景。
-
每个场景写明开始时间、结束时间、对应口播、画面目的、使用素材、动画方式和字幕位置。
-
优先使用assets文件夹中的真实截图和已有素材。
-
不要加入与内容无关的装饰动画。
-
字幕不能遮挡产品界面、人物面部和核心数据。
-
缺失素材必须明确标记,不要伪造产品截图。
-
镜头切换应该跟随语义变化,而不是固定每3秒切换一次。
-
检查所有场景是否覆盖完整音频时长。
九、HyperFrames和Remotion应该怎么选
HyperFrames和Remotion并不是完全相同的工具。
下面这些情况更适合使用HyperFrames:
每一期视频的视觉风格变化较大。
需要快速探索不同动态图形。
还没有确定固定的视频栏目模板。
希望根据不同选题灵活制作场景。
需要先制作视觉原型。
下面这些情况更适合使用Remotion:
栏目结构已经稳定。
片头、字幕、转场和结尾可以重复使用。
需要批量生产同一系列的视频。
希望通过React组件管理视频模板。
需要通过数据自动替换标题、图片和字幕。
比较实际的做法是:
前3至5期先使用灵活的视频工具探索内容和视觉风格。
等栏目结构稳定后,再使用Remotion把片头、字幕、镜头容器、转场和结尾制作成可复用组件。
十、先制作15秒预览

不建议第一次就直接渲染完整视频。
如果开头15秒已经存在标题太小、字幕遮挡、截图变形和转场过快等问题,渲染整条视频只会浪费更多时间。
可以先向Codex提出:
提示词:
请根据storyboard/storyboard.md制作视频前15秒的预览,并输出到preview/preview-15s.mp4。
要求:
-
使用audio/final.wav的前15秒音频。
-
字幕时间必须来自timing/captions.srt。
-
使用9:16竖屏画布。
-
所有文字和核心内容必须位于平台安全区域。
-
不允许拉伸图片和产品截图。
-
不允许使用无法访问的远程素材。
-
完成后检查视频是否可以独立播放。
-
暂时不要渲染完整视频,等待人工确认。
检查样片时,反馈越具体,AI修改得越准确。
推荐采用下面的反馈格式:
时间点+对象+当前问题+目标效果
例如:
00:03,主标题太小,放大约20%,保持居中。
00:06,产品截图停留时间太短,延长到3秒。
00:09,字幕遮挡操作区域,下移到安全区域。
00:12,转场速度过快,改成更克制的淡入。
00:14,背景动画抢夺注意力,降低亮度和移动幅度。
"再高级一点"并不是有效反馈。具体时间、具体对象和具体目标,才能减少无效修改。
十一、完整渲染和最终检查
确认15秒预览后,再生成完整视频。
提示词:
前15秒预览已经确认。请按照当前视频工程、最终音频、字幕文件和分镜表渲染完整视频,并输出到output/final.mp4。
渲染完成后检查:
-
final.mp4是否存在并且能够正常播放。
-
视频总时长是否与final.wav基本一致。
-
开头和结尾有没有被截断。
-
字幕是否与口播同步。
-
所有图片是否保持正确比例。
-
是否存在黑帧、空白画面或素材加载失败。
-
标题、字幕和核心元素是否位于安全区域。
-
整体音量是否稳定。
-
专有名词、数字和英文拼写是否正确。
-
输出检查报告,并列出需要人工确认的问题。
视频导出后,还需要人工从第一秒看到最后一秒。
最终验收清单:
□ 前3秒能否让观众知道视频主题
□ 口播是否存在错误发音
□ 字幕是否提前或延迟
□ 字幕是否适合在手机上阅读
□ 产品截图是否清晰
□ 画面有没有遮挡核心内容
□ 动画是否帮助理解内容
□ 是否存在黑屏或异常静止
□ 音频开头和结尾是否完整
□ 图片、音乐、字体和声音是否拥有授权
□ final.mp4能否在目标平台正常播放
只有最终MP4通过检查,视频才算真正完成。
十二、真人口播视频如何接入这套流程
如果已经拍摄了真人口播素材,可以保留前面的文案设计和时间轴思路,但制作路径会变成:
口播稿
→ 真人拍摄
→ 语音识别和镜头分析
→ 生成剪辑方案
→ 人工确认删除片段
→ 执行剪辑
→ 补充字幕和辅助画面
→ 导出成片
video-use等项目可以辅助编码Agent分析和编辑视频。
涉及删除真人镜头时,建议先让工具输出剪辑计划,经过人工确认后再执行。真人口播中的停顿、表情和语气有时也是表达的一部分,不能只根据静音长度机械删除。
十三、真正值得复用的是中间文件
AI工具、模型和开源项目都可能不断变化。
真正能够长期复用的是下面这些标准化文件:
article.md:原始文章。
narration.md:最终口播稿。
final.wav:最终声音。
captions.srt:字幕文件。
timing.json:结构化时间数据。
storyboard.md:视频分镜。
assets:经过授权的素材。
final.mp4:最终成片。
只要这些中间文件足够清晰,即使以后更换TTS、HyperFrames或Remotion,也不必推翻整套工作流。
这就是一条生产线和临时拼接几个AI工具之间的区别。
十四、第三方Skill和素材安全
安装第三方Skill或开源项目之前,应该检查:
-
项目是否仍在维护。
-
脚本会执行哪些操作。
-
是否需要访问网络。
-
是否会调用收费API。
-
是否会读取本地文件。
-
是否需要提供API密钥。
-
素材是否允许商业使用。
-
项目许可证是否覆盖代码以外的内容。
第三方Skill本质上也是代码和操作指令,不能因为带有AI标签就默认安全。
API Key不要直接写进提示词、代码仓库、文章或截图中。应该使用环境变量或者项目提供的安全配置方式。
还需要注意:开源代码的许可证不一定覆盖仓库中的品牌标志、字体、照片、音频和视频素材。
十五、初学者可以先完成这个最小版本
第一次尝试时,不必直接搭建复杂系统。
先完成下面七个步骤:
第一步:选择一篇自己拥有使用权的文章。
第二步:让Codex改写一篇60秒口播稿。
第三步:用TTS生成最终配音。
第四步:根据音频生成SRT字幕。
第五步:制作包含5个场景的分镜表。
第六步:渲染前15秒并完成修改。
第七步:渲染完整视频并从头播放检查。
第一条视频的目标不是实现完全自动化,而是跑通所有步骤。
流程稳定后,再逐渐增加:
固定片头。
统一字幕模板。
自动匹配素材。
批量渲染。
横屏和竖屏多尺寸导出。
统一颜色和字体。
自动执行发布前检查。
每增加一个自动化步骤,都应该减少一种重复劳动,而不是增加新的不确定性。
结语
AI视频生产最容易被忽视的不是模型能力,而是正确的执行顺序。
先确定口播,再确定声音。
先有声音,再生成时间轴。
先有时间轴,再制作分镜。
先检查15秒样片,再渲染完整视频。
最后一定要检查真正导出的成片。
Codex的价值,是把文案、配音、字幕、时间轴、分镜、素材和渲染任务连接起来。
当这些步骤被固化为统一目录、标准文件和检查规则后,得到的就不再是一条偶然生成的视频,而是一套可以反复修改、复用和扩展的AI视频生产流程。
需要注意的是,自动化能够提高视频制作效率,但不能保证流量和爆款。最终影响内容表现的,仍然是选题、观点、表达方式、受众匹配和持续迭代。
参考资料
原始参考内容:
https://x.com/miles_mazy/status/2097177704282136838
OpenAI Codex使用案例:
https://learn.chatgpt.com/use-cases
HyperFrames Community Skills:
https://github.com/heygen-com/hyperframes-community-skills
HyperFrames公开视频项目:
https://github.com/heygen-com/hyperframes-launches
Remotion Agent Skills:
https://github.com/remotion-dev/skills
video-shotcraft:
https://github.com/Vincentwei1021/video-shotcraft
video-use:
https://github.com/browser-use/video-use
edge-tts:
https://github.com/rany2/edge-tts
CosyVoice:
https://github.com/QwenAudio/CosyVoice
文章标签
Codex,AI视频,AI视频生成,Codex教程,视频自动化,HyperFrames,Remotion,AI配音,短视频制作,AIAgent