The Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video Generation
1. Motivation
当前的视频生成模型(如 Sora2-Pro、Veo3.1、Wan2.5)虽然已经能够根据文本 prompt 合成高质量的短视频,但在面对更复杂的创作任务时暴露出根本性的局限:从高层叙事概念(如一段对话)到电影级视频之间存在巨大的"语义鸿沟"(semantic gap)。
具体来说,给定一段粗粒度的角色对话,现有模型无法自主完成以下三件事:
- 细粒度上下文理解:从稀疏对话中消解歧义,补全隐含信息;
- 电影制作领域知识:生成合理的镜头类型、运镜方式等专业规格;
- 创意推理:将"说了什么"桥接到"应该展示什么"。
论文的核心论点引用了希区柯克的名言------"拍一部好电影需要三样东西:剧本、剧本、还是剧本",认为自动化电影制作中缺失的关键环节正是**剧本(Script)**本身。因此,论文提出在 T2V 生成之前,先自动生成一份细粒度、可执行的电影级分镜脚本,作为下游视频模型的指导。
2. Related Work
论文的相关工作主要覆盖三个方向:
视频生成:当前主流方法依赖扩散模型(Sora、Wan2.5 等)和语言模型(CogVideo 等),但在长时叙事连贯性方面仍有显著不足,特别是受限于固定时长(通常 8-12 秒)的生成窗口。
LLM 用于电影制作:Anim-Director、MovieAgent 等系统利用 LLM 进行场景生成和角色规划,但普遍依赖人工输入来完成叙事和镜头规划,自动化程度有限。
故事可视化:从早期的 StoryGAN 到近期的 StoryDiffusion、Magic-Me,虽然在时序一致性上有所改善,但仍缺乏对镜头语言、场景结构和角色交互的自动化高层规划能力。
本文的差异化在于:提出了一个端到端的多 agent 框架,从对话出发自动生成完整的分镜脚本,再驱动视频生成,减少了人工干预。
3. Method

整体框架由三个 Agent 组成:ScripterAgent (剧本生成)、DirectorAgent (视频执行)、CriticAgent(质量评测)。
3.1 ScriptBench 数据集

首先构建了 ScriptBench,一个大规模的电影级分镜脚本基准数据集,包含 1,750 个标注实例(1700 训练 + 50 测试),平均视频时长约 15.4 秒。数据来源于高质量电影过场动画,具备丰富的对话、专业镜头语言和高视觉一致性。
标注流程分三个阶段,使用 Gemini-2.5-Pro 作为标注引擎,但全程由专家定义的模板和约束规则严格控制:
- 上下文重建与对话融合:联合分析文本和音频,推断角色关系、场景设定、情感倾向等,将隐式因果关系显式化;
- 镜头级语义规划:在镜头完整性、时长适配(≤10秒)、语义连贯性、技术可行性四个约束下进行分镜规划;
- 多轮自适应纠错:通过对话完整性、角色外观一致性、场景连贯性、位置与物理合理性四个验证模块进行迭代修正。自动通过率达 94%,但专家审核发现了角色瞬移、对话-动作冲突等细微错误,这些反馈被融入了后续的约束优化中。
3.2 ScripterAgent:两阶段训练
ScripterAgent 基于 Qwen-Omni-7B 微调,目标是将粗粒度对话转化为结构化的 JSON 格式分镜脚本。
阶段一:SFT(结构能力)
将任务形式化为 seq2seq 任务,输入为多轮对话,输出为结构化脚本。使用标准的条件对数似然损失训练 20 个 epoch,学习率 1e-5,最大序列长度 8192 tokens。此阶段使模型掌握脚本的格式和基本叙事结构。
阶段二:GRPO(电影美学对齐)
SFT 保证了结构正确性,但无法捕捉镜头组合、节奏感、情感冲击力等主观审美。因此引入 Group Relative Policy Optimization (GRPO) 进行偏好对齐。
核心是一个混合奖励函数:
R total ( y ) = α ⋅ R structure ( y ) + ( 1 − α ) ⋅ R human ( y ) , α = 0.4 R_{\text{total}}(y) = \alpha \cdot R_{\text{structure}}(y) + (1-\alpha) \cdot R_{\text{human}}(y), \quad \alpha=0.4 Rtotal(y)=α⋅Rstructure(y)+(1−α)⋅Rhuman(y),α=0.4
- R structure R_{\text{structure}} Rstructure(规则奖励):包含格式合规、对话完整性、场景角色一致性、物理合理性四个自动化检查;
- R human R_{\text{human}} Rhuman(人类偏好奖励):由 3 位资深美术总监对 500 个 SFT 输出样本打分(1-5 分,覆盖分镜合理性、角色表演、视觉美学、导演意图四个维度),训练了一个 BERT 回归模型作为人类偏好的可扩展代理。
GRPO 优化时,对每个输入生成 K=8 个候选脚本,计算组内归一化优势函数,并加 KL 散度惩罚(β=0.04)防止偏离 SFT 初始化太远。训练 5000 步,学习率 1e-6。
3.3 DirectorAgent:跨场景连续生成
DirectorAgent 负责将脚本转化为连贯的长视频,核心是跨场景连续生成策略,包含两个关键机制:
智能分镜分割:按照 ScripterAgent 定义的自然镜头边界将脚本切分为多个生成任务(而非任意时间切割),遵循镜头完整性、时长适配(含 10% 安全缓冲)、语义连贯性、技术可行性四个原则。
帧锚定连续性(Frame-Anchoring):提取上一个场景的最后一帧作为下一个场景的视觉锚点(conditioning image),配合文本提示"Continuing from the previous scene",形成视觉接力,显著减少身份漂移和场景突变。本质上是将长时序生成问题转化为一系列局部可解的、保持连续性的子问题。

已知局限:唇形同步和细粒度动作对齐仍有残差误差。
3.4 CriticAgent:评测框架
CriticAgent 基于 Gemini-2.5-Pro,分别对脚本生成和视频生成进行多维度自动评分(0-5 分),并结合人类专家评分和自动化指标(CLIP Score、VBench、VSA)构成综合评测体系。
其中,Visual-Script Alignment (VSA) 是论文提出的新指标,衡量视频内容是否在脚本指定的时间区间内出现,评估时序-语义对齐能力:
VSA = 1 ∑ k = 1 K ∣ T k ∣ ∑ k = 1 K ∑ t ∈ T k Sim ( E vis ( v t ) , E txt ( I k ) ) \text{VSA} = \frac{1}{\sum_{k=1}^{K}|T_k|} \sum_{k=1}^{K} \sum_{t \in T_k} \text{Sim}(\mathcal{E}{\text{vis}}(v_t), \mathcal{E}{\text{txt}}(I_k)) VSA=∑k=1K∣Tk∣1k=1∑Kt∈Tk∑Sim(Evis(vt),Etxt(Ik))
4. Experiments
4.1 脚本生成实验

在 ScriptBench 测试集上,ScripterAgent(Full,即 SFT+RL)在所有 AI 评分和人类评分指标上均显著优于基线方法(CHAE、MoPS、SEED-Story):
| 方法 | 格式合规 | 分镜合理 | 内容完整 | 叙事连贯 | 角色一致 | 戏剧张力 | 视觉想象 |
|---|---|---|---|---|---|---|---|
| SEED-Story | 3.6 | 3.5 | 3.7 | 3.8 | 3.6 | 3.7 | 3.8 |
| ScripterAgent (SFT) | 3.9 | 3.6 | 3.8 | 3.9 | 3.7 | 3.6 | 3.8 |
| ScripterAgent (Full) | 4.0 | 3.9 | 4.1 | 4.2 | 4.0 | 4.1 | 4.3 |
关键发现:SFT 阶段已能学到基本结构,但 RL 阶段对主观艺术维度提升显著(戏剧张力 3.6→4.1,视觉想象 3.8→4.3),验证了 GRPO + 混合奖励对创意任务的有效性。
4.2 视频生成实验

对 7 个 SOTA 视频生成模型(Vidu2、Seedance1.5-Pro、Kling2.6、Wan2.6、HYVideo1.5、Sora2-Pro、Veo3.1)进行了有/无 ScripterAgent 的对比:
- 加入 ScripterAgent 后,所有模型在所有维度上均有提升,平均 AI 评分从 4.2→4.5,平均人类评分从 3.7→4.2;
- 脚本忠实度(Script Faithfulness)提升最为显著,如 Wan2.6 从 3.2→4.0;
- VSA 指标普遍提升,验证了时序-语义对齐的改善;
- 发现了一个重要 trade-off:Sora2-Pro 在视觉效果(Visual Appeal 4.8)和物理真实性(4.5)上最强,但 HYVideo1.5 在脚本忠实度(4.6)和叙事连贯性(4.3)上领先,说明当前模型在"视觉奇观"和"脚本遵从"之间存在取舍。
4.3 消融实验
在 Wan2.6 和 HYVideo1.5 上的四阶段消融(Baseline → +Script → +Segment → Full Agent)表明:
- ScripterAgent 主要提升视觉描述忠实度和肢体动作表现;
- DirectorAgent(分割 + 帧锚定)主要提升叙事节奏和镜头表达维度;
- 两者的贡献功能性解耦,且三个不同的 LLM 评估器结果高度一致。
5. Conclusion
论文提出了首个端到端的对话驱动电影级视频生成框架,核心思路是"先生成专业分镜脚本,再驱动视频生成"。通过 ScriptBench 数据集和两阶段训练的 ScripterAgent,成功弥合了高层叙事与底层视频合成之间的语义鸿沟。实验验证了该方法对所有测试的 SOTA 视频模型均有普适性提升,并发现了视觉效果与脚本遵从之间的关键 trade-off。
未来方向包括:精确唇形同步、自适应生成多样化电影风格的内容。
6. 个人思考
核心贡献的判断 :这篇工作的主要贡献其实就是 ScripterAgent------训练了一个能将粗粒度对话转化为细粒度分镜脚本的模型。论文的实验设计本质上是在对比不同的 T2V 模型"有无 ScripterAgent 辅助"时的表现差异,以证明脚本规划的价值。
关于"三个 Agent"的包装:如果去掉包装来看:
- ScripterAgent = 一个经过 SFT+GRPO 微调的 7B 模型,本质是一个 planner;
- DirectorAgent = 一个基于规则的分割策略 + 帧锚定的工程 trick,并不涉及模型训练;
- CriticAgent = 直接调用 Gemini-2.5-Pro 做评测,是评估工具而非系统组件。
所以整体框架可以简化理解为:在 T2V 生成前加了一个 planner(脚本生成器),用三个 agent 的叙事做了包装。
关于流程设计 :整个 pipeline 是单次前向 的------ScripterAgent 生成脚本后直接交给 DirectorAgent 生成视频,CriticAgent 只在最终评测时介入,不存在生成-评测-修改的反馈循环。如果 CriticAgent 的评估结果能反馈给 ScripterAgent 或 DirectorAgent 进行迭代修正,系统的效果可能会更好。这也许是一个值得探索的方向。
值得肯定的点:
- Frame-Anchoring 机制虽然不涉及模型训练,但它用一个简洁的工程方案(上一场景末帧作为下一场景的 conditioning image)解决了跨场景视觉一致性这个实际痛点。消融实验也验证了它对叙事节奏和镜头连贯性的独立贡献,是一个实用且可迁移的 trick。
- "视觉奇观 vs 指令遵从"的 trade-off 发现是本文最有启发性的 insight 。Sora2-Pro 优化方向偏向视觉效果(Visual Appeal 4.8, Physical Law 4.5),而 HYVideo1.5 优化方向偏向 instruction following(Script Faithfulness 4.6, Character Consistency 4.4)。这说明当前的 T2V 模型在训练目标上存在内在分歧------有的追求"看起来好看",有的追求"按指令办事",二者尚未统一。这个发现对于实际选型(高视觉品质场景 vs 高可控性场景)和未来模型设计都有参考价值。
- VSA 指标关注了"内容是否在正确的时间出现"这一被忽视的维度,有一定新颖性。
Related Work 中对前人工作的描述值得商榷 :论文在 Related Work 中称 MovieAgent 等方法"依赖人工输入进行叙事和镜头规划"(reliance on manual input),但 MovieAgent 的全称就是"Automated movie generation via multi-agent CoT planning",本身就是用多 agent 做自动规划的。论文自己也承认 MovieAgent 使用了 multi-agent 协作,紧接着又说它依赖人工输入,存在自相矛盾。实际上两者的核心差异不在于"人工 vs 自动",而在于脚本输出的粒度和专业度------MovieAgent 的输出是较粗的 plot summary + 简单运镜描述(如 Figure 4 所示),而 ScripterAgent 输出的是带精确时间戳、镜头参数、角色外观、空间位置等细粒度信息的可执行分镜脚本。这种在 Related Work 中为突出自身贡献而对前人工作描述稍显不公。

不足之处:
- 测试集仅 50 个样本,规模偏小,结果的统计显著性存疑;
- 数据来源于游戏过场动画(cinematic cutscenes),与真实电影场景的多样性和复杂度有差距;
- 帧锚定机制虽然有效,但比较简单(仅用最后一帧做 conditioning),在复杂场景变换(如跨场景大幅度转场)时效果可能有限;
- "Agentic" 的说法有些过度包装,整个系统中并没有真正的 agent 间协作或自主决策闭环。