One Sentence, One Drama: Personalized Short-Form Drama Generation via Multi-Agent Systems
一、Motivation

短剧(Short Drama)近年来在内容消费领域爆发式增长,但现有的AI短剧生成方法存在三个核心痛点:
-
叙事节奏失控:现有方法多依赖LLM的一次性(one-shot)脚本生成,导致"开头钩子"弱、冲突升级不足、结尾缺乏悬念,不符合短剧"快节奏、高密度反转"的创作规律。
-
空间一致性差:各片段(clip)之间的生成是松耦合的,场景布局会发生漂移,角色位置在相邻镜头间跳变,物品状态不连续。
-
制作质量难以把控:从脚本到关键帧再到视频的全流程缺乏系统化的质量审核机制,通常需要大量人工介入才能达到可发布水平。
作者提出的核心问题是:能否仅凭用户一句话的创意,就自动生成一部完整的、具备商业品质的短剧?
二、Related Work
论文梳理了三条相关的技术路线:
视频基础模型:Sora、Veo、Kling、Seedance 等模型在单个5-15秒片段的视觉保真度上表现出色,但无法处理多镜头的长程规划与跨片段一致性问题,只能作为底层渲染引擎使用。
故事可视化与长视频生成:MovieAgent、ScriptAgent、StoryMem 等系统通过LLM规划或记忆机制将单镜头模型扩展到多场景叙事。但这些工作主要面向电影风格的叙事,通常需要精心策划的输入(完整剧本、角色库),且生成的片段之间松散耦合,缺乏短剧特有的高密度钩子和反转结构。
短剧生成系统:Toonflow(开源)和小云雀/Xiaoyunque(字节跳动闭源产品)是最接近的工作。Toonflow需要完整小说作为输入;小云雀依赖一次性LLM扩展。两者都存在关键帧独立生成导致的空间漂移问题,且均缺乏场景级BGM和转场设计。
本文定位:统一解决从"一句话"到"完整短剧"全链路中的叙事节奏、空间一致性、制作质量三大挑战。
三、Method

整体框架分为四个阶段(见 Figure 2),采用层次化多智能体架构:
3.1 阶段A:层次化剧集规划(Hierarchical Episode Planning)
原子脚本语料库构建:从约300部高分短剧脚本中提取结构化知识,构建两个检索库:
- 模式库(Pattern Bank):约2923个节拍级(beat-level)单元,编码了开场动作、冲突功能、结尾钩子等可迁移的短剧"包装"模式。
- 逻辑库(Logic Bank):将脚本切分为重叠的局部文本块,保留因果上下文(角色动机、证据激活、后果传递等)。
多智能体辩论式故事生成:这是本文的核心创新之一。
- 用户输入一句话 logline → 扩展为种子文本 → 生成检索计划(事实/逻辑/模式三条路线)
- 检索结果汇总为事实原子、逻辑原子、模式原子
- 生成故事核心(Story Core):包含元数据、场景规划、五条全局进展线(外部压力线、主角响应线、解决机制线、情感进展线、知识状态线)
- 多智能体辩论打磨:三个独立的LLM评审者并行审查,遇到分歧时由GPT-5.4 Pro作为最终裁决者。采用补丁式局部重写而非全文重生成。被删除的优秀创意存入"创意银行"(Idea Bank),最终轮可选择性恢复。
场景/片段级脚本合成:场景分解为时间序列的clip脚本,并通过分区重写(partitioned rewriting)分别优化开头钩子(第一个clip)、结尾悬念(最后一个clip)和中间反转密度(除首尾外的所有clip)。
3.2 阶段B:视觉资产与提示词生成(Visual Assets and Prompt Generation)
- 为每个场景生成360°全景图作为环境参考
- 构建场景级角色资产(多视角角色参考图)
- 为每个clip构建配对的"关键帧提示词+视频提示词"
- 引入提示词级审查循环:在渲染前检查空间一致性、物理合理性、跨clip连续性
3.3 阶段C:基于3D先验的关键帧-视频生成(Keyframe-to-Video with 3D Priors)
这是本文的另一核心技术创新------3D锚定的首帧生成,解决跨镜头空间漂移问题:
-
场景锚点初始化:用全景图通过Marble重建场景级3D世界W,从中采样多个候选视角,生成背景+角色合成的首帧候选,由VLM选择最优视角。
-
首帧注册与轨迹锚定:将生成的首帧I*通过VGGT注册回3D世界,消除角色插入带来的视角偏移。视频生成后,用CUT3R恢复相机轨迹并锚定到同一世界坐标系。
-
人体对齐:用SAM 3D Body从尾帧重建人体mesh,注册到共享坐标系中。
-
下一镜头一致性首帧生成:基于尾帧位姿和对齐的人体模型,在局部球壳上采样几何可行的相机位置,经几何滤波器(面部可见性、背景充分性)和语义滤波器(VLM验证场景锚点)两阶段筛选,最终生成空间一致的下一个首帧。
-
帧级和视频级审查循环:VLM检查背景模糊、边界变形、亮度匹配等问题,不合格则修复重生成。
3.4 阶段D:后期制作与组装(Post-Production and Assembly)
多样化场景转场:根据时间偏移、空间偏移和角色运动自动选择四种转场类型:
- 直接切(时空连续)
- 时间过渡(同一地点但时间推进,带文字叠加)
- 地点确立镜头(大幅位置变化)
- 运动桥接过渡(角色穿过走廊等,带叙事意义的空间移动)
BGM规划与混音:
- 8122首曲目的BGM库,分为16个功能桶(对话铺底、悬疑、冲突升级等)
- LLM选择场景匹配的BGM桶 → GPT-Audio评分候选片段 → 自适应音量控制混音(对话感知增益、LUFS响度校准、语音保护动态压缩)
四、模型分工一览
论文没有集中介绍使用了哪些模型,信息分散在正文、附录表3-7和引用中。整理如下:
文本/语言模型
| 模型 | 担当职责 |
|---|---|
| GPT-5.4 | 多智能体辩论中三个评审者之一(与Claude Sonnet 4.6、Gemini 3.0并列) |
| Claude Sonnet 4.6 | 多智能体辩论中三个评审者之一 |
| Gemini 3.0 | 多智能体辩论中三个评审者之一 |
| GPT-5.4 Pro | 辩论最终裁决者(Final Decider),当三个评审意见冲突时做最终判定 |
| Claude Opus 4.6 | clip空间文本审查、道具连续性审查、下一clip场景信息判断、BGM桶选择 |
视觉/图像模型
| 模型 | 担当职责 |
|---|---|
| Gemini 3 Pro(图像生成) | 角色条件化首帧合成、背景修复 |
| Qwen3-VL | VLM语义滤波器,判断候选视角是否符合clip描述;场景锚点选择 |
| SAM3 | 人物分割掩码提取 |
| SAM 3D Body | 从视频帧重建人体mesh及2D/3D关键点 |
3D/几何模型
| 模型 | 担当职责 |
|---|---|
| Marble(World Labs) | 从360°全景图重建场景级3D世界W |
| VGGT | 估计首帧与背景之间的相对变换,完成首帧到3D世界的注册 |
| CUT3R | 从视频帧恢复局部相机轨迹、深度和内参 |
视频生成模型
| 模型 | 担当职责 |
|---|---|
| Kling v3 Pro | 图像到视频生成(image-to-video),是主要的视频渲染引擎 |
音频模型
| 模型 | 担当职责 |
|---|---|
| GPT-Audio | BGM候选片段评分(情感匹配、叙事匹配、节奏匹配、转场匹配) |
审查/质量控制模型
| 模型 | 担当职责 |
|---|---|
| Qwen3.5-397B-A17B | 首帧候选选择评分、尾帧特写检测、生成视频空间审查、角色在场一致性检查 |
评测专用模型(不参与生成,仅用于benchmark评分)
| 模型 | 担当职责 |
|---|---|
| Gemini 3 Pro、Qwen3.5-Omni、Seed 2.0 Pro | Short-Drama-Bench三个评测裁判 |
| ChatGPT 5.0 | ViStoryBench故事可视化评测 |
小结:整个框架大量依赖API调用,不同环节使用了不同厂商的最强模型各司其职。文本审查偏好Claude Opus 4.6(推理能力强),视觉审查使用Qwen3.5-397B(多模态理解强),辩论裁决用GPT-5.4 Pro(综合判断力),视频渲染用Kling v3 Pro(视频生成质量高)。这种"混合调度多家模型"的策略本身也是工程上的一个特点。
五、Experiments
5.1 数据基础设施
整个框架的运行依赖两个预构建的数据库:
- 结构化脚本数据库:从300部高分原创短剧剧本中提取出2923个节拍卡片(beat cards,构成Pattern Bank的检索来源)和6984个逻辑块(logic chunks,构成Logic Bank的检索来源)。这两个库为多智能体故事生成提供可迁移的叙事节奏模式和局部因果逻辑支撑。
- BGM音乐库:8122首曲目,按8个高级类别和40个细分子类标注分桶(如对话铺底、悬疑、冲突升级、情感治愈等)。每个类别配有文字描述,供后期BGM规划阶段的LLM匹配和GPT-Audio评分使用。
5.2 基准测试:Short-Drama-Bench
测试集构成:50个故事提示(logline),覆盖7大类别(逆袭重生、社会现实、古代宫斗、悬疑惊悚、穿越重生、甜蜜爱情、职场商战)和17个细分子类别,每个子类别包含2-3个代表性样本。所有prompt全部生成完整短剧,总计约239分钟视频(2部长篇≈30分钟,5部中篇≈10分钟,43部短篇≈3分钟),迫使模型在数百个连续clip上维持一致性,远比评估孤立片段的传统benchmark更具挑战性。
评估体系分三层:
第一层:通用视频质量(复用现有benchmark)。借用VBench评估底层视频质量(主体一致性、背景一致性、运动平滑度);借用ViStoryBench评估故事可视化能力(场景对齐、跨角色一致性、角色动作),但将原本基于单图的评估协议改为按1FPS采样多帧的视频评估,更贴合本文任务。
第二层:短剧专项指标(本文核心贡献)。分四大类八个指标,每个指标有明确的评估单元切分方式:
- 叙事钩子:Opening Hook取每个场景的开头片段评估能否快速吸引观众;End Hook取每个场景的结尾片段评估是否留下足够悬念。
- 叙事流:Escalation Effect对每个场景的中间部分评估冲突升级效果;Narrative Coherence评估故事逻辑的清晰自洽程度。
- 连续性:从前一clip尾部采样3帧、后一clip头部采样3帧,评估Character Spatial Continuity(角色身份、位置、朝向连贯性)和Environment Layout Continuity(背景布局、物品摆放一致性)。
- 音频与转场 :Music-Emotion Alignment在场景级评估BGM情绪与画面的匹配度;Transition Naturalness在场景交界处评估转场的自然流畅度。
评分方式:由三个不同厂商的大模型(Gemini 3 Pro、Qwen3.5-Omni、Seed 2.0 Pro)作为评审,按统一prompt模板对每个评估单元打1-5分,取三模型在所有样本上的平均分。使用不同厂商的模型是为了减少单一模型的偏好偏差。
第三层:人类评分。招募20名标注者,对与模型评估相同的评估单元按同样的短剧指标打5点量表分。所有样本匿名且随机排序,每人独立评分后取全体平均,用于验证自动评估与人类感知的一致性。
5.2 主要结果

对比基线包括MovieAgent、ScriptAgent、StoryMem三个学术方法,以及Toonflow、小云雀两个产品级系统。本文方法在几乎所有指标上取得最优。
5.3 消融实验
移除各组件的影响清晰且互补:
- 去掉故事生成模块:叙事指标(钩子、升级)显著下降,空间连续性变化不大
- 去掉3D首帧:连续性指标最大幅下降(角色空间连续性3.52→2.81),叙事基本不受影响
- 去掉多阶段审查:所有指标均匀下降,说明迭代反馈是全局性的质量保障
- 去掉转场与BGM:主要影响音乐情感匹配和转场自然度

5.4 成本分析
- 生成一分钟短剧的API成本约$25-27
- 对比:小云雀约24.36/分钟,Toonflow约21.53/分钟
- 对比人工制作:A级短剧约293/分钟,真人实拍约1464/分钟
- 生成10分钟短剧总耗时约74-90分钟
六、Conclusion
本文提出了"One Sentence, One Drama"框架,核心贡献可总结为:
- 将单句短剧生成形式化为需要联合建模叙事节奏、空间一致性和制作质量的结构化生成问题
- 提出检索增强的多智能体辩论式故事生成,解决叙事节奏问题
- 提出3D锚定首帧生成,通过共享空间坐标系解决跨clip空间漂移
- 设计多阶段审查循环,实现全流程质量控制
- 发布Short-Drama-Bench基准测试
一句话总结:这篇工作的核心价值不在于某个单点技术的突破,而在于对短剧生成这一复杂系统工程的全面、深入的问题分解与方案设计------从叙事智能、空间智能到质量控制,构建了一条从"一句话创意"到"可发布短剧"的完整技术路径。