AVA-Encoder:面向智能体原生视频表征学习框架

AVA-Encoder:面向智能体原生视频表征学习框架

arXiv:2608.12313v1

摘要

当前创意智能体难以从成熟人类影视作品中学习创作逻辑,核心瓶颈是缺少一套智能体原生结构化视频表征 :该表征需要同时完整留存影片细节、适配大模型推理、支持灵活编辑。本文提出AVA-Encoder(智能体原生视频自编码框架),将原始视频转换为知识图谱(K(\mathcal{G}))表征并实现完整视频重建。

该图谱以分层文本节点为核心,配套多媒体素材存储层;通过分类边记录剧情、人物、镜头、音视频之间的关联关系,天然支持智能体查询、修改、复用。基于重建误差设计双循环文本梯度优化机制 :外层循环完成与数据无关的编码策略伪训练,内层循环针对单条视频做数据驱动的知识图谱精细化修正。

在标准化重建基准测试中,AVA-Encoder相较最优基线整体指标提升20.7个百分点;仅使用优化后的编码策略(关闭图谱内层修正)时,对比人工精心调校的提示词方案,指标提升1.4个百分点,同时提示词token用量降低74.3%。

本文开源完整AVA-Encoder框架、标准化智能体视频重建评测基准、全球首套电影知识图谱数据集;配套图编辑工具可实现跨镜头一致性视频修改。

目录

  1. 引言
    2 相关工作
    2.1 智能体视频生成系统
    2.2 智能体原生视频表征
    3 任务定义
    3.1 问题形式化
    3.2 优化目标
    4 方法:AVA-Encoder整体架构
    4.1 智能体视频编码器
    4.2 知识图谱表征结构
    4.3 双循环文本梯度演化机制
    4.3.1 重建误差与两类优化指标
    4.3.2 外层循环:数据无关编码策略伪训练
    4.3.3 内层循环:数据驱动图谱精细化修正
    5 实验
    5.1 实验配置
    5.1.1 数据集
    5.1.2 模型配置
    5.1.3 评测体系
    5.1.4 对比基线
    5.1.5 自动化图编辑实验
    5.1.6 研究问题(RQ)设计
    5.2 RQ1:视频重建保真度整体结果
    5.3 RQ2:双循环模块独立贡献与消融
    5.3.1 分层理解与策略迭代效果
    5.3.2 内外循环独立增益
    5.3.3 接纳门控消融实验
    5.4 RQ3:知识图谱可编辑性实验
    5.5 RQ4:下游视频生成复用实验
    6 结论
    参考文献
    附录
    A 文本梯度与AVA-Encoder自优化原理
    A.1 Text(\mathcal{G})rad基础理论
    A.2 AVA-Encoder结构化文本梯度实现
    B 重建评测全套指标
    B.1 四大评测维度与八大评估方向
    B.2 直接视频/关键帧打分规则
    B.3 盲反向字幕打分规则
    B.4 重建评测专用系统提示词
    B.5 基准分数聚合计算方式
    B.6 人工评测对齐验证
    C 循环优化所用重建奖励函数
    C.1 奖励函数配套提示词
    C.2 奖励函数在双循环中的调用逻辑
    D 双循环接纳门控细则
    D.1 关键帧图谱修正门控
    D.2 视频镜头图谱修正门控
    D.3 编码策略伪训练接纳门控
    D.4 编码策略伪训练完整流程
    E 智能体编码器全套系统提示词
    F 基线模型适配与公平性控制方案
    F.1 VideoAnalyzer基线适配
    F.2 Storyboard Studio基线适配
    F.3 soap2soap基线适配
    F.4 原始像素禁用规则
    F.5 表征token预算约束
    F.6 生成器共享与时序对齐方案
    (\mathcal{G}) 数据集与可复现性完整说明
    (\mathcal{G}).1 开源电影知识图谱数据集
    (\mathcal{G}).2 伪训练/评测视频库
    (\mathcal{G}).2.1 伪训练视频集
    (\mathcal{G}).2.2 评测视频集
    H 细粒度重建定量结果附表
    I 消融实验定义与指标差值
    J 知识图谱构建与编辑完整规范
    J.1 图谱存储范式
    J.2 图谱构建与修改传播机制
    K 额外定性可视化结果
    K.1 多方法重建对比图
    K.2 图谱拓扑编辑案例
    K.2.1 素材闭合规则
    K.2.2 语义一致性校验
    K.2.3 分层更新逻辑
    K.2.4 按编辑类型传播规则
    L 下游故事视频评测细则
    M 全套系统原始提示词文本

1 引言

近两年大模型驱动的视频智能体已实现剧本撰写、分镜设计、短视频生成,但现有系统难以产出院线级完整影视作品。核心短板是缺少完整影视创作规划能力,无法统筹剧本、人物、镜头、视听多维度复杂决策。

高质量专业影片蕴含海量编剧、人物塑造、运镜、节奏、视听协调知识,但现有智能体无法直接学习影片经验:原始视频是密集多模态混合载体,而智能体依靠文本、图谱、规划等结构化信息完成推理,二者存在天然表征鸿沟。

理想的智能原生视频表征需同时满足三大条件:

  1. 智能体可读:文本化结构,大模型可直接解析;
  2. 智能体可操作:支持检索、局部修改、批量更新;
  3. 高保真:完整留存重建所需全部视听、叙事信息。

现有表征方案存在明显短板:

  1. 底层像素/视频嵌入:视觉信息完整,但智能体无法直接解读、修改;
  2. 线性字幕文本:易丢失人物关系、时序事件、跨模态关联等结构化信息;
  3. 传统场景图/视频知识图谱:仅适配检索、问答等理解任务,丢失大量生成所需细粒度视听细节。

针对上述痛点,本文设计电影知识图谱表征 :将故事、事件、镜头分层存储结构化文本;人物、场景、物体、运镜、音频等状态节点配套关联素材层;通过分类边记录跨层级、跨模态依赖。修改局部节点后可自动同步所有关联镜头素材。

基于该图谱,本文提出AVA-Encoder自编码框架:输入视频编码为知识图谱,再固定解码器完成视频重建;以重建误差作为优化信号,分别迭代全局共享编码策略单视频专属图谱

本文三大核心贡献:

  1. 提出智能体视频自编码范式AVA-Encoder,设计双循环文本梯度优化机制;在标准基准上整体重建指标达49.0%,领先最优基线20.7个百分点;仅使用外层伪训练策略时,提示词token相比人工方案减少74.3%,指标提升1.4%;
  2. 搭建全球首套面向重建保真度的视频表征评测基准,包含4大评测维度、8类影视评估方向;自动评测结果与人工标注匹配度97.3%;
  3. 开源首套大规模电影知识图谱数据集与配套图编辑工具,支持可控视频改写、影片混剪、下游生成模型复用。

图1 AVA-Encoder完整流程:

(a) 自编码闭环:原始视频经智能编码器生成知识图谱,固定解码器重建视频;重建残差分别触发外层策略伪训练、内层图谱精细化修正;

(b) 分层智能编码器:依次完成影片、镜头、关键帧三级理解,全局上下文注入+人物/场景/物体注册库;

© 知识图谱分层结构:故事-事件-镜头层级,配套多模态素材层,支持子图拓扑联动编辑。

2 相关工作

2.1 智能体视频生成系统

现有LLM驱动视频智能体依靠规划、工具调度完成生成/改写,分为多智能协作生成框架、单模型编辑工具两大类。但现有系统缺少标准化高质量影片学习素材,无法复用专业影视的成熟创作逻辑。AVA-Encoder将原始影片转化为可推理知识图谱,提供完整创作记录,支持智能体学习与联动编辑。

2.2 智能体原生视频表征

现有表征分为三类:

  1. 底层像素/隐向量:信息完整,但无法直接编辑;
  2. 线性字幕文本:丢失结构化关联;
  3. 视频场景图:仅面向检索、问答,缺失生成所需视听细节。
    本文AVA-Encoder图谱以重建保真度为优化目标,专为视频生成设计,完整留存叙事、镜头、色彩等创作信息。

3 任务定义

本文将影视创作建模为智能体自编码任务,输入原始视频,输出可编辑知识图谱表征,再通过固定解码器还原视频。

3.1 问题形式化

  1. 智能体视频编码器E
    由三层策略P=(Pfilm,Pshot,Pkf)P=(P_{film},P_{shot},P_{kf})P=(Pfilm,Pshot,Pkf)(影片/镜头/关键帧提示词)控制,输入视频VVV输出知识图谱KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲\mathcal{G}\):
    KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲\(\mathcal{G}\)...
  2. 知识图谱隐空间KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal{\̲(̲\mathcal{G}\)}
    文本为核心分层结构:故事/事件/镜头三层叙事节点,人物/场景/物体/运镜/音频状态节点;图像、音频、成片仅作为关联素材存储,原始像素不参与表征存储。
  3. 固定解码器Dec
    两阶段固定生成管线:文本生成关键帧、关键帧生成完整镜头;全程不读取原始视频像素,仅依托图谱文本素材重建:
    KaTeX parse error: Can't use function '\(' in math mode at position 23: ...htarrow{E(;P)} \̲(̲\mathcal{G}\) \...

3.2 优化目标

  1. 外层循环(数据无关策略伪训练)
    使用批量训练视频{Vn}\{V_n\}{Vn}优化镜头级编码策略PshotP_{shot}Pshot,影片、关键帧策略与生成模型全部冻结。最大化单视频平均重建奖励:
    KaTeX parse error: Can't use function '\(' in math mode at position 90: ...}\sum_{n=1}^{L}\̲(̲R_{\mathrm{rewa...
  2. 内层循环(数据驱动图谱修正)
    编码策略冻结后,仅优化当前输入视频专属图谱,在可达图谱空间内最大化重建奖励:
    KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲\mathcal{G}\)_{...
    内外循环不同时更新,外层优化全局通用提示策略,内层仅修正单条视频图谱。

4 方法:AVA-Encoder整体架构

AVA-Encoder四大核心模块:分层智能视频编码器、文本知识图谱表征、双循环文本梯度演化、重建误差优化指标。

4.1 智能体视频编码器

输入视频VVV经镜头分割算子划分为有序镜头序列;执行粗到细三级分层理解 ,上层全局上下文向下传递,同时维护全局人物/场景/物体注册库,保证跨镜头实体一致性:

Cfilm=Efilm(V;Pfilm)Cshot,i=Eshot(si,Cfilm;Pshot)Ckf,i=Ekf(fi∗,Cshot,i;Pkf)\begin{align} \mathcal{C}{\mathrm{film}} &=E{\mathrm{film}}(V;P_{\mathrm{film}}) \\ \mathcal{C}{\mathrm{shot},i} &=E{\mathrm{shot}}(s_i,\mathcal{C}{\mathrm{film}};P{\mathrm{shot}}) \\ \mathcal{C}{\mathrm{kf},i} &=E{\mathrm{kf}}(f_i^{*},\mathcal{C}{\mathrm{shot},i};P{\mathrm{kf}}) \end{align}CfilmCshot,iCkf,i=Efilm(V;Pfilm)=Eshot(si,Cfilm;Pshot)=Ekf(fi∗,Cshot,i;Pkf)

分层上下文整合后,自动构建完整知识图谱:

KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲\mathcal{G}\)=\...

4.2 知识图谱表征结构

图谱KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲\mathcal{G}\)=(...分为文本节点、分类边、素材层三部分:

  1. 文本节点(仅存储文本描述)
    分层叙事:Story、Event、Shot
    镜头状态:Character、Scene、Object、Style、Camera、Audio
  2. 关键帧资产节点:关联生成图片素材,不存储原图像素
  3. 11类有向边:层级包含、时序序列、人物关联、素材引用、音频归属、风格传递等;
    优势:修改任意节点后,沿边自动更新全部关联镜头与素材,实现全局一致性编辑。

4.3 双循环文本梯度演化机制

文本梯度:以自然语言形式输出重建错误修正方向,无需数值梯度,适配LLM推理优化。

图2 (a)内层循环:单视频图谱迭代修正,抗退化接纳门控;(b)外层循环:编码策略伪训练,抗遗忘回放门控。

4.3.1 重建误差与两类优化指标
  1. 循环优化奖励KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲R_{\mathrm{rewa...:用于内外循环迭代更新,基于原子QA问答正确率计算,定位具体错误、生成文本梯度;
  2. 最终评测指标RevalR_{\mathrm{eval}}Reval:统一四大维度、八大影视维度聚合分数,仅用于横向对比基线,不参与训练优化。

KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲R_{\mathrm{rewa...单镜头计算公式:

KaTeX parse error: Can't use function '\(' in math mode at position 1: \̲(̲R_{\mathrm{rewa...

RevalR_{\mathrm{eval}}Reval加权聚合公式:

Reval(V,V^)=∑d=1Dωdeval(1−rdeval),∑d=1Dωdeval=1R_{\mathrm{eval}}(V,\hat{V})=\sum_{d=1}^{D}\omega_{d}^{\mathrm{eval}}(1-r_{d}^{\mathrm{eval}}),\quad\sum_{d=1}^{D}\omega_{d}^{\mathrm{eval}}=1Reval(V,V^)=d=1∑Dωdeval(1−rdeval),d=1∑Dωdeval=1

4.3.2 外层循环:数据无关编码策略伪训练

批量输入视频序列,迭代更新镜头级提示词PshotP_{shot}Pshot;每轮生成候选策略后,通过回放记忆 验证历史视频性能,防止过拟合遗忘。

接纳门控三大约束:当前视频奖励提升、视觉指标小幅下降可控、历史回放指标不衰退。完整伪训练流程见算法1。

4.3.3 内层循环:数据驱动图谱精细化修正

编码策略冻结后,对当前视频图谱迭代优化,分关键帧修正完整镜头修正两种模式;通过抗退化门控过滤会降低重建质量的候选图谱,多次修正无改善则移交人工调整。完整流程见算法2。

5 实验

5.1 实验配置

5.1.1 数据集

伪训练集:6段无重叠公开影视片段;

评测集:18段动画、院线电影、AI短片,共129个镜头、246个关键帧,全程与训练集无交集。

5.1.2 模型基座

理解/评测模型:(\mathcal{G})emini-3.1-Pro-Preview

文本梯度改写模型:Qwen-3.7-Max

图像生成器:Nano Banana Pro

视频生成器:HappyHorse 1.0

全部大模型权重冻结,仅迭代文本提示策略、图谱文本内容。

5.1.3 四大评测维度
  1. Video(V):原始视频直接对比
  2. Keyframe(KF):关键帧视觉细节对比
  3. V-BC:视频盲反向字幕匹配
  4. KF-BC:关键帧盲反向字幕匹配
    八大评估维度:人物、场景、空间位置、运动、音频、美术风格、运镜、叙事(关键帧评测不含音频)。
    自动评测与人工标注匹配度97.3%。
5.1.4 对比基线

VideoAnalyzer、Storyboard Studio、soap2soap;全部基线共享图像/视频生成器,禁止读取原始像素用于生成,保证公平对比。

5.1.5 自动化图编辑

修改图谱人物/风格节点,自动传播至全部关联镜头,可视化展示跨镜头一致性改写效果。

5.1.6 四大研究问题

RQ1:AVA-Encoder整体重建保真度是否超越现有基线;

RQ2:外层策略伪训练、内层图谱修正各自独立贡献;

RQ3:知识图谱拓扑联动编辑可行性;

RQ4:该表征能否提升各类下游视频生成模型效果。

5.2 RQ1:重建保真度整体结果

表1 各方法重建整体指标(越高越好)

方法 Video(%) KF(%) V-BC(%) KF-BC(%) Overall(%)
VideoAnalyzer 26.1 28.5 9.7 21.7 21.5
Storyboard Studio 16.4 28.6 9.6 23.0 19.4
soap2soap 36.7 39.5 15.8 21.3 28.3
AVA-Encoder(完整) 57.8 73.7 29.7 34.6 49.0
结论:AVA-Encoder全部维度最优,整体指标领先最强基线soap2soap 20.7个百分点。

5.3 RQ2:双循环模块消融实验

表2 模块消融整体指标

实验配置 V KF V-BC KF Overall
单层编码器,无任何循环 35.1 38.4 15.4 21.1 27.5
分层编码器,仅内层图谱修正 52.7 71.8 23.9 33.1 45.4
分层编码器,仅外层策略训练 55.6 68.3 26.6 32.7 45.8
分层编码器,无内外循环 50.7 67.6 21.2 29.9 42.4
人工调校编码策略(无循环) 53.5 68.1 25.8 30.2 44.4
移除所有接纳门控 53.1 67.2 24.3 29.4 43.5
完整AVA-Encoder 57.8 73.7 29.7 34.6 49.0
核心结论:
  1. 分层三级理解相比单层提升18.3个百分点;
  2. 仅外层策略训练:对比人工调校提示词提升1.4%,token从31336降至8052(减少74.3%);
  3. 内外循环同时启用相比无循环基线,整体提升6.6个百分点(相对+15.6%);
  4. 接纳门控有效防止优化退化,增加5.5个百分点收益。

5.4 RQ3:知识图谱可编辑性

图谱支持四类标准化编辑:人物替换、美术风格统一、剧情修改、运镜参数调整;修改单一节点自动遍历所有关联子图,无关镜头保持不变。

图4 (a)现代短片多镜头人物替换;(b)古装剧跨镜头人物统一替换,人物形象全局同步,场景、剧情不受干扰。

5.5 RQ4:下游生成复用实验

表3 有无AVA图谱参考下游生成评分(1-4分)

生成框架 无图谱参考 引入图谱参考 提升维度
MovieAgent 2.47 3.30 人物、叙事、美术
FilmAgent 1.85 2.83 人物、镜头、风格
Anim-Director 1.85 2.50 人物、运镜
VideoStudio 1.90 1.95 运镜、美术
结论:全部主流智能视频生成框架引入AVA图谱后综合质量提升,图谱提供完整标准化叙事、视听先验,降低生成逻辑断裂、人物崩坏概率。

6 结论

本文提出AVA-Encoder智能体原生视频自编码框架,以电影知识图谱作为中间表征,搭配分层编码器、双循环文本梯度优化机制,实现高保真影片编码与重建。

完整系统整体重建指标49.0%,相较最优基线提升20.7个百分点;仅外层策略方案提示词开销降低74.3%,性能优于人工调校提示。图谱支持拓扑联动编辑,可无缝对接各类下游视频智能体。

未来方向:拓展长时序多集剧集图谱、融合音频时序表征、支持交互式图谱可视化编辑工具。

参考文献

(原文参考文献完整保留,见arxiv原文https://arxiv.org/html/2608.12313v1)

附录

附录A 文本梯度与AVA-Encoder自优化原理

A.1 Text(\mathcal{G})rad基础

Text(\mathcal{G})rad将LLM流程建模为文本计算图,以自然语言反馈作为反向梯度,无需数值微分,适配提示词、图谱文本类变量迭代更新。

A.2 AVA-Encoder结构化文本梯度

定义原子修正记录KaTeX parse error: Can't use function '\(' in math mode at position 38: ...u_{i}^{\mathrm{\̲(̲\mathcal{G}\)T}...,存储错误维度、真值事实、重建事实、视听证据、修正指令;批量错误记录聚合生成策略/图谱两类文本梯度,分别用于内外循环更新。

附录B 重建评测全套指标

完整打分流程、四类评测方向、八大维度细则、人工对齐实验数据、VLM评测专用提示词完整原文。

附录C 循环优化所用重建奖励函数

QA问答库构建规则、视频/关键帧问答提示词、奖励函数在内外循环的调用计算流程、阈值参数完整数值。

附录D 双循环接纳门控细则

关键帧/镜头内层修正门控、外层伪训练抗遗忘回放门控、全部阈值、采样规则、伪训练分步伪代码。

附录E 智能体编码器全套系统提示词

初始策略、伪训练后策略、人工调校策略三套中英文完整提示文本。

附录F 基线模型适配与公平性控制

VideoAnalyzer/Storyboard Studio/soap2三套基线适配改造方案;原始像素禁用规则、单镜头提示词token上限1200、每镜头最多5张生成参考图约束、统一图像/视频生成器细节。

附录(\mathcal{G}) 数据集与可复现性

(\mathcal{G}).1 开源电影知识图谱数据集

数万条影视结构化知识图谱,仅开放文本节点,不含原始音视频素材,支持自行对接生成模型渲染成片。

(\mathcal{G}).2 视频库

伪训练6段影视、评测18段影视完整片单、公开数据源链接、训练/测试无重叠划分规则。

附录H 细粒度重建定量附表

V、KF维度分维度完整数值表,对应八大影视维度单项指标。

附录I 消融实验定义与指标差值

全部消融配置单项提升/下降绝对值、相对增益百分比。

附录J 知识图谱构建与编辑完整规范

J.1 图谱存储节点、边完整Schema

J.2 编辑传播四大规则:素材闭合、语义校验、分层更新、分编辑类型子图遍历算法。

附录K 额外定性可视化

多基线重建对比图、风格统一编辑可视化、图谱交互界面截图

附录L 下游故事视频评测细则

无参考人工式打分标准、五大下游评估维度分级规则。

附录M 全套系统原始提示词

编码器、奖励函数、评测、关键帧对比全部中英文提示原文,存放于附件PDF:appendix_prompts/AV-AE-system-prompts.pdf

资源下载链接

论文原文网页:https://arxiv.org/html/2608.12313v1

开源协议:CC BY-NC-ND 4.0

数据集、代码、全套提示词、实验脚本存放于arxiv论文附件;

基线复现完整训练/推理流程见附录F、(\mathcal{G});

内外循环算法伪代码见原文算法1、算法2;

全部消融、定量实验完整表格、可视化图原文附录H-K。

相关推荐
吃好睡好便好3 小时前
说说口罩的佩戴
学习·生活·口罩
fīɡЙtīиɡ ℡3 小时前
大模型结构化输出
人工智能·学习
Dave1205464 小时前
Day17:Agent Memory高级设计——短期记忆、长期记忆与向量语义记忆
人工智能·学习
小唔w4 小时前
2026年AI培训行业观察:主流学习渠道一览
人工智能·学习
美狐美颜sdk4 小时前
直播APP开发技术架构解析:从音视频流到第三方美颜SDK接入的完整方案
大数据·人工智能·音视频·美颜sdk·美颜api
Nan_Shu_6145 小时前
学习:MapVGL 地理信息可视化
学习
皖山文武5 小时前
逻辑代数基础学习笔记--概述
笔记·学习·机器学习
fanged5 小时前
高通学习24--XBL(TODO)
学习
阿童木写作6 小时前
跨境电商图片翻译工具推荐:跨马翻译批量处理视频字幕与抠图
python·音视频