AAAI 2026 | KTV:基于聚类与Token剪枝的关键帧选取

文章目录

  • [1 论文信息](#1 论文信息)
  • [2 论文主要贡献](#2 论文主要贡献)
  • [3 论文创新点](#3 论文创新点)
  • [4 方法](#4 方法)
    • [4.1 整体框架](#4.1 整体框架)
      • [Stage 1:与问题无关的关键帧选取](#Stage 1:与问题无关的关键帧选取)
      • [Stage 2:关键视觉 Token 选择](#Stage 2:关键视觉 Token 选择)
  • [4.2 具体模块](#4.2 具体模块)
    • [(1)基于 CLS Attention 的 Token 重要性模块](#(1)基于 CLS Attention 的 Token 重要性模块)
    • [(2)Token 冗余性模块](#(2)Token 冗余性模块)
    • [(3)重要性 与 避免冗余性 融合](#(3)重要性 与 避免冗余性 融合)
    • (4)感知问题的Token分配
  • [5 实验分析](#5 实验分析)

1 论文信息

论文题目:KTV: Keyframes and Key Tokens Selection for Efficient Training-Free Video LLMs

论文作者:Baiyang Song, Jun Peng, Yuxin Zhang, Guangyao Chen, Feidiao Yang, Jianyuan Guo

发表单位:厦门大学、鹏城实验室、北京大学、香港城市大学

发表会议期刊:AAAI 2026

代码链接:https://github.com/songbaiyang07-star/KTV

2 论文主要贡献

本文针对Video Large Language Model(Video LLM)在处理长视频时存在的视频冗余和视觉 token 数量过多的问题,提出了一种两阶段的视频压缩框架 KTV(Keyframes and Key Tokens Selection)。

论文主要贡献如下:

  1. 提出了一种无需训练的视频理解框架 KTV,通过关键帧选择和关键视觉 token 选择同时降低视频的时间冗余和空间冗余。

  2. 提出一种基于视觉特征聚类的无关问题关键帧选择方法(Question-Agnostic Keyframe Selection),避免传统基于文本相似度的方法受到问题语义偏置影响。

  3. 提出一种结合 token 重要性(Importance)和 token 冗余性(Redundancy)的视觉 token 筛选方法,在保证语义信息完整性的同时减少输入 LLM 的视觉 token 数量。

3 论文创新点

KTV 的核心思想是:

视频理解中存在两种主要冗余:

  1. 视频帧之间的时间冗余(Temporal Redundancy)
  2. 单帧内部视觉 token 的空间冗余(Spatial Redundancy)

传统方法通常只关注其中一个方面:

  • 均匀采样减少视频帧数量,但是容易遗漏关键事件;
  • CLIP 文本相关性方法依赖问题语义,容易陷入语义陷阱;
  • token剪枝 方法通常只考虑 token 重要性,没有考虑 token 之间的信息重复。

因此,KTV 提出:

V i d e o → K e y f r a m e S e l e c t i o n → K e y T o k e n S e l e c t i o n → L L M Video \rightarrow Keyframe Selection \rightarrow Key Token Selection \rightarrow LLM Video→KeyframeSelection→KeyTokenSelection→LLM

第一阶段:

利用视觉特征聚类选择具有代表性的关键帧,降低时间维度冗余。

第二阶段:

利用 CLS token 注意力衡量 token 重要性,同时利用 token 间相似度衡量冗余性,综合选择最具有信息量的视觉 token。

4 方法

4.1 整体框架

给定一个视频:

V = { I 1 , I 2 , . . . , I T } V=\{I_1,I_2,...,I_T\} V={I1,I2,...,IT}

KTV 包含两个阶段:

Stage 1:与问题无关的关键帧选取

首先利用视觉编码器提取所有视频帧的特征:

{ f 1 , f 2 , . . . , f T } = E d i n o v 2 ( V ) \{f_1,f_2,...,f_T\}=E_{dinov2}(V) {f1,f2,...,fT}=Edinov2(V)

然后利用 K-means 对所有帧特征进行聚类:

F V = { f 1 , f 2 , . . . , f T } F_V=\{f_1,f_2,...,f_T\} FV={f1,f2,...,fT}

将视频帧划分为 m m m 个类别,每个类别选择距离聚类中心最近的帧作为关键帧:

j ∗ = arg ⁡ min ⁡ f j ∈ C i ∣ ∣ f j − c i ∣ ∣ j^*=\arg\min_{f_j\in C_i}||f_j-c_i|| j∗=argfj∈Cimin∣∣fj−ci∣∣

其中:

  • C i C_i Ci 表示第 i i i 个聚类;
  • c i c_i ci 表示该聚类中心;
  • j ∗ j^* j∗ 表示选出的代表帧。

相比基于文本-视频相似度的方法,该方法不依赖问题信息,可以保持视频整体内容多样性。


Stage 2:关键视觉 Token 选择

对于每一个关键帧:

利用视觉编码器得到 token 特征:

F i = E v i s ( I i ′ ) = { t i , 1 , . . . , t i , L } F_i=E_{vis}(I'i)=\{t{i,1},...,t_{i,L}\} Fi=Evis(Ii′)={ti,1,...,ti,L}

其中:

  • L L L 为视觉 token 数量;
  • t i , j t_{i,j} ti,j 表示第 i i i 个关键帧中的第 j j j 个视觉 token。

随后计算每个 token 的重要性和冗余性,并选择 top-k token 输入 LLM。

4.2 具体模块

(1)基于 CLS Attention 的 Token 重要性模块

为了判断一个视觉 token 是否包含重要语义信息,KTV 使用 CLS token 与视觉 token 之间的注意力关系作为重要性指标。

Transformer Attention 计算方式:

A t t e n t i o n ( Q , K ) = s o f t m a x ( Q K T d ) Attention(Q,K)=softmax(\frac{QK^T}{\sqrt d}) Attention(Q,K)=softmax(d QKT)

其中 CLS token 作为 Query:

Q = W Q t i c l s Q=W_Qt_i^{cls} Q=WQticls

视觉 token 作为 Key:

K = W K t i , j K=W_Kt_{i,j} K=WKti,j

因此,第 j j j 个 token 的重要性定义为:

S i , j c l s = . s o f t m a x ( ( W Q t i c l s ) ( W K t i , j ) T d ) S^{cls}{i,j} =. softmax ( \frac{ (W_Qt_i^{cls}) (W_Kt{i,j})^T } {\sqrt d} ) Si,jcls=.softmax(d (WQticls)(WKti,j)T)

其中:

  • W Q W_Q WQ 和 W K W_K WK 为注意力映射矩阵;
  • t i c l s t_i^{cls} ticls 为第 i i i 个关键帧对应 CLS token;
  • t i , j t_{i,j} ti,j 为视觉 token。

该分数表示:

CLS token 对当前视觉 token 的关注程度。

分数越高,说明该 token 对整体图像语义越重要。


(2)Token 冗余性模块

仅根据重要性选择 token 会导致大量相似 token 被保留 。因此 KTV 引入 token 冗余度。

利用 token 与其他 token 的平均余弦相似度:

S i , j s i m = . 1 L − 1 ∑ k = 1 , k ≠ j L f i , j ⋅ f i , k ∣ ∣ f i , j ∣ ∣ ∣ ∣ f i , k ∣ ∣ S^{sim}{i,j} =. \frac{1}{L-1} \sum{k=1,k\neq j}^{L} \frac{ f_{i,j}\cdot f_{i,k} } { ||f_{i,j}||||f_{i,k}|| } Si,jsim=.L−11k=1,k=j∑L∣∣fi,j∣∣∣∣fi,k∣∣fi,j⋅fi,k

其中:

  • f i , j f_{i,j} fi,j 表示第 j j j 个视觉 token 特征;
  • cosine similarity 越高,说明该 token 与其他 token 越相似;
  • 相似度越高表示信息冗余越严重。

(3)重要性 与 避免冗余性 融合

由于两个 score 的范围不同,首先进行归一化:

重要性归一化:

N o r m ( S i , j c l s ) = . S i , j c l s − m i n ( S i c l s ) m a x ( S i c l s ) − m i n ( S i c l s ) Norm(S^{cls}{i,j}) =. \frac{ S^{cls}{i,j}-min(S^{cls}_i) } { max(S^{cls}_i)-min(S^{cls}_i) } Norm(Si,jcls)=.max(Sicls)−min(Sicls)Si,jcls−min(Sicls)

冗余性归一化:

N o r m ( S i , j s i m ) = . S i , j s i m − m i n ( S i s i m ) m a x ( S i s i m ) − m i n ( S i s i m ) Norm(S^{sim}{i,j}) =. \frac{ S^{sim}{i,j}-min(S^{sim}_i) } { max(S^{sim}_i)-min(S^{sim}_i) } Norm(Si,jsim)=.max(Sisim)−min(Sisim)Si,jsim−min(Sisim)

最终 token 得分:

S i , j = . α N o r m ( S i , j c l s ) + ( 1 − α ) ( 1 − N o r m ( S i , j s i m ) ) S_{i,j} =. \alpha Norm(S^{cls}{i,j}) + (1-\alpha)(1-Norm(S^{sim}{i,j})) Si,j=.αNorm(Si,jcls)+(1−α)(1−Norm(Si,jsim))

其中:

  • α \alpha α 控制重要性和多样性的权重;
  • 第一项表示 token 的语义重要程度;
  • 第二项表示 token 的非冗余程度。

t o p − k top-k top−k

得分最高的视觉 token 输入 LLM。


(4)感知问题的Token分配

为了进一步提升效率,KTV 根据问题相关性动态调整不同关键帧保留 token 数量。

计算关键帧与问题之间的 CLIP 相似度:

S i Q = C L I P − S I M ( I i ′ , Q ) S_i^Q=CLIP-SIM(I'_i,Q) SiQ=CLIP−SIM(Ii′,Q)

相关性高的关键帧保留更多 token;

相关性低的关键帧减少 token。

5 实验分析

表 1:KTV 与现有模型在多项选择视频问答基准上的性能对比。所有模型按大语言模型参数量(7B 或 34B)、以及是否为有训练型 / 免训练型进行分组。加粗字体表示 7B 参数量模型中的最优性能,下划线字体表示 34B 参数量模型中的最优性能。

NExTQA :经典视频问答基准,侧重时序因果、动作逻辑推理,考察对事件先后关系的理解

Ego Schema : 第一人称长视频问答基准,侧重长时序内容记忆、细节理解,视频普遍时长较长

Intent QA :视频意图推理基准,核心考察对人物行为目的与动机的推断能力

STAR :场景化推理基准,侧重真实场景下的空间关系、状态变化推理

Video MME :多模态综合能力基准,覆盖多维度视频理解能力的综合评测

MVBench :多任务视频理解基准,涵盖动作识别、时序判断、因果推理等多类子任务

消融实验

相关推荐
这个DBA有点耶20 小时前
实时数据集成工具选型2026:从CDC到数据同步的完整指南
数据库·数据挖掘·dba
2601_950760791 天前
树突状细胞亚群的分类、标志物与功能特征
人工智能·分类·数据挖掘·蛋白
慧都小项1 天前
夜间Web回归跑到一半停了?TestComplete 15.83提升批量测试稳定性
前端·测试工具·数据挖掘·回归·汽车·web
逻辑君1 天前
ANNA 意识驱动 RAG 系统
人工智能·机器学习·数据挖掘
民乐团扒谱机1 天前
【读论文】2005 一种旋律转录的分类方法A classification approach to melody transcription[C]
人工智能·分类·数据挖掘
十三画者2 天前
【文献分享】KCFtools:基于k-mer的无比对基因组变异检测与基因型矩阵构建工具
人工智能·深度学习·数据挖掘·数据分析
cspttty2 天前
会计专业大学期间考什么证
大数据·数据库·人工智能·数据挖掘
空堂与归4 天前
用户分群找不到规律?用K-Means聚类算法自动发现数据模式
算法·机器学习·kmeans·聚类
十三画者5 天前
【文献分享】ConfRetro:融合3D构象信息的逆合成预测Transformer框架
人工智能·深度学习·数据挖掘·数据分析·transformer·数据可视化