文章目录
- [1 论文信息](#1 论文信息)
- [2 论文主要贡献](#2 论文主要贡献)
- [3 论文创新点](#3 论文创新点)
- [4 方法](#4 方法)
-
- [4.1 整体框架](#4.1 整体框架)
-
- [Stage 1:与问题无关的关键帧选取](#Stage 1:与问题无关的关键帧选取)
- [Stage 2:关键视觉 Token 选择](#Stage 2:关键视觉 Token 选择)
- [4.2 具体模块](#4.2 具体模块)
-
- [(1)基于 CLS Attention 的 Token 重要性模块](#(1)基于 CLS Attention 的 Token 重要性模块)
- [(2)Token 冗余性模块](#(2)Token 冗余性模块)
- [(3)重要性 与 避免冗余性 融合](#(3)重要性 与 避免冗余性 融合)
- (4)感知问题的Token分配
- [5 实验分析](#5 实验分析)
1 论文信息
论文题目:KTV: Keyframes and Key Tokens Selection for Efficient Training-Free Video LLMs
论文作者:Baiyang Song, Jun Peng, Yuxin Zhang, Guangyao Chen, Feidiao Yang, Jianyuan Guo
发表单位:厦门大学、鹏城实验室、北京大学、香港城市大学
发表会议期刊:AAAI 2026
代码链接:https://github.com/songbaiyang07-star/KTV
2 论文主要贡献
本文针对Video Large Language Model(Video LLM)在处理长视频时存在的视频冗余和视觉 token 数量过多的问题,提出了一种两阶段的视频压缩框架 KTV(Keyframes and Key Tokens Selection)。
论文主要贡献如下:
-
提出了一种无需训练的视频理解框架 KTV,通过关键帧选择和关键视觉 token 选择同时降低视频的时间冗余和空间冗余。
-
提出一种基于视觉特征聚类的无关问题关键帧选择方法(Question-Agnostic Keyframe Selection),避免传统基于文本相似度的方法受到问题语义偏置影响。
-
提出一种结合 token 重要性(Importance)和 token 冗余性(Redundancy)的视觉 token 筛选方法,在保证语义信息完整性的同时减少输入 LLM 的视觉 token 数量。

3 论文创新点
KTV 的核心思想是:
视频理解中存在两种主要冗余:
- 视频帧之间的时间冗余(Temporal Redundancy)
- 单帧内部视觉 token 的空间冗余(Spatial Redundancy)
传统方法通常只关注其中一个方面:
- 均匀采样减少视频帧数量,但是容易遗漏关键事件;
- CLIP 文本相关性方法依赖问题语义,容易陷入语义陷阱;
- token剪枝 方法通常只考虑 token 重要性,没有考虑 token 之间的信息重复。
因此,KTV 提出:
V i d e o → K e y f r a m e S e l e c t i o n → K e y T o k e n S e l e c t i o n → L L M Video \rightarrow Keyframe Selection \rightarrow Key Token Selection \rightarrow LLM Video→KeyframeSelection→KeyTokenSelection→LLM
第一阶段:
利用视觉特征聚类选择具有代表性的关键帧,降低时间维度冗余。
第二阶段:
利用 CLS token 注意力衡量 token 重要性,同时利用 token 间相似度衡量冗余性,综合选择最具有信息量的视觉 token。
4 方法
4.1 整体框架

给定一个视频:
V = { I 1 , I 2 , . . . , I T } V=\{I_1,I_2,...,I_T\} V={I1,I2,...,IT}
KTV 包含两个阶段:
Stage 1:与问题无关的关键帧选取
首先利用视觉编码器提取所有视频帧的特征:
{ f 1 , f 2 , . . . , f T } = E d i n o v 2 ( V ) \{f_1,f_2,...,f_T\}=E_{dinov2}(V) {f1,f2,...,fT}=Edinov2(V)
然后利用 K-means 对所有帧特征进行聚类:
F V = { f 1 , f 2 , . . . , f T } F_V=\{f_1,f_2,...,f_T\} FV={f1,f2,...,fT}
将视频帧划分为 m m m 个类别,每个类别选择距离聚类中心最近的帧作为关键帧:
j ∗ = arg min f j ∈ C i ∣ ∣ f j − c i ∣ ∣ j^*=\arg\min_{f_j\in C_i}||f_j-c_i|| j∗=argfj∈Cimin∣∣fj−ci∣∣
其中:
- C i C_i Ci 表示第 i i i 个聚类;
- c i c_i ci 表示该聚类中心;
- j ∗ j^* j∗ 表示选出的代表帧。
相比基于文本-视频相似度的方法,该方法不依赖问题信息,可以保持视频整体内容多样性。
Stage 2:关键视觉 Token 选择
对于每一个关键帧:
利用视觉编码器得到 token 特征:
F i = E v i s ( I i ′ ) = { t i , 1 , . . . , t i , L } F_i=E_{vis}(I'i)=\{t{i,1},...,t_{i,L}\} Fi=Evis(Ii′)={ti,1,...,ti,L}
其中:
- L L L 为视觉 token 数量;
- t i , j t_{i,j} ti,j 表示第 i i i 个关键帧中的第 j j j 个视觉 token。
随后计算每个 token 的重要性和冗余性,并选择 top-k token 输入 LLM。
4.2 具体模块
(1)基于 CLS Attention 的 Token 重要性模块

为了判断一个视觉 token 是否包含重要语义信息,KTV 使用 CLS token 与视觉 token 之间的注意力关系作为重要性指标。
Transformer Attention 计算方式:
A t t e n t i o n ( Q , K ) = s o f t m a x ( Q K T d ) Attention(Q,K)=softmax(\frac{QK^T}{\sqrt d}) Attention(Q,K)=softmax(d QKT)
其中 CLS token 作为 Query:
Q = W Q t i c l s Q=W_Qt_i^{cls} Q=WQticls
视觉 token 作为 Key:
K = W K t i , j K=W_Kt_{i,j} K=WKti,j
因此,第 j j j 个 token 的重要性定义为:
S i , j c l s = . s o f t m a x ( ( W Q t i c l s ) ( W K t i , j ) T d ) S^{cls}{i,j} =. softmax ( \frac{ (W_Qt_i^{cls}) (W_Kt{i,j})^T } {\sqrt d} ) Si,jcls=.softmax(d (WQticls)(WKti,j)T)
其中:
- W Q W_Q WQ 和 W K W_K WK 为注意力映射矩阵;
- t i c l s t_i^{cls} ticls 为第 i i i 个关键帧对应 CLS token;
- t i , j t_{i,j} ti,j 为视觉 token。
该分数表示:
CLS token 对当前视觉 token 的关注程度。
分数越高,说明该 token 对整体图像语义越重要。
(2)Token 冗余性模块
仅根据重要性选择 token 会导致大量相似 token 被保留 。因此 KTV 引入 token 冗余度。
利用 token 与其他 token 的平均余弦相似度:
S i , j s i m = . 1 L − 1 ∑ k = 1 , k ≠ j L f i , j ⋅ f i , k ∣ ∣ f i , j ∣ ∣ ∣ ∣ f i , k ∣ ∣ S^{sim}{i,j} =. \frac{1}{L-1} \sum{k=1,k\neq j}^{L} \frac{ f_{i,j}\cdot f_{i,k} } { ||f_{i,j}||||f_{i,k}|| } Si,jsim=.L−11k=1,k=j∑L∣∣fi,j∣∣∣∣fi,k∣∣fi,j⋅fi,k
其中:
- f i , j f_{i,j} fi,j 表示第 j j j 个视觉 token 特征;
- cosine similarity 越高,说明该 token 与其他 token 越相似;
- 相似度越高表示信息冗余越严重。
(3)重要性 与 避免冗余性 融合
由于两个 score 的范围不同,首先进行归一化:
重要性归一化:
N o r m ( S i , j c l s ) = . S i , j c l s − m i n ( S i c l s ) m a x ( S i c l s ) − m i n ( S i c l s ) Norm(S^{cls}{i,j}) =. \frac{ S^{cls}{i,j}-min(S^{cls}_i) } { max(S^{cls}_i)-min(S^{cls}_i) } Norm(Si,jcls)=.max(Sicls)−min(Sicls)Si,jcls−min(Sicls)
冗余性归一化:
N o r m ( S i , j s i m ) = . S i , j s i m − m i n ( S i s i m ) m a x ( S i s i m ) − m i n ( S i s i m ) Norm(S^{sim}{i,j}) =. \frac{ S^{sim}{i,j}-min(S^{sim}_i) } { max(S^{sim}_i)-min(S^{sim}_i) } Norm(Si,jsim)=.max(Sisim)−min(Sisim)Si,jsim−min(Sisim)
最终 token 得分:
S i , j = . α N o r m ( S i , j c l s ) + ( 1 − α ) ( 1 − N o r m ( S i , j s i m ) ) S_{i,j} =. \alpha Norm(S^{cls}{i,j}) + (1-\alpha)(1-Norm(S^{sim}{i,j})) Si,j=.αNorm(Si,jcls)+(1−α)(1−Norm(Si,jsim))
其中:
- α \alpha α 控制重要性和多样性的权重;
- 第一项表示 token 的语义重要程度;
- 第二项表示 token 的非冗余程度。
t o p − k top-k top−k
得分最高的视觉 token 输入 LLM。
(4)感知问题的Token分配
为了进一步提升效率,KTV 根据问题相关性动态调整不同关键帧保留 token 数量。
计算关键帧与问题之间的 CLIP 相似度:
S i Q = C L I P − S I M ( I i ′ , Q ) S_i^Q=CLIP-SIM(I'_i,Q) SiQ=CLIP−SIM(Ii′,Q)
相关性高的关键帧保留更多 token;
相关性低的关键帧减少 token。
5 实验分析

表 1:KTV 与现有模型在多项选择视频问答基准上的性能对比。所有模型按大语言模型参数量(7B 或 34B)、以及是否为有训练型 / 免训练型进行分组。加粗字体表示 7B 参数量模型中的最优性能,下划线字体表示 34B 参数量模型中的最优性能。
NExTQA :经典视频问答基准,侧重时序因果、动作逻辑推理,考察对事件先后关系的理解
Ego Schema : 第一人称长视频问答基准,侧重长时序内容记忆、细节理解,视频普遍时长较长
Intent QA :视频意图推理基准,核心考察对人物行为目的与动机的推断能力
STAR :场景化推理基准,侧重真实场景下的空间关系、状态变化推理
Video MME :多模态综合能力基准,覆盖多维度视频理解能力的综合评测
MVBench :多任务视频理解基准,涵盖动作识别、时序判断、因果推理等多类子任务
消融实验
