前面介绍了一篇关于《多模态文档理解视觉token剪枝思路》的方案,今天又看到一篇类似的方案-LayoutLite,其核心背景也是OCR场景中图片上有很多冗余背景token【大量token对应空白边距、纯色背景等无文本信息的冗余区域;这些冗余token会全程参与后续解码器计算,直接推高预填充(prefill)阶段延迟、整体计算量(FLOPs)以及KV缓存的内存占用,成为端到端OCR落地的核心性能短板。】,需要剔除以提升VLM-OCR的效率。LayoutLite 的应用场景是在 token 层面做隐式布局分析,用轻量模块替代显式版面检测,在不改动原有 VLM 主体结构的前提下,实现视觉 token 的精准压缩。
-
隐式布局分析的含义:
不同于传统方法显式识别"标题/段落/表格/图片"等布局元素,LayoutLite不输出任何结构化布局标签,而是通过为每个视觉token预测重要性得分,直接保留有效文本区域的token、剔除空白冗余token------相当于在token粒度上隐式完成了"有效内容区/无效背景区"的布局划分,因此被称为token级隐式布局分析。

LayoutLite 是一个轻量级、即插即用的中间模块,插入在视觉编码器与语言解码器之间:
- 输入:视觉编码器输出的多层视觉特征表示
- 输出:筛选后的精简视觉 token 序列(完整保留原始空间位置信息)
- 原有 VLM 的编码器、解码器结构无需修改,训练和部署成本低。
方法

1. 多层视觉特征聚合与轻量打分网络
(1)多层视觉特征聚合
聚合视觉编码器不同层级的特征表示:
- 低层视觉特征包含像素级细节(笔画、纹理),避免遗漏小字号、低对比度的文本;
- 高层视觉特征包含语义信息(文本/背景的语义区分),提升对有效内容的判断准度。
多层特征融合后,为每个token生成兼具细节与语义的综合表征,作为打分依据。
(2)轻量级打分网络
基于融合后的特征,通过一个参数量极小的轻量网络,为每个视觉token预测一个重要性得分 ,表征该token对OCR任务的信息价值。
该网络设计极为精简,保证推理时的额外计算开销可以忽略不计。
2. Token筛选与空间位置保留机制
根据每个token的重要性得分,LayoutLite按设定的压缩比例(如保留50%的token)筛选出Top-N个高价值token,直接剔除低信息的冗余token。
设计:所有保留的token完全维持其原始空间位置信息。
- 文档OCR高度依赖版面的二维空间结构(阅读顺序、段落划分、表格行列等),一旦打乱位置或丢失位置编码,解码器将无法正确还原文档语义与格式;
- LayoutLite仅做"删除冗余token"的稀疏化操作,不改变保留token的相对位置与位置编码,完整保留版面的空间结构信息,从机制上避免了压缩带来的格式与语义误差。
3. 无人工标注的训练范式
LayoutLite的一大核心优势是无需任何人工布局标注即可完成训练,其训练框架结合了强化学习与辅助监督,核心优化目标是"压缩后的OCR效果与原始全量效果一致"。
(1)强化学习建模:将token选择转化为序列决策问题
由于"token留/不留"是离散决策,无法直接通过OCR损失反向传播优化打分网络,因此论文将token选择建模为强化学习问题:
- 策略网络:即上述的打分网络,输出每个token被保留的概率/得分;
- 奖励信号 :核心奖励来自OCR输出一致性------将筛选后的token输入解码器得到OCR结果,与全量原始token的OCR结果做对比,二者相似度越高、识别误差越小,奖励值越高。该奖励完全基于模型自身的输出构造,不需要任何人工标注的文本或布局数据。
- 优化目标 :采用组相对策略优化,通过组内相对优势来计算策略梯度,有效降低强化学习的训练方差,提升训练稳定性。
(2)辅助布局监督信号
为了进一步稳定训练、加速收敛,论文加入了辅助布局监督信号:
- 该信号无需人工标注,属于无监督/自生成的布局先验(如文本区域的视觉特征统计规律、无监督显著性先验等),用于引导打分网络在训练初期快速建立"文本区域重要、空白区域不重要"的基础判断;
- 作用是缓解强化学习冷启动难、训练波动大的问题,作为主奖励的补充,不依赖人工标注数据。

实验结果





参考文献
LayoutLite: Token-Level Implicit Layout Analysis for Efficient Document OCR,https://arxiv.org/abs/2607.22200