再看多模态OCR视觉token裁剪思路-LayoutLite基于token的隐式布局分析

前面介绍了一篇关于《多模态文档理解视觉token剪枝思路》的方案,今天又看到一篇类似的方案-LayoutLite,其核心背景也是OCR场景中图片上有很多冗余背景token【大量token对应空白边距、纯色背景等无文本信息的冗余区域;这些冗余token会全程参与后续解码器计算,直接推高预填充(prefill)阶段延迟、整体计算量(FLOPs)以及KV缓存的内存占用,成为端到端OCR落地的核心性能短板。】,需要剔除以提升VLM-OCR的效率。LayoutLite 的应用场景是在 token 层面做隐式布局分析,用轻量模块替代显式版面检测,在不改动原有 VLM 主体结构的前提下,实现视觉 token 的精准压缩。

  • 隐式布局分析的含义:

    不同于传统方法显式识别"标题/段落/表格/图片"等布局元素,LayoutLite不输出任何结构化布局标签,而是通过为每个视觉token预测重要性得分,直接保留有效文本区域的token、剔除空白冗余token------相当于在token粒度上隐式完成了"有效内容区/无效背景区"的布局划分,因此被称为token级隐式布局分析

LayoutLite 是一个轻量级、即插即用的中间模块,插入在视觉编码器与语言解码器之间:

  • 输入:视觉编码器输出的多层视觉特征表示
  • 输出:筛选后的精简视觉 token 序列(完整保留原始空间位置信息)
  • 原有 VLM 的编码器、解码器结构无需修改,训练和部署成本低。

方法

1. 多层视觉特征聚合与轻量打分网络

(1)多层视觉特征聚合

聚合视觉编码器不同层级的特征表示:

  • 低层视觉特征包含像素级细节(笔画、纹理),避免遗漏小字号、低对比度的文本;
  • 高层视觉特征包含语义信息(文本/背景的语义区分),提升对有效内容的判断准度。
    多层特征融合后,为每个token生成兼具细节与语义的综合表征,作为打分依据。
(2)轻量级打分网络

基于融合后的特征,通过一个参数量极小的轻量网络,为每个视觉token预测一个重要性得分 ,表征该token对OCR任务的信息价值。

该网络设计极为精简,保证推理时的额外计算开销可以忽略不计。

2. Token筛选与空间位置保留机制

根据每个token的重要性得分,LayoutLite按设定的压缩比例(如保留50%的token)筛选出Top-N个高价值token,直接剔除低信息的冗余token。

设计:所有保留的token完全维持其原始空间位置信息

  • 文档OCR高度依赖版面的二维空间结构(阅读顺序、段落划分、表格行列等),一旦打乱位置或丢失位置编码,解码器将无法正确还原文档语义与格式;
  • LayoutLite仅做"删除冗余token"的稀疏化操作,不改变保留token的相对位置与位置编码,完整保留版面的空间结构信息,从机制上避免了压缩带来的格式与语义误差。

3. 无人工标注的训练范式

LayoutLite的一大核心优势是无需任何人工布局标注即可完成训练,其训练框架结合了强化学习与辅助监督,核心优化目标是"压缩后的OCR效果与原始全量效果一致"。

(1)强化学习建模:将token选择转化为序列决策问题

由于"token留/不留"是离散决策,无法直接通过OCR损失反向传播优化打分网络,因此论文将token选择建模为强化学习问题:

  • 策略网络:即上述的打分网络,输出每个token被保留的概率/得分;
  • 奖励信号 :核心奖励来自OCR输出一致性------将筛选后的token输入解码器得到OCR结果,与全量原始token的OCR结果做对比,二者相似度越高、识别误差越小,奖励值越高。该奖励完全基于模型自身的输出构造,不需要任何人工标注的文本或布局数据。
  • 优化目标 :采用组相对策略优化,通过组内相对优势来计算策略梯度,有效降低强化学习的训练方差,提升训练稳定性。
(2)辅助布局监督信号

为了进一步稳定训练、加速收敛,论文加入了辅助布局监督信号:

  • 该信号无需人工标注,属于无监督/自生成的布局先验(如文本区域的视觉特征统计规律、无监督显著性先验等),用于引导打分网络在训练初期快速建立"文本区域重要、空白区域不重要"的基础判断;
  • 作用是缓解强化学习冷启动难、训练波动大的问题,作为主奖励的补充,不依赖人工标注数据。

实验结果

参考文献

LayoutLite: Token-Level Implicit Layout Analysis for Efficient Document OCR,https://arxiv.org/abs/2607.22200

相关推荐
二狗PPT1 小时前
AI做PPT提示词怎么写,换个写法效果差很多
人工智能·powerpoint
段一凡-华北理工大学1 小时前
AI推动工业智能化转型~系列文章07:分类与诊断算法体系:故障识别的完整工具箱
数据库·人工智能·算法·机器学习·分类·数据挖掘·高炉炼铁智能化
cxr8281 小时前
第 7 章 . 设计哲学回顾与最终说明
人工智能
skywalk81632 小时前
经过多次尝试,在kaggle 双T4训练Qwen2.5-0.5B的正确打开方式是:
人工智能·深度学习·机器学习·qwen2.5·段言
孪生质数-2 小时前
AI Agent 工程实践(一):大模型 API 接入示范
网络·人工智能·ai·chatgpt·github·claude·claudecode
qq_419563092 小时前
机器能思考吗?“——图灵测试、达特茅斯会议与 AI 的诞生
人工智能
维核科技2 小时前
世界模型落地:物理 AI 方案走向商用,机器人“理解“物理世界
人工智能
神神道呵he2 小时前
[深度学习] 大模型学习-RAG技术全景解析
人工智能·深度学习·学习
deepseek232 小时前
750 亿参数只激活 37 亿:LG 开源 K-EXAONE 2.0,与 DeepSeek 的路线之争迎来新玩家
人工智能·ai agent·mcp