再看多模态OCR视觉token裁剪思路-LayoutLite基于token的隐式布局分析前面介绍了一篇关于《多模态文档理解视觉token剪枝思路》的方案,今天又看到一篇类似的方案-LayoutLite,其核心背景也是OCR场景中图片上有很多冗余背景token【大量token对应空白边距、纯色背景等无文本信息的冗余区域;这些冗余token会全程参与后续解码器计算,直接推高预填充(prefill)阶段延迟、整体计算量(FLOPs)以及KV缓存的内存占用,成为端到端OCR落地的核心性能短板。】,需要剔除以提升VLM-OCR的效率。LayoutLite 的应用场景是在 token 层面做隐式布局分析