多模态文档解析后处理开源模型:MinerU-Popo方案思路提升RAG性能

目前各类的文档解析方案(VLM-OCR)都是基于【单页】文档进行解析,输出每页文字、表格、图片+坐标框,但存在4类跨页缺点:

  1. 段落跨页被分页切割、文本断裂;
  2. 大表格分页拆分,上下表身割裂;
  3. 多级标题(一级/二级/三级标题)层级混乱、从属关系丢失;
  4. 插图和对应正文分离,图文无法绑定。

在RAG场景,需要全书/文档连贯的文档级结构化数据

MinerU-Popo是一个后处理方案,在不改动原有VLM-OCR模型后对文档级结构进行重构。

方法架构

整体方案针对4类跨页缺点基于Qwen3-VL-4B构造4个任务各自独立数据集进行微调。对于【跨页文本截断、表格截断】,定义成二分类任务;

对于【标题层级重构】,定义成开放层级(1、2、3...n)预测;

图文关联匹配(图片和图注 / 正文描述分散在不同页面,绑定图文)】,预测文字与其关联的图像或表格。

最终四项任务全部跑完后,所有零散页面元素被组装为文档树结构

全书(H0)→一级标题H1→二级H2→(段落/完整表格/绑定图片),直接适配RAG知识库入库。

实验评测

参考文献

MinerU-Popo: Universal Post-Processing Model for Structured Document Parsing,https://arxiv.org/abs/2605.24973

往期相关

多模态文档解析的开源项目模型技术方案都在《文档智能专栏》,如:

...

相关推荐
ShallWeL13 分钟前
【Agent工程】(6)—— 危险写操作与二次确认
人工智能·agent·工作流·智能体
具身AGI18 分钟前
基座模型架构之争,物理AI 人类学习路线 的双脑答案
人工智能·学习·架构
DeepIntelli18 分钟前
GEO服务、传统网页优化与AI问答引流的区别:从工程视角看三者的目标、链路与验收方式
人工智能
SmartBrain19 分钟前
以史为鉴,对AI时代企业数字化转型的启示
人工智能·架构·创业创新
阿宁学科技术库23 分钟前
关于“库库AI”在股票投研场景实用性的技术观察
大数据·人工智能·职场和发展
AR-26710-37 分钟前
机器学习复习Day8——异常检测
人工智能·python·机器学习·scikit-learn
TAN-90°-42 分钟前
Deep Learning for Computer Vision——Attention and Transformers
人工智能·深度学习·神经网络·机器学习·计算机视觉·cnn·机器翻译
Profile排查笔记43 分钟前
指纹浏览器手机版怎么选?从本地 App 到云端 Android 的实现方式解析
前端·人工智能·后端·自动化
shiter1 小时前
舍筏 · 观异 · 破执:中国人的创新审视三问
人工智能·程序人生
Henry-SAP1 小时前
SAP MRP类型与计划策略配置精髓解析
人工智能·云原生·sap·erp