【MLLM】文档多模态MinerU2.5-Pro模型

note

  • 创新点:1)留 MinerU2.5 的 1.2B 参数架构,主要改动点是训练数据从不足 1000 万页扩至 6550 万;2)对齐ppocr-vl,加了流程图解析;3)表格带图片、表格合并、段落合并功能。

文章目录

一、MinerU2.5-Pro模型

【文档多模态模型进展】MinerU2.5-Pro更新,主要特点是保留 MinerU2.5 的 1.2B 参数架构,主要改动点是训练数据从不足 1000 万页扩至 6550 万,工作报告在:MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale,https://arxiv.org/pdf/2604.04771,

代码在: https://github.com/opendatalab/MinerU,

模型权重在: https://huggingface.co/opendatalab/MinerU2.5-Pro-2604-1.2B,

核心点:

1)看数据。

Step1.多样性与难度感知采样(DDAS)【先对全部PDF页面做ViT-Base嵌入+K-Means聚类,再做页面级与元素级双粒度采样;简单簇下采样、困难/小簇上采样,纠正长尾分布偏移,最终把训练数据从不足1000万页扩充到6550万页,覆盖复杂嵌套表格、稠密公式、非常规版式等高难度场景】

->Step2.跨模型一致性验证(CMCV)【用MinerU2.5、PaddleOCR-VL、Qwen3-VL-30B多个异构模型交叉验证,按文本编辑距离、表格TEDS、公式CDM计算一致性,自动划分三级难度:简单60%、中等25%、困难15%;简单/中等样本直接用多模型共识做可靠自动标注,不用人工】

->Step3.判别-精炼标注流水线【针对困难样本,采用"渲染→视觉对比→迭代修正"机制:把模型输出的LaTeX公式/HTML表格重新渲染成图像,和原图对比让模型直观识别错误,多轮迭代修正标注,提升难样本标注准确率】

->Step4.目标专家标注【对自动修正仍无法解决的极难样本,优先分配标注资源;用Gemini3Pro预标注+专业人员精修,最终产出19.2万条人工标注数据,只聚焦模型最薄弱、提升最大的场景】

->Step5.分层数据打包与供给【按数据质量与难度分层输出:6550万页易/中等样本用于大规模预训练;390万混合样本(含19.2万人工标注)用于难样本微调;19.2万高质量样本用于GRPO强化学习对齐】;

2)训练方式:

Step1.大规模预训练(Stage1)【使用数据引擎产出的6550万页简单+中等难度自动标注样本,覆盖文本、公式、表格、版面、图像分析全任务;全参数可训练,构建全面、均衡的文档解析基础能力,】

->Step2.高质量难样本微调(Stage2)【使用390万混合样本,其中包含19.2万条专家标注难样本,搭配不同比例的回放数据防止遗忘,重点强化复杂表格、稠密公式等困难场景】

->Step3.GRPO强化学习对齐(Stage3)【使用19.2万高质量专家标注样本,以文本编辑距离、公式CDM、表格TEDS、布局IoU为直接奖励】。

相关推荐
深圳市快瞳科技有限公司2 天前
个体识别、行为解读、健康管理:多模态宠物AI大模型的场景化落地
人工智能·算法·计算机视觉·大模型·多模态·宠物·宠物ai识别
山顶夕景3 天前
【VQA】VideoChat3长视频理解模型
音视频·多模态·视频理解·长视频
猫先生Mr.Mao5 天前
世界模型之HY-World 2.0详解:生成完还能走进去——如何把文本、照片和视频变成可探索的 3D 世界
多模态·论文解读·3dgs·世界模型
GoAI5 天前
# AI Agent 记忆框架横向对比报告总结
人工智能·大模型·llm·多模态
deepseek238 天前
MiniMax H3 全模态模型拆解:2K 视频成本被腰斩背后,H3-VAE 和 In-context Regeneration 做了什么
人工智能·多模态·视频生成
带娃的IT创业者9 天前
Inkling:当开源模型开始思考“如何思考”
人工智能·开源·大语言模型·多模态·moe·开源模型·inkling
余俊晖9 天前
多模态大模型细粒度视觉理解:Vision-OPD在线策略自蒸馏技术方案概述
人工智能·深度学习·算法·多模态·opd
余俊晖9 天前
再看多模态OCR视觉token裁剪思路-LayoutLite基于token的隐式布局分析
人工智能·ocr·多模态
HyperAI超神经9 天前
15亿参数挑战机器人控制,MiniCPM-RobotManip正式开源;覆盖文本/图/视频/动作序列,英伟达发布全模态模型Cosmos3-Edge
人工智能·深度学习·机器人·多模态·图像生成·具身智能·智能体
不爱记笔记9 天前
多模态AI如何理解视频内容?从视觉、语音到语义的三层技术拆解
人工智能·自然语言处理·nlp·音视频·多模态