文档解析工具汇总

自己收集了很多文档解析工具,整体感觉mineru最好用,mineru同时支持大模型与小模型两种技术路线,比较靠谱。其余的项目,也可以酌情选择使用。

基于 OmniDocBench 等基准的评测数据,梳理当前主流文档解析工具的技术路线与定位。


一、评测基准:OmniDocBench

OmniDocBench 是 2024 年 12 月发布的文档解析综合评测基准,覆盖学术论文、教科书、手写笔记、密集排版报纸等 9 种文档类型,支持端到端、任务级和属性级多维度评估,使用 19 种布局类别和 15 种属性标签进行细粒度打分。它已成为当前文档解析领域的事实标准,几乎所有新模型都会在此报告成绩。


二、端到端视觉语言模型

这类工具将文档图像直接输入 VLM,输出结构化文本(Markdown/HTML),无需传统的检测-识别-后处理流水线。

olmocr --- AllenAI 推出的 7B 参数端到端文档解析模型,基于 Qwen2.5-VL 架构,专为 PDF 转 Markdown 优化,在 OlmOCRBench 上表现突出。

OmniParser V2 --- 统一视觉文本解析框架,通过"结构化思维点"(Structured-Points-of-Thought)提示将文本发现、关键信息提取、表格识别和布局分析统一在一个模型中,在 CORD 和 SROIE 等基准上达到 SOTA。

MonkeyOCR --- 华科与金山联合推出的 3B 端到端模型,采用"结构-识别-关系"(SRR)三元组范式。OmniDocBench v1.5 整体 91.02,公式 CDM 89.51,表格 TEDS 88.43;v1.5 英文任务上超过 Qwen2.5-VL-72B 和 Gemini 2.5 Pro,v1.5 进一步超越 Qwen-3-VL-235B 3.86%、Gemini 2.5-Pro 4.98%。单页 0.24 pages/s,多页 0.84 pages/s,单卡 3090 可部署。

Dolphin --- 字节跳动推出的 322M 轻量级文档图像解析模型,采用"先分析后解析"(analyze-then-parse)两阶段范式:第一阶段生成阅读顺序的布局元素序列,第二阶段并行解析各元素内容,在 Fox-Page 和 Dolphin-Page 基准上达到 SOTA,推理速度约 0.17 FPS。

dots.ocr --- 单视觉语言模型统一完成布局检测、文本识别和关系理解三项核心任务,支持 126 种语言,在 OmniDocBench 和自建的 XDocParse 基准上均达到 SOTA,相对提升约 10%。

DeepSeek-OCR / DeepSeek-OCR 2 --- DeepSeek 推出的视觉因果流编码器方案,核心创新是将长上下文通过光学 2D 映射进行压缩,在压缩比 10× 时 OCR 精度达 97%,OmniDocBench v1.5 上整体性能 91.09%,阅读顺序编辑距离从 0.085 降至 0.057;生产环境单卡 A100 日处理 20 万页以上。

Chandra --- 基于 Qwen3-VL 的布局保留 OCR 系统,输出带语义标签和边界框的 HTML,支持复杂布局、手写、表格、公式和图像,在 PDF 表格提取评测中 LLM 得分 8.43/10。

LightOnOCR-2-1B --- 1B 参数以下的轻量级端到端模型,在 PDF 表格提取评测中 LLM 得分高达 9.08/10,接近 Gemini 3 Pro(9.55),推理仅需 30 分钟处理 100 页(单卡 RTX 4090)。

Nanonets-OCR-s --- Nanonets 推出的专用 OCR 模型,在表格提取评测中得分 6.92/10,定位中等偏下,推理需 50 分钟/100 页。

MinerU2.5 / MinerU2.5-Pro --- 上海 AI Lab 推出的解耦两阶段模型(1.2B 参数,Stage I 布局检测 → Stage II 元素识别)。OmniDocBench v1.5 整体 90.67,TEDS-S 92.38、阅读顺序编辑距离 0.044 领先 MonkeyOCR-3B;vLLM 优化后吞吐 2.12 pages/s,是 MonkeyOCR 的 4 倍。最新版 MinerU2.5-Pro(2026.04) 保持 1.2B 架构不变,通过数据工程(难度感知采样、跨模型一致性验证、裁判-精修标注)和三阶段训练(预训练→SFT→GRPO 强化学习),将 OmniDocBench v1.6 整体分从 92.98 提升至 95.69,超越 GLM-OCR、PaddleOCR-VL-1.5、Youtu-Parsing 等专用模型,也超越 Gemini 3 Pro 和 Qwen3-VL-235B。

OCRFlux --- 文档解析领域的专用模型,定位与 LightOnOCR 类似,主打轻量化端到端解析。

HunyuanOCR --- 腾讯混元推出的 OCR 模型,面向中文文档场景优化。

glm-ocr --- 智谱 AI 推出的文档解析模型,基于 GLM 系列架构。

OvisOCR2 --- 多模态文档解析方案,支持视觉丰富的文档理解。

Granite-Docling-258M --- IBM 推出的 258M 参数轻量级文档解析模型,基于 Granite 架构,面向企业级文档处理。


三、HTML 与网页内容提取

MinerU-HTML --- 上海 AI Lab 推出的 HTML 内容提取流水线,将提取任务重构为 0.6B 语言模型的序列标注问题,两阶段架构(Main-HTML 提取 → Markdown 转换),在 WebMainBench(7887 页)上 ROUGE-N F1 达 0.8182,远超 Trafilatura 的 0.6358;代码块保留率 90.93%、公式 93.99%、表格 TEDS 0.7388。已用于构建 7.3T token 的 AICC 预训练语料。


四、传统流水线与专用工具

pp-ocr / pp-structure --- 百度飞桨推出的经典 OCR 流水线,PP-OCR 负责文本检测与识别,PP-Structure 负责文档版面分析、表格识别和关键信息提取,开源生态成熟,工业部署广泛。

rapidocr --- 基于 ONNXRuntime 的高性能 OCR 推理框架,支持多语言、多平台,强调推理速度和易部署性。

GOT-OCR2.0 --- 端到端 OCR 2.0 模型,扩展了传统 OCR 的任务范围,支持更多合成图像解析任务,在效率和性能之间做了明确权衡。

Mathpix --- 商业 API 服务,专注数学公式和 STEM 文档识别,在表格提取评测中得分 8.53/10,定价 0.35-0.50/100 页。

Mistral OCR 3 --- Mistral AI 的商业文档解析 API,表格提取得分 8.89/10,定价 0.20/100 页。

GROBID --- 传统的科学文献解析工具,基于规则提取参考文献、作者、标题等元数据,在 PDF 表格提取评测中作为基线参与对比。

PyMuPDF4LLM --- 基于 PyMuPDF 的规则工具,直接从 PDF 文本层提取内容,速度快但缺乏布局理解能力。


五、Agentic 与智能文档理解

agentic-doc --- 面向 Agent 场景的文档解析方案,强调将文档解析结果直接服务于下游智能体任务。

InSight-doc --- 2026 年 8 月提出的 Agentic 视觉感知框架,将视觉分辨率视为自适应推理资源,从低分辨率开始、选择性放大高分辨率区域,在文档 VQA 基准上比基线提升 4.3-16.4 分,长文档幻觉降低 40% 以上,推理延迟减少 41%-68%。

Logics-Parsing-Omni --- 统一多模态解析框架,覆盖文档、图像、音频、视频四大模态,采用"全景认知基础 + 统一解析对齐"两阶段训练,在 OmniParsingBench 的几何子任务上从 71.53 提升至 85.98。


六、文档转换与格式化工具

Markitdown --- 微软推出的文档转 Markdown 工具,支持多种格式(PDF、Word、PPT 等)的统一转换,强调结构保留和可读性。

MarkPDFDown --- 专注 PDF 到 Markdown 的转换工具,面向开发者和技术文档场景。

markdownify-mcp --- 基于 MCP(Model Context Protocol)的 Markdown 转换工具,支持将各种文档格式标准化为模型友好的 Markdown 输出。

pdf-craft --- PDF 文档解析与转换工具,支持提取文本、表格、图片等元素并重组为结构化格式。

DocExt --- 文档提取工具,面向大规模文档批处理场景。

DocTr --- 文档转换与识别工具,支持多格式输入输出。

ConvertX --- 开源文档格式转换工具,支持多种格式互转。

Reader-LM --- 文档阅读与解析语言模型,面向长文档理解和信息提取。


七、中文与特定领域方案

openDoc --- 复旦大学推出的 0.1B 参数轻量级文档解析模型,借鉴了百度的部分技术成果,面向资源受限场景。

longcat --- 长文档解析工具,针对超长文档的上下文处理进行优化。

memect-ppx --- 专注表格等金融文档解析的方案,面向财务报表、审计报告等专业场景。

Uni-Parser --- 统一解析框架,支持多种文档类型的统一处理。

TexTAR --- 文本分析与识别工具,面向特定排版格式的文档。

Unlimited-OCR / HPD-Parsing --- 并行解码的 OCR 方案,通过多路径并行解码提升识别速度和准确率。

firecrawl pdf-inspector / anydoc --- Firecrawl 推出的新文档解析工具,面向网页和 PDF 的自动化内容提取。


八、检索精度与检索速度的权衡

文档解析的选型核心矛盾在于:精度与速度不可兼得,且两者对硬件资源的消耗呈非线性增长。以下数据来自统一的表格提取评测(PDF 表格提取,100 页基准,LLM 评分 0-10)和端到端 OCR 流水线基准。

8.1 速度-精度-成本的实测数据

工具 精度 (LLM Score) 推理方式 100 页耗时 100 页成本 参数量
Gemini 3 Pro 9.55 API --- $10.00 ---
Gemini 3 Flash 9.50 API --- $0.57 ---
LightOnOCR-2-1B 9.08 GPU (RTX 4090) 30 min --- 1B
Mistral OCR 3 8.89 API --- $0.20 ---
dots.ocr 8.73 GPU 20 min --- ---
Mathpix 8.53 API --- $0.35-0.50 ---
Chandra 8.43 GPU 4 h --- ---
Qwen3-VL-235B 8.43 API/GPU --- $0.20 235B
MonkeyOCR-3B 8.39 GPU 20 min --- 3B
MinerU2.5 8.43 GPU 47 min --- 1.2B
MinerU2.5-Pro 9.57 GPU --- --- 1.2B
DeepSeek-OCR 5.75 GPU 4 min --- ---
PP-OCRv6_tiny --- A100 0.13 s/页 --- 1.1M
PP-OCRv6_medium --- A100 0.29 s/页 --- 34.5M

8.2 两条路线的实测对比

将工具按技术路线分组后,数据呈现清晰的边界:

大模型/VLM 路线:

工具 精度 100页耗时 参数量 核心特征
Gemini 3 Pro 9.55 API延迟 --- 精度天花板,$10/100页
Gemini 3 Flash 9.50 API延迟 --- 性价比最优,$0.57/100页
MinerU2.5-Pro 9.57 --- 1.2B v1.6基准领先所有,2.12 pages/s
LightOnOCR-2-1B 9.08 30 min 1B 本地部署甜点,RTX 4090
MonkeyOCR-3B 8.39 20 min 3B 公式/多语言强项
dots.ocr 8.73 20 min --- 126语言,双SOTA
Qwen3-VL-235B 8.43 --- 235B 通用VLM,幻觉率19.4%

小模型/传统流水线路线:

工具 文本检测Hmean 100页耗时 参数量 核心特征
PP-OCRv6_medium 86.2% 29 s 34.5M 幻觉率6.8%,工业成熟
PP-OCRv6_tiny --- 13 s 1.1M 速度极端,CPU友好
rapidocr --- --- --- ONNX多后端,跨平台
GOT-OCR2.0 --- --- --- 扩展OCR 2.0任务范围

关键观察:

  1. 精度天花板在MinerU2.5-Pro:v1.6 基准 95.69 分超越所有专用模型和通用 VLM,且 1.2B 参数、2.12 pages/s 的吞吐证明"小参数+好数据"可以击败"大参数+通用训练"。

  2. 速度天花板在PP-OCRv6_tiny:A100 上 0.13 秒/页,但只解决文本检测识别,不处理表格/公式/阅读顺序。这是传统流水线的根本局限。

  3. 幻觉率鸿沟:PP-OCRv6_medium 幻觉率 6.8%,Qwen3-VL-235B 19.4%------专用架构在可控性上碾压通用 VLM。金融、医疗、法律场景必须考虑这个指标。cite🛠web_search:9#0:~:text=PP-OCRv6_medium achieves 93.2% accuracy...Qwen3-VL-235B, 80.6%

  4. "大"不等于"准":Qwen3-VL-235B(235B)表格提取 8.43,不及 1B 的 LightOnOCR(9.08);PP-OCRv6_medium(34.5M)文本检测 Hmean 86.2%,超过 Gemini-3.1-Pro(46.8%)39.4 个百分点。 通用 VLM 在专用 OCR 子任务上的定位精度和幻觉控制显著弱于专用架构。

  5. API vs 本地的成本结构:API 路线(Gemini/Mistral)精度高但存在数据出境、延迟不可控、长期成本累积问题;本地路线(MinerU/MonkeyOCR/PP-OCR)一次性硬件投入,适合日均万页以上的固定场景。

8.3 两条技术路线的推荐

大模型路线(精度优先,预算充足)

适用场景:学术出版、法律合同审计、医疗报告解析、科研论文公式提取------任何对精度和结构完整性要求极高的场景。

首选:MonkeyOCR-3B / MonkeyOCR-v1.5

  • OmniDocBench v1.5 整体 91.02,公式 CDM 89.51,表格 TEDS 88.43;v1.5 英文任务超越 Qwen-3-VL-235B 3.86%、Gemini 2.5-Pro 4.98%

  • 3B 参数,SRR 三元组端到端架构,单页 0.24 pages/s,单卡 3090 可部署

  • 适用场景:公式密集、多语言混合的复杂学术文档

次选:MinerU2.5 / MinerU2.5-Pro

  • OmniDocBench v1.5 整体 90.67,TEDS-S 92.38、阅读顺序编辑距离 0.044 领先 MonkeyOCR;v1.6 上 MinerU2.5-Pro 整体 95.69,超越所有对比模型

  • 1.2B 参数,解耦两阶段架构,vLLM 优化后 2.12 pages/s(MonkeyOCR 的 4 倍)

  • 适用场景:高吞吐流水线、表格精度、阅读顺序敏感的企业文档

MonkeyOCR vs MinerU2.5-Pro 对比:

维度 MonkeyOCR-3B MinerU2.5-Pro
架构 端到端 SRR 统一模型 解耦两阶段流水线
v1.5 整体 91.02 90.67
v1.6 整体 --- 95.69(领先所有)
公式 CDM 89.51 88.46
表格 TEDS-S 91.02 92.38
阅读顺序 0.077 0.044
吞吐 ~0.5 pages/s 2.12 pages/s
参数 3B 1.2B
选型 公式/学术/多语言 表格/企业/高吞吐

次选:dots.ocr

  • OmniDocBench 和 XDocParse 双 SOTA,支持 126 种语言

  • GPU 推理 20 分钟/100 页,精度 8.73

  • 单 VLM 统一完成布局检测、文本识别、关系理解三项任务,部署简单

API 备选:Gemini 3 Flash

  • 精度 9.50,成本 $0.57/100 页

  • 无需本地 GPU,即开即用

  • 适合无本地算力、数据可出境的场景

小模型路线(速度优先,成本敏感)

适用场景:批量文档预处理、实时扫描、边缘设备部署、日志审计、网页内容提取------任何对吞吐量和延迟敏感的场景。

首选:PP-OCRv6 系列(百度飞桨)

  • tiny 版 1.1M 参数,A100 上 0.13 秒/页,Intel Xeon OpenVINO 上 0.20 秒/页

  • medium 版 34.5M 参数,A100 上 0.29 秒/页,精度超过 PP-OCRv5_server 5.1%

  • 幻觉率 6.8%,远低于所有 VLM

  • 支持 50 种语言,ONNX/TensorRT/OpenVINO 多后端,CPU 友好

  • 开源,工业部署成熟

边缘部署:PP-OCRv6_tiny + OpenVINO

  • 1.1M 参数,Intel Xeon 上 0.20 秒/页

  • 无 GPU 依赖,可在普通服务器甚至边缘设备运行

  • 适合日均百万页级的批量预处理流水线

8.4 选型决策树

数据是否敏感/需本地处理?

├─ 是 → 有 GPU?

│ ├─ A100/V100 → MonkeyOCR-3B(精度)或 PP-OCRv6_medium(速度)

│ ├─ RTX 4090 → LightOnOCR-2-1B(甜点)

│ └─ 无 GPU/CPU only → PP-OCRv6_tiny + OpenVINO

└─ 否 → 预算?

├─ 充裕 → Gemini 3 Pro($10/100页,9.55分)

├─ 中等 → Gemini 3 Flash($0.57/100页,9.50分)

└─ 敏感 → Mistral OCR 3($0.20/100页,8.89分)

核心结论:2025-2026 年的文档解析领域已经不存在"一个工具打天下"的选项。大模型路线在端到端复杂文档理解上领先,但代价是延迟、成本和幻觉;小模型路线在速度、可控性和无幻觉上碾压,但局限在文本检测识别,不处理表格结构和公式。正确的做法是根据文档类型和 SLA 要求分层选型------简单扫描件走 PP-OCRv6,复杂学术/金融文档走 MonkeyOCR,API 兜底处理边缘 case。


九、赛道格局总结

路线 代表工具 核心特点
端到端 VLM MonkeyOCR、Dolphin、DeepSeek-OCR、dots.ocr 单模型统一处理,精度高,部署简
轻量级专用 LightOnOCR-2-1B、Granite-Docling-258M、openDoc <1B 参数,边缘部署友好
商业 API Mathpix、Mistral OCR 3、Gemini 3 Pro 精度高,按量付费,延迟可控
HTML 提取 MinerU-HTML、Trafilatura 面向网页和 Common Crawl 场景
传统流水线 pp-ocr/pp-structure、rapidocr、GOT-OCR2.0 成熟稳定,可控性强
Agentic 感知 InSight-doc、agentic-doc 分辨率自适应,服务下游 Agent
多模态统一 Logics-Parsing-Omni 文档+图像+音频+视频统一解析
格式转换 Markitdown、pdf-craft、ConvertX 跨格式标准化输出

当前趋势清晰:端到端 VLM 正在取代传统流水线成为主流,但轻量级模型(<1B)和商业 API 在特定场景仍有不可替代的优势;HTML 提取和 Agentic 感知是两个快速上升的新方向。