自己收集了很多文档解析工具,整体感觉mineru最好用,mineru同时支持大模型与小模型两种技术路线,比较靠谱。其余的项目,也可以酌情选择使用。
基于 OmniDocBench 等基准的评测数据,梳理当前主流文档解析工具的技术路线与定位。
一、评测基准:OmniDocBench
OmniDocBench 是 2024 年 12 月发布的文档解析综合评测基准,覆盖学术论文、教科书、手写笔记、密集排版报纸等 9 种文档类型,支持端到端、任务级和属性级多维度评估,使用 19 种布局类别和 15 种属性标签进行细粒度打分。它已成为当前文档解析领域的事实标准,几乎所有新模型都会在此报告成绩。
二、端到端视觉语言模型
这类工具将文档图像直接输入 VLM,输出结构化文本(Markdown/HTML),无需传统的检测-识别-后处理流水线。
olmocr --- AllenAI 推出的 7B 参数端到端文档解析模型,基于 Qwen2.5-VL 架构,专为 PDF 转 Markdown 优化,在 OlmOCRBench 上表现突出。
OmniParser V2 --- 统一视觉文本解析框架,通过"结构化思维点"(Structured-Points-of-Thought)提示将文本发现、关键信息提取、表格识别和布局分析统一在一个模型中,在 CORD 和 SROIE 等基准上达到 SOTA。
MonkeyOCR --- 华科与金山联合推出的 3B 端到端模型,采用"结构-识别-关系"(SRR)三元组范式。OmniDocBench v1.5 整体 91.02,公式 CDM 89.51,表格 TEDS 88.43;v1.5 英文任务上超过 Qwen2.5-VL-72B 和 Gemini 2.5 Pro,v1.5 进一步超越 Qwen-3-VL-235B 3.86%、Gemini 2.5-Pro 4.98%。单页 0.24 pages/s,多页 0.84 pages/s,单卡 3090 可部署。
Dolphin --- 字节跳动推出的 322M 轻量级文档图像解析模型,采用"先分析后解析"(analyze-then-parse)两阶段范式:第一阶段生成阅读顺序的布局元素序列,第二阶段并行解析各元素内容,在 Fox-Page 和 Dolphin-Page 基准上达到 SOTA,推理速度约 0.17 FPS。
dots.ocr --- 单视觉语言模型统一完成布局检测、文本识别和关系理解三项核心任务,支持 126 种语言,在 OmniDocBench 和自建的 XDocParse 基准上均达到 SOTA,相对提升约 10%。
DeepSeek-OCR / DeepSeek-OCR 2 --- DeepSeek 推出的视觉因果流编码器方案,核心创新是将长上下文通过光学 2D 映射进行压缩,在压缩比 10× 时 OCR 精度达 97%,OmniDocBench v1.5 上整体性能 91.09%,阅读顺序编辑距离从 0.085 降至 0.057;生产环境单卡 A100 日处理 20 万页以上。
Chandra --- 基于 Qwen3-VL 的布局保留 OCR 系统,输出带语义标签和边界框的 HTML,支持复杂布局、手写、表格、公式和图像,在 PDF 表格提取评测中 LLM 得分 8.43/10。
LightOnOCR-2-1B --- 1B 参数以下的轻量级端到端模型,在 PDF 表格提取评测中 LLM 得分高达 9.08/10,接近 Gemini 3 Pro(9.55),推理仅需 30 分钟处理 100 页(单卡 RTX 4090)。
Nanonets-OCR-s --- Nanonets 推出的专用 OCR 模型,在表格提取评测中得分 6.92/10,定位中等偏下,推理需 50 分钟/100 页。
MinerU2.5 / MinerU2.5-Pro --- 上海 AI Lab 推出的解耦两阶段模型(1.2B 参数,Stage I 布局检测 → Stage II 元素识别)。OmniDocBench v1.5 整体 90.67,TEDS-S 92.38、阅读顺序编辑距离 0.044 领先 MonkeyOCR-3B;vLLM 优化后吞吐 2.12 pages/s,是 MonkeyOCR 的 4 倍。最新版 MinerU2.5-Pro(2026.04) 保持 1.2B 架构不变,通过数据工程(难度感知采样、跨模型一致性验证、裁判-精修标注)和三阶段训练(预训练→SFT→GRPO 强化学习),将 OmniDocBench v1.6 整体分从 92.98 提升至 95.69,超越 GLM-OCR、PaddleOCR-VL-1.5、Youtu-Parsing 等专用模型,也超越 Gemini 3 Pro 和 Qwen3-VL-235B。
OCRFlux --- 文档解析领域的专用模型,定位与 LightOnOCR 类似,主打轻量化端到端解析。
HunyuanOCR --- 腾讯混元推出的 OCR 模型,面向中文文档场景优化。
glm-ocr --- 智谱 AI 推出的文档解析模型,基于 GLM 系列架构。
OvisOCR2 --- 多模态文档解析方案,支持视觉丰富的文档理解。
Granite-Docling-258M --- IBM 推出的 258M 参数轻量级文档解析模型,基于 Granite 架构,面向企业级文档处理。
三、HTML 与网页内容提取
MinerU-HTML --- 上海 AI Lab 推出的 HTML 内容提取流水线,将提取任务重构为 0.6B 语言模型的序列标注问题,两阶段架构(Main-HTML 提取 → Markdown 转换),在 WebMainBench(7887 页)上 ROUGE-N F1 达 0.8182,远超 Trafilatura 的 0.6358;代码块保留率 90.93%、公式 93.99%、表格 TEDS 0.7388。已用于构建 7.3T token 的 AICC 预训练语料。
四、传统流水线与专用工具
pp-ocr / pp-structure --- 百度飞桨推出的经典 OCR 流水线,PP-OCR 负责文本检测与识别,PP-Structure 负责文档版面分析、表格识别和关键信息提取,开源生态成熟,工业部署广泛。
rapidocr --- 基于 ONNXRuntime 的高性能 OCR 推理框架,支持多语言、多平台,强调推理速度和易部署性。
GOT-OCR2.0 --- 端到端 OCR 2.0 模型,扩展了传统 OCR 的任务范围,支持更多合成图像解析任务,在效率和性能之间做了明确权衡。
Mathpix --- 商业 API 服务,专注数学公式和 STEM 文档识别,在表格提取评测中得分 8.53/10,定价 0.35-0.50/100 页。
Mistral OCR 3 --- Mistral AI 的商业文档解析 API,表格提取得分 8.89/10,定价 0.20/100 页。
GROBID --- 传统的科学文献解析工具,基于规则提取参考文献、作者、标题等元数据,在 PDF 表格提取评测中作为基线参与对比。
PyMuPDF4LLM --- 基于 PyMuPDF 的规则工具,直接从 PDF 文本层提取内容,速度快但缺乏布局理解能力。
五、Agentic 与智能文档理解
agentic-doc --- 面向 Agent 场景的文档解析方案,强调将文档解析结果直接服务于下游智能体任务。
InSight-doc --- 2026 年 8 月提出的 Agentic 视觉感知框架,将视觉分辨率视为自适应推理资源,从低分辨率开始、选择性放大高分辨率区域,在文档 VQA 基准上比基线提升 4.3-16.4 分,长文档幻觉降低 40% 以上,推理延迟减少 41%-68%。
Logics-Parsing-Omni --- 统一多模态解析框架,覆盖文档、图像、音频、视频四大模态,采用"全景认知基础 + 统一解析对齐"两阶段训练,在 OmniParsingBench 的几何子任务上从 71.53 提升至 85.98。
六、文档转换与格式化工具
Markitdown --- 微软推出的文档转 Markdown 工具,支持多种格式(PDF、Word、PPT 等)的统一转换,强调结构保留和可读性。
MarkPDFDown --- 专注 PDF 到 Markdown 的转换工具,面向开发者和技术文档场景。
markdownify-mcp --- 基于 MCP(Model Context Protocol)的 Markdown 转换工具,支持将各种文档格式标准化为模型友好的 Markdown 输出。
pdf-craft --- PDF 文档解析与转换工具,支持提取文本、表格、图片等元素并重组为结构化格式。
DocExt --- 文档提取工具,面向大规模文档批处理场景。
DocTr --- 文档转换与识别工具,支持多格式输入输出。
ConvertX --- 开源文档格式转换工具,支持多种格式互转。
Reader-LM --- 文档阅读与解析语言模型,面向长文档理解和信息提取。
七、中文与特定领域方案
openDoc --- 复旦大学推出的 0.1B 参数轻量级文档解析模型,借鉴了百度的部分技术成果,面向资源受限场景。
longcat --- 长文档解析工具,针对超长文档的上下文处理进行优化。
memect-ppx --- 专注表格等金融文档解析的方案,面向财务报表、审计报告等专业场景。
Uni-Parser --- 统一解析框架,支持多种文档类型的统一处理。
TexTAR --- 文本分析与识别工具,面向特定排版格式的文档。
Unlimited-OCR / HPD-Parsing --- 并行解码的 OCR 方案,通过多路径并行解码提升识别速度和准确率。
firecrawl pdf-inspector / anydoc --- Firecrawl 推出的新文档解析工具,面向网页和 PDF 的自动化内容提取。
八、检索精度与检索速度的权衡
文档解析的选型核心矛盾在于:精度与速度不可兼得,且两者对硬件资源的消耗呈非线性增长。以下数据来自统一的表格提取评测(PDF 表格提取,100 页基准,LLM 评分 0-10)和端到端 OCR 流水线基准。
8.1 速度-精度-成本的实测数据
| 工具 | 精度 (LLM Score) | 推理方式 | 100 页耗时 | 100 页成本 | 参数量 |
|---|---|---|---|---|---|
| Gemini 3 Pro | 9.55 | API | --- | $10.00 | --- |
| Gemini 3 Flash | 9.50 | API | --- | $0.57 | --- |
| LightOnOCR-2-1B | 9.08 | GPU (RTX 4090) | 30 min | --- | 1B |
| Mistral OCR 3 | 8.89 | API | --- | $0.20 | --- |
| dots.ocr | 8.73 | GPU | 20 min | --- | --- |
| Mathpix | 8.53 | API | --- | $0.35-0.50 | --- |
| Chandra | 8.43 | GPU | 4 h | --- | --- |
| Qwen3-VL-235B | 8.43 | API/GPU | --- | $0.20 | 235B |
| MonkeyOCR-3B | 8.39 | GPU | 20 min | --- | 3B |
| MinerU2.5 | 8.43 | GPU | 47 min | --- | 1.2B |
| MinerU2.5-Pro | 9.57 | GPU | --- | --- | 1.2B |
| DeepSeek-OCR | 5.75 | GPU | 4 min | --- | --- |
| PP-OCRv6_tiny | --- | A100 | 0.13 s/页 | --- | 1.1M |
| PP-OCRv6_medium | --- | A100 | 0.29 s/页 | --- | 34.5M |
8.2 两条路线的实测对比
将工具按技术路线分组后,数据呈现清晰的边界:
大模型/VLM 路线:
| 工具 | 精度 | 100页耗时 | 参数量 | 核心特征 |
|---|---|---|---|---|
| Gemini 3 Pro | 9.55 | API延迟 | --- | 精度天花板,$10/100页 |
| Gemini 3 Flash | 9.50 | API延迟 | --- | 性价比最优,$0.57/100页 |
| MinerU2.5-Pro | 9.57 | --- | 1.2B | v1.6基准领先所有,2.12 pages/s |
| LightOnOCR-2-1B | 9.08 | 30 min | 1B | 本地部署甜点,RTX 4090 |
| MonkeyOCR-3B | 8.39 | 20 min | 3B | 公式/多语言强项 |
| dots.ocr | 8.73 | 20 min | --- | 126语言,双SOTA |
| Qwen3-VL-235B | 8.43 | --- | 235B | 通用VLM,幻觉率19.4% |
小模型/传统流水线路线:
| 工具 | 文本检测Hmean | 100页耗时 | 参数量 | 核心特征 |
|---|---|---|---|---|
| PP-OCRv6_medium | 86.2% | 29 s | 34.5M | 幻觉率6.8%,工业成熟 |
| PP-OCRv6_tiny | --- | 13 s | 1.1M | 速度极端,CPU友好 |
| rapidocr | --- | --- | --- | ONNX多后端,跨平台 |
| GOT-OCR2.0 | --- | --- | --- | 扩展OCR 2.0任务范围 |
关键观察:
-
精度天花板在MinerU2.5-Pro:v1.6 基准 95.69 分超越所有专用模型和通用 VLM,且 1.2B 参数、2.12 pages/s 的吞吐证明"小参数+好数据"可以击败"大参数+通用训练"。
-
速度天花板在PP-OCRv6_tiny:A100 上 0.13 秒/页,但只解决文本检测识别,不处理表格/公式/阅读顺序。这是传统流水线的根本局限。
-
幻觉率鸿沟:PP-OCRv6_medium 幻觉率 6.8%,Qwen3-VL-235B 19.4%------专用架构在可控性上碾压通用 VLM。金融、医疗、法律场景必须考虑这个指标。cite🛠web_search:9#0:~:text=PP-OCRv6_medium achieves 93.2% accuracy...Qwen3-VL-235B, 80.6%
-
"大"不等于"准":Qwen3-VL-235B(235B)表格提取 8.43,不及 1B 的 LightOnOCR(9.08);PP-OCRv6_medium(34.5M)文本检测 Hmean 86.2%,超过 Gemini-3.1-Pro(46.8%)39.4 个百分点。 通用 VLM 在专用 OCR 子任务上的定位精度和幻觉控制显著弱于专用架构。
-
API vs 本地的成本结构:API 路线(Gemini/Mistral)精度高但存在数据出境、延迟不可控、长期成本累积问题;本地路线(MinerU/MonkeyOCR/PP-OCR)一次性硬件投入,适合日均万页以上的固定场景。
8.3 两条技术路线的推荐
大模型路线(精度优先,预算充足)
适用场景:学术出版、法律合同审计、医疗报告解析、科研论文公式提取------任何对精度和结构完整性要求极高的场景。
首选:MonkeyOCR-3B / MonkeyOCR-v1.5
-
OmniDocBench v1.5 整体 91.02,公式 CDM 89.51,表格 TEDS 88.43;v1.5 英文任务超越 Qwen-3-VL-235B 3.86%、Gemini 2.5-Pro 4.98%
-
3B 参数,SRR 三元组端到端架构,单页 0.24 pages/s,单卡 3090 可部署
-
适用场景:公式密集、多语言混合的复杂学术文档
次选:MinerU2.5 / MinerU2.5-Pro
-
OmniDocBench v1.5 整体 90.67,TEDS-S 92.38、阅读顺序编辑距离 0.044 领先 MonkeyOCR;v1.6 上 MinerU2.5-Pro 整体 95.69,超越所有对比模型
-
1.2B 参数,解耦两阶段架构,vLLM 优化后 2.12 pages/s(MonkeyOCR 的 4 倍)
-
适用场景:高吞吐流水线、表格精度、阅读顺序敏感的企业文档
MonkeyOCR vs MinerU2.5-Pro 对比:
| 维度 | MonkeyOCR-3B | MinerU2.5-Pro |
|---|---|---|
| 架构 | 端到端 SRR 统一模型 | 解耦两阶段流水线 |
| v1.5 整体 | 91.02 | 90.67 |
| v1.6 整体 | --- | 95.69(领先所有) |
| 公式 CDM | 89.51 | 88.46 |
| 表格 TEDS-S | 91.02 | 92.38 |
| 阅读顺序 | 0.077 | 0.044 |
| 吞吐 | ~0.5 pages/s | 2.12 pages/s |
| 参数 | 3B | 1.2B |
| 选型 | 公式/学术/多语言 | 表格/企业/高吞吐 |
次选:dots.ocr
-
OmniDocBench 和 XDocParse 双 SOTA,支持 126 种语言
-
GPU 推理 20 分钟/100 页,精度 8.73
-
单 VLM 统一完成布局检测、文本识别、关系理解三项任务,部署简单
API 备选:Gemini 3 Flash
-
精度 9.50,成本 $0.57/100 页
-
无需本地 GPU,即开即用
-
适合无本地算力、数据可出境的场景
小模型路线(速度优先,成本敏感)
适用场景:批量文档预处理、实时扫描、边缘设备部署、日志审计、网页内容提取------任何对吞吐量和延迟敏感的场景。
首选:PP-OCRv6 系列(百度飞桨)
-
tiny 版 1.1M 参数,A100 上 0.13 秒/页,Intel Xeon OpenVINO 上 0.20 秒/页
-
medium 版 34.5M 参数,A100 上 0.29 秒/页,精度超过 PP-OCRv5_server 5.1%
-
幻觉率 6.8%,远低于所有 VLM
-
支持 50 种语言,ONNX/TensorRT/OpenVINO 多后端,CPU 友好
-
开源,工业部署成熟
边缘部署:PP-OCRv6_tiny + OpenVINO
-
1.1M 参数,Intel Xeon 上 0.20 秒/页
-
无 GPU 依赖,可在普通服务器甚至边缘设备运行
-
适合日均百万页级的批量预处理流水线
8.4 选型决策树
数据是否敏感/需本地处理?
├─ 是 → 有 GPU?
│ ├─ A100/V100 → MonkeyOCR-3B(精度)或 PP-OCRv6_medium(速度)
│ ├─ RTX 4090 → LightOnOCR-2-1B(甜点)
│ └─ 无 GPU/CPU only → PP-OCRv6_tiny + OpenVINO
└─ 否 → 预算?
├─ 充裕 → Gemini 3 Pro($10/100页,9.55分)
├─ 中等 → Gemini 3 Flash($0.57/100页,9.50分)
└─ 敏感 → Mistral OCR 3($0.20/100页,8.89分)
核心结论:2025-2026 年的文档解析领域已经不存在"一个工具打天下"的选项。大模型路线在端到端复杂文档理解上领先,但代价是延迟、成本和幻觉;小模型路线在速度、可控性和无幻觉上碾压,但局限在文本检测识别,不处理表格结构和公式。正确的做法是根据文档类型和 SLA 要求分层选型------简单扫描件走 PP-OCRv6,复杂学术/金融文档走 MonkeyOCR,API 兜底处理边缘 case。
九、赛道格局总结
| 路线 | 代表工具 | 核心特点 |
|---|---|---|
| 端到端 VLM | MonkeyOCR、Dolphin、DeepSeek-OCR、dots.ocr | 单模型统一处理,精度高,部署简 |
| 轻量级专用 | LightOnOCR-2-1B、Granite-Docling-258M、openDoc | <1B 参数,边缘部署友好 |
| 商业 API | Mathpix、Mistral OCR 3、Gemini 3 Pro | 精度高,按量付费,延迟可控 |
| HTML 提取 | MinerU-HTML、Trafilatura | 面向网页和 Common Crawl 场景 |
| 传统流水线 | pp-ocr/pp-structure、rapidocr、GOT-OCR2.0 | 成熟稳定,可控性强 |
| Agentic 感知 | InSight-doc、agentic-doc | 分辨率自适应,服务下游 Agent |
| 多模态统一 | Logics-Parsing-Omni | 文档+图像+音频+视频统一解析 |
| 格式转换 | Markitdown、pdf-craft、ConvertX | 跨格式标准化输出 |
当前趋势清晰:端到端 VLM 正在取代传统流水线成为主流,但轻量级模型(<1B)和商业 API 在特定场景仍有不可替代的优势;HTML 提取和 Agentic 感知是两个快速上升的新方向。