在大模型落地的一年又一年里,有一个环节始终绕不开:你的知识库不是 Markdown,而是成千上万份 PDF。论文、财报、合同、招标书、扫描件------双栏排版、跨页表格、公式、页眉页脚混杂其中。直接把 PDF 文本糊给 LLM,效果通常惨不忍睹。MinerU 就是专门解决这个问题的一个开源项目,目前最新版本是 2026 年 6 月发布的 v3.4。
MinerU 是什么
MinerU 是上海人工智能实验室 OpenDataLab 团队开源的文档解析引擎,诞生于书生·浦语大模型的预训练过程------他们当年自己就需要把海量科技文献转成干净的训练数据,索性把工具做了出来。它做的事情一句话可以说清:
把 PDF、图片、DOCX、PPTX、XLSX 转成结构化的 Markdown / JSON,让内容可以直接进入 RAG、Agent 和 LLM 的处理流水线。
具体能力包括:
- 公式转 LaTeX、表格转 HTML,而不是把公式拍扁成乱码、把表格拆成一串碎片文字
- 按人类阅读顺序输出,正确处理单栏、多栏和复杂排版
- 自动去除页眉、页脚、脚注、页码,保证语义连贯
- 自动识别扫描件和乱码 PDF 并启用 OCR,支持 109 种语言
- 跨页表格合并、截断段落合并、表格内图片识别等复杂版面场景
三个解析后端,按硬件选
MinerU 现在有三种推理后端,这是它工程上比较成熟的一个体现:
| 后端 | 精度(OmniDocBench v1.6) | 特点 |
|---|---|---|
pipeline |
86.47 | 传统多模型流水线,无幻觉,纯 CPU 可跑,显存 4GB 起步 |
vlm-engine |
95.39(high) | 自研 1.2B 参数视觉语言模型本地推理,需要 GPU(8GB 显存) |
hybrid-engine |
95.39(high)/ 95.26(medium) | 原生文本提取 + VLM 结合,高精度且低幻觉 |
几个值得注意的细节:
VLM 后端用的模型只有 1.2B 参数 (MinerU2.5-Pro-2605-1.2B),却做到了文档解析的顶级精度。这得益于解耦式架构------版面检测和内容提取分开处理(技术细节见论文)。小模型意味着部署门槛低,一台带普通显卡的机器就能跑。
Hybrid 后端支持 effort 档位 。v3.3 新增的 medium 档相比 high 精度只降 0.13 分,但解析速度提升 35%~220%(macOS 上文本 PDF 提速约 220%),日常文档处理默认走 medium 就够了。
没有 GPU 也能用 。pipeline 后端纯 CPU 可运行,这在开源文档解析工具里不算普遍。另外它适配了十余款国产算力平台(昇腾、寒武纪、摩尔线程等),还提供 vlm-http-client 模式------本地只做轻量客户端,推理丢给远程 OpenAI 兼容服务,本地显存 2GB 即可。
版本演进:从工具到基础设施
看 MinerU 这两年的版本节奏,能明显看出它从一个"PDF 转 Markdown 工具"在往"大规模文档解析基座"演进:
- v3.0(2026/03) :架构大升级。DOCX 原生解析(比先转 PDF 再解析快数十倍);异步任务 API;新增
mineru-router支持多服务、多 GPU 统一入口和负载均衡;滑动窗口优化让上万页长文档不用再手动拆分;移除 AGPLv3 依赖模型。 - v3.1.0(2026/04) :许可证正式切换为基于 Apache 2.0 的 MinerU 开源许可证------对商业落地来说这是最关键的一步;补齐 PPTX 和 XLSX 原生解析,完成全格式覆盖。
- v3.3(2026/06):Hybrid 引擎提速,VLM 模型升级到 2605 版本,原生多语言 OCR。
- v3.4(2026/06):pipeline 后端 OCR 模型升级到 PP-OCRv6,OCR 相关指标提升约 11%,OCR 处理速度翻倍;模型下载支持源自动选择。
许可证这条值得展开:早期 AGPLv3 让很多公司在集成时犹豫,现在基于 Apache 2.0 的协议大幅降低了商用门槛,这也是它 GitHub star 数持续涨的原因之一。
上手成本很低
安装就三行:
bash
pip install --upgrade pip
pip install uv
uv pip install -U "mineru[all]"
使用更简单,一条命令:
bash
# 有 GPU(Volta 及以后架构或 Apple Silicon)
mineru -p 你的文件.pdf -o ./output
# 纯 CPU 环境
mineru -p 你的文件.pdf -o ./output -b pipeline
国内网络环境可以 export MINERU_MODEL_SOURCE=modelscope 切到魔搭下载模型,v3.4 之后还会自动选源。Python 3.10--3.13、Windows/Linux/macOS 都支持,Linux 上有官方 Docker 镜像。
生态接入也比较全:
- RAG 框架:LangChain、LlamaIndex、RAGFlow、Dify、FastGPT 等原生集成
- AI 编程工具:提供 MCP Server,可以直接接 Cursor、Claude Desktop、Windsurf
- 零代码 :mineru.net 在线版,或本地 Gradio WebUI、桌面客户端
我的建议是:先拿你手头最恶心的几份文档(扫描件、双栏论文、复杂表格)去在线版试一下效果,再决定要不要本地部署。
和其他方案比
文档解析这个赛道现在很热闹,粗略可以分几类:
- 传统工具(pdfplumber、PyMuPDF):只能提取文本层,版面理解弱,免费但天花板低
- 云服务 API(各家大厂的文档解析接口):效果好,但按页收费,且文档要出你的环境
- 开源深度学习方案:MinerU、Marker、Dotseed/Docling 等
MinerU 的差异化在于三点:精度数据公开可查 (OmniDocBench 本身就是他们做的基准)、全格式覆盖且无格式转换损耗 、从单机 CPU 到多卡集群的完整部署梯度。1.2B 的小模型 + Apache 2.0 协议,让个人开发者和小团队的上手成本几乎为零。
一点务实的提醒
文档解析本质上是困难任务。扫描件、手写体、老论文的印刷质量、极端复杂版面,任何工具都可能翻车。MinerU 官方自己也说得很坦率:结果不及预期欢迎带着样例文件去提 issue。实践上建议:
- 用在线版先验证你自己的文档类型效果如何,再决定部署
- 生产环境把解析结果做可视化质检(MinerU 自带 layout 可视化)
- 高价值文档人工抽查,别完全信任任何解析器------尤其数字和表格
总体来说,如果你的工作涉及"让大模型理解存量文档",MinerU 是目前开源方案里绕不开的一个选项。它不是玩具,书生系列大模型的训练数据流水线就是它的第一个用户。