MinerU:把文档变成大模型能"读"的样子

在大模型落地的一年又一年里,有一个环节始终绕不开:你的知识库不是 Markdown,而是成千上万份 PDF。论文、财报、合同、招标书、扫描件------双栏排版、跨页表格、公式、页眉页脚混杂其中。直接把 PDF 文本糊给 LLM,效果通常惨不忍睹。MinerU 就是专门解决这个问题的一个开源项目,目前最新版本是 2026 年 6 月发布的 v3.4。

MinerU 是什么

MinerU 是上海人工智能实验室 OpenDataLab 团队开源的文档解析引擎,诞生于书生·浦语大模型的预训练过程------他们当年自己就需要把海量科技文献转成干净的训练数据,索性把工具做了出来。它做的事情一句话可以说清:

把 PDF、图片、DOCX、PPTX、XLSX 转成结构化的 Markdown / JSON,让内容可以直接进入 RAG、Agent 和 LLM 的处理流水线。

具体能力包括:

  • 公式转 LaTeX、表格转 HTML,而不是把公式拍扁成乱码、把表格拆成一串碎片文字
  • 按人类阅读顺序输出,正确处理单栏、多栏和复杂排版
  • 自动去除页眉、页脚、脚注、页码,保证语义连贯
  • 自动识别扫描件和乱码 PDF 并启用 OCR,支持 109 种语言
  • 跨页表格合并、截断段落合并、表格内图片识别等复杂版面场景

三个解析后端,按硬件选

MinerU 现在有三种推理后端,这是它工程上比较成熟的一个体现:

后端 精度(OmniDocBench v1.6) 特点
pipeline 86.47 传统多模型流水线,无幻觉,纯 CPU 可跑,显存 4GB 起步
vlm-engine 95.39(high) 自研 1.2B 参数视觉语言模型本地推理,需要 GPU(8GB 显存)
hybrid-engine 95.39(high)/ 95.26(medium) 原生文本提取 + VLM 结合,高精度且低幻觉

几个值得注意的细节:

VLM 后端用的模型只有 1.2B 参数MinerU2.5-Pro-2605-1.2B),却做到了文档解析的顶级精度。这得益于解耦式架构------版面检测和内容提取分开处理(技术细节见论文)。小模型意味着部署门槛低,一台带普通显卡的机器就能跑。

Hybrid 后端支持 effort 档位 。v3.3 新增的 medium 档相比 high 精度只降 0.13 分,但解析速度提升 35%~220%(macOS 上文本 PDF 提速约 220%),日常文档处理默认走 medium 就够了。

没有 GPU 也能用pipeline 后端纯 CPU 可运行,这在开源文档解析工具里不算普遍。另外它适配了十余款国产算力平台(昇腾、寒武纪、摩尔线程等),还提供 vlm-http-client 模式------本地只做轻量客户端,推理丢给远程 OpenAI 兼容服务,本地显存 2GB 即可。

版本演进:从工具到基础设施

看 MinerU 这两年的版本节奏,能明显看出它从一个"PDF 转 Markdown 工具"在往"大规模文档解析基座"演进:

  • v3.0(2026/03) :架构大升级。DOCX 原生解析(比先转 PDF 再解析快数十倍);异步任务 API;新增 mineru-router 支持多服务、多 GPU 统一入口和负载均衡;滑动窗口优化让上万页长文档不用再手动拆分;移除 AGPLv3 依赖模型。
  • v3.1.0(2026/04)许可证正式切换为基于 Apache 2.0 的 MinerU 开源许可证------对商业落地来说这是最关键的一步;补齐 PPTX 和 XLSX 原生解析,完成全格式覆盖。
  • v3.3(2026/06):Hybrid 引擎提速,VLM 模型升级到 2605 版本,原生多语言 OCR。
  • v3.4(2026/06):pipeline 后端 OCR 模型升级到 PP-OCRv6,OCR 相关指标提升约 11%,OCR 处理速度翻倍;模型下载支持源自动选择。

许可证这条值得展开:早期 AGPLv3 让很多公司在集成时犹豫,现在基于 Apache 2.0 的协议大幅降低了商用门槛,这也是它 GitHub star 数持续涨的原因之一。

上手成本很低

安装就三行:

bash 复制代码
pip install --upgrade pip
pip install uv
uv pip install -U "mineru[all]"

使用更简单,一条命令:

bash 复制代码
# 有 GPU(Volta 及以后架构或 Apple Silicon)
mineru -p 你的文件.pdf -o ./output

# 纯 CPU 环境
mineru -p 你的文件.pdf -o ./output -b pipeline

国内网络环境可以 export MINERU_MODEL_SOURCE=modelscope 切到魔搭下载模型,v3.4 之后还会自动选源。Python 3.10--3.13、Windows/Linux/macOS 都支持,Linux 上有官方 Docker 镜像。

生态接入也比较全:

  • RAG 框架:LangChain、LlamaIndex、RAGFlow、Dify、FastGPT 等原生集成
  • AI 编程工具:提供 MCP Server,可以直接接 Cursor、Claude Desktop、Windsurf
  • 零代码mineru.net 在线版,或本地 Gradio WebUI、桌面客户端

我的建议是:先拿你手头最恶心的几份文档(扫描件、双栏论文、复杂表格)去在线版试一下效果,再决定要不要本地部署。

和其他方案比

文档解析这个赛道现在很热闹,粗略可以分几类:

  • 传统工具(pdfplumber、PyMuPDF):只能提取文本层,版面理解弱,免费但天花板低
  • 云服务 API(各家大厂的文档解析接口):效果好,但按页收费,且文档要出你的环境
  • 开源深度学习方案:MinerU、Marker、Dotseed/Docling 等

MinerU 的差异化在于三点:精度数据公开可查 (OmniDocBench 本身就是他们做的基准)、全格式覆盖且无格式转换损耗从单机 CPU 到多卡集群的完整部署梯度。1.2B 的小模型 + Apache 2.0 协议,让个人开发者和小团队的上手成本几乎为零。

一点务实的提醒

文档解析本质上是困难任务。扫描件、手写体、老论文的印刷质量、极端复杂版面,任何工具都可能翻车。MinerU 官方自己也说得很坦率:结果不及预期欢迎带着样例文件去提 issue。实践上建议:

  1. 用在线版先验证你自己的文档类型效果如何,再决定部署
  2. 生产环境把解析结果做可视化质检(MinerU 自带 layout 可视化)
  3. 高价值文档人工抽查,别完全信任任何解析器------尤其数字和表格

总体来说,如果你的工作涉及"让大模型理解存量文档",MinerU 是目前开源方案里绕不开的一个选项。它不是玩具,书生系列大模型的训练数据流水线就是它的第一个用户。

相关链接

相关推荐
武子康2 小时前
GPT-Live 分析研究:从回合式语音到连续交互循环
人工智能·llm·agent
小帅不太帅3 小时前
给大家推荐一个特别好用的专为 AI Agent 打造的最快浏览器
前端·agent·浏览器
莫逸风3 小时前
【AgentScope 2.0】10-总结回顾详解
java·ai·agent·springai·agentscope
武子康4 小时前
给 Pi 增加能力时,应该写 Prompt、Skill、Tool 还是 Extension?
人工智能·llm·agent
怕浪猫12 小时前
第1章:认识 DeepSeek Harness——一个插件化的 Agent Runtime 平台
agent·natural language toolkit·deepseek
特立独行的猫a13 小时前
一切皆插件:DeepSeek Harness 的架构哲学,以及与主流 Agent 的对比
人工智能·架构·agent·deepseek·harness
海兰17 小时前
mcporter — 安装部署及使用完全指南(二)
人工智能·agent
一拳不是超人17 小时前
LangChain 们的丧钟?DeepSeek 把 Agent 开发变成了拼乐高
人工智能·agent