【系列梳理】文档解析系列梳理
- [1. 文档解析任务的意义](#1. 文档解析任务的意义)
- [2. 上海人工智能实验室minerU系列梳理](#2. 上海人工智能实验室minerU系列梳理)
-
- [2.1 opendatalab](#2.1 opendatalab)
- [2.2 MinerU](#2.2 MinerU)
- [2.3 MinerU2.5/MinerU2.5-Pro](#2.3 MinerU2.5/MinerU2.5-Pro)
- [2.4 MinerUdiffusion](#2.4 MinerUdiffusion)
- [3. 小红书团队dots系列梳理](#3. 小红书团队dots系列梳理)
-
- [3.1 Dots.ocr](#3.1 Dots.ocr)
- [3.2 Dots.mocr](#3.2 Dots.mocr)
1. 文档解析任务的意义
文档解析任务就是将适合人使用的形式(例如pdf形式,文档图片形式)转换为适合机器使用的形式(例如xml),有了解析好的文档协议,就可以作为多模态大模型的训练语料。广义的OCR在大模型时代焕发生机,成了一个基建工具。但在文档解析中,传统的狭义OCR普通文本识别无论是中文、英文还是其他语种相对都比较成熟。但是对于文档中的公式(latex表示)、表格、图片(流程图,普通图片)还是蛮有挑战的。
2. 上海人工智能实验室minerU系列梳理
上海人工智能实验室的opendata平台发布了一系列的相关成果,具体梳理如下:
2.1 opendatalab
- Opendatalb发表于2024年7月,它算是一篇定义协议和架构的成果。提出了AI Data Set Description Language(DSDL),并宣称改善了数据准备效率30%。(其实有点好奇,如何定量的衡量数据准备效率呢,这算是一个非标准的问题吧?另外就是如何从0到1设计一个架构呢?这是这篇文章最有价值的两个学习的点吧)

2.2 MinerU
- MinerU发表于2024年9月,它是opendatalab团队在文档解析领域的第一个版本,在这个版本中还是利用了各种pdf-extract-kit models先把初始版本搭起来。

2.3 MinerU2.5/MinerU2.5-Pro
- MinerU2.5/MinerU2.5-Pro分别发表于25年9月和26年4月。这两篇成果则是在上一个版本的基础上把数据飞轮转起来,以及一些细节上的处理。例如:layout分析阶段使用downsample的图片来提高效率,仅仅在content recognition阶段使用high resolution图片。

2.4 MinerUdiffusion
- MinerUdiffusion 发表于2026年3月,它算是一个偏学术的文章,探索用diffusion的方式来代替autoregression的方式来做文档解析。这样带来的一个好处是文档解析的速度会更快,算是一个蛮有意思的尝试。

3. 小红书团队dots系列梳理
3.1 Dots.ocr
- Dots.ocr是小红书团队在2025年12月发表的一篇成果,它上来就主打single模型来解决文档解析问题,而不是像MinerU那样Modular的方式。当然这种方式要训练起来,可想而知需要大量的数据,因此它更加强调自己做的一个highly scable data engine。另外的话它主打了一个multilingual(即多语言),这事实上也是一个数据问题。

3.2 Dots.mocr
- Dots.mocr是想回答这样的一个问题,在最后的解析结果中,图片该如何处理,以往可能都是直接一个图片链接,但是在这篇文章中提出image-to-code的概念,具体来讲是svg code(这个感觉是一个很赞的想法啊)。
