【系列梳理】文档解析系列梳理

【系列梳理】文档解析系列梳理

  • [1. 文档解析任务的意义](#1. 文档解析任务的意义)
  • [2. 上海人工智能实验室minerU系列梳理](#2. 上海人工智能实验室minerU系列梳理)
    • [2.1 opendatalab](#2.1 opendatalab)
    • [2.2 MinerU](#2.2 MinerU)
    • [2.3 MinerU2.5/MinerU2.5-Pro](#2.3 MinerU2.5/MinerU2.5-Pro)
    • [2.4 MinerUdiffusion](#2.4 MinerUdiffusion)
  • [3. 小红书团队dots系列梳理](#3. 小红书团队dots系列梳理)
    • [3.1 Dots.ocr](#3.1 Dots.ocr)
    • [3.2 Dots.mocr](#3.2 Dots.mocr)

1. 文档解析任务的意义

文档解析任务就是将适合人使用的形式(例如pdf形式,文档图片形式)转换为适合机器使用的形式(例如xml),有了解析好的文档协议,就可以作为多模态大模型的训练语料。广义的OCR在大模型时代焕发生机,成了一个基建工具。但在文档解析中,传统的狭义OCR普通文本识别无论是中文、英文还是其他语种相对都比较成熟。但是对于文档中的公式(latex表示)、表格、图片(流程图,普通图片)还是蛮有挑战的。

2. 上海人工智能实验室minerU系列梳理

上海人工智能实验室的opendata平台发布了一系列的相关成果,具体梳理如下:

2.1 opendatalab

  • Opendatalb发表于2024年7月,它算是一篇定义协议和架构的成果。提出了AI Data Set Description Language(DSDL),并宣称改善了数据准备效率30%。(其实有点好奇,如何定量的衡量数据准备效率呢,这算是一个非标准的问题吧?另外就是如何从0到1设计一个架构呢?这是这篇文章最有价值的两个学习的点吧)

2.2 MinerU

  • MinerU发表于2024年9月,它是opendatalab团队在文档解析领域的第一个版本,在这个版本中还是利用了各种pdf-extract-kit models先把初始版本搭起来。

2.3 MinerU2.5/MinerU2.5-Pro

  • MinerU2.5/MinerU2.5-Pro分别发表于25年9月和26年4月。这两篇成果则是在上一个版本的基础上把数据飞轮转起来,以及一些细节上的处理。例如:layout分析阶段使用downsample的图片来提高效率,仅仅在content recognition阶段使用high resolution图片。

2.4 MinerUdiffusion

  • MinerUdiffusion 发表于2026年3月,它算是一个偏学术的文章,探索用diffusion的方式来代替autoregression的方式来做文档解析。这样带来的一个好处是文档解析的速度会更快,算是一个蛮有意思的尝试。

3. 小红书团队dots系列梳理

3.1 Dots.ocr

  • Dots.ocr是小红书团队在2025年12月发表的一篇成果,它上来就主打single模型来解决文档解析问题,而不是像MinerU那样Modular的方式。当然这种方式要训练起来,可想而知需要大量的数据,因此它更加强调自己做的一个highly scable data engine。另外的话它主打了一个multilingual(即多语言),这事实上也是一个数据问题。

3.2 Dots.mocr

  • Dots.mocr是想回答这样的一个问题,在最后的解析结果中,图片该如何处理,以往可能都是直接一个图片链接,但是在这篇文章中提出image-to-code的概念,具体来讲是svg code(这个感觉是一个很赞的想法啊)。
相关推荐
幂律智能1 小时前
穿透到合同,管控到付款
大数据·人工智能
今天AI了吗1 小时前
【AI】一文讲清 RAG:从大模型局限到企业级知识库落地流程
前端·javascript·人工智能·python·深度学习·机器学习·easyui
“AI国潮设计-小江”1 小时前
《Python实战 | 用SDXL大模型生成“潮汕英歌舞”国潮IP头像,已申请外观专利,附Prompt思路!》
人工智能·python·prompt·aigc·scikit-learn
Mr数据杨1 小时前
Arxiv论文标题生成实战 从摘要到标题的文本生成建模案例
人工智能·数据分析·kaggle竞赛
martindelophy1 小时前
开源 AI 视频编辑器实战:用 Manifest + Adapter 构建可扩展的生成插件系统
人工智能·开源·音视频
小唔w1 小时前
告别水印烦恼:2026年AI去水印工具实测与梳理
人工智能
人民广场吃泡面1 小时前
DLSS 5 深度解析:当 AI 学会“创造”画面,实时游戏渲染迎来“GPT 时刻”
人工智能·gpt·游戏
行走的小派1 小时前
香橙派高质价比OPi 4系列4款板卡如何匹配不同开发需求
人工智能
tuanxiang1 小时前
文本AI率检测免费实现方案:本地部署绕过商用接口配额限制
人工智能