多模态文档解析新思路:MinerU-Diffusion通过扩散解码进行文档OCR

继续跟进【文档智能】解析进展。在前期介绍了非常多的多模态视觉语言模型在OCR场景的方法思路,在模型架构上,基本都是vit+MLP+LLM的框架,以自回归(AR)【即文本以从左到右、逐个词元的方式生成。】的方式进行OCR解码,存在顺序延迟问题,其延迟与文档长度呈线性关系。AR的因果生成导致错误传播,即初始错误会在输出中逐级放大。

如上图,MinerU-Diffusion引入了一种不同的范式,将文档OCR重构为一个逆向渲染问题。该框架不一次预测一个序列,而是使用一个并行的基于扩散的解码器。通过将文档视为一个空间耦合的离散随机场,MinerU-Diffusion旨在直接从视觉特征重建结构化文本,从而确保高效率并以视觉输入为基础。

建模

把文档OCR建模为从2D文档图像到1D结构化token序列的逆渲染过程

y = ( y ( 1 ) , . . . , y ( L ) ) ∈ V L y=\left( y^{(1)},... ,y^{(L)}\right) \in \mathcal {V}^{L} y=(y(1),...,y(L))∈VL

  • y y y:统一结构化token,包含文本、布局标记、表格分隔符、数学符号;
  • 核心逻辑:token间的依赖来自文档空间布局/格式,而非固定的生成因果顺序;
  • OCR本质:基于视觉证据的后验推断 p ( y ∣ x ) p(y|x) p(y∣x),而非语言驱动的序列生成。

模型结构

这一块直接从代码看,整体架构分为三大核心组件:视觉编码器、视觉 - 语言投影器、SDAR 语言模型:

SDAR 语言模型基于扩散(Diffusion)机制生成文本,这个区别传统的多模态视觉语言模型自回归的方式,重点看一下。

复制代码
SDARModel
├── Token嵌入层 (Embedding):将文本token转为向量
├── N × SDARDecoderLayer:解码器层(核心计算单元)
├── SDARRMSNorm:归一化层(稳定训练)
└── SDARRotaryEmbedding:旋转位置编码(RoPE,支持长文本)

SDARForCausalLM:基座模型 + 语言模型头(LM Head)

核心创新:generate_with_embeds 方法 → 块级去噪扩散生成

  • 用掩码 token(MASK)占位待生成的文本
  • 分块、分步去噪,逐步把掩码 token 替换为生成 token
  • 比传统自回归生成速度更快、长文本效果更稳

实验

参考文献

MinerU-Diffusion: Rethinking Document OCR as Inverse

Rendering via Diffusion Decoding,https://arxiv.org/pdf/2603.22458

往期相关

多模态文档解析的开源项目模型技术方案都在《文档智能专栏》,如:

...

相关推荐
老云讲算力市场7 分钟前
WAIC首日观察:国产算力与机器人加速落地,奇点算力迎来产业新机遇
人工智能·科技
小林ixn21 分钟前
大模型随机说话的秘密:Temperature 和 Top K 深度解析,LangChain 实战调优
人工智能·langchain
ALINX技术博客33 分钟前
ALINX 亮相 2026 WAIC 世界人工智能大会,展示 AI 视觉 FPGA+GPU 异构计算与电子后视镜解决方案
人工智能·ai·fpga·世界人工智能大会·电子后视镜
程序员老猫1 小时前
当 AI 能写 80% 的代码时,后端工程师的核心价值还剩什么?
人工智能
想会飞的蒲公英1 小时前
计算机怎样读取中文文本:编码、清洗与标准化
人工智能·python·自然语言处理
CIO_Alliance1 小时前
AI+iPaaS解决方案深度整合:让跨系统业务流程自动化一步到位
人工智能·ipaas·系统集成·ai+ipaas·企业cio联盟·企业级ai化转型
苏州IT威翰德1 小时前
算力资产“续命”专家:苏州威翰德科技赋能NVIDIA高端AI芯片芯片级维修
大数据·人工智能
天上路人2 小时前
A59P双波束语音模块:神经网络降噪在远场拾音中的工程实现分析
人工智能·深度学习·神经网络·ai降噪·ai语音·麦克风·回音消除
冬奇Lab2 小时前
AI 评测系列(03):LLM-as-Judge——让 LLM 评价 LLM 的正确姿势
人工智能·llm
小程故事多_802 小时前
边缘端OCR+RAG文档智能问答系统,落地实践与全场景解析
ocr·rag