最新百度PaddleOCR开源HPD-Parsing,提出层级并行文档解析,1B模型解码步数最高压缩18倍,文档解析效率提升3倍!

拿到一份扫描文档,丢给一个视觉语言模型做解析。模型看了一眼图片,视觉编码器几十毫秒就处理完了,然后开始一个字一个字地往外吐结果。

看着挺正常对吧。但如果你去掐表算一下,会发现一个很反直觉的事实。

文档解析模型真正慢的地方,根本不在「看」,而在「写」。

看得快,写得慢

论文链接:https://arxiv.org/abs/2607.18839

PaddleOCR团队在HPD-Parsing论文里做了一个profiling实验,结果挺扎眼的。他们用InternVL3.5-1B作为基线,在vLLM上batch size 16跑了一遍标准自回归解析,把编码器和解码器的耗时分别拆开统计。

结果显示,视觉编码器的耗时基本稳定,不管文档多长都差不多。但解码器的耗时会随输出长度快速增长,长文档场景下,解码耗时可以接近视觉编码的500倍

500倍,你想想看,模型其实已经把整页内容都看到了,视觉信息早就编码完毕。但它还是被迫沿着一条自回归序列,一个token接一个token地把结果「抄写」出来。页面越复杂、内容越多,这条序列就越长,等待就越久。

这不是某个工程实现不够好的问题,这是自回归解码范式本身的结构性瓶颈。

PaddleOCR团队把这个洞察往前推了一步。页面结构确实需要全局理解,标题层级、多栏布局、阅读顺序这些东西得整体协调。但某个文本段落、公式或表格的具体内容解析,往往只依赖对应区域的图像和必要上下文,不需要等其他区域全部生成完毕。

文档需要整体理解,却不需要整体串行生成。

这句话是HPD-Parsing整个技术方案的认知起点。基于这个判断,他们提出了层级并行文档解析(Hierarchical Parallel Document Parsing),把传统单一自回归序列重构为具有层级关系的并行生成过程。

全局协调,局部并行

理解HPD-Parsing的关键,在于想清楚一个问题,为什么文档解析可以并行。

答案藏在文档本身的结构里。一份文档天然有层级,标题、段落、公式、表格,这些东西在空间上彼此独立。主布局分支负责理解页面结构,确定每个区域是什么类型、在什么位置、阅读顺序怎么排。当一个区域的边界和类型确定了,这个区域的具体内容就可以交给一个独立的内容分支去解码。

这跟传统的pipeline方法不一样。Pipeline是先用一个模块做版面分析,再把切好的区域丢给另一个模块识别,模块之间割裂,而且检测出错会直接传导到识别阶段。HPD-Parsing把区域级并行直接融入统一模型的解码过程,各内容分支共享整页视觉上下文,主布局分支持续维护区域关系和阅读顺序。

分工不等于重复劳动。HPD-Parsing用了共享前缀KV Cache复用机制,新分支可以直接复用已计算的视觉信息和布局前缀,不用重新编码整页图像,也不用重复执行完整的prefill过程。

更关键的是上下文隔离。传统全页自回归解码里,每个新生成的token都要attend到之前所有输出,KV cache和注意力开销随文档长度持续增长。HPD-Parsing里每个内容分支只attend共享视觉上下文、自己的结构前缀和自己生成的内容,跟其他区域的文本历史完全隔离。这不仅省了计算,还带来了一个意外好处,后面会讲到。

主布局分支在阅读顺序中逐个识别区域,每遇到一个<FORK>标记就动态创建一个内容分支。内容分支替换标记为<CHILD>后开始生成区域内容,主分支则继续往前走,识别下一个区域。多个内容分支可以同时跑。

这就是第一层并行,分支间并行

每个分支一次读N个字

分支间并行解决了区域之间的等待问题,但每个分支内部仍然是逐token解码的串行路径。

HPD-Parsing在这里接入了PaddleOCR团队此前在ECCV 2026提出的P-MTP(Progressive Multi-Token Prediction,渐进式多Token预测)技术。P-MTP用一个轻量残差MLP从解码器隐状态预测多个未来token,在一次解码迭代中同时预测并验证,验证通过的token直接纳入输出。

实际测试中,HPD-Parsing平均每个解码步骤可以接受6.6个token。这意味着布局分支和内容分支都能用更少的解码步数完成生成。

两层并行合在一起,分支间并行减少区域间的相互等待,分支内P-MTP减少单个区域内部的解码步数。整页内容不再沿着一条冗长的序列逐步生成,而是在不同区域之间并行展开,每个区域内部也更快推进。

效率,而且是越长的文档越快

光说机制不够,得看数据。

HPD-Parsing在OmniDocBench v1.6评测集上做了512并发的推理效率测试,结果在论文Table 2里列得很清楚。

1B参数的基线自回归模型,TPS(每秒Token生成量)1554.8,PPS(每秒页吞吐量)1.02。引入HPD后,TPS拉到4752.1,PPS拉到2.68,分别提升3.06倍和2.62倍。

跟其他模型比呢。DeepSeek-OCR-2是3B-A0.5B架构,TPS 2932.1,PPS 2.05。HPD-Parsing用1B参数做到了TPS比它高62%,PPS比它高31%。要知道HPD-Parsing每页处理的输入token大约4800个,是DeepSeek-OCR-2的四倍多,在这种更大的输入预算下仍然跑得更快。

但更值得关注的是一个结构性优势。论文把OmniDocBench v1.6测试集按输出长度等间隔划分,对比HPD-Parsing和基线在不同长度桶上的表现。

传统自回归解析的解码步数大致跟总输出长度成正比,文档越长,步数越多。HPD-Parsing的关键解码路径主要由最长活跃分支决定,而不是所有块长度的总和。P-MTP又进一步缩短了每条分支的解码轨迹。

结果就是,文档越长,HPD-Parsing的优势越大。在最长的输出长度桶里,解码步数最高压缩18.04倍,批量请求吞吐最高提升3.67倍,单并发推理时延最高下降5.8倍。

这不是固定比例的加速,而是从解码机制上缓解了「文档越长、等待越久」的结构性瓶颈。页面越复杂、可并行解析的区域越多,效率优势越明显。

快了,但准吗

效率上去了,精度会不会掉。这是所有人最自然的问题。

论文Table 1给出了OmniDocBench v1.6上的完整精度对比。HPD-Parsing以1B参数做到了Overall 94.91分,在端到端统一解析模型里拿到了新SOTA。

对比一下,4B参数的Qianfan-OCR是93.90分,4B的Logics-Parsing-v2是93.33分,2B的FireRed-OCR是93.26分。HPD-Parsing用更小的模型超过了这些更大的统一模型。在阅读顺序指标上,ReadOrderEdit达到了0.124,在统一模型里也是最好的。

这说明一件事,把布局和内容的监督分解开,不仅没有损失全局上下文,反而让不同解析能力得到了更有针对性的优化

论文还给了几组定性对比,在Figure 9里展示了HPD-Parsing相对pipeline方法和统一自回归方法的三个关键优势。

第一,对检测误差的鲁棒性。Pipeline方法高度依赖版面分析阶段,bounding box不准就会直接导致识别错误。HPD-Parsing在解析过程中保留了文档级视觉和语义上下文,即使区域定位不完美也能正确识别。

第二,相似字符的处理。Pipeline方法处理孤立文本区域时上下文有限,容易把数字0和大写字母O搞混。HPD-Parsing利用更广的文档上下文来消歧。

第三,也是最有意思的一点,错误传播阻断。统一自回归方法一旦在某个位置出错,可能进入重复解码,错误输出会沿着序列传播到后续所有内容。而HPD-Parsing的局部内容在独立分支里解码,重复错误被限制在单个区域内,不会影响后续文档块。

这就是前面说的上下文隔离带来的意外好处。它不只是省计算,还从结构上阻断了错误的跨区域传播。

怎么训出来的

从传统全页串行生成迁移到层级并行解码,不是换个推理方式就行的事,模型得重新学一套解码范式。

HPD-Parsing设计了三阶段训练策略。

第一阶段,280万条全页样本,用传统全页序列生成格式训练,建立通用文档解析能力,同时初始化P-MTP的多token预测能力。学习率1e-4。

第二阶段 ,10万条分支训练样本,把每页重新组织成布局解析实例和内容解码实例两种格式,让模型学会新的解码角色。布局实例监督完整结构序列,内容实例只在<CHILD>之后的局部转录部分施加监督。学习率1e-5。

第三阶段,600条代表性难例,通过强化学习做针对性优化。利用层级输出结构,把奖励信号分配到不同解析组件上,对公式质量、表格解析、布局预测分别设计任务感知奖励,加上基于计数的一致性奖励。学习率5e-7。

训练配置上,8张A800 80GB,bfloat16精度,DeepSpeed ZeRO-1加gradient checkpointing,FlashAttention加速,最大序列长度16000 token。

数据侧也有一套自动化引擎。先对原始文档做特征提取和聚类采样,扩大覆盖、减少重复。然后用PaddleOCR-VL-1.5和MinerU-2.5 Pro等多模型生成伪标签,跟中间阶段的HPD-Parsing checkpoint对比,按解析差异分成简单、中等、困难三档。困难样本用更强的VLM多轮检查、生成和纠正。最后从难度、文档类型和内容属性多个维度做分布平衡。

这套流程让模型能从传统范式渐进迁移到新范式,同时用少量数据实现了解码范式的切换。


回到开头那个问题。文档解析的瓶颈到底在哪。

HPD-Parsing给出的答案是,瓶颈不在视觉编码,不在模型太小或太大,而在生成方式本身。当一份文档的内容天然可以按区域拆分、并行解码时,强迫所有内容沿一条序列串行输出,就是一种结构性的浪费。

PaddleOCR团队做的事情,是把这个浪费从机制层面消掉了。1B参数,OmniDocBench v1.6上94.91分,TPS 4752.1,效率比基线快3倍,长文档场景下解码步数压缩18倍。这些数字背后是一个更根本的判断,页面结构需要全局协调,区域内容则可以局部并行

论文在结论里提到,这种结构化并行的思路不局限于单页解析,还可以扩展到关键信息提取、多页文档理解等具有层级结构的生成任务。这种解码范式和视觉token压缩、注意力长度压缩等加速手段也不冲突,可以叠加使用。

国产OCR在这条线上已经走了很远。从PaddleOCR-VL系列到HPD-Parsing,PaddleOCR团队在0.9B-1B这个参数量级上持续打磨,既有效果导向的PaddleOCR-VL-1.5(OmniDocBench v1.6 上96.3分),也有效率导向的HPD-Parsing。一个追精度天花板,一个追效率天花板,两者互补。

如果你对解析效果有强需求,PaddleOCR-VL系列仍然是首选。如果你对推理效率有强需求,尤其是扫描文档场景下需要高吞吐部署,HPD-Parsing值得试一试。

代码和权重都在GitHub和HuggingFace上开源了


感谢阅读。点个关注,不迷路,我们后续会持续跟进文档解析、OCR领域的前沿技术动态,第一时间为你解读。

相关推荐
Damon小智7 小时前
眼见不一定为实:WAIC 2026 探展合合信息,实测 AI 去反光 + AI 跨模态鉴伪两项黑科技
人工智能·ocr
山石满棠9 小时前
基于python313环境构建paddle-ocr镜像
ocr·paddle
AI人工智能+10 小时前
药品经营许可证识别技术,融合计算机视觉、自然语言处理和知识图谱,保障药品供应链安全,助力构建智慧药监体系。
深度学习·ocr·药品经营许可证识别
蓝创工坊Blue Foundry11 小时前
多个同模板 PDF,怎样批量提取同一类字段到 Excel
运维·数据库·pdf·自动化·ocr·excel
AI人工智能+1 天前
智能文档抽取系统采用“解析底座+大模型“双引擎架构,突破传统OCR局限
深度学习·ocr·文档抽取
蓝创工坊Blue Foundry1 天前
图片文字提取到 Excel:批量任务如何先定义要交付的字段
运维·服务器·开发语言·数据库·自动化·ocr·excel
求真学习1 天前
智谱联合清华开源GLM-OCR,0.9B参数配MTP多Token预测,文档解析吞吐量1.86页/秒,印章识别90.5分,第二名才42.2分
ocr·pdf解析·glm·文档解析·智谱
胡琦博客2 天前
HarmonyOS 智能工具箱(二):OCR 文字识别工具
华为·ocr·harmonyos
LaughingZhu2 天前
Product Hunt 每日热榜 | 2026-07-21
搜索引擎·百度