HPD-Parsing 是由百度PaddleOCR团队提出的一种高吞吐量、轻量级统一文档解析器 ,核心创新在于用层次化并行解码(Hierarchical Parallel Decoding) 范式替代了传统VLM文档解析器中普遍采用的全页面自回归逐词生成范式,从而在保持解析精度的同时,实现了3倍以上的推理吞吐量提升。
一、研究动机与问题定义
1.1 现有方法的瓶颈
-
统一VLM解析器 (如DeepSeek-OCR、GLM-OCR等)虽然精度高,但采用单一自回归轨迹生成整个页面的解析结果,解码步骤随文档长度线性增长,成为主要推理瓶颈。
-
性能分析显示(图2):对于长文档,解码器延迟可比视觉编码器延迟高近500倍,且随输出长度快速增长。
1.2 核心洞察
文章指出了一个被忽略的关键性质:
文档版面分析需要全局协调,但每个区域(文本块、表格、公式)的详细内容解码具有很强的局部性------主要依赖其对应的视觉区域,对远处区域的详细内容依赖有限。
因此,无需将全页面内容沿单一路径顺序生成,可以将全局结构解析与局部内容解码解耦,实现并行化。
二、核心技术方法
2.1 层次化并行解码(HPD)范式
将传统单一解码轨迹重构为两级结构:
| 分支类型 | 功能 | 输出内容 |
|---|---|---|
| 主版面分支 | 全局协调:按阅读顺序预测文档结构(区域类别、坐标) | 结构化序列 + <FORK> 路由令牌 |
| 内容分支 | 局部解码:为每个版面区域独立生成详细内容 | <CHILD> 后的区域转录文本 |
-
动态分支分叉 :当主分支输出
<FORK>时,调度器即时创建对应的内容分支,多个内容分支并发解码。 -
共享前缀KV缓存复用:新分支无需重编码图像或重复预填充计算,仅维护自身的增量KV缓存。
-
局部上下文隔离:每个分支仅关注共享视觉上下文+自身结构前缀+自身生成历史,避免全页面长序列的注意力开销。
2.2 渐进式多词预测(P-MTP)
在每个分支内部进一步加速:
-
轻量级残差MLP从解码器隐藏状态一次性预测多个未来令牌(平均接受长度6.6个令牌/步)。
-
采用渐进损失加权策略,为不同前瞻深度的预测分配不同权重,保证训练稳定性。
-
推理时通过草稿-验证-接受机制,单步可推进多个有效令牌。
2.3 三者协同效果
- 分支间并行 + 分支内多词预测 + KV缓存复用 = 大幅缩短有效顺序解码路径(同时从"分支数量维度"和"令牌维度"压缩)。
三、训练策略与数据工程
3.1 三阶段分阶段适应训练
| 阶段 | 目标 | 数据规模 | 关键操作 |
|---|---|---|---|
| Stage 1 | 通用文档解析能力初始化 | 280万全页面样本 | 传统全页面序列训练,P-MTP能力习得 |
| Stage 2 | 解码范式迁移 + 困难案例优化 | 10万分支特定样本 | 版面分支与内容分支分离监督,强调困难样本 |
| Stage 3 | 奖励引导优化(强化学习) | 600个代表性困难案例 | 任务感知奖励(公式质量、表格解析、版面预测等) |
3.2 自动化困难感知数据筛选流水线
包含四个环节:
-
特征聚类与采样:基于视觉特征聚类,防止数据集被重复版面主导。
-
多模型标注与难度估计:用PaddleOCR-VL、MinerU等生成伪标签,中间检查点预测结果与伪标签对比,将样本分为Easy/Medium/Hard三级。
-
VLM-based迭代精化:对困难样本用更强VLM识别错误类型并反复修正。
-
分布平衡:平衡不同难度级别和文档属性(表格/公式/多列等)的样本比例。
四、推理工作流
-
基于vLLM框架实现,扩展FCFS调度器以支持动态分支分叉与并发解码。
-
每个分支最大生成长度8000 tokens。
-
主版面分支持续运行,
<FORK>触发内容分支创建,各分支独立解码直至完成。
五、实验验证
5.1 精度结果(OmniDocBench v1.6)
-
总体得分94.91 ,在统一解析器类别中达到最先进水平,超越Qianfan-OCR、Logics-Parsing-v2等更大模型。
-
表格公式识别表现突出(Formula CDM达97.28),阅读顺序预测(0.124)竞争力强。
-
仅1B参数,接近甚至部分超越流水线方法(如PaddleOCR-VL-1.6)。
5.2 效率结果
| 指标 | 自回归基线 | HPD-Parsing | 提升倍数 |
|---|---|---|---|
| TPS (BS=512) | 1,554.8 | 4,752.1 | 3.06× |
| PPS (BS=512) | 1.02 | 2.68 | 2.62× |
-
相比最快现有模型(DeepSeek-OCR-2)仍有1.62× TPS提升。
-
加速增益随输出长度增大而显著增加:最长文档区间,解码步骤减少18× ,单请求延迟降低5.8×。
5.3 定性优势
-
鲁棒性:应对流水线方法中版面检测错误导致的识别失败。
-
字符消歧:通过全局上下文区分'0'与'O'等视觉相似字符。
-
错误隔离:重复解码错误被限制在单个内容分支内,不污染后续区域。
六、核心贡献总结
-
范式贡献 :首次提出并验证了**"全局版面协调 + 局部内容并行解码"**作为全页面自回归生成的有效替代范式。
-
方法贡献 :设计了完整的布局协调并行解码 + P-MTP 多词预测 + 共享前缀KV复用技术栈。
-
工程贡献 :构建了分阶段训练策略 + 自动化困难感知数据筛选流水线,实现从传统范式到新范式的平稳迁移。
-
性能贡献 :在精度保持SOTA的前提下,实现了3倍以上的吞吐量提升,为大规模文档解析部署提供了可行方案。
七、未来方向
-
扩展训练数据覆盖更广泛的文档场景。
-
探索结构感知注意力设计,进一步减少每步计算量和有效注意力上下文。
-
将层次化并行解码思想推广至多页文档理解 、关键信息抽取等其他结构化生成任务。
这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:

项目地址在这里,如下所示:

模型权重地址在这里, 如下所示:

摘要
高效的团队协作通常将全局协调与并行执行相结合,这一原则在基于统一视觉语言模型(VLM)的文档解析器中尚未得到充分体现。现有的统一解析器会联合处理整个页面,但其输出是通过单一的自回归逐词生成轨迹产生的,这造成了一个随文档长度增长的顺序瓶颈。这种全页面顺序生成忽略了文档解析的一个关键特性:版面分析必须在全局范围内进行,而区块内容则可以并行解析。基于这一观察,我们提出了 HPD-Parsing,它用层次化并行解码范式取代了全页面自回归生成。一个主版面分支负责组织整体文档结构,并动态地将区块级内容解码分配给并发的分支,同时,渐进式多词预测(P-MTP)进一步减少了每个分支内的解码步骤。在公开基准上的实验表明,HPD-Parsing 达到了每秒 4,752 个令牌的处理速度,是现有最快文档解析模型吞吐量的 2.62× 倍,是普通自回归基线的 3.06× 倍,同时保持了具有竞争力的解析精度。这些结果表明,层次化并行解码是全页面自回归生成的有效替代方案,为高效统一文档解析开辟了新方向。

图 1 | 解码范式与推理效率对比。(a) 传统的自回归解码按顺序生成全页面输出,而 HPD-Parsing 结合了跨文档区块的版面协调并行解码与 P-MTP。(b) HPD-Parsing 相比自回归基线实现了 (3.06times) 的吞吐量提升,在达到最先进推理效率的同时,保持了具有竞争力的解析精度。
1. 引言
文档解析是信息提取、文档检索和检索增强生成(RAG)等广泛下游应用的基础组成部分,对解析精度要求很高。与传统的基于流水线系统相比,最近的基于视觉语言模型(VLM)的解析器通过在统一框架内联合建模多样化的文档元素,大幅提高了精度和通用性。然而,文档页面通常包含密集内容并需要长结构化输出,导致基于 VLM 的解析器由于逐词自回归生成而产生比传统系统高得多的解码成本。随着文档工作负载的持续增长,在保持解析质量的同时提高推理效率因此成为一个日益重要的问题。
现有的基于 VLM 的文档解析器大致可分为基于流水线的方法和统一方法。基于流水线的方法 1, 2, 3, 4, 5, 6, 7, 8, 9 通常结合用于版面分析的专业组件和基于 VLM 的内容解码,实现灵活的按区域处理,但工作流本质上是碎片化的。相比之下,统一方法 10, 11, 12, 13, 9, 14, 15, 16, 17, 18, 19 将版面解析和内容识别整合到一个统一的序列生成框架中,使得能够在单一模型内进行联合优化。然而,现有解析器中基于 VLM 的解码仍然主要是自回归的,要求文档内容逐词生成。这种串行生成过程导致高推理延迟和有限的吞吐量,难以满足大规模文档解析的效率要求。
为缓解推理瓶颈,近期的研究沿两个互补方向展开。一方面,通过缩短有效上下文来降低注意力成本。DeepSeek-OCR 17, 18 压缩视觉令牌以减少高分辨率文档输入中的冗余,而 Unlimited OCR 20 引入参考滑动窗口注意力(R-SWA)来限制长序列解码过程中的文本 KV 缓存。另一方面,通过增加解码并行度来缩短生成路径。Youtu-Parsing 6 引入查询级和令牌级并行以实现区域级识别,GLM-OCR 9 采用多词预测(MTP)在单次解码步骤中推进多个令牌,HunyuanOCR-1.5 21 则采用 DFlash 进行并行草稿生成。这些进展提供了互补的效率提升,然而,更广泛的全页面文档生成解码范式仍待深入探索。
在现有加速策略之外,我们观察到统一文档解析中存在一个根本性的不匹配:虽然页面级解析需要全局协调,但内容解码在很大程度上是局部化的。全局版面决定了文档的空间结构、区域关系和阅读顺序,而每个区域的详细内容主要基于其对应的视觉证据,对远处区域的依赖有限。这使得单一的全页面自回归轨迹不必要地顺序化。此外,局部化内容的强视觉基础产生了相对可预测的生成轨迹,使得文档解析非常适合多词预测。受此启发,我们提出了 HPD-Parsing,一个建立在层次化解码(Hierarchical Parallel Decoding)之上的高吞吐量文档解析器。一个主版面分支执行全局协调,并动态地将传统的单一解码轨迹分解为并发的局部内容分支,同时复用共享前缀的 KV 缓存。在每个分支内,P-MTP 22 通过预测每次迭代中的多个未来令牌进一步减少解码步骤。总的来说,这些设计缩短了分支间和分支内的有效顺序解码路径,同时保留了一个统一的生成框架。为在此范式转换期间保持解析精度,我们进一步采用了分阶段适应和自动化困难感知数据筛选。如图 1(b) 所示,HPD-Parsing 在保持有竞争力的解析精度的同时,实现了最佳的吞吐量。
总之,HPD-Parsing 的主要贡献如下:
-
用于高吞吐量文档解析的层次化并行解码。我们引入了层次化并行解码(HPD),一种新的解码范式,将全页面自回归生成重构为全局协调、局部并行的解码。一个主版面分支执行全局协调,并动态地将传统的单一解码轨迹分解为并发的内部分支,每个分支负责一个局部文档区域。在每个分支内,P-MTP 通过预测每次迭代中的多个未来令牌进一步减少了解码步骤。结合共享前缀 KV 缓存复用,HPD 在分支和令牌维度上显著缩短了有效的顺序解码路径。
-
具有自动化困难感知数据筛选的分阶段适应。我们开发了一种分阶段适应策略,将传统的自回归文档解析能力迁移到所提出的层次化并行解码范式,同时保持解析精度。该策略由一个自动化的困难感知数据筛选流水线支持,该流水线整合了大规模数据收集、模型辅助标注、难度估计和平衡采样。通过逐步适应模型并强调具有挑战性的样本,该训练框架以最少的人工标注工作,减轻了向并行解码过渡所带来的精度下降。
-
具有竞争力解析精度的最先进吞吐量。HPD-Parsing 在 OmniDocBench v1.6 上实现了最先进的推理效率,峰值吞吐量达到每秒 4,752 个令牌(TPS)。它提供了现有最快文档解析模型 1.62× 的吞吐量,是其自回归基线的 3.06× 倍以上,同时保持了具有竞争力的解析精度。这些结果表明,文档解析可以通过全局版面协调和局部并行解码有效执行,而无需依赖单一的顺序生成轨迹。
2. 相关工作
2.1. 基于 VLM 的文档解析
现有的基于 VLM 的文档解析器根据其系统组织方式,大致可分为基于流水线的方法和统一方法。基于流水线的方法 1, 2, 3, 4, 5, 6, 7, 8, 9 将文档解析分解为一系列专门阶段,通常包括页面级版面分析,然后是针对局部区域的基于 VLM 的识别或内容解码。这种模块化设计使得能够针对不同的文档元素进行灵活优化,并在诸如 PaddleOCR-VL 和 MinerU 系列等系统中展示了强大的解析性能。然而,协调多个组件也增加了系统复杂性,并可能将定位错误传播到后续的识别阶段。
统一方法 10, 11, 12, 13, 9, 14, 15, 16, 17, 18, 19, 20, 21 则将版面解析、阅读顺序预测和内容识别整合到一个统一的序列生成框架中。近期的研究通过大规模数据筛选 23, 13, 10, 11、多任务监督和输出格式化 12 以及强化学习 16, 10, 19 改进了这一范式。尽管在解析精度方面取得了实质性进展,但两种范式中的基于 VLM 的解码器仍然主要是自回归的。无论是应用于局部区域还是整个页面,文档内容通常是逐词生成的,导致对于文本密集且具有长结构化输出的文档产生显著的推理延迟。
2.2. 文档解析的加速策略
近期研究沿两个互补维度加速了基于 VLM 的文档解析:减少每步计算量和缩短顺序解码路径。DeepSeek-OCR 17, 18 压缩视觉令牌以减少高分辨率文档输入的注意力成本,而 Unlimited OCR 20 引入参考滑动窗口注意力(R-SWA)以在长序列生成期间维持有界的文本 KV 缓存。这两种方法都通过限制每个解码步骤处理的有效上下文来提高效率。互补的努力是增加解码过程中的并行性以减少顺序解码轮次。Youtu-Parsing 6 引入了用于区域级内容识别的查询级和令牌级并行,而 GLM-OCR 9 采用多词预测(MTP)在单步中推进多个令牌。HunyuanOCR-1.5 21 进一步将 DFlash 适配于 OCR 解码,实现并行草稿生成以加速自回归推理。总的来说,这些方法减少了上下文处理的成本或在传统自回归流程内加速了令牌生成。然而,如何超越传统的自回归轨迹来重构全页面文档生成,在很大程度上仍未得到探索。
3. 方法论
3.1. 从顺序瓶颈到层次化并行解码
在介绍 HPD-Parsing 之前,我们首先分析标准自回归文档解析的推理瓶颈。为此,我们使用 InternVL3.5-1B 作为主干网络训练了一个基线文档解析器。该模型遵循传统的统一 VLM 解析流程:文档图像首先被编码为视觉令牌,然后完整的解析结果由 LLM 解码器逐词生成。如图 2 所示,我们使用 vLLM 并在推理批次大小为 16 的条件下,对按输出长度分组的样本的编码器和解码器延迟进行了性能分析。
随着输出长度的增加,尽管视觉令牌数量有适度变化,编码器延迟保持相对稳定。相比之下,解码器延迟随序列长度迅速增长,并逐渐主导整体推理成本。

图 2 | 在标准的基于 InternVL3.5-1B 的自回归解析模型上的性能分析结果显示,解码器延迟随输出长度迅速增加,并成为主要的推理成本。
对于长输出样本,解码时间可能比视觉编码长近 500 倍。这些结果表明,统一文档解析的主要效率瓶颈不在于全页面视觉处理,而在于逐词自回归解码所施加的长顺序执行路径。克服这一瓶颈需要重新考虑文档生成的组织方式。尽管文档解析依赖于全局协调来确定空间结构、区域关系和阅读顺序,但每个区域的详细内容在很大程度上是局部化的。文本段落、表格和公式主要基于其对应的视觉区域,并且通常对远处区域的详细内容依赖有限。因此,全局文档结构必须被联合协调,但区域内容无需沿着单一的自回归轨迹顺序生成。
这一观察激发了一种层次化解码组织。一个主版面分支建立全局版面结构和阅读顺序,同时动态地将传统的单一解码轨迹分解为并发的局部内容分支。每个内容分支解码一个局部区域,通过共享前缀 KV 缓存复用避免冗余计算。在每个分支内,局部视觉证据的强基础进一步使生成轨迹更加可预测,为渐进式多词预测(P-MTP)减少自回归解码步骤数创造了有利条件。基于这些见解,我们将文档解析表述为层次化并行解码:全局版面协调实现了跨内容分支的局部并行解码,而 P-MTP 则进一步加速了每个分支内的生成。
3.2. 概述
如图 3 所示,HPD-Parsing 采用 InternVL3.5-1B 24 作为其主干网络,包含一个 0.3B 的 InternViT 视觉编码器和一个 0.8B 的 LLM 解码器。视觉编码器提取高分辨率文档表示,这些表示被投影到语言空间并由解码器处理以进行统一文档解析。
视觉编码器。InternViT 采用基于动态分块的裁剪策略,以高效地保留高分辨率细节。在训练和推理过程中,每张输入图像根据其分辨率和宽高比被自适应地划分为最多 24 个图块。每个图块被调整为 448×448 并独立编码,之后产生的视觉令牌被馈送到 LLM。
LLM 解码器。LLM 解码器改编自 Qwen3-0.6B 架构,约占整体框架参数的 0.8B。它由 28 个 Transformer 层组成,隐藏维度为 1024,中间 FFN 大小为 3072。为管理注意力复杂度,解码器使用配置有 16 个查询头和 8 个键值头的分组查询注意力(GQA)。采用 SwiGLU 作为激活函数,并配合 RMSNorm。在此解码器基础上,HPD-Parsing 用版面协调的动态分支分叉取代了传统的单一自回归轨迹,使主版面分支和局部内容分支能够并发解码。我们先前提出的 P-MTP 被进一步整合到每个分支中,以减少剩余的自回归解码步骤。版面协调的分支解码机制及其与 P-MTP 的集成分别在 3.3 节和 3.4 节中描述。
3.3. 版面协调的并行解码
HPD-Parsing 引入版面协调的并行解码,以利用文档页面的结构局部性,缩短全页面生成的顺序执行路径。它不是沿着单一自回归轨迹生成完整的解析结果,而是将不同的解码角色分配给全局版面协调和局部内容生成。一个主版面分支按阅读顺序顺序地建立文档结构,而内容分支则被动态分叉以并发解码各个版面区域。

图 3 | HPD-Parsing 通过结合版面协调分支解码与 P-MTP 的层次化并行解码范式来加速文档解析。在 (a) 中,输入文档图像在预定义的宽高比下被编码为视觉令牌。一个主版面分支协调全局文档结构,并动态分叉多个内容分支以进行并发的局部解码,同时复用共享前缀的 KV 缓存。在每个分支内,P-MTP 通过渐进式前瞻预测进一步缩短解码路径。在 (b) 中,P-MTP 包含一个轻量级预测模块和一个渐进损失加权策略,用于监督递增前瞻深度的预测。
解码角色与序列格式。层次化解码过程包含两种类型的分支:
-
版面分支 。主版面分支按照页面的自然阅读顺序生成一个结构化序列。每个版面单元由其类别、归一化空间坐标和一个路由令牌
<FORK>表示,该令牌指示相应区域的内容可以由一个独立分支解码。 -
内容分支 。每个局部内容分支生成与一个版面单元相关的内容。其输入包括共享的视觉上下文和该单元对应的结构前缀,后跟一个过渡令牌
<CHILD>,标记局部内容生成的开始。
分支特定的序列监督 。基于两种序列格式,每个原始文档标注被转换为一个版面分支序列和一组区块特定的内容分支序列。对于版面解析,结构序列中的所有有效令牌都受到监督。对于内容解码,视觉上下文和区块特定的结构前缀仅作为条件信息,而监督被限制在 <CHILD> 之后的局部转录文本上。相应的有效性掩码定义为

动态分支分叉与高效上下文隔离 。在推理过程中,HPD-Parsing 维护一个主版面分支,按阅读顺序逐步预测文档区域。每当版面分支发出一个 <FORK> 令牌,推理调度器便为该对应区域创建一个局部内容分支。新分支复用可用的视觉和结构前缀 KV 缓存,将 <FORK> 替换为 <CHILD>,并开始生成区域内容。同时,主版面分支继续识别后续区域,允许多个内容分支并发解码。
这种设计避免了冗余的前缀计算。每个内容分支共享其分叉位置可用的视觉上下文和版面前缀,同时仅维护自身的增量内容 KV 缓存。因此,新创建的分支无需重新编码文档图像或重复共同的预填充计算。更重要的是,每个内容分支与不相关区域的详细文本历史隔离开来。在传统的全页面自回归解码下,每个新生成的令牌都关注完整的先前输出序列,导致活跃 KV 缓存和每步注意力成本随文档长度持续增长。在 HPD-Parsing 中,每个分支仅关注共享的视觉上下文、其关联的结构前缀及其自身的局部生成历史。这种共享前缀复用和局部上下文隔离的组合缩短了活跃注意力范围,并实现了高效的并发解码。
3.4. 与 P-MTP 的集成
版面协调的并行解码消除了跨文档区域不必要的顺序依赖,但每个活跃分支内的令牌生成仍然是自回归的。为进一步缩短分支内的解码轨迹,HPD-Parsing 将渐进式多词预测(P-MTP)集成到主版面分支和局部内容分支中。

在推理过程中,P-MTP 允许每个活跃分支草拟多个未来令牌,并行验证它们,并在单次解码步骤中接受多个令牌。平均接受长度为每步 6.6 个令牌,它显著减少了版面分支和内容分支所需的解码迭代次数。总的来说,版面协调的分支并发性和 P-MTP 分别缩短了跨分支和分支内的解码路径。
4. 模型训练与数据筛选
HPD-Parsing 建立在开源的 InternVL-3.5 1B 之上,并通过分阶段训练策略进一步适应,该策略由一个可扩展的数据筛选流水线支持。本节首先描述模型如何从传统的全页面解析过渡到层次化并行解码,然后介绍相应训练数据的构建和精化。
4.1. 向层次化并行解码的分阶段适应
HPD-Parsing 的训练策略旨在逐步获得通用文档解析能力,使模型适应层次化并行解码,并提高特定任务的输出质量。传统的全页面序列生成为完整的解析输出提供密集监督,因此适合学习广泛的识别、结构理解和阅读顺序建模。然而,层次化并行解码为全局版面协调和局部内容生成引入了不同的解码角色,需要分支特定的监督。此外,文档输出的显式分解使得组件级奖励分配更为可行。基于这些考虑,我们采用三阶段训练策略。
阶段 1:文档解析能力初始化。在第一阶段,HPD-Parsing 使用传统的全页面序列生成格式进行训练,以获取通用文档解析能力。每张文档图像与其完整的解析输出配对,为文本识别、版面理解、阅读顺序建模和结构化生成提供密集监督。这种公式允许模型在接触层次化解码格式之前,先从完整的页面级序列中学习。主干网络和 P-MTP 模块都在公式 2 的联合目标下进行优化,其中全页面输出中的所有有效位置都受到监督。此阶段还使 P-MTP 能够从大规模序列输出中获取渐进式前瞻预测能力。
阶段 2:解码范式转变与困难案例优化 。从阶段 1 初始化的全页面解析器开始,第二阶段通过分支特定监督使模型适应层次化并行解码。每个页面被重新组织为对应于第 3.3 节中介绍的解码角色的两种训练实例:全局版面解析和局部内容解码。版面实例监督完整的结构序列,允许主分支学习文档组织、区域分配和阅读顺序。内容实例应用公式 1 中的有效性掩码,使得仅有 <CHILD> 之后的局部转录文本对目标函数有贡献。P-MTP 在相同掩码下进行优化,将每个分支从下一词预测扩展到渐进式前瞻预测。由于模型已获得通用解析能力,此阶段主要侧重于学习新的解码格式,并加强对具有挑战性文档结构的性能。
阶段 3:奖励引导优化。在最后阶段,我们执行轻量级强化学习以改善输出一致性和容易出错的解析行为。层次化输出结构允许奖励信号更直接地分配给不同的解析组件。因此,我们构建了针对公式质量、表格解析和版面预测的任务感知奖励,以及基于计数的一致性奖励。这些信号在识别保真度、结构准确性和输出符合性方面提供细粒度反馈,使得能够进行有针对性的优化,而不会显著改变前序阶段获得的一般解析能力。

图 4 | 自动化困难感知数据筛选流水线概述,包含四个阶段:聚类与采样、多模型标注与难度估计、基于 VLM 的精化和分布平衡。
4.2. 自动化困难感知数据筛选流水线
为构建用于 HPD-Parsing 不同训练阶段的多样且可靠的训练数据,我们开发了一个自动化的困难感知数据筛选流水线,如图 4 所示。该流水线包含四个阶段:基于特征的聚类与采样、多模型标注与难度估计、基于 VLM 的精化和分布平衡。
聚类与采样。第一阶段旨在提高数据覆盖率并减少冗余。我们从原始文档图像中提取视觉特征表示,并将具有相似文档特征的样本分组到簇中。然后从不同的簇中选择代表性样本,防止筛选出的数据集被高度重复的版面或视觉上相似的页面所主导。此过程为后续标注提供了一个多样且可扩展的数据池。
多模型标注与难度估计。采样得到的文档使用互补的开源文档解析模型(包括 PaddleOCR-VL-1.5 和 MinerU-2.5 Pro)进行标注。它们的预测被用来构建初始伪标签。同时,一个中间的 HPD-Parsing 检查点为相同样本生成解析结果。我们使用 OmniDocBench 评估协议,将检查点预测与伪标签进行比较,并根据解析差异将样本分类为简单、中等和困难组。能够被中间模型可靠解析的样本被分配到较容易的组,而表现出文本或结构错误的样本则被视为困难案例。
基于 VLM 的精化。困难样本通过一个迭代精化过程进一步处理。一个更强的 VLM 首先检查当前的标注,并识别出文本识别、结构或格式方面的潜在错误。根据检测到的错误类型,使用预定义规则调整提示,并重新生成或修正标注。然后,VLM 再次评估精化后的结果。此过程持续进行,直到标注满足质量标准或达到最大 N 次精化尝试。精化阶段对于包含密集表格、多列版面、公式或模糊区域结构的复杂样本尤其有益。
分布平衡。在标注和精化之后,筛选出的样本在难度级别和文档属性之间进行平衡。我们调节简单、中等和困难样本的比例,以防止训练数据被简单案例主导。我们进一步平衡主要文档元素和版面特征的出现,包括文本块、表格、公式和复杂版面。最终生成的数据集为在层次化并行解码范式下训练提供了更广泛的结构覆盖和更可靠的监督。
该流水线在第 4.1 节中描述的三个训练阶段中不同地实例化。对于阶段 1,我们通过大规模特征聚类、过滤和采样构建了 280 万个有代表性的全页面训练样本,标注主要由 MinerU-2.5 Pro 生成。此阶段强调广泛的文档覆盖和可扩展的能力初始化。对于阶段 2,我们从更精心筛选的数据池部分构建了 10 万个分支特定样本。这些样本经过多模型标注、难度估计、分布平衡,对于具有挑战性的案例,在转换为全局版面解析和局部内容解码格式之前,还会使用更强的 VLM 进行迭代精化。对于阶段 3,我们从精化数据池中进一步选择了 600 个代表性困难案例,并根据组件特定的错误模式进行组织,为任务感知奖励优化提供有针对性的样本。
5. 推理工作流
为在推理过程中实现层次化并行解码,我们使用版面协调并行解码和 P-MTP 扩展了标准的先来先服务(FCFS)调度框架。由此产生的工作流动态分叉并发的内部分支,复用共享前缀的 KV 缓存,并加速所有解码分支的令牌生成,如算法 1 所形式化。

6. 实验
6.1. 实验设置

在推理方面,我们在 vLLM 0.17.1 上构建部署系统,并在 NVIDIA A800 GPU(80GB 内存)上评估吞吐量。我们在 vLLM 服务框架内实现了所提出的层次化解码机制,同时保留其先来先服务调度策略以维持稳定的在线服务行为。每个解码分支的最大生成长度设置为 8,000 个令牌。
评估指标。我们在广泛采用的文档解析基准 OmniDocBench 上评估我们的模型,该基准从多个维度全面评估文档解析能力,包括文本识别、公式识别、表格结构提取和阅读顺序预测。遵循文档解析文献中的标准实践,我们采用任务特定指标进行全面评估:(1)文本编辑距离(Edit)衡量文本识别的字符级准确性;(2)公式 CDM(CDM)评估数学公式识别质量;(3)表格 TEDS(TEDS)和表格 TEDS-S(TEDS-S)评估有无内容识别时的表格结构提取准确性;(4)阅读顺序编辑距离(Edit)量化预测阅读序列的正确性。总体得分计算为文本、公式和表格识别的加权平均值。
6.2. 主要结果
有效性比较。表 1 将 HPD-Parsing 与 OmniDocBench v1.6 上最先进的文档解析方法进行了比较。通过将全局版面协调与局部并行解码相结合,HPD-Parsing 保留了页面级结构,同时减少了困难区域对整体输出的影响。仅用 1B 参数,它就达到了 94.91 的总体得分,在端到端统一解析器中确立了新的最先进水平,并优于诸如 Qianfan-OCR、Logics-Parsing-v2 和 FireRed-OCR 等更大模型。尽管使用的训练样本少得多,它也与领先的基于流水线的解析器具有竞争力,实现了 0.124 的 ReadOrderEdit 得分。这表明分解版面监督和内容监督能够实现更有针对性的优化,而统一架构可能通过允许在感知整个页面的情况下解释每个区域,更好地保留全局文档上下文。
效率比较。表 2 比较了不同文档解析方法在 OmniDocBench v1.6 上的推理效率,以及它们的平均输入令牌数。与自回归基线相比,HPD-Parsing 将吞吐量从 1.02 PPS 和 1,554.8 TPS 分别提高到 2.68 PPS 和 4,752.1 TPS,分别对应 2.62× 和 3.06× 的提升。这一显著增益是通过用层次化并行解码取代传统的单一自回归轨迹实现的,这使得在版面协调的内容分支间进行并发解码成为可能,并通过 P-MTP 进一步减少了每个分支内的解码步骤。输入令牌数为解释效率比较提供了额外背景,因为更长的输入通常会带来更大的性能分析和注意力开销。尽管每页处理约 4,800 个输入令牌,是 DeepSeek-OCR-2 的四倍多,HPD-Parsing 仍然实现了高出 1.31× 的 PPS 和 1.62× 的 TPS,展示了在相当大的输入令牌预算下的强大推理效率。
为了研究加速增益如何随生成长度变化,我们将 OmniDocBench v1.6 测试集划分为输出长度区间,并比较 HPD-Parsing 与普通自回归基线。如图 5 所示,随着输出序列的增长,效率优势变得越来越明显。传统的统一文档解析器沿着单一自回归轨迹生成整个页面,导致解码步骤数大约随总输出长度增加。相比之下,HPD-Parsing 使用主版面分支进行全局协调,并将局部内容解码委托给并发的分支。因此,关键解码路径主要由最长的活跃分支决定,而不是所有区块长度的总和。P-MTP 通过在每个步骤生成和接受多个令牌,进一步缩短了每个局部解码轨迹。通过结合版面协调的分支并发性和渐进式多词预测,HPD-Parsing 缓解了传统自回归文档解析中与序列长度相关的减速。其加速优势因此随文档长度增长,在最长输出长度区间中,解码步骤最多减少 18.04×,请求吞吐量提高 3.67×,单请求延迟降低 5.80×。这些结果表明,层次化并行解码有效缓解了传统自回归文档解析中序列长度相关的减速。
表 1 | OmniDocBench v1.6 上的性能比较。每个类别中的最佳结果以粗体显示。


6.3. 定性分析
复杂文档的全面覆盖。我们的方法在具有不同结构特征的文档页面上展现出稳健的解析性能。图 6 展示了在具有复杂数学表达式的文档上的代表性结果。模型准确地转录了长多行公式、矩阵方程、分数和密集排列的数学符号,同时保留了有效的 LaTeX 结构以进行忠实渲染。图 7 进一步在表格密集型文档上评估了该方法。结果表明,它能够以结构化的 HTML 表示恢复大型且数据密集的表格,包括多行和多列结构,同时保持原始单元格组织。最后,图 8 展示了在具有挑战性版面的页面上的性能,包括报纸和拼图式文档。模型保留了交错文本块、图形和其他视觉元素的空间排列和阅读顺序,使得能够连贯地重建整体页面结构。这些定性示例共同表明,统一解析框架能够在全页面转录中一致地处理异构文档内容。
与竞争方法的比较优势。我们提供了与传统基于流水线的解析器和竞争性统一 VLM 方法相比,我们的层次化并行解码范式的关键优势的定性比较。图 9 展示了竞争方法的代表性失败案例以及我们成功的解析结果,突出了三个关键优势:


- 对检测错误的鲁棒性。基于流水线的方法严重依赖版面分析阶段。如图 9(a) 所示,不准确或不完整的边界框可能排除相关内容或混合相邻区域,直接导致后续阶段出现识别错误。相比之下,HPD-Parsing 在解析过程中结合了文档级视觉和语义上下文,使其能够在区域定位不完美的情况下仍能正确识别。


-
处理视觉相似字符。图 9(b) 展示了一个涉及视觉相似字符 '0' 和 'O' 的代表性案例。基于流水线的方法处理孤立的文本区域,上下文信息有限,因此可能将数字零与大写字母 O 混淆。通过利用更广泛的文档上下文,HPD-Parsing 能够更可靠地区分这两个字符并产生正确的解析结果。
-
错误传播预防。统一的自动回归方法一旦发生错误,可能会进入重复解码状态,导致错误的输出传播到后续的文档内容中。如图 9(c) 所示,竞争方法重复生成相同的文本片段。在 HPD-Parsing 中,局部内容在独立分支中解码,将重复错误限制在单个区域内,防止其影响后续的文档区块。
7. 结论与未来工作
在本文中,我们提出了 HPD-Parsing,一个轻量级、高吞吐量的文档解析器,建立在层次化并行解码范式之上。受文档解析需要全局协调而内容解码在很大程度上是局部化的观察所驱动,HPD-Parsing 用主版面分支进行全局协调和用于区域级内容生成的并发的局部解码分支取代了传统的单一自回归轨迹。渐进式多词预测进一步减少了版面分支和内容分支内的解码步骤。在公共基准上的实验表明,HPD-Parsing 在保持具有竞争力的解析精度的同时,显著提高了推理吞吐量,验证了版面协调的并行并发性作为完全顺序文档生成的有效替代方案。更广泛地讲,文档的全局协调但局部可分解的结构表明,层次化并行解码可能扩展到单页解析之外,应用于关键信息提取、多页文档理解和其他结构化生成任务。未来,我们将进一步扩展训练数据以提高在更广泛的文档场景中的覆盖率,并探索能够减少有效注意力上下文和每步解码所需计算量的结构感知注意力设计。