阅读笔记:ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

资源

TL;DR

这篇论文用 一个五轴挑战标注的 benchmark(370 篇真实/合成企业文档、4869 页、8 领域 67 文档类型)+ value F1 与 word/page-level grounding + 成本的联合评估 解决了 schema-guided 企业文档抽取缺乏"广覆盖 + 可溯源 + 可比成本"统一评测 的问题。核心结论是 不同系统族在质量-成本前沿上占据截然不同的位置:裸 VLM 便宜(≤1.0¢/page)但 F1 不超 80% 且长文档/巨型表崩塌,coding agent 健壮但 >15¢/page,specialized API(尤其 LlamaExtract Agentic Plus)在最前方(95.6% F1 @ 8.1¢/page) ,且即便最强的 word-level grounding F1 也不到 50%。主要 caveat:benchmark 由 LlamaIndex 团队构建,而全面领先的 LlamaExtract 正是其自家产品,利益冲突需打折看。

1. 研究内容

1.1 研究问题、痛点与动机

  • 研究问题 :给定一篇文档和一个用户自定义 JSON Schema,抽取系统能否在"值正确且完备 + 每个值能溯源到原文位置 + 单页成本可控"三方面同时达标?形式化即 f:(document, schema)⟼(structured data, evidence)f:(\text{document},\ \text{schema}) \longmapsto (\text{structured data},\ \text{evidence})f:(document, schema)⟼(structured data, evidence)。
  • 痛点:企业要把金融报表、保险理赔、采购单、政府表单里的结构化数据从文档里抽出来进系统,历史上靠人工录;现有 benchmark 各覆盖一窄条------固定模板的 KIE(SROIE/DocILE/RealKIE)不接受用户自定义 schema,schema-guided 的新基准(ContextualAI ExtractBench / LongArray-Extract / LongExtractBench-50 / VAREX)要么只几十篇、要么只合成单页、要么不评 grounding 也不量成本;于是无法横向比较不同系统族、也无法定位失败到底来自"长列表截断 / 扫描噪声 / 表格错拼 / schema 太大"中的哪一个。
  • 动机 / 为什么重要:企业部署是百万页量级,"每页差一分钱就决定 AI 项目是否划算"(100 万页 × 1¢ = $10,000),且出错代价高、必须有 grounding 让人在环审计;一个能同时量准确率、溯源、成本并按挑战维度切片的 benchmark,直接决定系统能不能上生产。
  • 领域定位:文档智能 / 信息抽取(document IE)的评测方向;上接 OCR 与版面分析,下接 RAG 与企业工作流自动化。

1.2 核心贡献

  • 一个挑战标注、广覆盖的 benchmark :370 篇文档 / 4869 页 / 8 业务领域 / 67 文档类型,每篇沿五个独立轴(任务挑战、感知挑战、表格结构、长度、领域)打标签,支持按挑战切片归因失败。
  • 一套可扩展的 schema 与 ground truth 构建流水线:真实文档用前沿模型 ensemble 共识 + 分歧裁决;合成长列表用"数据先于文档"的程序化生成保证 ground truth 精确;扫描表单用人工逐字段核验。不靠纯人工逐字段标注。
  • 一次覆盖 14 个前沿系统的广谱评测:横跨商用 VLM、开源抽取模型、coding agent、specialized API,同时报准确率、grounding、成本与质量-成本权衡。

1.3 相关工作脉络

#mermaid-svg-R6UrtHSOIQvaKCkA{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-R6UrtHSOIQvaKCkA .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-R6UrtHSOIQvaKCkA .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-R6UrtHSOIQvaKCkA .error-icon{fill:#552222;}#mermaid-svg-R6UrtHSOIQvaKCkA .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-R6UrtHSOIQvaKCkA .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-R6UrtHSOIQvaKCkA .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-R6UrtHSOIQvaKCkA .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-R6UrtHSOIQvaKCkA .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-R6UrtHSOIQvaKCkA .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-R6UrtHSOIQvaKCkA .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-R6UrtHSOIQvaKCkA .marker{fill:#333333;stroke:#333333;}#mermaid-svg-R6UrtHSOIQvaKCkA .marker.cross{stroke:#333333;}#mermaid-svg-R6UrtHSOIQvaKCkA svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-R6UrtHSOIQvaKCkA p{margin:0;}#mermaid-svg-R6UrtHSOIQvaKCkA .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-R6UrtHSOIQvaKCkA .cluster-label text{fill:#333;}#mermaid-svg-R6UrtHSOIQvaKCkA .cluster-label span{color:#333;}#mermaid-svg-R6UrtHSOIQvaKCkA .cluster-label span p{background-color:transparent;}#mermaid-svg-R6UrtHSOIQvaKCkA .label text,#mermaid-svg-R6UrtHSOIQvaKCkA span{fill:#333;color:#333;}#mermaid-svg-R6UrtHSOIQvaKCkA .node rect,#mermaid-svg-R6UrtHSOIQvaKCkA .node circle,#mermaid-svg-R6UrtHSOIQvaKCkA .node ellipse,#mermaid-svg-R6UrtHSOIQvaKCkA .node polygon,#mermaid-svg-R6UrtHSOIQvaKCkA .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-R6UrtHSOIQvaKCkA .rough-node .label text,#mermaid-svg-R6UrtHSOIQvaKCkA .node .label text,#mermaid-svg-R6UrtHSOIQvaKCkA .image-shape .label,#mermaid-svg-R6UrtHSOIQvaKCkA .icon-shape .label{text-anchor:middle;}#mermaid-svg-R6UrtHSOIQvaKCkA .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-R6UrtHSOIQvaKCkA .rough-node .label,#mermaid-svg-R6UrtHSOIQvaKCkA .node .label,#mermaid-svg-R6UrtHSOIQvaKCkA .image-shape .label,#mermaid-svg-R6UrtHSOIQvaKCkA .icon-shape .label{text-align:center;}#mermaid-svg-R6UrtHSOIQvaKCkA .node.clickable{cursor:pointer;}#mermaid-svg-R6UrtHSOIQvaKCkA .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-R6UrtHSOIQvaKCkA .arrowheadPath{fill:#333333;}#mermaid-svg-R6UrtHSOIQvaKCkA .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-R6UrtHSOIQvaKCkA .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-R6UrtHSOIQvaKCkA .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-R6UrtHSOIQvaKCkA .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-R6UrtHSOIQvaKCkA .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-R6UrtHSOIQvaKCkA .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-R6UrtHSOIQvaKCkA .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-R6UrtHSOIQvaKCkA .cluster text{fill:#333;}#mermaid-svg-R6UrtHSOIQvaKCkA .cluster span{color:#333;}#mermaid-svg-R6UrtHSOIQvaKCkA div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-R6UrtHSOIQvaKCkA .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-R6UrtHSOIQvaKCkA rect.text{fill:none;stroke-width:0;}#mermaid-svg-R6UrtHSOIQvaKCkA .icon-shape,#mermaid-svg-R6UrtHSOIQvaKCkA .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-R6UrtHSOIQvaKCkA .icon-shape p,#mermaid-svg-R6UrtHSOIQvaKCkA .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-R6UrtHSOIQvaKCkA .icon-shape .label rect,#mermaid-svg-R6UrtHSOIQvaKCkA .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-R6UrtHSOIQvaKCkA .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-R6UrtHSOIQvaKCkA .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-R6UrtHSOIQvaKCkA :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} SROIE

Huang et al., 2019
DocILE

Šimsa et al., 2023
RealKIE

Townsend et al., 2024
ExtractBench(本文)

LlamaIndex, 2026
ContextualAI ExtractBench

Ferguson et al., 2026
LongArray-Extract

Extend AI, 2026
LongExtractBench-50

micro1, 2026
VAREX

Barzelay et al., 2026

  • 关键传承:固定本体 KIE 线(SROIE → DocILE → RealKIE)逐步从收据/表单扩到多语言、企业域、行项目与长文档,但目标字段始终预设固定,不测"跟随用户新 schema"的能力;schema-guided 线的四 个新基准各压一个维度------ContextualAI ExtractBench 压 schema 复杂度(最多 369 字段但仅 5 个共享 schema)、LongArray-Extract 与 LongExtractBench-50 压长文档行完整性、VAREX 用每文档一 schema 的合成单页表单。本文把这四条线的覆盖面合并到一份 benchmark 里。
  • 分歧 :本文是唯一同时评长列表完整性、真实扫描与手写、word/page-level grounding、实测成本的基准(Table 1/7);且强调五个独立轴而非单一聚合分,使"低分能追溯到真实成因"。注意:与 Contextual AI 那篇同名 ExtractBench 12 是不同工作,作者专门加了 footnote 区分。

2. 方法概要

  • 方法路线:系统构建 / 基准评测(benchmark + 评测协议 + 14 系统横评),非理论证明也非单一新模型。
  • 关键假设
    • 显式:同一文档类型共享一个 schema;schema 写得足够明确时每个字段有确定性期望值;五个挑战轴互相独立、可正交归因。
    • 隐式(读者识别):合成文档虽程序化生成、ground truth 精确,但能代表真实企业文档的视觉变异性;ensemble 共识的 ground truth 接近"真值";用公开牌价重构的成本能反映真实部署开销。
  • 数据 / 实验设置:370 篇文档来自三种来源(真实 born-digital、基于真实版面的合成长列表、真实监管/税表扫描件),其中 38 篇为"扫描退化重捕"(clean 原件的旋转+透视+噪点版本,值不变);14 个系统在相同 document-schema 对上跑、无 benchmark 专属调参,运行于 2026 年 6--7 月;指标为 value F1、word/page-level grounding F1、¢/page 成本(附录 C.2 用 2026-07-01 公开牌价按实测 token/credit 消耗重构)。
  • 训练目标:n/a(benchmark 论文,无训练)。

整体处理流程(鸟瞰):评测一篇文档时,系统拿到完整文档 + 用户写的 JSON Schema 作为输入,产出一个 schema-valid 的 JSON 对象,其中每个标量值和每条对齐后的记录子字段都要带上 source page 与 bounding box 作为 evidence。评分端把预测输出与 ground truth 都展平成 cells(一个标量字段、一个对齐后的记录子字段各一个 cell),先做归一化(日期转 ISO、空白压缩、其余精确相等、无数值容差无 LLM judge),再用 Hungarian 算法对数组记录做全局最优一对一配对,逐 cell 按"期望-预测"状态表(Table 9)判 correct/miss,算出 per-document 的 micro precision/recall/F1,slice 与 overall 取 per-document F1 的无权重均值。对带人工核验 box 的字段额外评 grounding:word-level 要求值正确且预测 box 与真值 box 在正确页上 IoU≥0.5,page-level 只要求值正确且给对源页。最后把 F1 与实测 ¢/page 摆到质量-成本前沿图上横评。

2.1 架构图

上图(原文 Figure 2)展示 ground truth 如何由三种来源各自构建:卡片边框颜色标执行者(蓝=抽取模型池、紫=coding-agent 流水线代码、琥珀=人工),绿色填充卡是产出的 ground truth,橙色虚线标修复与分歧裁决回路。三条流水线分别是:真实文档(上条,多系统 ensemble 提议 + 分歧裁决)、合成长列表(中条,数据先于文档的程序化渲染 + ground truth 精确回读)、扫描表单(下条,schema 冻结后 ensemble 投票 + 人工逐字段核验 box)。

2.2 模块详解

  • 任务定义模块(输入→输出)

    • 处理流程:1. 输入一篇完整文档(born-digital 或扫描)+ 用户写的 JSON Schema(列字段名、类型、自然语言描述,可含标量、嵌套对象、记录数组、可空字段、值约束);2. 系统按 schema 抽取;3. 输出 schema-valid JSON,每个值带 source page 与 bounding box;4. 文档里没有的字段必须显式返回 null(不能省略键)。
    • 设计理由:JSON Schema 是工业界结构化输出的事实标准,"一 schema 覆盖同类型所有文档"贴近企业"为每个新工作流写一个 schema"的真实用法;强制 null 而非省略键,让空字段也被正确计入评分(见 Metrics 模块)。
    • 关键参数:schema 由用户而非 benchmark 预设------这正是 schema-guided 与固定本体 KIE 的本质区别。
  • Taxonomy 五轴标注模块(挑战归因)

    • 处理流程:每篇文档被沿五个独立轴打标签------任务挑战(T1 长列表完整性 / T2 大海捞针 / T3 密集文档)、感知挑战(P1 旋转或纯图 / P2 扫描 / P3 手写)、表格结构(S1 合并表头 / S2 透视或表头不在顶部 / S3 跨页 / S4 千行以上巨型表 / S5 单元格内嵌套表)、长度(L1 ≤10 页 / L2 11--50 / L3 >50)、业务领域(D1--D8)。
    • 设计理由:单一聚合分无法区分"漏了三分之一的行"与"读错一个标签",也无法区分"任务难"与"扫描差";独立轴让低分能追溯到真实成因。表格单列一轴是因为表格会"逐值读对却拼成错误结构",这种失败任务轴和感知轴都隔离不了。
    • 关键参数:标签可跨轴重叠(同一文档可同时是 T1 + P2 + S3 + L3 + D1);Figure 1 给出各标签在 370 篇中的占比。
  • Ground truth 三流水线模块(按来源分工)

    • 真实文档(ensemble 共识):1. 从样本文档起草 schema(字段描述带别名、格式要求、位置提示、勿混指引);2. 跑多个不同模型/流水线家族的抽取系统(同家族共享错误,故刻意跨家族);3. 所有系统一致同意的值(含空字段的 null)成为候选 ground truth;4. 分歧按成因分类------若多种读法都站得住脚说明 schema 有歧义,就收紧描述直到重跑收敛,若只有一种读法站得住脚就是模型失败,由审查者对照页面裁定。设计理由:单系统输出做 ground truth 会重复其错误并偏向该系统。
    • 合成长列表(精确构造):1. 选一个真实长列表版面(基金附表、持仓登记、债权人矩阵);2. 数据先于文档------先产出记录(逐字解析或按真实风格生成),再让 coding agent 研究版面字体/列宽/页眉写出渲染代码;3. 渲染成贴近真实的 PDF,按实测尺寸分页(而非固定行数/页,否则产生假分页与错误源页标签);4. 因为值在 PDF 存在前就已知,页码与 word-level box 从渲染结果回读,ground truth 无论列表多长都精确;5. 机械检查捕风格不匹配与裁剪,再由抽取系统池审计完工文档暴露渲染 bug。设计理由:数千条相似记录人工标太慢太易错,"先造数据再造文档"让 ground truth 生而可信、无需人工标值。
    • 扫描表单(人工核验):1. schema 对照空白模板起草并在标注前冻结(之后改动需版本号 + 定向复审);2. 最多五个系统 ensemble 对每个 schema 叶节点投票,争议叶节点交给必须先看页面才裁决的 adjudication agent;3. 由单一 citation 管线提议每字段 box(box 永不跨系统合并);4. 人工标注者对每字段 accept/edit/null/redraw。产出 169 篇人工核验文档,84% 核验字段带人工放置的 box(其余多为空字段,页面无物可框)。
    • 设计理由:三种来源各有短板,按各自最合适的方法标注------真实文档给版面/扫描噪声/领域跨度但逐字段画框太慢,合成覆盖太大无法手标,扫描件必须由人判断手写与介于两字段间的标记。退化扫描重捕不需新标注(值不变,clean 的 ground truth 直接沿用)。
  • Metrics 模块(value F1 + grounding)

    • value F1 评分流程:1. 预测与 ground truth 各展平成 cells;2. 归一化(8 种日期格式转 ISO、空白折叠、其余精确相等、无数值容差无 LLM judge);3. 数组用 Hungarian 算法做全局最优一对一配对(代价=不匹配子字段数,最小化总代价等价于最大化字段一致;完全匹配的行用 hash join 预配对作加速快路径);4. 按 Table 9 状态表逐 cell 判定------值匹配值=correct(计入 P 和 R)、值→null=两边 miss、null→null=correct、null→值=两边 miss(hallucination)、记录少了=缺记录 cell 仅计 R miss、记录多了=多余记录 cell 仅计 P miss;5. per-document 算 micro P/R/F1,slice 与 overall 取 per-document F1 无权重均值(文档字段多不加大权重)。
    • 设计理由:数组用 Hungarian 对齐而非按位置,是因为记录顺序不应影响值分;显式 null 计入两侧分母,让"诚实返回 null"不被惩罚、让"空字段上幻觉"同时扣 P 和 R;只有重复记录会把 P 和 R 拆开,所以 P-R 差直接诊断"截断 vs 多余记录"。
    • grounding:仅对带人工核验 box 的字段评;word-level 要求值正确且预测 box 与真值 box 在正确页 IoU≥0.5,page-level 只要求值正确且给对源页;grounding 的 P 分母只计可评分 claim、R 分母只计带核验 box 的 ground truth cell、无核验 box 的文档不产生 grounding 分(而非记零)。
    • 关键约束:每篇文档上恒有 value F1 ≥ page F1 ≥ word-level grounding F1(前者是后者的门控)。

2.3 算法 / 伪代码

原文无 Algorithm 伪代码框;评分是完全确定性的("the same predictions and ground truth always produce the same same score, with no model in the loop"),核心规则在 §2.4 与附录 B。其算法性流程已在 2.2 Metrics 模块中逐步说明(cell 展平 → 归一化 → Hungarian 对齐 → 状态表判定 → micro P/R/F1 → 无权重均值),附录 B.1--B.4 给出精确匹配规则、缺失值语义(Table 9)、数组对齐细节与聚合/grounding 门控定义,可直接复现,无需伪代码框。

3. 关键结果

  • 主要发现
    • 系统 族在质量-成本前沿上占据截然不同的区域------裸 VLM(GPT-5.4 Nano、Gemini 3.5 Flash 及四个自托管 OSS)占低成本端(≤1.0¢/page)但 F1 都不超 80%;coding agent(Claude Code Opus 4.8、Codex GPT-5.5)达 87--94% F1 但 >15¢/page;specialized API 跨度最大,LlamaExtract 三档描绘前沿。
    • 长文档是裸 VLM 的死穴:Gemini 3.5 Flash 从短文档 87.9% 暴跌到长文档 27.9%,多数 VLM 长文档 < 40%;而 LlamaExtract Agentic Plus 在三档长度上从不低于 90%(96.6 / 93.3 / 94.4)。
    • 巨型表(S4,千行以上)是"最锋利的分水岭":所有 VLM < 10%(Gemma4 26B 与 Gemini 3.5 Flash 低至 0.0% / 1.5%),只有 LlamaExtract Agentic Plus(95.9%)、Reducto Deep Extract(95.3%)、Claude Code Opus 4.8(87.8%)能扛。
    • Grounding gap:所有 VLM 和 coding agent 默认不返回 evidence,word/page-level grounding 直接记零;即便返回 box 的 specialized 系统,最好的 word-level grounding F1 也 < 50%(LlamaExtract Agentic Plus 46.4%),但 page-level 能到 84.9%。
    • 模型层级不预测抽取质量:GPT 家族是唯一质量随成本单调上升的(Nano 74.9 → Mini 85.2 → GPT-5.5 88.7);Gemini 基本持平甚至略降(Flash Lite 79.6 → Flash 79.8 → Pro 78.2);Claude 非单调且因拒签 Automotive 与 K-1 schema(33 篇 / 8.9%)拉低分数。
  • 证据强度:370 篇文档的横评,每系统每切片报 unweighted document-level mean F1;附录 D 给出 precision/recall 分拆(Table 13)证明长文档失败集中在 recall(整条记录被丢,而非读错值);成本用公开牌价按实测消耗重构(附录 C.2 透明列出所有定价)。无置信区间/无多次重复(单次运行),但确定性评分 + 统一输入降低了运行间噪声。
  • 最支撑结论的一条证据 :Table 2 的 Document Length 切片 + Table 13 的 P-R 分拆------长文档上 Gemini 3.5 Flash 的 Δ=P−R=57.2\Delta=P-R=57.2Δ=P−R=57.2 个百分点(P=83.7、R=26.5),直接证明"裸 VLM 长文档失败是截断(recall 崩)而非读错",这是"VLM 便宜但截断长列表"结论的最硬证据。

3.1 关键结果图 / 表

上图(原文 Figure 3)是 headline 结果:横轴实测 ¢/page(对数轴),纵轴 overall unified value F1。可读出三层信息------VLM 聚在最左低成本区但顶部被 80% 压住;两个 coding agent 在右上高质高代价区(>15¢/page);LlamaExtract 三档沿前沿排列,Agentic Plus(95.6% @ 8.1¢/page)在最右上方、质价比同时压住两个 coding agent。

上图(原文 Figure 7)把 GPT/Gemini/Claude 三家族的 basic/medium/flagship 三档连成线:只有 GPT 质量随成本单调上升,Gemini 与 Claude 都非单调------说明"换更大的模型"不必然换来更好的文档抽取,最佳工作点取决于成本-质量权衡而非模型层级。

下表重现 Table 2 的关键切片(Overall + 长度 + 任务挑战 + 巨型表 S4),系统列选 8 个代表(完整 14 系统见原文 Table 2):

系统(族) Overall L1 短 L2 中 L3 长 T1 长列表 T2 大海捞针 T3 密集 S4 巨型表
LE Agentic Plus(specialized) 95.6 96.6 93.3 94.4 96.1 93.6 95.5 95.9
LE Cost-Effective(specialized) 86.8 90.8 80.1 69.2 81.8 82.3 90.5 67.8
Reducto Deep Extract(specialized) 90.4 94.2 80.5 92.0 94.8 92.5 87.5 95.3
Codex GPT-5.5(coding agent) 93.6 95.7 91.2 78.9 91.7 91.7 95.4 78.9
CC Opus 4.8(coding agent) 87.1 90.1 79.2 88.1 93.6 89.1 82.4 87.8
GPT-5.4 Nano(VLM) 74.9 77.4 76.4 35.8 72.2 74.0 76.4 7.2
Gemini 3.5 Flash(VLM) 79.8 87.9 69.8 27.9 78.8 87.9 80.5 1.5
Qwen3.6 35B-A3B(OSS VLM) 87.3 93.1 84.8 26.8 79.0 85.3 93.1 1.3

(数值为 unified value F1 %,取自原文 Table 2;加粗为该行最高。完整 14 系统 × 全维度见原文 Table 2,子标签细拆见 Table 14。)

下表重现 Table 3 的 grounding 结果(完整):

系统 word-level F1(Overall) word-level F1(长文档) page-level F1(Overall) page-level F1(长文档)
LE Agentic Plus 46.4 54.7 84.9 87.1
LE Agentic 44.1 45.7 66.1 67.6
LE Cost-Effective 40.4 36.7 64.2 56.5
Datalab A+B 2.0 0.0 48.5 0.0
Extend Max Context 25.1 0.0 48.9 0.0
Reducto Deep Extract 43.3 41.1 71.7 67.3
所有其余系统 0.0 0.0 0.0 0.0

(% ,取自原文 Table 3;VLM 与 coding agent 默认不返回 evidence 故全零。)

  • 重点解读
    • 质量-成本前沿图:LlamaExtract Agentic Plus 在右上角"同时"比两个 coding agent 质量更高(95.6 vs 93.6/87.1)、成本更低(8.1 vs 27.8/16.2 ¢/page),是全文最核心的单点结论;但这也是利益冲突最刺眼之处(见 §4.1)。
    • Table 2 长度切片:裸 VLM 在 L3 长文档上的崩塌(Gemini 27.9、GPT-5.4 Nano 35.8、Qwen3.6 26.8、Gemma4 12.2、NuExtract3 8.9)是系统性而非个例;Reducto(92.0)与 Claude Code Opus 4.8(88.1)在长文档上反常地稳------前者是 specialized API 的长文档策略,后者是 coding agent 的迭代工具循环。
    • Table 2 的 S4 巨型表:所有 VLM < 10%,这是"逐值读对却拼不对结构"或"读到一半就停"的最纯样本;CC Opus 4.8 在此拿到 87.8%,说明 coding agent 的"写解析脚本跑"策略对超大表有效。
    • Table 3 grounding:word-level 与 page-level 的巨大鸿沟(Agentic Plus 46.4 vs 84.9)说明"找对页"远比"圈对词"容易;Extend 与 Datalab 在长文档上 word/page-level 双零,说明其 grounding 在长文档上完全失效。

4. 批判性评估与价值

4.1 批判性评估

评估:这篇 benchmark 在设计与执行层面相当扎实------五个独立挑战轴解决了"单聚合分无法归因"的老问题;三流水线 ground truth 构建把"无法纯人工标注"的规模问题用 ensemble 共识 + 程序化精确构造 + 定向人工核验组合化解,且每种来源都诚实声明了 ground truth 的背书强度(共识确认 / 构造精确 / 人工核验);评分完全确定性、无数值容差无 LLM judge,避免了主观打分;成本核算在附录 C.2 透明列出所有定价与重构规则,是同类 benchmark 里少见的诚实。precision/recall 分拆(Table 13)把"截断"从"读错"中隔离出来,是很有说服力的诊断证据。

评估:但最不容回避的是利益冲突 ------benchmark 由 LlamaIndex 团队构建,而全面领先(Overall、三档长度、T1/T3、S4、page-level grounding 全拿下)的 LlamaExtract Agentic Plus 正是 LlamaIndex 的商业产品。最强反方论证是:schema 全部由 LlamaIndex 团队撰写,即便无主观恶意,schema 的字段描述风格、勿混指引、位置提示也可能无意中更契合自家系统的处理路径;更微妙的是 Agentic Plus 用了"per-document extraction with confidence scores"的机制(附录 C.1),若该机制与评分的 cell 对齐 / null 语义更兼容,就构成结构性有利偏差。作者的部分缓解措施是实打实的:所有系统吃相同 document-schema 对、无 benchmark 专属调参、成本用公开牌价、ground truth 由跨家族 ensemble 共识而非任一被评测系统决定。但这些措施挡不住"schema 写法偏向"与"评分协议偏向"这两条更隐蔽的路径。读者应把"Agentic Plus 全面最优"的结论打折看------它很可能确实强(Reducto Deep Extract 作为独立第三方产品在多数切片也紧随其后,间接佐证 specialized API 族的整体优势是真的),但"刚好自家产品每项第一"的画面需要独立复现才能坐实。

评估:第二个值得说的是规模与代表性。370 篇相对 DocILE(6680)、VAREX(1798)小很多,作者用"广度 + 真实 + 多维"辩护且合成长列表补规模,逻辑成立;但 67 种文档类型分摊下来平均每种约 5.5 篇,长文档(L3)只有 20 篇、房地产(D8)只 6 篇,部分切片的得分波动会更受个别文档影响。合成长列表虽 ground truth 精确,但作者自己承认"generated documents do not capture the visual variability...of real enterprise data"------S4 巨型表的高分系统之所以集中在 specialized API 与 coding agent,部分可能因为这些系统能处理"规整的合成大表",而真实世界的脏大表未必如此。

评估:grounding 的 IoU 0.5 阈值是未经敏感性分析的选择------word-level F1 全员 < 50% 的结论,在更松阈值下可能没那么悲观,论文未给阈值扫描,略可惜。另外 14 个系统里"裸 VLM(单次模型调用)"与"specialized API(含预处理+解析+抽取的完整流水线)"被放一张图比较,严格说不在同一起跑线,但论文的 framing 本就是"比较不同 family 的工程权衡"而非"比较模型能力",这个 framing 站得住。

综合可信度:中------高。基准设计、评分确定性、成本透明度都是高质量;最大阴影是利益冲突,作者的程序性缓解部分有效但无法排除 schema/评分协议偏向。结论的"方向"(VLM 便宜但截断、coding agent 健壮但贵、specialized API 占前沿、grounding 是 open problem)可信;结论的"具体排名"(Agentic Plus 每项第一)需独立复现打折看。

4.2 Limitations 与复现性

  • 论文自承:合成文档不捕获真实视觉变异性;370 篇规模相对较小;单次运行无置信区间;Claude 家族拒签部分 schema 拉低分数(33 篇)。
  • 读者发现:grounding IoU 0.5 阈值无敏感性分析;schema 全由 LlamaIndex 团队撰写存在潜在偏向;L3 仅 20 篇、D8 仅 6 篇,小切片波动大;裸 VLM 与完整流水线 specialized API 同图比较、起跑线不同。
  • 复现性:代码 是(GitHub run-llama/ExtractBench) · 数据 是(HuggingFace llamaindex/ExtractBench) · 超参/定价 是(附录 C 详列 prompt、配置、2026-07-01 牌价) · (uncertain) 各被评测系统的具体版本快照与运行日志是否全开源未读清。

4.3 可复用与后续

  • 可借鉴:五轴独立挑战 taxonomy 的归因思路;unified value F1 的 cell 展平 + Hungarian 对齐 + 归一化评分法(附录 B 可直接实现);ground truth 三流水线(ensemble 共识 / 数据先于文档的精确合成 / 定向人工核验)的分工策略;质量-成本前沿的联合评估框架。
  • 引用场景 :做文档抽取/IE benchmark 或评测 schema-guided 抽取系统时;讨论 VLM 在长文档/巨型表上的系统性局限时;论证 grounding 是 open problem 时;BibTeX key 候选 zhang2026extractbench
  • 下一步
    • 若做文档抽取,下载 ExtractBench 数据集测自家系统,重点跑 L3 长文档与 S4 巨型表两切片
    • 关注 word-level grounding(全员 < 50%)这块 open problem,看是否有可突破的研究点
    • 独立复现时优先验证 schema 是否对 LlamaExtract 有偏向(用第三方重写部分 schema 再跑)

Verdict

推荐深读(领域相关者) --- 对做文档智能 / 企业信息抽取 / RAG 上游文档处理的人,这是 2026 年最值得读的基准之一:五轴 taxonomy、确定性的 unified value F1、ground truth 三流水线、质量-成本联合评估都是可直接借鉴的方法论,14 系统横评的失败模式数据(长文档截断、巨型表崩塌、grounding gap)极有参考价值。领域外读者选读 TL;DR + Figure 3 即可。最大保留意见:利益冲突使"自家产品每项第一"的排名需独立复现打折看。

作者:lusca

版本:lusca-paper-read v1.10.3

出处:https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-paper-read

相关推荐
尤乐娃子2 小时前
进入大厂(厂子大)实习Day8
前端·笔记·实习
一只小菜鸡..2 小时前
南京大学 操作系统 (JYY) 学习笔记:持久化的黑魔法——从磁铁、刻坑到闪存电荷
服务器·笔记·学习
aFakeProgramer2 小时前
Linux版本兼容问题及RTA-VRTE环境配置笔记
linux·笔记
龙仔7254 小时前
RustDesk 完整笔记
运维·笔记·rust·远程工具·rustdesk
HJX_07244 小时前
嵌入式软件C语言八股文复习笔记5——编译、链接与底层硬核机制
c语言·开发语言·笔记
摇滚侠4 小时前
《SpringBoot 3:入门与应用实战》第 15 章 生产级特性 监控指标 Metrics 阅读笔记
java·spring boot·笔记
噜~噜~噜~5 小时前
操作系统笔记-1.1.3 操作系统的特征
笔记·操作系统
杨先生哦5 小时前
【2026热端攻防系列 10/12】前端凭据安全深度攻防:Cookie/Storage劫持、会话固定、凭据泄露与浏览器最新加固方案
前端·笔记·安全·web安全
天天爱吃肉82186 小时前
# 商用车多体动力学实战笔记|第7篇:制动系统与制动热衰退、ABS滞环控制
大数据·人工智能·笔记·python·嵌入式硬件·汽车