文档抽取最常见的浪费,是把所有票据都交给最贵、最大的视觉语言模型。9月14日一项预印本在750份留出合成支票上比较11种系统,报告经过3000份样本微调的最佳开源视觉语言模型F1超过0.98,并高于该任务中的所有零样本商业系统。它不是"开源全面胜出"的证明,却给出一个更实用的选型原则:先判断文档变化和错误代价,再选模型。
研究比较了什么
论文覆盖三种商业系统、两种推理模型、五种开源VLM(Vision-Language Model,视觉语言模型)的预训练与微调版本,以及一个OCR(Optical Character Recognition,光学字符识别)加正则表达式基线。作者同时比较质量、延迟、治理和总成本,试图把实验分数转成具体部署决策。
官方摘要称,在这批合成支票上,微调后最佳开源模型F1超过0.98;F1是精确率与召回率的调和平均。GPT-5在商业系统中F1领先,Claude Sonnet 4.5在日期字段上表现异常。这里必须强调:数据是合成支票,版式、语言、扫描噪声和供应商分布有限;一类模型在一个字段失效,也不能外推到它在所有文档任务上的能力。
先用任务形状选方案
如果表单模板固定、字段坐标稳定,OCR加规则常常更便宜、更容易解释。它的弱点是遇到新版式、手写内容或模糊扫描时规则会碎裂。VLM能同时看文字和布局,适合供应商众多、字段位置变化的单据,但输出格式、日期理解和幻觉需要约束。
微调适合样本量大、字段长期稳定、错误成本足以覆盖训练与运维的场景。论文中的3000份样本说明一个小而专的数据集可能比直接调用通用模型更有价值,但真实项目还要付标注、版本升级、GPU和监控成本。若每月只有几百张低风险文档,零样本API加人工复核可能更经济。
具体例子是报销支票。金额错一位会直接影响付款,备注字段错一个标点却影响有限。系统应按字段设阈值:日期、金额、收款人采用双重校验,低置信度转人工;备注可允许更宽松的相似度。只报整体F1会让大量容易字段掩盖少数关键错误。
一套最小验证方法
先抽取200至500份真实历史文档,按模板、扫描质量、语言和时间分层。把最新模板和最差扫描件留到测试集,避免随机切分让近乎重复的样本同时进入训练和测试。定义严格的字段规范,例如日期统一成ISO 8601格式,金额禁止千位分隔歧义,缺失值必须输出空而不是猜测。
然后让至少三条路线在同一数据上运行:OCR加规则、通用VLM、目标领域微调模型。记录字段级精确率与召回率、每页延迟、每千页成本、人工复核分钟数、失败是否可解释,以及敏感文档是否离开受控环境。不要只测干净图片,还要加入旋转、阴影、裁切、低分辨率和新模板。
我的判断与风险
我的核心判断是,文档AI已经进入"窄任务工程"阶段。通用大模型提供强基线,真正决定生产效果的往往是字段定义、数据切分、异常路由和返工闭环。一个较小模型若能针对稳定分布微调,完全可能在成本和准确率上赢过零样本大模型;一旦版式漂移,它也可能迅速失效。
论文仍是预印本,且摘要没有提供足以复现所有成本假设的完整生产环境。F1超过0.98不代表每100张只错两张,因为F1按字段聚合,错误可能集中在少数文档。合成数据也无法覆盖真实欺诈、印章遮挡、纸张老化和地域格式。采购或迁移前必须用自有文档做盲测。
上线前检查表
- 每个关键字段单独设指标,不用一个总体F1决定上线。
- 保留传统OCR规则基线,确认VLM提升值是否覆盖新增成本。
- 训练集与测试集按模板和时间隔离,防止近重复泄漏。
- 为低置信度、格式冲突和新模板设置人工回退。
- 记录模型版本、原图、输出与人工修改,建立回归集。
- 敏感票据先确认存储、跨境、删除和审计要求。
- 每次模板或模型升级后重跑噪声与边界样本。
若文档量很小、格式极稳,微调通常不划算;若错误会直接触发付款、诊疗或法律动作,也不适合无人工复核的端到端自动化。
你的文档抽取项目最难的是识别文字、理解版式,还是为每个错误找到责任人?
关注「蜗牛聊AI」,一起看懂技术变化背后的真正机会。
本文首发于 java4u.cn,转载请注明出处。