票据抽取不一定要上最大模型:先看版式是否真的变化

文档抽取最常见的浪费,是把所有票据都交给最贵、最大的视觉语言模型。9月14日一项预印本在750份留出合成支票上比较11种系统,报告经过3000份样本微调的最佳开源视觉语言模型F1超过0.98,并高于该任务中的所有零样本商业系统。它不是"开源全面胜出"的证明,却给出一个更实用的选型原则:先判断文档变化和错误代价,再选模型。

研究比较了什么

论文覆盖三种商业系统、两种推理模型、五种开源VLM(Vision-Language Model,视觉语言模型)的预训练与微调版本,以及一个OCR(Optical Character Recognition,光学字符识别)加正则表达式基线。作者同时比较质量、延迟、治理和总成本,试图把实验分数转成具体部署决策。

官方摘要称,在这批合成支票上,微调后最佳开源模型F1超过0.98;F1是精确率与召回率的调和平均。GPT-5在商业系统中F1领先,Claude Sonnet 4.5在日期字段上表现异常。这里必须强调:数据是合成支票,版式、语言、扫描噪声和供应商分布有限;一类模型在一个字段失效,也不能外推到它在所有文档任务上的能力。

flowchart TD A[收集真实文档样本] --> B{版式是否固定} B -->|高度固定| C[OCR加规则基线] B -->|变化较大| D[VLM零样本基线] C --> E[按字段测准确率与返工] D --> E E --> F{错误成本或数据敏感度高} F -->|是| G[微调或本地部署并加人工复核] F -->|否| H[按量API并设置信心阈值] G --> I[成本延迟治理联合验收] H --> I

先用任务形状选方案

如果表单模板固定、字段坐标稳定,OCR加规则常常更便宜、更容易解释。它的弱点是遇到新版式、手写内容或模糊扫描时规则会碎裂。VLM能同时看文字和布局,适合供应商众多、字段位置变化的单据,但输出格式、日期理解和幻觉需要约束。

微调适合样本量大、字段长期稳定、错误成本足以覆盖训练与运维的场景。论文中的3000份样本说明一个小而专的数据集可能比直接调用通用模型更有价值,但真实项目还要付标注、版本升级、GPU和监控成本。若每月只有几百张低风险文档,零样本API加人工复核可能更经济。

具体例子是报销支票。金额错一位会直接影响付款,备注字段错一个标点却影响有限。系统应按字段设阈值:日期、金额、收款人采用双重校验,低置信度转人工;备注可允许更宽松的相似度。只报整体F1会让大量容易字段掩盖少数关键错误。

一套最小验证方法

先抽取200至500份真实历史文档,按模板、扫描质量、语言和时间分层。把最新模板和最差扫描件留到测试集,避免随机切分让近乎重复的样本同时进入训练和测试。定义严格的字段规范,例如日期统一成ISO 8601格式,金额禁止千位分隔歧义,缺失值必须输出空而不是猜测。

然后让至少三条路线在同一数据上运行:OCR加规则、通用VLM、目标领域微调模型。记录字段级精确率与召回率、每页延迟、每千页成本、人工复核分钟数、失败是否可解释,以及敏感文档是否离开受控环境。不要只测干净图片,还要加入旋转、阴影、裁切、低分辨率和新模板。

我的判断与风险

我的核心判断是,文档AI已经进入"窄任务工程"阶段。通用大模型提供强基线,真正决定生产效果的往往是字段定义、数据切分、异常路由和返工闭环。一个较小模型若能针对稳定分布微调,完全可能在成本和准确率上赢过零样本大模型;一旦版式漂移,它也可能迅速失效。

论文仍是预印本,且摘要没有提供足以复现所有成本假设的完整生产环境。F1超过0.98不代表每100张只错两张,因为F1按字段聚合,错误可能集中在少数文档。合成数据也无法覆盖真实欺诈、印章遮挡、纸张老化和地域格式。采购或迁移前必须用自有文档做盲测。

上线前检查表

  • 每个关键字段单独设指标,不用一个总体F1决定上线。
  • 保留传统OCR规则基线,确认VLM提升值是否覆盖新增成本。
  • 训练集与测试集按模板和时间隔离,防止近重复泄漏。
  • 为低置信度、格式冲突和新模板设置人工回退。
  • 记录模型版本、原图、输出与人工修改,建立回归集。
  • 敏感票据先确认存储、跨境、删除和审计要求。
  • 每次模板或模型升级后重跑噪声与边界样本。

若文档量很小、格式极稳,微调通常不划算;若错误会直接触发付款、诊疗或法律动作,也不适合无人工复核的端到端自动化。

你的文档抽取项目最难的是识别文字、理解版式,还是为每个错误找到责任人?

关注「蜗牛聊AI」,一起看懂技术变化背后的真正机会。


本文首发于 java4u.cn,转载请注明出处。

相关推荐
小刘快学习1 小时前
高并发下的优雅降级:企业AI网关的流量整形与过载保护
人工智能
知几蜗牛1 小时前
语义相近却总找错资料?从Embedding看懂向量检索
人工智能
知几蜗牛1 小时前
AI算力开始听电网指挥:比换GPU更现实的增产方法
人工智能
智慧医养结合软件开源1 小时前
【源码交付】智慧养老系统 · Java + Vue3-技术架构
大数据·人工智能·信息可视化·云计算
QXWZ_IA1 小时前
化工园区安全风险智能化管控平台怎么建?千寻位置对标路径
人工智能·科技·安全
湘美书院--湘美谈教育1 小时前
湘美书院夜谈录:AI时代的体验感与选择价值观念
人工智能·深度学习·学习·安全·生活
知几蜗牛1 小时前
临床AI别再只比像不像标准答案,先算医生少改了多少
人工智能
知几蜗牛1 小时前
AI做长程科研,真正稀缺的不是更多Agent而是反证链
人工智能
知几蜗牛1 小时前
AI代码审计最危险的不是漏报,而是团队开始不再相信它
人工智能