Python 自动化接单实战(四):PDF 批量提取先识别文本层还是扫描件

"把这些 PDF 转成 Excel"不是一个单一需求。电子 PDF 有可复制文本,扫描件只有图片;表格可能跨页,页眉也可能被误当成数据。报价前先识别文件类型,比一开始堆 OCR 参数更重要。

一、先做轻量分类,不急着提取

下面的标准库脚本通过文件特征做第一轮分流。它不是完整 PDF 解析器,但能快速发现加密文件、疑似图片型文件和异常小文件。

python 复制代码
from pathlib import Path

def classify(path):
    data = path.read_bytes()
    if not data.startswith(b"%PDF-"):
        return "not_pdf"
    if b"/Encrypt" in data:
        return "encrypted"
    image_count = data.count(b"/Subtype /Image")
    text_ops = data.count(b" BT") + data.count(b"\nBT")
    return "scanned_like" if image_count > 2 and text_ops == 0 else "text_like"

for path in sorted(Path("input").glob("*.pdf")):
    print(path.name, classify(path))

输出示例:

text 复制代码
invoice-01.pdf text_like
invoice-02.pdf scanned_like
contract.pdf encrypted

分类结果决定后续工具:文本型文件使用 PDF 文本库,扫描件进入 OCR,小部分加密或破损文件进入人工确认。

二、先定义字段证据,再处理版式

发票提取不能只输出金额,还要保留文件名、页码、原始片段和置信状态。金额正则命中多个位置时不要擅自选择最大值,应输出候选并标记 needs_review

python 复制代码
import re

def amount_candidates(text):
    pattern = r"(?:合计|总额)[::\s]*[¥¥]?(\d+(?:\.\d{1,2})?)"
    return re.findall(pattern, text)

sample = "小计:80.00\n合计:96.00"
print(amount_candidates(sample))

输出:

text 复制代码
['96.00']

三、验收按文件类型分层

从每种版式抽样,记录字段正确率与需要人工复核的比例。扫描件还要覆盖旋转、阴影、低分辨率和印章遮挡。若客户不能提供可核对的期望结果,就先交付分类报告和小样本,不承诺整批准确率。


📌 本文用文件分类、字段证据和分层验收拆开了 PDF 提取问题,避免把所有失败都归因于 OCR。

💬 你的 PDF 资料更常见的是扫描件、跨页表格、加密文件还是版式频繁变化?

👉 关注《Python 自动化接单实战》,下一篇继续拆解第三方 API 对接中的分页、限流与幂等。

参考来源

相关推荐
智能体与具身智能9 小时前
TVA具身智能的概念、架构与应用(19)
人工智能·python·具身智能
吴佳浩 Alben9 小时前
Agent 怎么做自动化评测?构建端到端的 Agent Evaluation 体系
人工智能·语言模型·架构·自动化·ai编程
2601_962294619 小时前
python中range函数怎么用
python·for循环·可迭代对象·range函数·整数列表
weixin_4692738110 小时前
如何在线把文字转为 pdf 文档
pdf
楚识科技10 小时前
OCR 推理选 CPU 还是 GPU?一份可落地的算力评估与实测方案
ocr
2601_9639067810 小时前
离线截图 OCR 识别:支持表格与 PDF 解析
pdf·ocr·软件需求
青 春 记 忆10 小时前
零基础入门python70:Docker Compose 编排完整后端
python·后端开发
新时代牛马10 小时前
字符设备驱动完整篇:从 cdev_add、file_operations 到chrdev_open 与排障
开发语言·python
pt104310 小时前
网络自动化Python课程:Cisco PyATS网络自动化测试框架
运维·自动化
像风一样自由202011 小时前
23.OCR在知识库中的作用扫描件和图片文字如何进入RAG
postgresql·大模型·ocr·rag