每个月收到一批版式相近的 PDF,想把每份里的编号、日期、名称、金额等信息汇总到 Excel,很多人会先搜索"PDF 批量提取同一位置内容"。
但真正要交付的通常不是一堆全文文本,而是每份文件对应一行、固定信息对应固定列的结果表。这个任务能不能批量做,关键也不在"看起来位置相同",而在于模板、字段和记录规则是否足够稳定。
1. 先确认这 3 个条件
同模板 PDF 适合做字段批量提取,通常要先满足下面三个条件。
| 条件 | 要确认的问题 | 不明确时的风险 |
|---|---|---|
| 模板相近 | 页面结构、字段名称和顺序是否基本一致 | 不同版本可能取到相邻内容 |
| 字段固定 | 每份都要提取哪些列 | 导出后还要重新找信息 |
| 行规则明确 | 一份文件或一页是否对应一行 | 多条记录会混在同一行 |
例如,你要汇总的是"文件编号、名称、日期、金额",那四个名称应当先成为 Excel 的列名。搜索词里的"同一位置"可以帮助定位需求,但实际配置时更适合用字段名和字段描述说明要取什么。
💡 先验证一小批样本
先拿几份真实或脱敏 PDF,检查字段名称、页数和每行记录规则,再决定是否扩展到整批文件。
2. 从最终 Excel 反推字段
先做一张空的交付表,而不是先把所有 PDF 转成全文。比如:
| 文件编号 | 名称 | 日期 | 金额 |
|---|---|---|---|
| 待提取 | 待提取 | 待提取 | 待提取 |
列名确定后,为每个字段补充一句描述。金额是含税金额还是合计金额?日期取签署日期还是出具日期?编号是否保留前导零?这些规则会直接影响后续复核。
还要提前约定字段缺失时怎么处理。找不到就留空并标记待查,通常比根据上下文猜一个值更容易验收。
3. 导入一批 PDF,配置固定字段
文档工作台可以导入 PDF、图片,或同时包含两者的文件夹。PDF 会按页面进入处理流程。导入后,在字段配置区添加最终表格需要的列;如果已经有 Excel 模板,也可以把列名作为字段配置的起点。
字段不要只写"内容""信息"这类泛称。可以写成"单据编号""签署日期""含税金额",并在描述中补充取值规则。这样得到的结果更接近最终表格,也便于不同页面之间保持一致。

图 1:左侧保留原始页面,右侧查看按字段整理的结果。图片来自文档工作台客户端。
4. 批量处理后,按异常页复核
批量处理减少了逐份查找和复制的重复动作,但不代表所有结果都可以跳过检查。建议至少抽查四类页面:模板正常的页面、字段位置变化的页面、扫描质量较差的页面,以及字段缺失的页面。
复核时重点看容易混淆的字符和规则:编号中的字母与数字、日期中的年月日、金额的小数点和负号,以及同一页面上出现多个相似名称的情况。原始页面和字段结果放在一起,更容易确认结果来自正确位置。
如果同一批 PDF 中出现新模板,不要把它当成普通异常值直接导出。先判断是字段名称变化、版式变化,还是记录规则变化,再决定补充字段描述、拆分批次或人工处理。
5. 导出 Excel,并保留可追溯信息
字段确认后导出 Excel,字段名对应列名,每个文件或页面按预先约定的规则对应一行。建议额外保留来源文件名或页码,方便接收方回到原件核对。

图 2:导出结果的列名与预先定义的字段一致,便于继续录入或分析。图片来自文档工作台客户端。
导出后可以继续做系统录入、统计或人工审核。字段提取解决的是"去哪里找、放进哪一列"的重复工作,业务人员仍需要对异常值和重要结论负责。
6. 哪些情况要先调整方案
下面几类任务,不适合直接套用同模板批量字段提取:
- 每份 PDF 的版式和字段完全不同,无法形成稳定列。
- 一页里有多条记录,但没有明确的拆分规则。
- 关键字段跨页出现,或同一字段在不同版本里含义不同。
- 页面模糊、倾斜、手写内容较多,且没有人工复核安排。
- 目标是无损还原复杂表格,而不是汇总固定字段。
如果你的任务符合"多份版式相近 PDF + 固定字段 + 明确行规则 + Excel 交付",可以先用少量样本验证,再进入批量处理。文档工作台支持按字段整理 PDF 和图片,并导出 Excel;实际结果仍应以你的材料和复核标准为准。