手里有几十份甚至更多 PDF,要从每份里取出姓名、编号、日期、金额这类固定信息,再汇总成 Excel,最容易卡在两件事上:每页内容很多,最后要交的却只是几列数据;而且复制出来的文本还要反复贴进表格。
这类任务的关键不是先把 PDF 全文转出来,而是先说清楚"指定内容"到底是什么。本文所说的方法适合每页或每份 PDF 都要提取一组固定字段、最终交付 Excel 的场景;不等于把任意复杂表格无损还原成 Excel。
1. 先把 Excel 的列定下来
开始处理前,先写出最终表格。比如交付物是这样的:
| 客户名称 | 单据编号 | 日期 | 金额 |
|---|---|---|---|
| 待提取 | 待提取 | 待提取 | 待提取 |
这四个列名就是四个字段。还要同时定一条规则:一页 PDF 是不是对应 Excel 的一行?如果一页里有多条记录,或者同一条记录跨页,就先把拆分规则说清楚,再开始批量任务。
💡 先定义交付物
全文识别得到的是一大段文字;字段提取得到的是可直接放进 Excel 列的结果。后者的前提,是先定义列名和每一行代表什么。
2. 导入多个 PDF,并配置字段
文档工作台的客户端界面名称显示为 LocalDoc Studio。它可以导入 PDF、图片,或一个同时包含 PDF 和图片的文件夹;PDF 按页面处理。右侧可以手动添加字段,也可以导入已有 Excel 模板,让列名成为字段名。

图 1:导入文件或文件夹后,在右侧配置要交付的字段。图片来自文档工作台客户端。
字段名不要只写"信息""内容"这类泛词。更稳妥的写法是"单据编号""开票日期""实收金额",必要时补一句描述,说明要取哪一种日期或金额。字段越接近最终 Excel 列,后续复核越直接。
3. 本地识别后,先看字段结果再导出
字段配置完成后,识别和字段提取在本机进行。这里不要把"本地处理"理解成"可以不检查"。原始扫描质量、版式变化和字段本身的歧义,都可能让某一页需要人工确认。
推荐把复核集中在容易出错的字段上:编号中的字母和数字、日期格式、金额小数点,以及字段位置突然变化的页面。界面里可以将原图和字段结果放在一起看,便于快速核对。

图 2:左侧保留原始页面,右侧显示按字段整理的结果,适合导出前复核。图片来自文档工作台客户端。
如果文件模糊、倾斜,或者同一个字段在不同模板里含义不同,应该以原件和业务规则为准。工具负责把重复的查找和整理动作前置,不能替代业务判断。
4. 按字段导出 Excel
确认后导出时,字段名对应 Excel 的列名,页面结果对应表格中的行。这样交付的是结构化数据,而不是一份还需要人工二次整理的全文文本。

图 3:导出后的列与事先定义的字段一致。图片来自文档工作台客户端。
导出的 Excel 可以继续用于系统录入、统计分析或交给下一位同事处理。真正节省的环节,是不再逐页寻找同一类信息并手动建表,而不是跳过验收。
5. 哪些情况不应按这个方法处理
下面几类任务要先调整预期:
- 目标是完整还原任意复杂表格,而不是提取固定字段。
- 文件格式不是 PDF、图片或包含两者的文件夹。
- 每页记录规则不清楚,或字段含义需要业务人员临场判断。
- 对任意版式、任意图片提出强制准确要求,且没有人工复核环节。
如果任务符合"多个 PDF + 固定字段 + Excel 交付 + 本机处理"的条件,可以按上述流程执行。先定义字段,再导入、提取、复核、导出,流程会比先做全文 OCR 再人工拼表更可控。