任意PDF与图片的批量信息提取软件 OCR 识别加大模型

之前好几个朋友问我是否可以提取一些很少见的票据的信息到Excel, 比如国外的飞机票,或者国外的保险单,或者工厂地秤的票据,如果单独为这些少见的票据写定制的代码其实很麻烦,所以今天花了点时间做了一个通用的信息提取工具

0 软件做什么用的?

比如你有一堆同样格式!同样格式!同样格式! 的发票或飞机票或者地铁票或者保险单或者其他任意文件(目前支持PDF和图片),需要批量把里面的某些信息提取出来,

比如所有发票或飞机票的金额,或者保险单的金额以及其他细节等等,那么就可以使用这个软件

1 怎么使用软件?

直接打开用就会使用了,很简单,只有三个按照顺序点击的按钮,按照步骤来即可, 可以直接先使用,不会的话再来看说明

把你需要提取信息的PDF或者图片放在一个文件夹里面,

然后打开软件,等待界面出现,有点慢

第一步,软件里面选择这个文件夹

第二步,点击软件的识别样本按钮,软件就会识别你的第一个文件,然后返回所有的信息和字段,你在这个步骤之后可以选择你需要提取的字段

第三步,点击软件的批量识别提取按钮,等待所有信息提取完成即可,结果会自动保存在你的第一步的文件夹

2 和之前软件最大的不同点在哪里?

不仅仅支持发票了,支持任意票据,任意PDF和图片格式的文档;

并且采用了不同的技术路线,这次使用的是OCR加大模型的技术路线,之前是使用的是电子PDF内部数据直接解析的方案

所以可以混合使用,根据你的实际数据情况和需求来

PS:很多人分不清什么是电子PDF,什么是非电子的PDF,简单说就是如果PDF里面的文字你可以用鼠标选中,那就是电子格式的,可以直接解析读取内部数据,如果是一整张照片那样的就是非电子格式的PDF,可以把它看作一张张图片组成的PDF,这种就只能通过OCR来识别

下载地址:

链接:https://pan.baidu.com/s/1WQQ8kaDilaagjoK5IrYZzA

提取码:1111

相关推荐
驯龙高手_追风14 小时前
Adobe Acrobat PDF阅读器设置默认滚动翻页
adobe·pdf·adobe acrobat reader·adobe reader
AI人工智能+17 小时前
不动产权证书识别技术:融合了计算机视觉、自然语言处理(NLP)和人工智能的深度技术栈
人工智能·计算机视觉·语言模型·ocr·不动产权证书识别
优化控制仿真模型19 小时前
【26年社工】初级社会工作者历年真题及答案PDF电子版(2010-2025年)
经验分享·pdf
ComPDFKit19 小时前
PDF发票生成怎么做?从零到服务化落地的完整指南
pdf·pdf生成·文件生成·发票生成
Maydaycxc20 小时前
跨境电商多账号自动化:RPA对接指纹浏览器与OCR识图实战
自动化·ocr·rpa
Miss roro21 小时前
法律文书信息自动提取:OCR识别与AI技术在案件管理中的应用
人工智能·ocr·法律科技·律所管理系统·案件管理系统
weixin_4410036421 小时前
【2026年最新】初级社会工作者(社工)考试历年真题及答案解析电子版pdf(2010-2025年)
pdf
Fleshy数模21 小时前
基于机器视觉的工业产品型号识别与报警系统实现
python·ocr·pyqt
开开心心就好1 天前
带OCR识别的电子发票打印工具
运维·javascript·科技·游戏·青少年编程·ocr·powerpoint
优化控制仿真模型1 天前
【26年7月】日语N1、N2、N3、N4、N5历年真题及答案PDF电子版(2010-2025年12月)
经验分享·pdf