OCR材料信息提取工具(附件中含代码和数据)

OCR材料信息提取工具

功能说明

本工具可以从图片(JPG、PNG等)和PDF文件中自动识别并提取以下信息:

  • 材料名称
  • 规格/型号
  • 数量
  • 单位

提取的结果会自动保存到Excel文件中。

安装步骤

1. 安装Python依赖

bash 复制代码
pip install -r requirements.txt

注意:首次运行时,PaddleOCR会自动下载中文识别模型,可能需要几分钟时间。

2. 运行脚本

bash 复制代码
python ocr_to_excel.py

输出文件

运行完成后,会在当前目录生成 材料清单.xlsx 文件,包含以下列:

  • 来源文件:原始文件名
  • 材料名称:识别出的材料名称
  • 规格:材料规格/型号
  • 数量:材料数量
  • 单位:计量单位

支持的文件格式

  • 图片格式:JPG, JPEG, PNG, BMP, TIFF
  • 文档格式:PDF

处理的目录

脚本会自动处理以下两个目录中的所有文件:

  1. d://急救包(1)
  2. d://2023年第18批

注意事项

  1. 确保图片清晰度足够,文字可辨认
  2. OCR识别准确率受图片质量影响,建议处理后检查结果
  3. 首次运行会下载模型文件,请确保网络连接正常
  4. 如果识别效果不理想,可能需要调整图片对比度或分辨率

故障排除

如果遇到安装问题

如果PaddleOCR安装失败,可以尝试使用CPU版本:

bash 复制代码
pip install paddlepaddle -i https://mirror.baidu.com/pypi/simple
pip install paddleocr

如果识别结果不理想

  1. 检查原始文件是否清晰
  2. 对于扫描PDF,确保分辨率至少300dpi
  3. 可以手动调整识别参数(在代码中修改PaddleOCR初始化参数)
相关推荐
东莞市云毅网络有限公司1 小时前
AI 引用句逐条回指原文:让回答可回溯的校验实现
python·数据清洗·rag·企业知识库·文档解析
小和尚同志1 小时前
1.8k star 的开源 token 使用量监控神器— TokenTracker
人工智能·ai编程
极客 - L U2 小时前
神经网络 - 激活函数、损失函数、优化器
人工智能·深度学习·神经网络
数字融合3 小时前
透明化视频三维矿山井下照明重建技术
人工智能·python·数码相机
yi0113 小时前
LeetCode 219:存在重复元素 II——哈希表记录“最近一次出现的位置”
数据结构·人工智能·笔记·python·算法·leetcode·哈希表
xiangzhihong83 小时前
创之星花店多端业务闭环拆解
人工智能
奈落243 小时前
AI 编程从助手到 Agent:基于两份资料看哪些环节可以交出去,哪些必须自己攥住
大数据·人工智能
Joker可视化开发平台3 小时前
AI短剧接棒真人剧:开机量跌七成,普通人进场窗口在收窄
大数据·人工智能
澳鹏Appen3 小时前
澳鹏电子书 | 强化学习环境:为AI智能体打造高保真训练场
人工智能
吴佳浩3 小时前
单卡5090跑125B 大模型:Strata 把服务器级 MoE 拉进普通 PC
人工智能