Nougat:科学文档的OCR 使用记录

https://github.com/facebookresearch/nougat

python环境需要在3.8以上

安装:pip install nougat-ocr

模型默认下载地址:/home/****/.cache/torch/hub/nougat-0.1.0-small

环境安装好之后默认使用cpu

UserWarning: CUDA initialization: The NVIDIA driver on your system is too old (found version 11080). Please update your GPU driver by downloading and installing a new version from the URL: http://www.nvidia.com/Download/index.aspx Alternatively, go to: https://pytorch.org to install a PyTorch version that has been compiled with your version of the CUDA driver. (Triggered internally at ../c10/cuda/CUDAFunctions.cpp:108.)

return torch._C._cuda_getDeviceCount() > 0

WARNING:root:No GPU found. Conversion on CPU is very slow.

如果需要使用GPU,则需要重新安装和自己cuda版本对应的torch等,我这边是cuda11.8

conda install pytorch torchvision torchaudio pytorch-cuda=11.8 -c pytorch -c nvidia

环境配置好之后即可进行PDF识别

在output目录下会生成.mmd格式的文件

vscode中使用如下插件可以查看mmd格式中的内容,文字可直接复制

3090GPU上

显存占用17368 / 24576M 显存占用17G,16页的PDF 耗时30秒

自己随便写的文字可能识别不了,图片中的文字无法识别

相关推荐
AI人工智能+2 天前
AI攻克阿拉伯文OCR:深度学习如何破译千年文字密码
人工智能·深度学习·ocr·阿拉伯文识别
开开心心就好2 天前
PDF清晰度提升工具,让模糊文档变清晰
java·服务器·前端·python·智能手机·pdf·ocr
一条数据库2 天前
高质量票据识别数据集:1000张收据图像+2141个商品标注,支持OCR模型训练与文档理解研究
人工智能·ocr
中科逸视OCR12 天前
当OCR遇见NLP:解析深度学习发票识别中的语义理解与关系抽取模块
nlp·ocr·发票识别
EkihzniY13 天前
OCR 识别技术:各行业信息化转型的 “加速器”
ocr
虚行13 天前
一个海康相机OCR的程序
ocr
kevin 114 天前
智能文档处理业务,应该选择大模型还是OCR专用小模型?
ocr
空影星14 天前
Pot Translator,跨平台划词翻译与OCR工具
python·ocr·电脑
私人珍藏库14 天前
[Windows] 天若OCR开源版 6.0.0
ocr
ONLYOFFICE14 天前
如何在ONLYOFFICE中使用OCR工具:轻松识别图片和PDF中的文字
编辑器·ocr·office