全新开源 OCR 模型:精准识别复杂内容,迈向 2.0 时代!

在如今信息爆炸的时代,如何高效处理大量扫描文档成了每个大家日常生活工作中必备技能。

最近,一款端到端的开源 OCR 模型GOT-OCR2.0,号称将跨向 OCR 2.0 时代!

从正式发布官方 Demo 开始,凭借其出色的识别效果,短短两天时间在 GitHub 上斩获 2.5k Star。

接下来,跟大家详细介绍下它。

项目介绍

GOT 是一个统一的、优雅的端到端模型,包含高压缩编码器和长上下文解码器。

作为一个 OCR-2.0 模型,GOT 能够处理各种 OCR 任务,包括 普通文本、数学/分子公式、表格、图表、乐谱,甚至几何形状等内容识别。

在输入端,模型支持常见的场景和文档风格的图像,包括切片和整页风格。在输出端,GOT 可以通过简单的提示生成纯文本或格式化文档。

安装指南

  1. 克隆代码到本地,并进入文件夹:
复制代码
git clone https://github.com/Ucas-HaoranWei/GOT-OCR2.0.gitcd 'the GOT folder'
  1. 安装依赖包:
复制代码
conda create -n got python=3.10 -yconda activate gotpip install -e .
  1. 安装 Flash-Attention:
复制代码
pip install ninjapip install flash-attn --no-build-isolation

在线体验

官方提供在线演示 Demo,可以直接在 HuggingFace 上体验,地址在末尾。

写在最后

此外,值得一说,该模型拿到了 BLEU 高达 0.972 高分,碾压众多 OCR 工具。再看下识别的效果。

以上便是 GOT 工具的详细介绍。

总的来说,该模型识别精确度非常高,能支持非常多复杂场景,如音符、数学公式等。

而且模型大小仅 1.43 GB,本地运行起来相信要求的配置不是特别高,感兴趣的可以试试。

相关推荐
思通数据1 天前
AI全域智能监控系统重构商业清洁管理范式——从被动响应到主动预防的监控效能革命
大数据·人工智能·目标检测·机器学习·计算机视觉·数据挖掘·ocr
向北威威1 天前
eSearch:一款集截图、OCR与录屏于一体的多功能软件
ocr
静心问道2 天前
Donut:无OCR文档理解Transformer
深度学习·ocr·transformer
开开心心就好3 天前
高效全能PDF工具,支持OCR识别
java·前端·python·pdf·ocr·maven·jetty
一个人的博客@你4 天前
C# 通用OCR识别
图像处理·c#·ocr·图像识别·文字提取
Grassto4 天前
dockerfile: PaddleOCR hubserving api 服务
docker·ocr·paddleocr
TextIn智能文档云平台5 天前
PDF文档解析新突破:图表识别、公式还原、手写字体处理,让AI真正读懂复杂文档!
图像处理·人工智能·算法·自然语言处理·pdf·ocr
带鱼工作室6 天前
通义读光系列文字检测+识别模型端到端OCR应用
python·opencv·计算机视觉·ocr
白熊1886 天前
【计算机视觉】OpenCV实战项目:Text-Extraction-Table-Image:基于OpenCV与OCR的表格图像文本提取系统深度解析
opencv·计算机视觉·ocr
沉到海底去吧Go6 天前
【身份证识别表格】批量识别身份证扫描件或照片保存为Excel表格,怎么大批量将身份证图片转为excel表格?基于WPF和腾讯OCR的识别方案
ocr·wpf·excel·身份证识别表格·批量扫描件身份证转表格·图片识别表格·图片识别excel表格