Tesseract入门--把图片里印刷文字提取成文本

Tesseract 是 Google 开源 OCR 光学字符识别引擎,Apache2.0 协议,把图片里印刷文字提取成文本,支持 130 + 语言,没有自带 GUI,命令行 / API 调用,当前稳定版 5.x(LSTM 深度学习模型)。

⚠️ 只擅长印刷体;手写识别很差;中文需要单独中文训练包 chi_sim。

下载

1、tesseract-ocr-w64-setup-5.5.3.20260724资源-CSDN下载

2、Home · UB-Mannheim/tesseract Wiki · GitHub

安装要点

1、运行 exe 安装包

2、展开 Additional language data → 勾选 Chinese (Simplified) 简体中文语言包(识别中文必须)

3、默认路径:C:\Program Files\Tesseract-OCR,配置到环境变量PATH。

验证是否安装成功

复制代码
tesseract --version

查看已装语言:

bash 复制代码
tesseract --list-langs

Python 侧安装

bash 复制代码
pip install pytesseract pillow

英文识别

被识别图片

识别代码

python 复制代码
from PIL import Image
import pytesseract

# Windows如果没配置PATH,取消下面注释写对路径
# pytesseract.pytesseract.tesseract_cmd = r'C:\Program Files\Tesseract‑OCR\tesseract.exe'

img = Image.open("english.png")
text = pytesseract.image_to_string(img, lang="eng")
print(text)

数字识别

被识别图片

识别代码

python 复制代码
from PIL import Image
import pytesseract

# Windows如果没配置PATH,取消下面注释写对路径
# pytesseract.pytesseract.tesseract_cmd = r'C:\Program Files\Tesseract‑OCR\tesseract.exe'

img = Image.open("digital.png")
text = pytesseract.image_to_string(img)
print(text)

中英混合识别

被识别图片

识别代码

python 复制代码
from PIL import Image
import pytesseract

# Windows如果没配置PATH,取消下面注释写对路径
# pytesseract.pytesseract.tesseract_cmd = r'C:\Program Files\Tesseract‑OCR\tesseract.exe'

img = Image.open("test.png")
text = pytesseract.image_to_string(img, lang="chi_sim+eng") #中英混合识别
print(text)
相关推荐
青 春 记 忆27 分钟前
LeetCode 283. 移动零|Python 解法详解
python·算法·leetcode
人工干智能36 分钟前
科普:Python中的生成器——带`yield`的函数
开发语言·python
whcyhhh37 分钟前
头歌实践教学平台:数据科学与大数据技术导论(十四)
大数据·开发语言·python
清水白石00838 分钟前
Python dataclass 高级避坑指南:从 default_factory、frozen、slots 到哈希灾难
windows·python·哈希算法
在学了加油42 分钟前
阿尔茨海默病诊断(优化特征选择版)
人工智能·python·dnn
淼澄研学1 小时前
GPT-4o及mini模型参数解析与Python API调用实操
开发语言·python
kyrie_sakura2 小时前
python学习笔记 7--- 文件(IO)操作
笔记·python·学习
Patrick在香港2 小时前
Claude Agent 进阶编排:循环控制 + 写权限审批闸门 + 幂等重试
python·agent·claude·编排·anthropic api