Tesseract 是 Google 开源 OCR 光学字符识别引擎,Apache2.0 协议,把图片里印刷文字提取成文本,支持 130 + 语言,没有自带 GUI,命令行 / API 调用,当前稳定版 5.x(LSTM 深度学习模型)。
⚠️ 只擅长印刷体;手写识别很差;中文需要单独中文训练包 chi_sim。
下载
1、tesseract-ocr-w64-setup-5.5.3.20260724资源-CSDN下载
2、Home · UB-Mannheim/tesseract Wiki · GitHub
安装要点
1、运行 exe 安装包
2、展开 Additional language data → 勾选 Chinese (Simplified) 简体中文语言包(识别中文必须)
3、默认路径:C:\Program Files\Tesseract-OCR,配置到环境变量PATH。
验证是否安装成功
tesseract --version
查看已装语言:
bash
tesseract --list-langs
Python 侧安装
bash
pip install pytesseract pillow
英文识别
被识别图片

识别代码
python
from PIL import Image
import pytesseract
# Windows如果没配置PATH,取消下面注释写对路径
# pytesseract.pytesseract.tesseract_cmd = r'C:\Program Files\Tesseract‑OCR\tesseract.exe'
img = Image.open("english.png")
text = pytesseract.image_to_string(img, lang="eng")
print(text)
数字识别
被识别图片

识别代码
python
from PIL import Image
import pytesseract
# Windows如果没配置PATH,取消下面注释写对路径
# pytesseract.pytesseract.tesseract_cmd = r'C:\Program Files\Tesseract‑OCR\tesseract.exe'
img = Image.open("digital.png")
text = pytesseract.image_to_string(img)
print(text)
中英混合识别
被识别图片

识别代码
python
from PIL import Image
import pytesseract
# Windows如果没配置PATH,取消下面注释写对路径
# pytesseract.pytesseract.tesseract_cmd = r'C:\Program Files\Tesseract‑OCR\tesseract.exe'
img = Image.open("test.png")
text = pytesseract.image_to_string(img, lang="chi_sim+eng") #中英混合识别
print(text)