Tesseract OCR 安装与中文+英文识别实现

一、下载

https://digi.bib.uni-mannheim.de/tesseract/

下载,尽量选择时间靠前的(识别更好些)。符合你的运行机(我的是windows64)

持续点击下一步安装,安装你认可的路径即可,没必要配置环境变量(后续在代码里指定即可)。

二、下载语言包

https://github.com/tesseract-ocr/tessdata/blob/main/chi_sim.traineddata

(这是中文的。有了它,后续的识别会更精准)

下载到的语言包放到安装目录的 Tesseract-OCR\tessdata 目录下

三、代码实现和图片优化

注意:图片的优化很重要,这会极大的提高识别。

【图片越大、像素越清晰,识别的准确度越高。

如果是小图片,需要额外做放大、锐化、对比度等处理。 本文章不做这方面的优化。

各位可以截大图和小图对比一下结果就知道了。】

下面以python实现为例:

程序:替换你的安装路径和图片地址,运行即可测试。

python 复制代码
import pytesseract
from PIL import Image

# 设置Tesseract路径(根据实际安装路径修改)
pytesseract.pytesseract.tesseract_cmd = r'C:\soft_install\Tesseract-OCR\tesseract.exe'


def ocr_scan(image_path):
    """
    对指定图片文件进行OCR识别
    :param image_path: 图片文件路径(支持PNG/JPG等格式)
    """
    try:
        # 加载图片文件
        image = Image.open(image_path)

        # 识别文字(中英文混合)
        text = pytesseract.image_to_string(image, lang='chi_sim+eng')
        print("识别结果:\n", text.strip())

    except FileNotFoundError:
        print(f"错误:文件 '{image_path}' 不存在")
    except Exception as e:
        print(f"发生错误:{str(e)}")


if __name__ == "__main__":
    # 直接指定图片路径(示例路径)
    image_path = "processed_latest.png"  # 修改为你的图片路径
    ocr_scan(image_path)

图片实例如下:

(图1 未经过放大和二值化阈值等处理。 会存在识别失真)

(图2 经过放大和二值化阈值处理。 上面的程序可以正确识别

相关推荐
石榴树下的七彩鱼44 分钟前
OCR 识别不准确怎么办?模糊 / 倾斜 / 反光图片优化实战(附完整解决方案 + 代码示例)
图像处理·人工智能·后端·ocr·api·文字识别·图片识别
开开心心_Every6 小时前
安卓图片压缩工具,无损缩放尺寸免费好用
人工智能·pdf·计算机外设·ocr·语音识别·团队开发·规格说明书
Klong.k6 小时前
话不多说 直接上glm-ocr的工具类
ocr
无心水9 小时前
13、云端OCR终极指南|百度/阿里/腾讯API高精度文字提取实战
百度·架构·pdf·ocr·dubbo·pdf解析·pdf抽取
Chef_Chen20 小时前
论文解读:不需要OCR,不需要描述生成——ColPali重构了文档检索的底层逻辑
重构·ocr
新缸中之脑1 天前
Chandra:商业OCR的终结者
ocr
MarkHD2 天前
RPA进阶实战:从零打造智能票据处理机器人——OCR识别、Excel自动填报与邮件通知全流程
机器人·ocr·rpa
叫我黎大侠2 天前
.NET 实战:调用千问视觉模型实现 OCR(车票识别完整教程)
阿里云·ai·c#·ocr·asp.net·.net·.netcore
石榴树下的七彩鱼2 天前
OCR 识别接口哪个好?2026 年主流 OCR API 对比评测(附免费在线体验)
图像处理·人工智能·后端·计算机视觉·ocr·api·文字识别
AI人工智能+2 天前
表格识别技术通过深度学习与计算机视觉,实现复杂表格的自动化解析与结构化输出
深度学习·计算机视觉·ocr·表格识别