1,新建 maven 工程
2,引入依赖
<dependency>
<groupId>net.sourceforge.tess4j</groupId>
<artifactId>tess4j</artifactId>
<version>5.11.0</version>
</dependency>
3,安装 tesseract-ocr
下载地址https://digi.bib.uni-mannheim.de/tesseract/tesseract-ocr-w64-setup-5.3.3.20231005.exe
其他版本可以查看 https://digi.bib.uni-mannheim.de/tesseract/
安装过程中一直点下一步,建议取消语言包选项,后面手动下载
可能需要安装visual c++ 2015-2019 redistributable或最新版visual c++ 2015-2022 redistributable
4,下载语言包
https://digi.bib.uni-mannheim.de/tesseract/tessdata_fast/
下载enm.traineddata和chi_sim.traineddata,复制粘贴到C:\Program Files\Tesseract-OCR\tessdata
5,调用 Tesseract API 完成文本识别
import java.io.File;
import net.sourceforge.tess4j.Tesseract;
public class Tess4jDemo {
public static void main(String[] args) {
// 创建实例
Tesseract instance = new Tesseract();
// 设置语言包路径
instance.setDatapath("C:\\Program Files\\Tesseract-OCR\\tessdata");
// 设置语言
instance.setLanguage("chi_sim");
// 设置文本文件
File file = new File("C:\\Users\\user1\\Desktop\\截图.PNG");
try {
// 文本识别
String result = instance.doOCR(file);
System.out.println(result);
} catch (Exception e) {
e.printStackTrace();
}
}
}
示例代码见