1,新建 maven 工程
2,引入依赖
<dependency>
<groupId>net.sourceforge.tess4j</groupId>
<artifactId>tess4j</artifactId>
<version>5.11.0</version>
</dependency>
3,安装 tesseract-ocr
下载地址https://digi.bib.uni-mannheim.de/tesseract/tesseract-ocr-w64-setup-5.3.3.20231005.exe
其他版本可以查看 https://digi.bib.uni-mannheim.de/tesseract/
安装过程中一直点下一步,建议取消语言包选项,后面手动下载
可能需要安装visual c++ 2015-2019 redistributable或最新版visual c++ 2015-2022 redistributable
4,下载语言包
https://digi.bib.uni-mannheim.de/tesseract/tessdata_fast/
下载enm.traineddata和chi_sim.traineddata,复制粘贴到C:\Program Files\Tesseract-OCR\tessdata
5,调用 Tesseract API 完成文本识别
import java.io.File;
import net.sourceforge.tess4j.Tesseract;
public class Tess4jDemo {
public static void main(String[] args) {
// 创建实例
Tesseract instance = new Tesseract();
// 设置语言包路径
instance.setDatapath("C:\\Program Files\\Tesseract-OCR\\tessdata");
// 设置语言
instance.setLanguage("chi_sim");
// 设置文本文件
File file = new File("C:\\Users\\user1\\Desktop\\截图.PNG");
try {
// 文本识别
String result = instance.doOCR(file);
System.out.println(result);
} catch (Exception e) {
e.printStackTrace();
}
}
}
示例代码见文章来源:https://www.toymoban.com/news/detail-857923.html
https://download.csdn.net/download/daqinzl/89221358文章来源地址https://www.toymoban.com/news/detail-857923.html
到了这里,关于Java调用tess4j完成 OCR 文字识别的文章就介绍完了。如果您还想了解更多内容,请在右上角搜索TOY模板网以前的文章或继续浏览下面的相关文章,希望大家以后多多支持TOY模板网!