tesseract:一个.Net版本的开源OCR项目

推荐一个.Net版本的开源OCR项目,方便我们在项目中集成OCR功能。

01 项目简介

tesseract是针对Tesseract-OCR(C++)引擎封装的.NET版本,支持超过100种语言的文本识别,使得.NET开发者能够轻松地利用Tesseract的强大功能,无需深入了解OCR的底层技术。

此项目缺点是,只能识别印刷的文本,针对手写的需要自己训练语言包。

02 使用方法

1、安装依赖Tesseract

复制代码
Install-Package Tesseract

2、下载语言数据文件

根据需求下载对于的语言数据文件,并在属性设置"复制到输出目录"设置为"始终",如下示例为中文简体数据文件。

语言文件下载地址:

https://github.com/tesseract-ocr/tessdata_fast

3、示例代码

复制代码
using System.Diagnostics;
using Tesseract;

var testImagePath = "./photo.bmp";

try
{
    using (var engine = new TesseractEngine(@".", "chi_sim", EngineMode.Default))
    {
        using (var img = Pix.LoadFromFile(testImagePath))
        {
            using (var page = engine.Process(img))
            {
                var text = page.GetText();

                Console.WriteLine("识别结果:" + text);
            }
        }
    }
}
catch (Exception e)
{
    Console.WriteLine(e.ToString());
}
Console.ReadKey(true);

4、识别效果

图片:

识别:

03 项目地址

https://github.com/charlesw/tesseract

  • End -

更多开源项目: https://github.com/bianchenglequ/NetCodeTop

我是编程乐趣,一个.Net开发经验老程序员,欢迎"关注"我,每天为你分享开源项目和编程知识。

也欢迎加入【.Net技术编程交流社区】,和大家共同学习交流!,点击加入https://bbs.csdn.net/topics/613465368

推荐阅读

2个零基础入门框架教程!

一个C#开源工具库,集成了超过1000个扩展方法

Sep:一个低内存、高性能的CSV文件读写操作.Net开源库

Boxed:包含多个.Net项目模板,涵盖了ASP.NET Core API、GraphQL等。

Atata:一个基于 Selenium的C#自动化测试Web框架

相关推荐
切糕师学AI8 小时前
.NET 对象转Json的方式
json·.net
weixin_497845548 小时前
通过ML.Net调用yolov5的Onnx模型
yolo·.net
时光追逐者8 小时前
全面的 C#/.NET 图表构建解决方案,助力快速实现图表开发需求!
微软·c#·.net·.net core·图表
xiecoding.cn8 小时前
.Net Framework 3.5下载安装教程(附安装包)
.net·.netframework·netframework3.5·.net3.5
追逐时光者12 小时前
分享 4 款基于 .NET 开源免费、实用的文件搜索工具,效率提升利器!
后端·.net
AI人工智能+15 小时前
服务器端护照识别技术:通过图像预处理、OCR字符识别和智能分析实现高效身份核验
人工智能·深度学习·ocr·护照识别
Eiceblue20 小时前
Python 快速提取扫描件 PDF 中的文本:OCR 实操教程
vscode·python·ocr·1024程序员节
之墨_1 天前
【LLM】用 FastAPI 搭建「OpenAI 兼容」DeepSeek-OCR 服务 + 简洁WebUI
大模型·ocr·deepseek-ocr
小白狮ww1 天前
dots.ocr 基于 1.7B 参数实现多语言文档处理,性能达 SOTA
人工智能·深度学习·机器学习·自然语言处理·ocr·小红书·文档处理
xunan0031 天前
DeepSeek-OCR MoE结构梳理(其它LLM原理类似)
ocr