深度学习篇---PaddleOCR


文章目录

  • 前言
  • [1. 安装与环境配置](#1. 安装与环境配置)
  • [2. 基本用法](#2. 基本用法)
    • [(1) 单张图片的文本检测与识别](#(1) 单张图片的文本检测与识别)
    • [(2) 批量图片处理](#(2) 批量图片处理)
  • [3. 多语言支持](#3. 多语言支持)
  • [4. 高级功能](#4. 高级功能)
    • [(1) 方向分类(处理旋转文本)](#(1) 方向分类(处理旋转文本))
    • [(2) 版面分析(识别文档结构)](#(2) 版面分析(识别文档结构))
    • [(3) 表格识别](#(3) 表格识别)
  • [5. 参数调优](#5. 参数调优)
    • [(1) 调整检测与识别阈值](#(1) 调整检测与识别阈值)
    • [(2) 使用轻量级模型](#(2) 使用轻量级模型)
  • [6. 自定义模型训练](#6. 自定义模型训练)
    • [(1) 准备数据集](#(1) 准备数据集)
    • [(2) 启动训练](#(2) 启动训练)
  • [7. 常见问题](#7. 常见问题)
    • [(1) 模型下载失败](#(1) 模型下载失败)
    • [(2) 处理GPU内存不足](#(2) 处理GPU内存不足)
  • [8. 总结](#8. 总结)

前言

本文简单介绍一下PaddleOCR这款百度旗下的PaddlePaddle框架下的文本识别工具包。


1. 安装与环境配置

(1)安装PaddlePaddle

python 复制代码
#安装PaddlePaddle(GPU版本需根据CUDA版本调整)
pip install paddlepaddle

(2)安装PaddleOCR

python 复制代码
#安装PaddleOCR
pip install paddleocr

2. 基本用法

(1) 单张图片的文本检测与识别

python 复制代码
from paddleocr import PaddleOCR
#初始化OCR模型(默认使用中英文模型)
ocr = PaddleOCR(use_angle_cls=True, lang='ch')  # `lang`可选:ch, en, fr, german等


#读取图片并识别
img_path = 'test.jpg'
result = ocr.ocr(img_path, cls=True)  # cls=True表示启用方向分类

#打印结果
for line in result:
    print(line)

#可视化结果
from PIL import Image
image = Image.open(img_path).convert('RGB')
boxes = [line[0] for line in result]
txts = [line[1][0] for line in result]
scores = [line[1][1] for line in result]
Image.fromarray(ocr.draw_ocr(image, boxes, txts, scores)).show()

(2) 批量图片处理

python 复制代码
import os

image_dir = 'images/'
results = []
for img_name in os.listdir(image_dir):
    img_path = os.path.join(image_dir, img_name)
    result = ocr.ocr(img_path, cls=True)
    results.append((img_name, result))

3. 多语言支持

支持80+语言 ,通过lang参数指定:

(1)英文识别

python 复制代码
ocr_en = PaddleOCR(lang='en')
result_en = ocr_en.ocr('en_test.jpg')

(2)法语识别

python 复制代码
ocr_fr = PaddleOCR(lang='fr')
result_fr = ocr_fr.ocr('fr_test.jpg')

4. 高级功能

(1) 方向分类(处理旋转文本)

python 复制代码
ocr = PaddleOCR(use_angle_cls=True, lang='ch')  # 默认启用方向分类
result = ocr.ocr('rotated_text.jpg', cls=True)

(2) 版面分析(识别文档结构)

python 复制代码
from paddleocr import PPStructure

#初始化版面分析模型
structure_engine = PPStructure(table=False, ocr=False, show_log=True)

#分析图片版面
img_path = 'document.jpg'
result = structure_engine(img_path)

#输出结果(标题、段落、表格等)
for region in result:
    print(region['type'], region['bbox'], region['res'])

(3) 表格识别

python 复制代码
from paddleocr import PaddleOCR

ocr = PaddleOCR(use_angle_cls=True, lang='ch', table=True)  # 启用表格识别
result = ocr.ocr('table.jpg', cls=True)

5. 参数调优

(1) 调整检测与识别阈值

python 复制代码
ocr = PaddleOCR(
    det_db_thresh=0.3,  # 检测模型阈值(默认0.3)
    det_db_box_thresh=0.5,  # 检测框阈值(默认0.5)
    rec_thresh=0.7  # 识别置信度阈值(默认0.7)
)

(2) 使用轻量级模型

python 复制代码
#使用轻量级检测模型(速度更快,精度稍低)
ocr = PaddleOCR(
    det_model_dir='ch_ppocr_mobile_v2.0_det_infer',
    rec_model_dir='ch_ppocr_mobile_v2.0_rec_infer',
    cls_model_dir='ch_ppocr_mobile_v2.0_cls_infer'
)

6. 自定义模型训练

(1) 准备数据集

数据集需按以下格式组织:

bash 复制代码
dataset/
├── train/
│   ├── images/
│   └── label.txt  # 格式:img_path\tlabel
└── val/
    ├── images/
    └── label.txt

(2) 启动训练

bash 复制代码
#文本检测训练
python tools/train.py -c configs/det/ch_ppocr_v2.0/ch_det_mv3_db_v2.0.yml

#文本识别训练
python tools/train.py -c configs/rec/ch_ppocr_v2.0/rec_chinese_lite_train_v2.0.yml

7. 常见问题

(1) 模型下载失败

python 复制代码
手动下载模型并指定路径:
ocr = PaddleOCR(
    det_model_dir='path/to/det_model',
    rec_model_dir='path/to/rec_model',
    cls_model_dir='path/to/cls_model'
)

(2) 处理GPU内存不足

python 复制代码
降低批处理大小:
ocr = PaddleOCR(use_gpu=True, rec_batch_num=2, det_batch_num=2)

8. 总结

(1)核心功能

核心功能:文本检测、识别、多语言支持、版面分析、表格识别。

(2)优势

优势:开箱即用、多语言覆盖、轻量级模型、社区活跃。

(3)适用场景

适用场景:文档数字化、车牌识别、票据处理、多语言翻译等。

(4)官方资源

GitHub: PaddleOCR

文档: PaddleOCR Docs

通过灵活调整参数和结合业务需求,PaddleOCR可广泛应用于各类OCR场景。


相关推荐
DES 仿真实践家13 分钟前
【Day 11-N22】Python类(3)——Python的继承性、多继承、方法重写
开发语言·笔记·python
张较瘦_1 小时前
[论文阅读] 人工智能 + 软件工程 | 需求获取访谈中LLM生成跟进问题研究:来龙去脉与创新突破
论文阅读·人工智能
一 铭2 小时前
AI领域新趋势:从提示(Prompt)工程到上下文(Context)工程
人工智能·语言模型·大模型·llm·prompt
云泽野5 小时前
【Java|集合类】list遍历的6种方式
java·python·list
麻雀无能为力6 小时前
CAU数据挖掘实验 表分析数据插件
人工智能·数据挖掘·中国农业大学
时序之心6 小时前
时空数据挖掘五大革新方向详解篇!
人工智能·数据挖掘·论文·时间序列
IMPYLH6 小时前
Python 的内置函数 reversed
笔记·python
.30-06Springfield6 小时前
人工智能概念之七:集成学习思想(Bagging、Boosting、Stacking)
人工智能·算法·机器学习·集成学习
说私域7 小时前
基于开源AI智能名片链动2+1模式S2B2C商城小程序的超级文化符号构建路径研究
人工智能·小程序·开源
永洪科技7 小时前
永洪科技荣获商业智能品牌影响力奖,全力打造”AI+决策”引擎
大数据·人工智能·科技·数据分析·数据可视化·bi