第6节:OCR文本错漏频发?结合LLM纠错,让图像文本也能精确使用

RAG与Agent性能调优:6.OCR文本错漏频发?结合LLM纠错,让图像文本也能精确使用

Gitee地址:https://gitee.com/agiforgagaplus/OptiRAGAgent

文章详情目录:RAG与Agent性能调优

上一节:第5节:动态切片策略与重叠机制提升RAG召回率

下一节:第7节:图像切分不合理,文本矫正和版面区域检查,保证信息不完整且不冗余

错误类型

OCR识别错误通常可分为以下几种:

  • 字符识别错误
  • 文字遗漏
  • 多次重复
  • 格式混乱
  • 特殊符号识别错误

这些错误往往源于以下几个方面:

  • 图像质量不佳
  • 字体样式复杂
  • 背景干扰
  • OCR算法限制

传统解决方案的局限性

传统的OCR优化方案主要包括

  • 图像预处理
  • 后处理规则
  • 模型微调

结合LLM进行文本纠错新思路

  • 充分发挥大语言模型能力
  • OCR+大语言模型协同流程

我们可以将整个OCR处理流程分为两个阶段:

  • OCR识别阶段:使用PaddleOCR5其对图像进行识别,得到初步的文本结果
  • LLM纠错阶段:将OCR输出的文本送入大语言模型,由其进行语义级别的纠错和优化

实操

https://www.paddlepaddle.org.cn/install/quick?docurl=undefined

复制代码
# 运行 PP-OCRv5 推理
! paddleocr ocr -i https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png --use_doc_orientation_classify False --use_doc_unwarping False --use_textline_orientation False 

# 运行 PP-ChatOCRv4 推理前,需要先获得千帆API Key
# paddleocr pp_chatocrv4_doc -i https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/vehicle_certificate-1.png -k 驾驶室准乘人数 --qianfan_api_key your_api_key --use_doc_orientation_classify False --use_doc_unwarping False 

# 查看 "paddleocr ocr" 详细参数
# paddleocr ocr --help

# PP-OCRv5 示例
from paddleocr import PaddleOCR
# 初始化 PaddleOCR 实例
ocr = PaddleOCR(
    use_doc_orientation_classify=False,
    use_doc_unwarping=False,
    use_textline_orientation=False)
# 对示例图像执行 OCR 推理 
result = ocr.predict(
    input="https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png")
# 可视化结果并保存 json 结果
for res in result:
    res.print()
    res.save_to_img("output")
    res.save_to_json("output")
相关推荐
Microvision维视智造1 分钟前
从“看见“到“看懂“——工业视觉的大模型时刻到了吗?
人工智能·计算机视觉·视觉检测·机器视觉
janeboe8 分钟前
抖音黑科技兵马俑总站源头简博科技 | 抖音锚点不合规挂载新规今日生效,短视频引流直播间迈入三端全链路监管时代
大数据·人工智能·科技
lialaka10 分钟前
「未来星途(Future_Odyssey)」——全语音_3D_AI_具身交互智能数字教官与全双工星际科普沉浸舱[1]
人工智能·3d·交互
hongmai66688811 分钟前
ESP32-C61-WROOM-1-N8R2:Wi-Fi 6与RISC-V融合的中坚力量
人工智能·单片机·嵌入式硬件·物联网·智能家居·risc-v
正在走向自律15 分钟前
用豆包Seed Evolving打造全功能【AI智能记账】小程序,开源可落地
人工智能·小程序·开源·智能记账
小保CPP23 分钟前
OpenCV C++提取webp动图里的图片
c++·人工智能·opencv·计算机视觉
B8017913Y23 分钟前
手动整理录音太慢错漏多?2026专业AI录音可高效整理内容
人工智能
梦想的颜色26 分钟前
AI Agent 可观测性:破解多步推理黑盒|从概念、架构、指标到生产落地图鉴
人工智能·ai agent 可观测性·llm 追踪 trace·llmops 硬核实战·agent 生产运维
IT智慧客073129 分钟前
Harness 到底指什么
人工智能
大模型任我行36 分钟前
阿里:端到端文档解析模型OvisOCR2
人工智能·语言模型·自然语言处理·论文笔记