RapidOCR(最推荐替代 PaddleOCR,手写笔记 / 作业首选)
- 架构:DB 检测 + CRNN 识别,PyTorch,支持 ONNX Runtime CPU 推理
- 优势:中文手写实测漏检比 PaddleOCR 少,倾斜、不规整手写笔记、学生作业表现更好;Umi-OCR 内置引擎,开箱即用,可微调,支持输出坐标。
- 缺点:重度草书识别差;版面分析弱。
- 适合:需要检测框坐标、CPU 部署、手写笔记、试卷手写。
2. CnOCR(breezedeus)
- 架构:DB/CTPN 检测 + CRNN 识别,自带中文手写预训练权重
- 优势:API 简洁,原生支持手写中文,支持竖排;很方便用自己手写数据集做微调。
- 缺点:社区较小,检测速度略慢于 RapidOCR。
1. GLM-OCR(智谱,0.9B,手写混排强,显存门槛低)
- 亮点:专门文档 VLM,手写 + 印刷混排、表格、简单公式都能处理;最低 4GB 显存可跑;Apache2.0 可商用,输出 Markdown/JSON。
- 适合:笔记、作业,手写印刷混排,不想折腾检测框调参。
2. 腾讯 HunyuanOCR(HyOCR,1B)
- 亮点:端到端 OCR,消除两阶段误差传递;手写、表格、畸变拍照文档强,支持 vLLM 加速。
- 适合:复杂文档手写,需要高吞吐推理。
3. MinerU
- 亮点:试卷、笔记手写 + 表格 + 公式综合能力很强;常用来做 PDF / 图片文档解析,输出 markdown。
- 注意:偏向文档解析,细粒度文字坐标输出不如传统 OCR 流水线。