阿里:端到端文档解析模型OvisOCR2

📖标题:OvisOCR2 Technical Report

🌐来源:arXiv, 2607.13639v1

🛎️文章简介

🔸研究问题:如何在不依赖复杂流水线的情况下,利用紧凑的端到端模型实现超越传统方法的文档解析性能?

🔸主要贡献:论文提出了OvisOCR2,一个0.8B参数的端到端文档解析模型,通过创新的数据引擎和训练策略,在OmniDocBench等基准上取得SOTA成绩。

📝重点思路

🔸构建混合数据引擎:结合真实文档与合成数据。真实数据经专用OCR解析、规则清洗及人工抽检;合成数据基于HTML模板生成,确保图像与Markdown标注严格对齐,覆盖长尾难例。

🔸多阶段训练策略:首先对Qwen3.5-0.8B和4B模型进行监督微调;随后在4B分支上使用GRPO算法进行强化学习,引入文本、公式和表格的多组件奖励;接着通过在线策略蒸馏将4B教师模型的知识迁移至0.8B学生模型;最后进行模型融合。

🔸优化强化学习训练:设计包含文本编辑距离、公式CDM和表格TEDS的综合奖励函数,并采用分层并行和快捷路径优化奖励计算效率,解决长序列生成的训练瓶颈。

🔎分析总结

🔸性能全面领先:在OmniDocBench v1.6上获得96.58的最高分,超越PaddleOCR-VL-1.6等主流流水线方法;在PureDocBench上Avg3得分75.06,同样位居第一。

🔸鲁棒性与泛化能力强:在涵盖手写体和复杂表格的内部基准测试中,OvisOCR2在整体得分、文本准确率及表格结构恢复上均表现最佳,且表格缺失率显著低于对比方法。

🔸小模型潜力巨大:证明仅0.8B参数的端到端模型,通过高质量数据和精细化训练,足以在结构化文档解析任务上击败参数量更大或架构更复杂的流水线系统。

💡个人观点

论文打破了端到端模型性能不及流水线的刻板印象,成功关键不仅在于模型架构,更在于构建了高保真的合成数据闭环以及"大模型RL引导+小模型蒸馏"的高效训练范式。

相关推荐
智慧物业老杨12 分钟前
物业日常巡查的数智化重构:从“打卡式巡检“到“闭环式风控“
android·java·人工智能·系统架构·rxjava
吴佳浩3 小时前
Skill 为什么不同于 Tool?Agent 技能库的自演进与动态加载机制
人工智能·agent·ai编程
大模型任我行6 小时前
谷歌:“课程学习”融入扩散模型强化学习
人工智能·语言模型·自然语言处理·论文笔记
AIGCmagic社区6 小时前
具身智能专题:机器人也有Scaling Law?智元GE-Act 2.0用3万小时真机数据给出答案
人工智能·aigc·具身智能
Rosanci7 小时前
谷歌浏览器插件开发实战指南:从 Hello World 到上架发布
大数据·人工智能·chrome·程序人生
明月_清风7 小时前
AI 越来越强,程序员真正的价值到底是什么?
人工智能·后端
m0_466525298 小时前
云从科技上线云起ModelHub:AI团队时代的模型算力基础设施
大数据·人工智能·科技
火山引擎开发者社区8 小时前
OpenViking:给 Codex 加上长期记忆
人工智能
荆棘鸟智能8 小时前
城市感知设备怎么统一接入?从多协议网关到设备模型的中间件架构设计
人工智能·算法·边缘计算
火山引擎开发者社区8 小时前
当 AI 内容真假难辨,谁来为真实签名 —— 证书中心 C2PA 内容可信溯源服务正式发布
人工智能