【文档解析】2026年技术发展和趋势

note

  • 文档解析三个特征:
    • 视觉token极压缩:"光学压缩"成了新卖点
    • 推理加速成为显学:多token预测+投机解码被卷到这个领域
    • 训练全面转向"可验证奖励的强化学习"(RLVR)
      • LightOnOCR和olmOCR用unit-test式评估+GRPO;
      • Infinity-Parser2一次co-train八个任务;
      • Jina-OCR-v1用五维乘积奖励(内容、结构、单元测试、重复、格式)给部分分,并特意合成公式/表格密集页喂奖励。
  • 三个判断:
    • 下一个瓶颈不在"看",在"结构推理"
    • 从"全局压token"转向"按内容动态分配token"
    • 会有一次"可验证奖励范式"的事故或反噬

文章目录

一、文档解析

1、三个突出特征

其一,视觉token极压缩:"光学压缩"成了新卖点。

其二,推理加速成为显学:多token预测+投机解码被卷到这个领域。

OCR输出长、又高度可预测,成了投机解码的"肥肉"。2026年几乎每家都在解「生成长、解码慢」的问题。代表的:

  • FastMTP(共享单块递归草拟)、DFlash(HunyuanOCR-1.5用)、GLM-OCR的共享参数MTP,
  • 都在走"一个草稿块猜多个token、主模型批量验证"的路线;

其三,后训练全面转向"可验证奖励的强化学习"(RLVR)。这是2026年最实质的质量来源。不再是纯SFT让模型背答案,而是用确定性可验证奖励+GRPO/DAPO让模型自己摸索更高分,看下代表工作:

  • 一个是奖励信号用确定性代码打分:表格用TEDS、公式用CDM、再加结构完整性(括号是否闭合、标签是否闭合、表格是否完整),不需要奖励模型或judge;
  • 具体的,又LightOnOCR和olmOCR用unit-test式评估+GRPO;Infinity-Parser2一次co-train八个任务;Jina-OCR-v1用五维乘积奖励(内容、结构、单元测试、重复、格式)给部分分,并特意合成公式/表格密集页喂奖励。

2、三个判断

2、三个判断同样的,有三个判断,也可以做个思考:

判断一:下一个瓶颈不在"看",在"结构推理" 。阅读顺序、多栏、跨行表格,这些"看不见但要想"的结构问题,正是今年分数的洼地(所有模型在reading-order、OldScans上都难看),而且结构恰恰是规则奖励最难表达的(什么叫"阅读顺序对",你很难写成确定性检查)。2027会需要新的监督信号,很可能是强标注的"结构对比合成对"+判别性结构判官。

判断二:从"全局压token"转向"按内容动态分配token" 。全局256token把细节全丢光了。往下走会是全局粗看+局部按需高分辨率:先低精度分栏定结构,再对公式、数字区、小字区动态放大并加token。这是视频编码"人眼敏感区给高码率"的行星级分配逻辑,搬到视觉token上。Deep Encoder V2的causal flowtokens已经是这个方向的苗头。

判断三:会有一次"可验证奖励范式"的事故或反噬 。RLVR太容易被榜单绑架。当几家都靠合成数据喂专项奖励刷分时,模型在真实世界的样张上会集体露馅(奖项能打分的和真实需求开始背离)。其实关于"OCRbenchmark与真实文档错位"的公开争论一直有,就像当年ROUGE被诟病那样。真正确立地位的,会是"保真度追踪+失真优先级预算"这类评估,而不是一个总分。

相关推荐
东莞市云毅网络有限公司1 小时前
AI 引用句逐条回指原文:让回答可回溯的校验实现
python·数据清洗·rag·企业知识库·文档解析
论文复现现场15 小时前
Qwen-VL 票据 OCR 微调需要几张 4090?单卡 QLoRA、4 卡训练与 OOM 排查
人工智能·机器学习·ocr·分布式训练·qlora·rtx4090·qwen2.5-vl
开开心心_Every18 小时前
电脑OCR识别软件支持表格识别图片转Excel
java·开发语言·微信·计算机外设·ocr·intellij-idea·excel
成旭先生2 天前
银行卡识别 API:一张照片读出卡号、BIN 与发卡行
人工智能·算法·ocr·api接口·金融科技·银行卡识别·支付风控
开开心心就好2 天前
本地文件搜索工具推荐,占用小速度还快
智能手机·ffmpeg·ocr·word·音视频·网络攻击模型·安全架构
winfredzhang2 天前
用 Chrome 插件 + 局域网 Qwen2.5-VL 打造视频截屏 OCR 工具
人工智能·chrome·ocr·api·plugin
开开心心就好2 天前
视频压缩工具推荐,画质效果很能打
智能手机·ffmpeg·ocr·word·排序算法·音视频·散列表
万物皆智能3 天前
12个图片转文字软件,包括OCR识别等功能
ocr
跨境数据猎手3 天前
ddddocr 与多模态大模型 OCR 对比和选择建议
ocr