文档理解多模态模型:PaddleOCR-VL-1.6 部署实测,0.9B 小钢炮暴打 GPT-5.2,文档解析刷新 SOTAPaddleOCR-VL-1.6 是百度飞桨团队的 0.9B 文档理解多模态模型(NaViT 动态分辨率视觉编码器 + ERNIE-4.5-0.3B 语言模型),BF16 权重仅 1.79GB,单卡 RTX 4090(24GB)甚至纯 CPU 即可跑通。它在权威文档解析基准 OmniDocBench v1.6 上取得 96.33% 综合精度,刷新开源与闭源 SOTA。本文给出基于 transformers 与 PaddleOCR 官方流水线的完整可运行部署代码,并附与 MinerU、GLM-OCR、Gem