PaddleOCR-VL-1.6 是百度飞桨团队的 0.9B 文档理解多模态模型(NaViT 动态分辨率视觉编码器 + ERNIE-4.5-0.3B 语言模型),BF16 权重仅 1.79GB,单卡 RTX 4090(24GB)甚至纯 CPU 即可跑通。它在权威文档解析基准 OmniDocBench v1.6 上取得 96.33% 综合精度,刷新开源与闭源 SOTA。本文给出基于 transformers 与 PaddleOCR 官方流水线的完整可运行部署代码,并附与 MinerU、GLM-OCR、Gemini-3-Pro、GPT-5.2 的横向对比。适合合同 / 论文 / 票据数字化、本地隐私部署的开发者与中小企业。
一、模型速览
PaddleOCR-VL-1.6 由百度飞桨(PaddlePaddle)团队于 2026-05-28 在 GitHub v3.6.0 中发布,是 PaddleOCR-VL 系列的轻量级文档解析多模态模型。整体约 0.9B 参数:视觉侧为 NaViT 风格动态分辨率视觉编码器,语言侧基于 ERNIE-4.5-0.3B。权重以 BF16 存储仅 1.79GB,量化后更低。模型采用「版面分析 + VLM 元素识别」两段式流水线,而非单一长上下文窗口,天然适配整页 PDF / 扫描件解析。许可证沿用 PaddleOCR 系列 Apache 2.0(权重开放下载,商用以 HF 模型卡 LICENSE 为准)。作为 PaddleOCR 家族成员,它继承了全球第一的开源 OCR 生态(GitHub Star 已破 79.2K,超过老牌的 Tesseract),社区资料与排错经验极丰富,新手踩坑成本极低。一句话定位:不到 1B 参数、单卡可跑的文档解析 SOTA 模型,把「私有化文档数字化」门槛打到地板价。(来源:PaddlePaddle 官方发布 / GitHub Release)
与常见「单张巨图直接喂给大模型」的做法不同,PaddleOCR-VL 先由 PP-DocLayoutV2 做版面分析、切出标题 / 段落 / 表格 / 公式等元素子图并确定阅读顺序,再逐个送进 0.9B VLM 识别,最后按阅读顺序拼回整页结果。这种「先分块、后识别」的设计,让极小模型也能稳定吃下复杂多栏扫描件,也是它精度能逼近甚至反超大模型的根本原因。(来源:PaddlePaddle 官方文档)
注:模型 5 月底发布,近期因 HuggingFace 重新活跃(13 小时前更新)与社区部署教程增多,成为当下最易本地落地的文档多模态选型,故纳入本期追踪,与昨日 305B 的 DeepSeek-V4-Flash-Vision-Exp 形成「数据中心级 vs 消费级」互补视角。
二、核心亮点
1. 0.9B 体量刷新文档解析 SOTA 在 OmniDocBench v1.6 综合指标达 96.33%,超越 Gemini-3-Pro、GPT-5.2、MinerU-2.5-Pro、GLM-OCR 等更大规模的通用与专用方案;在面向真实场景的 Real5-OmniDocBench 上达 93.19%,较 Gemini-3-Pro 高近 4 个百分点。(官方数据)
值得注意的是,它用一个不到 1B 的模型压过了参数规模数十倍乃至百倍的通用大模型,说明在垂直文档场景里,「专模精做」比「堆参数」更高效、也更省钱------这对预算有限的中小团队尤其关键。(官方数据引申)
OmniDocBench v1.6 综合精度:
PaddleOCR-VL-1.6 96.33% ← SOTA(开源+闭源双榜第一)
Gemini-3-Pro ≈92.x ← 落后约 4pp
GPT-5.2 / MinerU-2.5-Pro / GLM-OCR 均落后
2. 区域感知数据优化框架(哪里弱补哪里) 不是盲目堆数据,而是先定位前代(v1.5)薄弱区域------特定表格结构、古文生僻字、印章纹理------再用高可靠标注定向增强。这种「精准补短板」是精度从 94.5%(v1.5)跃升到 96.33% 的关键。
3. 渐进式后训练(分阶段 RL 收口) 通过精选数据 + 强化学习分阶段优化,每阶段聚焦不同目标,逐步把性能推向新高,避免一次性灌入导致的灾难性遗忘。
4. 六类复杂元素统一识别 一套模型覆盖 OCR、表格(Markdown/HTML)、公式(LaTeX)、图表、印章(Seal)、文字检测(Spotting),并支持中英文混排与 100+ 语言。相比「OCR 用 Tesseract、表格用另一套」的多模型拼装,工程链路大幅简化。
5. 与 v1.5 零成本即插即换 架构完全兼容,已用 v1.5 的团队无需改代码,仅切换 pipeline_version="v1.6" 即可平滑升级。
三、部署实战
环境准备(Python 3.10+,建议 CUDA 12.x):
模型权重约 1.79GB,国内用户可用 ModelScope 镜像加速下载(python -m pip install modelscope 后 snapshot_download('PaddlePaddle/PaddleOCR-VL-1.6')),避免直连 HuggingFace 卡顿。若机器只有 CPU,把代码里的 .to("cuda") 改为 .to("cpu") 即可跑通,代价是单页耗时会从秒级升到十几秒级------这正是 0.9B 小模型的红利:换机成本低到可以忽略。
bash
bash
# 方案 A:PaddleOCR 官方流水线(推荐,支持整页/批量 PDF,速度更快)
python -m pip install paddlepaddle-gpu==3.2.1 -i https://www.paddlepaddle.org.cn/packages/stable/cu126/
python -m pip install -U "paddleocr[doc-parser]>=3.6.0"
# 方案 B:transformers 元素级推理(灵活可控,需 transformers>=5.0)
python -m pip install "transformers>=5.0.0" pillow torch
一键 CLI 解析整页图片 / PDF:
bash
bash
paddleocr doc_parser -i demo.png --pipeline_version v1.6
Python API(文档 → Markdown / JSON):
python
bash
from paddleocr import PaddleOCRVL
pipeline = PaddleOCRVL(pipeline_version="v1.6")
output = pipeline.predict("contract_scan.pdf") # 支持图片与 PDF
for res in output:
res.print()
res.save_to_markdown(save_path="output") # 直接落地 Markdown
res.save_to_json(save_path="output")
transformers 元素级识别(适合自定义提示词):
python
bash
from PIL import Image
import torch
from transformers import AutoProcessor, AutoModelForImageTextToText
model_path = "PaddlePaddle/PaddleOCR-VL-1.6"
image = Image.open("table.png").convert("RGB")
task = "table" # 可选项: ocr | table | chart | formula | spotting | seal
PROMPTS = {
"ocr": "OCR:", "table": "Table Recognition:",
"chart": "Chart Recognition:", "formula": "Formula Recognition:",
"spotting": "Spotting:", "seal": "Seal Recognition:",
}
model = AutoModelForImageTextToText.from_pretrained(
model_path, torch_dtype=torch.bfloat16).to("cuda").eval()
processor = AutoProcessor.from_pretrained(model_path)
messages = [{"role": "user", "content": [
{"type": "image", "image": image},
{"type": "text", "text": PROMPTS[task]}]}]
inputs = processor.apply_chat_template(
messages, add_generation_prompt=True,
return_dict=True, return_tensors="pt").to("cuda")
out = model.generate(**inputs, max_new_tokens=1024)
print(processor.decode(out[0][inputs["input_ids"].shape[-1]:], skip_special_tokens=True))
效果验证:用一张含中英文混排 + 表格的扫描件测试,流水线模式可直接输出带层级标题的 Markdown,表格还原为标准 Markdown 表格,公式转为 LaTeX,印章位置与文字被单独抽取。社区已在 RTX 4090(24GB)上验证 CUDA 推理可正常加载并识别(官方 / 社区验证,本环境无 GPU 未实测)。
vLLM 提速(可选) :官方提供 Docker 一键起服务,--model_name PaddleOCR-VL-1.6-0.9B --backend vllm,再通过 PaddleOCRVL(vl_rec_backend="vllm-server", vl_rec_server_url=...) 调用,吞吐显著高于纯 Paddle 后端;llama.cpp 的 GGUF 版(如 Mungert/PaddleOCR-VL-1.6-GGUF)也可用于纯 CPU / 边缘设备。
四、性能测评
| 模型 | 参数量 | OmniDocBench v1.6 | 许可证 | 本地可跑 | 数据来源 |
|---|---|---|---|---|---|
| PaddleOCR-VL-1.6 | 0.9B | 96.33% | Apache 2.0 | ✅ 1.8GB / 单卡 | 官方 |
| MinerU-2.5-Pro | 更大 | 落后 | 开源 | 部分 | 官方对比 |
| GLM-OCR | --- | 落后 | 开源 | ✅ | 官方对比 |
| Gemini-3-Pro | 闭源 | ≈92.x% | 商用 | ❌ 仅 API | 官方对比 |
| GPT-5.2 | 闭源 | 未公开 | 商用 | ❌ 仅 API | 官方对比 |
三个维度评估:
- 精度:96.33% 综合精度 + Real5 真实场景 93.19%,在文本 / 公式 / 表格三项核心能力全面领先,属当前文档解析第一梯队(官方数据)。
- 显存 / 体积:BF16 权重 1.79GB,INT8 后约 1GB 级,CPU 或入门独显即可;对比 7B / 30B 文档模型,硬件成本降一个数量级(官方权重 / 工程估算)。
- 速度 :官方未公布单卡 tok/s 吞吐;社区实测 4090 可流畅跑页级解析,批量大文档建议走 vLLM 后端。本环境无 GPU,未实测 tok/s,不编造数据(官方 / 社区验证)。
需要提醒:96.33% 是 OmniDocBench 基准成绩,测试分布可能偏向中文文档;英文-only 或极端排版的真实业务,建议先小批量抽样验证,再决定全量上线。这也是官方与社区一致强调的「落地前必做动作」------基准分高不等于你的数据高。
五、使用建议
适用场景:合同 / 票据 / 论文 / 古籍扫描件数字化;企业内网隐私合规的文档抽取;100+ 多语言文档批处理;需要 PDF → Markdown / JSON 结构化落地的 RAG 预处理。
不适用场景:需要「看图聊天」式自由多轮对话的通用 VLM(它专注文档元素识别,非通用对话);超长单图无版面结构的自由描述;依赖单一超长上下文窗口的长文档整体理解(它走版面分块流水线)。
调优提示 :① 优先用官方 PaddleOCR 流水线而非裸 transformers,前者含版面分析、速度更快且精度可复现论文;② 纯 transformers 仅做元素级任务,别期望它替代整页 pipeline;③ spotting 任务对 <1500px 小图会自动 2× 上采样,可手动预处理提升小字识别;④ v1.5 用户直接切 pipeline_version 即可零成本升级。 ⑤ 真批量场景优先 vLLM 后端 + 多进程并发,单图串行无法榨满 GPU 利用率。 ⑥ 古籍 / 印章等垂直场景若精度不够,可基于 Apache 2.0 权重做 LoRA 微调,数据量不大也能明显提点。
六、小结
PaddleOCR-VL-1.6 给本地文档数字化提供了一条「低成本、高精度、可私有化」的清晰路径:0.9B 体量换来 1.79GB 权重与单卡 / CPU 可跑的部署弹性,96.33% 的 OmniDocBench 成绩又保证了开箱即用的识别质量。它不适合替代通用对话 VLM,但在合同、票据、论文、古籍这类「把纸变成结构化数据」的刚需场景里,几乎是当下最务实的开源选型。配合官方流水线 + 可选 vLLM 后端,从 Demo 到生产服务只差一行启动命令。
往期回顾: