【DeepSeek-OCR系列第三篇】Pix2Struct:让视觉语言理解回归像素本身【ICML23】


📚 论文信息

  • 标题Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding

  • 作者:Kenton Lee, Mandar Joshi, Iulia Turc, Hexiang Hu, Fangyu Liu, Julian Eisenschlos, Urvashi Khandelwal, Peter Shaw, Ming-Wei Chang, Kristina Toutanova

  • 单位:Google Research、succinctly.ai、University of Cambridge

  • 会议:ICML 2023

  • 🔗 GitHub 项目


一、问题背景:视觉与语言的"割裂"

当前的视觉-语言理解(Vision-Language Understanding)研究,大多基于图像与文本分开处理的范式。 但现实中,我们接触到的文本和视觉往往是交织在一起的,例如👇

  • 📄 含表格和图片的文档

  • 📊 图示和信息图

  • 📱 UI 界面

  • 🌐 网页内容

现有方法多依赖 OCR 管线特定领域工程 来拆解这种混合信息,例如:

  • 文档理解依赖外部 OCR;

  • UI 理解依赖平台特定 metadata;

  • 图表理解依赖图结构提取。

👉 这导致模型难以泛化,工程复杂、跨域能力弱,也难以构建统一的视觉语言理解框架。


二、方法创新:Pix2Struct = 截图 + HTML 解析

论文提出的 Pix2Struct 旨在彻底简化这一过程。 其核心思想是:

"只用像素输入 + 预训练解析网页结构,就能学到通用视觉语言能力。"

✳️ 核心技术路径

  1. 截图解析预训练(Screenshot Parsing)
  • 从网页抓取 截图 + HTML

  • 通过模型输入像素截图,输出 HTML 简化结构(类似图像转标记语言);

  • 自监督学习网页的布局与内容关系。

  • 可变分辨率输入

    • 改进 ViT 输入,支持灵活分辨率和长宽比;

    • 避免 OCR 模型常见的失真问题。

  • 文本直接渲染到图像上

    • 任务中的问题(如 VQA)直接绘制在图片上方;

    • 模型通过单一视觉通道理解所有信息,避免多模态对齐难题。

    📌 Pix2Struct 是一种 视觉编码 + 文本解码 架构。 与 T5 的"文本到文本"类似,它是 "像素到文本"的通用框架。


    三、实验结果:跨 4 大领域,9 项任务

    论文在四个视觉语言领域的九个基准上进行了系统测试:

    领域 任务示例 数据集
    Illustrations 图表/示意图问答 ChartQA, AI2D
    UI 组件识别、界面描述 RefExp, Widget Captioning
    Natural Images 图像问答、文字识别 TextCaps, OCR-VQA
    Documents 文档问答 DocVQA, InfographicVQA

    1. 对比 Donut 与 GIT2

    • Pix2Struct 在 9 个基准中 8 个优于 Donut

    • 并在 6 个任务上创下单模型 SOTA;

    • 相比 GIT2(12.9B 图文对),Pix2Struct 预训练数据更小,但跨域迁移更强。

    2. UI 与插图任务表现尤为突出

    • RefExp(UI组件定位)超过 UIBert;

    • Widget Captioning CIDEr 从 127.4 提升至 136.7;

    • Screen2Words 从 64.3 提升到 109.4。

    3. 文档与信息图任务表现

    • DocVQA ANLS 提升 9 分;

    • InfographicVQA 从 11.6 提升到 40。 👉 说明其对长宽比极端的图像也具有较强鲁棒性。


    四、优势与局限

    ✅ 优势

    • 统一像素输入,跨领域泛化能力强;

    • 训练目标简洁,自监督高效;

    • 可变分辨率机制适配真实场景;

    • 超越 OCR 管线,在 6/9 基准任务上达 SOTA。

    ⚠️ 局限

    • 语义理解深度与专用文本模型仍有差距;

    • 高分辨率训练成本高;

    • 对特定领域结构(如 PDF 元数据)不加利用时略有性能损失;

    • 暂不具备生成能力,仅限理解类任务。


    📝 一句话总结 : Pix2Struct 用"截图+像素解析"打破多模态割裂, 是迈向 通用视觉语言理解 的重要一步。

相关推荐
10mAh10 小时前
【PaddleOCR】扫描版 PDF 无法复制、RAG 检索为空怎么解决?——OCR 解析与版面还原实战
前端·pdf·ocr
AI人工智能+11 小时前
智能文档抽取系统通过“视觉感知+大模型认知“双引擎架构,实现非结构化文档的自动化处理
深度学习·计算机视觉·语言模型·自然语言处理·ocr·文档抽取
zyplayer-doc4 天前
同一份制度别复制到多个知识库:用zyplayer-doc引用文档解决重复维护
javascript·人工智能·智能手机·开源·ocr
zyplayer-doc4 天前
核心制度不该被随手修改:用zyplayer-doc锁定文档和全部子文档
大数据·数据库·人工智能·笔记·pdf·ocr
一个王同学5 天前
从零到一 | CV转多模态大模型 | week21 | 实战项目-DocuMind-VL:基于 OCR 与 Qwen-VL 的文档多模态问答系统(一)
人工智能·深度学习·计算机视觉·ocr·vllm
Sinosecu-OCR5 天前
文通OCR技术深度解析:自研算法如何搞定复杂场景识别?
算法·ocr·ocr识别系统
AI人工智能+5 天前
一种高效、精准的不动产权证书智能识别技术,打通了物理世界与数字世界的信息壁垒
深度学习·计算机视觉·自然语言处理·ocr·不动产权证书识别
oradh6 天前
Oracle RAC OCR维护操作总结
数据库·oracle·ocr·rac ocr维护·ocr维护·vote disk
诸葛大钢铁6 天前
PDF无法复制文字怎么办?3种方法解除PDF复制限制并提取文字
pdf·ocr·pdf教程·pdf解除限制·pdf无法复制·pdf文字识别
AI人工智能+6 天前
学位证书识别技术通过计算机视觉、自然语言处理和大模型推理相结合,实现了高精度、高效率的证书数字化处理
深度学习·计算机视觉·自然语言处理·ocr·学位证书识别