探索DocLLM:摩根大通推出的新型文档处理语言模型

探索DocLLM:摩根大通推出的新型文档处理语言模型

摩根大通近日推出了一款名为DocLLM的新型语言模型,专为处理具有复杂布局的文档而设计。该模型是传统大型语言模型的轻量级版本,专注于理解丰富的文档内容。与使用昂贵的图像编码器的其他模型不同,DocLLM通过文本框的位置和大小(边界框信息)来理解页面上文本的布局,这使其在处理各种布局的文档时更为高效。

关键亮点:

  • DocLLM是标准大型语言模型的轻量级扩展,能够同时捕获空间布局和文本语义,而无需使用成本高昂的图像编码器。
  • DocLLM提供1B和7B两种规模的版本,能够在四个未见过的数据集中,相较于Llama2--7B模型,提升15%至61%的性能。
  • 在使用零样本指令的情况下,DocLLM-7B在16个数据集中的12个上超越了GPT-4和Llama2,特别擅长关键信息提取(KIE)和文档分类(CLS)任务。

技术特色:

  • DocLLM优化了对视觉文档分析的方法,通过仅依赖边界框数据整合空间布局,避免了昂贵的视觉编码器的使用,使模型更加紧凑,处理时间更高效。
  • 通过将标准变换器中的注意力机制重新配置为独立的矩阵,DocLLM能够在文本和空间布局之间建立独特的对齐,捕获这两个元素之间的依赖关系。
  • 开发了一种专注于填充文本段落的预训练目标,使模型能够有效处理视觉文档中常见的不规则布局和多样化内容。

应用范围:

  • DocLLM通过大规模指令数据集的细化预训练,覆盖了四个核心的文档智能任务:关键信息提取、自然语言推理、视觉问答和文档分类。
  • 在指令调优阶段,共使用了16个具有相应OCR数据的单页和多页文档数据集。

性能对比:

  • DocLLM在14个数据集中超越了当前最先进的语言模型,并且在五个先前未见过的数据集中表现良好。
  • 特别是,在不同数据集的不同切分(SDDS)设置中,DocLLM-7B在使用零样本指令的情况下,在12个数据集中超越了GPT-4和Llama2。

DocLLM通过其独特的设计和优化,为处理复杂布局的文档提供了一个高效且性能卓越的新选择,尤其在关键信息提取和文档分类任务上展现了其强大的能力。

相关推荐
蓝速科技7 小时前
仓储盘点移动终端选型与蓝速科技 K10 实战方案
运维·数据库·人工智能·科技·材质
硅谷秋水7 小时前
RoboEdit:将人类操作视频转化为可扩展的机器人经验
人工智能·机器学习·计算机视觉·机器人
阿明67 小时前
小白深度学习基础【AI】
人工智能·深度学习
acrel77 小时前
化工企业能源管理体系下智能化技术实践与探索
网络·人工智能
ZEB11067 小时前
博彦科技董事长、总经理韩洁:AI必须扎根具体行业业务场景
人工智能·科技
梦帮科技7 小时前
万亿 Token 工业级语料洗炼:MinHash LSH 兆级去重、语义纯化与元提示词泄漏绝对阻断
人工智能·深度学习·神经网络·生成对抗网络·自然语言处理·数据挖掘
百无聊赖是也非也7 小时前
从被动应对到开放生态:中国模型为何崛起
人工智能·大模型
RPAdaren7 小时前
AI 智能体概念别混淆!按执行深度分为五类:从聊天助手到企业级平台
人工智能
DP DPharness8 小时前
拆开 webnovel-writer 的 Story System:从运行时合同到投影重放
人工智能·dpharness
素男8 小时前
叫沉默的,和叫留白的——一次改名记
人工智能·agent·self-becoming·ai长期记忆·ai自我介绍