探索DocLLM:摩根大通推出的新型文档处理语言模型

探索DocLLM:摩根大通推出的新型文档处理语言模型

摩根大通近日推出了一款名为DocLLM的新型语言模型,专为处理具有复杂布局的文档而设计。该模型是传统大型语言模型的轻量级版本,专注于理解丰富的文档内容。与使用昂贵的图像编码器的其他模型不同,DocLLM通过文本框的位置和大小(边界框信息)来理解页面上文本的布局,这使其在处理各种布局的文档时更为高效。

关键亮点:

  • DocLLM是标准大型语言模型的轻量级扩展,能够同时捕获空间布局和文本语义,而无需使用成本高昂的图像编码器。
  • DocLLM提供1B和7B两种规模的版本,能够在四个未见过的数据集中,相较于Llama2--7B模型,提升15%至61%的性能。
  • 在使用零样本指令的情况下,DocLLM-7B在16个数据集中的12个上超越了GPT-4和Llama2,特别擅长关键信息提取(KIE)和文档分类(CLS)任务。

技术特色:

  • DocLLM优化了对视觉文档分析的方法,通过仅依赖边界框数据整合空间布局,避免了昂贵的视觉编码器的使用,使模型更加紧凑,处理时间更高效。
  • 通过将标准变换器中的注意力机制重新配置为独立的矩阵,DocLLM能够在文本和空间布局之间建立独特的对齐,捕获这两个元素之间的依赖关系。
  • 开发了一种专注于填充文本段落的预训练目标,使模型能够有效处理视觉文档中常见的不规则布局和多样化内容。

应用范围:

  • DocLLM通过大规模指令数据集的细化预训练,覆盖了四个核心的文档智能任务:关键信息提取、自然语言推理、视觉问答和文档分类。
  • 在指令调优阶段,共使用了16个具有相应OCR数据的单页和多页文档数据集。

性能对比:

  • DocLLM在14个数据集中超越了当前最先进的语言模型,并且在五个先前未见过的数据集中表现良好。
  • 特别是,在不同数据集的不同切分(SDDS)设置中,DocLLM-7B在使用零样本指令的情况下,在12个数据集中超越了GPT-4和Llama2。

DocLLM通过其独特的设计和优化,为处理复杂布局的文档提供了一个高效且性能卓越的新选择,尤其在关键信息提取和文档分类任务上展现了其强大的能力。

相关推荐
o561-6o623o7鹿1 分钟前
路,新生鼠适配器
人工智能
2601_959477913 分钟前
Vatee:外汇行情信息呈现与技术架构如何影响体验,给出一套细节
大数据·人工智能·安全·ux
KaMeidebaby5 分钟前
卡梅德生物技术快报|重组蛋白的表达和纯化:工艺调试全记录:大肠杆菌体系重组蛋白的表达和纯化参数标定(肠激酶轻链案例)
前端·人工智能·算法·数据挖掘·数据分析
kishu_iOS&AI9 分钟前
LLM —— LangChain
人工智能·langchain
tedcloud12310 分钟前
Supermemory部署教程:打造Agent记忆与RAG环境
服务器·人工智能·学习·自动化·powerpoint
下班走回家11 分钟前
老登说GEO ①:从AI数据来源看GEO的本质
人工智能
阿里云瑶池数据库14 分钟前
阿里云RDS Agent Manager正式上线,为规模化AI Agent而生的企业级数据管理平台
人工智能·阿里云·云计算
网安情报局16 分钟前
AI Agent零信任安全体系解析:核心风险、分层架构与落地全流程
人工智能·安全·架构
DO_Community17 分钟前
Mythos级最强 AI 模型 Claude Fable 5 现已上线 DigitalOcean无服务器推理
人工智能·serverless·agent·ai编程·claude
IvorySQL18 分钟前
PostgreSQL 技术日报 (6月8日)|索引预取迭代,AI 安全功能上新
数据库·人工智能·sql·安全·postgresql