Hugging Face 引入了 Idefics2,一个 8B 开源视觉语言模型

Hugging Face 于 2023 年首次发布了其 Idefics 视觉语言模型,该模型使用 DeepMind 最初开发的技术提供支持。如今,Idefics 正在接受升级,具有更小的参数大小、开放许可证和改进的光学字符识别 (OCR) 功能。Idefics2 现已在 Hugging Face 上推出。

Idefics 是 Image-aware Decorder Enhanced à la Flamingo with Interleaved Cross-attentionS 的缩写,是一种可以响应文本和图像提示的通用多模态模型。虽然其前身的参数大小为 800 亿,但 Idefics2 的参数大小仅为 80 亿的十分之一,可与 DeepSeek-VL 和 LLaVA-NeXT-Mistral-7B 相媲美。

在其核心功能中,Idefics2 承诺在高达 980 x 980 像素的原始分辨率和原始纵横比下提供更好的图像处理。图像将不再需要调整大小以适应固定大小的平方比,这在计算机视觉中传统上是完成的。

通过转录图像或文档中的文本生成的数据集成,增强了 OCR 功能。Hugging Face的团队还提高了Idefics回答图表、数字和文档问题的能力。

最后,该模型的架构得到了简化,摆脱了 Idefics1 的门控交叉注意力。"图像被馈送到视觉编码器,然后是学习的感知器池化和[多层感知器]模态投影,"Hugging Face在一篇博客文章中说。 "然后将池化的序列与文本嵌入连接起来,以获得图像和文本的(交错)序列。

Hugging Face 使用公开可用的数据集(特别是 Mistral-7B-v0.1 和 siglip-so400m-patch14-384)来训练 Idefics2。此外,还利用了 Web 文档、图像标题对、OCR 数据、渲染文本和图像到代码数据。

它的发布是随着人工智能热潮的持续而推出的许多多模态模型的一部分,包括 Reka 的新 Core 模型、xAI 的 Grok-1.5V 和谷歌的 Imagen 2。

相关推荐
树獭非懒10 小时前
AI大模型小白手册|Embedding 与向量数据库
后端·python·llm
KaneLogger10 小时前
【Agent】openclaw + opencode 打造助手 安装篇
人工智能·google·程序员
小兵张健10 小时前
价值1000的 AI 工作流:Codex 通用前端协作模式
前端·aigc·ai编程
知识浅谈11 小时前
一步步带你把 OpenClaw 玩宕机(附云服务器避坑部署教程)
人工智能
冬奇Lab12 小时前
OpenClaw 深度解析(四):插件 SDK 与扩展开发机制
人工智能·开源·源码阅读
IT_陈寒13 小时前
SpringBoot实战:5个让你的API性能翻倍的隐藏技巧
前端·人工智能·后端
机器之心13 小时前
让AI自我进化?斯坦福华人博士答辩视频火了,庞若鸣参与评审
人工智能·openai
iceiceiceice13 小时前
iOS PDF阅读器段评实现:如何从 PDFSelection 精准还原一个自然段
前端·人工智能·ios
爱可生开源社区14 小时前
MiniMax M2.5 的 SQL 能力令人惊艳!
sql·llm