Blip2:使用冻结图像编码器和大型语言模型的Bootstrapping图像预训练-2301

Blip2-2301

codehttps://github.com/salesforce/LAVIS/tree/main/projects/blip2

背景:如何不重新训练巨大的视觉模型和 LLM,只训练一个很小的"桥梁",就让 LLM 看懂图片?

方案Frozen Image Encoder + Q-Former + Frozen LLM 。视觉模型和语言模型都冻结,只重点训练中间的 Q-Former,从而大幅降低多模态预训练成本。

1、Q-Former

Q-Former(Querying Transformer) :它放了一组可学习的 Query 去主动从图像特征中"询问"有用的信息。论文使用 32 个 query,每个 768 维 。因此原本类似 257 × 1024 的大量 ViT 特征,最后被压缩成 32 × 768,形成一个信息瓶颈。

复制代码
                ViT visual tokens
                     │
                    K, V
                     │
                     ▼
Q tokens ──Q──→ Cross Attention   × N
                     │
                     ▼
         image-aware Query tokens
2、训练、推理

BLIP-2 不是直接把 Q-Former 接到 LLM 上训练。采用两阶段训练

第一阶段:让 Q-Former"学会看图"

复制代码
Image
  ↓
Frozen Image Encoder
  ↓
visual features
  ↓
Q-Former
  ↕  #让 Q-Former 学会从海量视觉特征中提取"与文字有关"的信息。
Text

使用三种任务进行学习:

ITC:Image-Text Contrastive Learning

复制代码
正确 image-text → 拉近
错误 image-text → 推远

ITM:Image-Text Matching

复制代码
(image, text)
       ↓
是否匹配?
   Yes / No

ITG:Image-Grounded Text Generation

复制代码
Image Encoder
     ↓
   Query
     ↓
   Text

第二阶段:让 Q-Former"学会说 LLM 的语言"

复制代码
Image
  ↓
Frozen Image Encoder
  ↓
Q-Former
  ↓
FC Projection
  ↓
Visual Tokens
  ↓
Frozen LLM
  ↓
Text

为什么要分两阶段?

复制代码
Image → Q-Former → LLM
loss:P(text | image)

理论上也能训练。Frozen、Flamingo 等模型本质上都更接近这种路线。

BLIP-2 的观点是:

单纯 image-to-text generation loss 不足以有效解决 modality gap。

多模态特征空间存在 "modality gap",即图文特征并不是完全拉齐的分布。

相关推荐
衡石科技13 分钟前
衡石科技携手超聚变联合发布HENGSHI BOX,引领私域ChatBI规模化落地
大数据·人工智能·科技
新知图书18 分钟前
10.4 交互优化与用户体验提升
人工智能·多模态·智能体
IT_陈寒39 分钟前
JavaScript数组排序踩的坑,差点让我加班到凌晨
前端·人工智能·后端
敢敢是只喵i43 分钟前
一个本地 AI Agent 要操作多个门店或 SaaS 账号,应该怎样安全切换身份?
人工智能·安全·ai·系统架构·业界资讯
wangchunyu11444 分钟前
Aider介绍和安装说明
人工智能
SpaceAIGlobal1 小时前
AI做PPT 工具哪个好:先搞懂原理,再按 3 个维度挑对那一个(2026)
人工智能·powerpoint
β添砖java1 小时前
深度学习28RNN循环神经网络
人工智能·深度学习
2301_818474441 小时前
福建中小微企业云 ERP 落地实践:轻量化信息化项目实施指南
大数据·人工智能
咕泡科技1 小时前
咕泡科技×创业酵母俞头私享会:AI时代,组织如何长出“破局力”?
大数据·人工智能·科技
啊阿狸不会拉杆1 小时前
《自然语言处理:基于大语言模型的方法》第1章 绪论 读书笔记
人工智能·自然语言处理·nlp·easyui·智能体