Blip2:使用冻结图像编码器和大型语言模型的Bootstrapping图像预训练-2301

Blip2-2301

codehttps://github.com/salesforce/LAVIS/tree/main/projects/blip2

背景:如何不重新训练巨大的视觉模型和 LLM,只训练一个很小的"桥梁",就让 LLM 看懂图片?

方案Frozen Image Encoder + Q-Former + Frozen LLM 。视觉模型和语言模型都冻结,只重点训练中间的 Q-Former,从而大幅降低多模态预训练成本。

1、Q-Former

Q-Former(Querying Transformer) :它放了一组可学习的 Query 去主动从图像特征中"询问"有用的信息。论文使用 32 个 query,每个 768 维 。因此原本类似 257 × 1024 的大量 ViT 特征,最后被压缩成 32 × 768,形成一个信息瓶颈。

复制代码
                ViT visual tokens
                     │
                    K, V
                     │
                     ▼
Q tokens ──Q──→ Cross Attention   × N
                     │
                     ▼
         image-aware Query tokens
2、训练、推理

BLIP-2 不是直接把 Q-Former 接到 LLM 上训练。采用两阶段训练

第一阶段:让 Q-Former"学会看图"

复制代码
Image
  ↓
Frozen Image Encoder
  ↓
visual features
  ↓
Q-Former
  ↕  #让 Q-Former 学会从海量视觉特征中提取"与文字有关"的信息。
Text

使用三种任务进行学习:

ITC:Image-Text Contrastive Learning

复制代码
正确 image-text → 拉近
错误 image-text → 推远

ITM:Image-Text Matching

复制代码
(image, text)
       ↓
是否匹配?
   Yes / No

ITG:Image-Grounded Text Generation

复制代码
Image Encoder
     ↓
   Query
     ↓
   Text

第二阶段:让 Q-Former"学会说 LLM 的语言"

复制代码
Image
  ↓
Frozen Image Encoder
  ↓
Q-Former
  ↓
FC Projection
  ↓
Visual Tokens
  ↓
Frozen LLM
  ↓
Text

为什么要分两阶段?

复制代码
Image → Q-Former → LLM
loss:P(text | image)

理论上也能训练。Frozen、Flamingo 等模型本质上都更接近这种路线。

BLIP-2 的观点是:

单纯 image-to-text generation loss 不足以有效解决 modality gap。

多模态特征空间存在 "modality gap",即图文特征并不是完全拉齐的分布。

相关推荐
文心快码BaiduComate1 小时前
文心快码能力扩展、记忆、代码可视化上线
人工智能·ai编程·vibecoding
安逸sgr1 小时前
RAG 检索到了正确内容,但模型回答仍然错误,可能是什么原因?
人工智能·ai·大模型·agent·智能体
zhangfeng11331 小时前
Open-AutoGLM 手机端 AI Agent 框架 用自然语言操控手机
人工智能·智能手机
安逸sgr2 小时前
神经网络是怎么工作的?从神经元到多层感知机
人工智能·ai·大模型·agent·智能体
FIT2CLOUD飞致云2 小时前
学习笔记丨MaxKB原生工作流实现AI PPT生成
人工智能·ai·开源·智能体·maxkb
刘一说2 小时前
AI科技热点日报 | 2026年8月12日
人工智能·科技
Henry-SAP2 小时前
SAP MRP类型如何影响计划订单生成
人工智能·云原生·sap·erp
星马梦缘2 小时前
人工智能学院科协 · 2026秋季学期工作安排说明
人工智能·智能硬件
zhangfeng11332 小时前
CodeBuddy 切换账号后对话历史“消失“解决办法。找回历史记录
人工智能