【提示学习论文】CoCoLe:Conceptual Codebook Learning for Vision-Language Models

Conceptual Codebook Learning for Vision-Language Models(ECCV 2024)

  • CPL的改进
  • 暂无代码

CPL

详见CPL论文

CoCoLe

  • a:手工概念缓存的建立过程
  • b:制作提示的过程,将图像输入Ev,得到image features v 作为查询query,找出相似度top-k2(k2=10)的键keys,与cls一起输入到LLM,生成最优的提示。
  • c:训练推理过程
  • 只有概念代码本中的key和value是可学习的
  • work:多个不同的图像特征分别有着对应的提示,更加细粒度

1 Loss

  • Lce:分类损失,最大化对齐图像特征fv和文本特征ft
  • Lma:最小化top-3 keys和图像特征fv的距离
  • Lcc:正则化,减小过拟合问题
  • Lor:确保文本特征是正交的,增强提示的多样性。对于每个提示,做余弦相似度,使得不同的提示嵌入正交化。

2 可学习的概念码本

  • 视觉概念向量Vi作为keys,D
  • 概念提示Pi作为values,由M个learnable vectors组成,DxM
  • 组成N对,N=100

具体过程

  • 输入图像到image encoder,得到图像特征fvj,计算fvj与所有Vi之间的余弦相似度得分Sc
  • 选择余弦相似度得分最高的top-k3(k3=4)个视觉概念Vi,组成集合Vj
  • 将Vj作为key,获得对应的value概念提示Pi,组成集合Pj
  • 将提示Pj与cls输入text encoder,得到文本特征ftj
  • 计算概率

疑问:

Vi的初始化是什么?Pi的初始化是什么?

3 手工概念缓存

  • CPL:选择top-1作为key
  • 区别:选择top-k1(k1=3)个图像特征,并计算它们的平均值作为key
  • 然后存储手工概念缓存

4 正则化的概念码本学习

确保可学习文本特征与手工概念提示差异不大

  • fhtd:手工制作的概念提示文本特征
  • fltd:可学习的提示文本特征

进行欧几里得距离约束:

5 推断

输出的文本特征,与图像特征进行相似度计算。

相关推荐
火山引擎边缘云30 分钟前
探索端智能,加速大模型应用,火山引擎边缘智能 x 扣子技术沙龙等你来
人工智能·机器人·火山引擎
张琪杭36 分钟前
深度学习-目标检测(一)-R-CNN
人工智能·深度学习·算法·目标检测·cnn
为为-180-3121-145540 分钟前
基于多技术融合在生态系统服务构建生态安全格局中的实践技术应用
大数据·人工智能·安全
再不会python就不礼貌了41 分钟前
一步步教你利用大模型开发个性化AI应用,告别‘人工智障’!
人工智能·学习·算法·oracle·llama
互联网女工人1 小时前
大学生必备10个AI工具网站,辅助完成辩论/开题/实践/形势政策报告、创新创业计划书、思想汇报、心得感悟等作业,提升学习效率和学术表现!
学习
AI科技圈.1 小时前
用最新方案为数据密集型AI供能:将服务器农场沉入旧金山湾
大数据·服务器·人工智能
网安kk1 小时前
2024网络安全与黑客技术:零基础自学手册
网络·学习·安全·web安全·网络安全·php
冯宝宝^1 小时前
基于学习功能聚合的英语口语学习APP
python·学习
繁依Fanyi1 小时前
SpringBoot + Vue + ElementUI 实现 el-table 分页功能详解
java·开发语言·人工智能·python·算法
鑫宝Code1 小时前
【机器学习】迁移学习概论
人工智能·机器学习·迁移学习