VLAD NETVLAD

VLAD:

先用sift对图像提取特征点并计算其描述子.对一张图像的n个d维的描述子进行聚类得到k个聚类中心,对每个类所包含的描述子减去聚类中心后求和得到一个向量,k个类别就得到k个d维向量,用这k个d维向量去表达一张图像

NETVLAD:

改进1: 用所有描述子对每一个聚类中心的差值求加权平均和.即对描述子到聚类中心的差值乘以一个权重再去求和.权重是所有描述子到聚类中心距离再做一个softmax得到的.

改进2: 引入卷积网络直接对一张图像提取这k个d维向量

网络: 一张图像经过卷积得到wxhxd的featuremap,用N表示wxh,然后网络分成两个分支,一个分支对N个d维向量计算出k个聚类中心.另一个分支去计算权重.计算完权重和聚类中心就可以减去聚类中心加权求和后得到一张图的kxd的向量表达.

计算N个描述子到K个聚类中心的权重,结果应该是Nxk的矩阵.计算权重的分支对wxhxd的fm用k个1x1卷积核卷积得wxh x k的fm,代表N个k维向量,每个k有N个向量,用每个k下的N个向量求softmax,得到描述子到每个聚类中心加权的权重.

总结:不再需要提取特征点即可得到一张图的向量表达,就没有特征点了.

参考:NetVLAD原理详解和推导-CSDN博客

NeXtVLAD:

对网络做了改进,加了残差连接和多尺度的网络结构(一层出来经过多个不同尺度的卷积核的结果再融合到一起)

参数量从netvlad的268MB降低到netxtvlad的 71MB

参考:NetVLAD系列代码串讲 - 知乎

用chatgpt总结一下:

本文讨论了图像特征提取和表达的相关技术,包括 SIFT、VLAD、NETVLAD 和 NeXtVLAD。关键要点包括:

  • VLAD:对图像的描述子进行聚类,得到聚类中心,然后对每个类所包含的描述子减去聚类中心后求和,用这 k 个 d 维向量去表达一张图像。

  • NETVLAD:对 VLAD 进行改进,用所有描述子对每一个聚类中心的差值求加权平均和,并引入卷积网络直接对一张图像提取这 k 个 d 维向量。

  • NeXtVLAD:对网络做了改进,加了残差连接和多尺度的网络结构,降低了参数量。

相关推荐
光泽雨11 分钟前
VM图像处理(1、图像二值化和图像滤波,Sobel提取过程)
图像处理·人工智能
HERR_QQ15 分钟前
dirving transformer详读
人工智能·深度学习·transformer
自动驾驶小学生27 分钟前
Transformer和LLM前沿内容(4):Long-Context LLM
人工智能·深度学习·transformer
冰西瓜6001 小时前
深度学习的数学原理(三十一)—— Transformer前馈网络FFN(为什么要先升维再降维)
人工智能·深度学习·transformer
栀栀栀栀栀栀1 小时前
基于深度学习的自然语言处理和语音识别 阅读笔记
人工智能·笔记·深度学习·自然语言处理·语音识别
kishu_iOS&AI2 小时前
深度学习 —— RNN
人工智能·rnn·深度学习
纤纡.2 小时前
解锁 Python 实用编程技巧:线程、视觉识别、正则匹配与装饰器实战
开发语言·python·深度学习·opencv
IRevers2 小时前
【Agent】基于Langchain的Agent数据库查询助手
数据库·人工智能·pytorch·sql·深度学习·langchain·agent
隔壁大炮3 小时前
Day02-13.张量的拼接操作
人工智能·pytorch·深度学习·神经网络·numpy
数智工坊3 小时前
DeepLabv3+:融合空洞可分离卷积的编码器-解码器语义分割架构
人工智能·深度学习·cnn