VLAD NETVLAD

VLAD:

先用sift对图像提取特征点并计算其描述子.对一张图像的n个d维的描述子进行聚类得到k个聚类中心,对每个类所包含的描述子减去聚类中心后求和得到一个向量,k个类别就得到k个d维向量,用这k个d维向量去表达一张图像

NETVLAD:

改进1: 用所有描述子对每一个聚类中心的差值求加权平均和.即对描述子到聚类中心的差值乘以一个权重再去求和.权重是所有描述子到聚类中心距离再做一个softmax得到的.

改进2: 引入卷积网络直接对一张图像提取这k个d维向量

网络: 一张图像经过卷积得到wxhxd的featuremap,用N表示wxh,然后网络分成两个分支,一个分支对N个d维向量计算出k个聚类中心.另一个分支去计算权重.计算完权重和聚类中心就可以减去聚类中心加权求和后得到一张图的kxd的向量表达.

计算N个描述子到K个聚类中心的权重,结果应该是Nxk的矩阵.计算权重的分支对wxhxd的fm用k个1x1卷积核卷积得wxh x k的fm,代表N个k维向量,每个k有N个向量,用每个k下的N个向量求softmax,得到描述子到每个聚类中心加权的权重.

总结:不再需要提取特征点即可得到一张图的向量表达,就没有特征点了.

参考:NetVLAD原理详解和推导-CSDN博客

NeXtVLAD:

对网络做了改进,加了残差连接和多尺度的网络结构(一层出来经过多个不同尺度的卷积核的结果再融合到一起)

参数量从netvlad的268MB降低到netxtvlad的 71MB

参考:NetVLAD系列代码串讲 - 知乎

用chatgpt总结一下:

本文讨论了图像特征提取和表达的相关技术,包括 SIFT、VLAD、NETVLAD 和 NeXtVLAD。关键要点包括:

  • VLAD:对图像的描述子进行聚类,得到聚类中心,然后对每个类所包含的描述子减去聚类中心后求和,用这 k 个 d 维向量去表达一张图像。

  • NETVLAD:对 VLAD 进行改进,用所有描述子对每一个聚类中心的差值求加权平均和,并引入卷积网络直接对一张图像提取这 k 个 d 维向量。

  • NeXtVLAD:对网络做了改进,加了残差连接和多尺度的网络结构,降低了参数量。

相关推荐
Eric.4626 分钟前
AI漫剧量产Prompt参数实操手册:Stable Diffusion+ComfyUI+OpenClaw通用复制即用配置
人工智能·深度学习·stable diffusion·prompt·ai漫剧
阿图灵2 小时前
Seq2Seq Transformer 中英翻译实战:从 GRU 到 Transformer,BLEU 0.225 → 0.307
pytorch·深度学习·gru·transformer·机器翻译·seq2seq
手写码匠4 小时前
华为云Flexus+DeepSeek征文|Dify 多 Agent 会话管理与上下文工程实战:让智能体“记住该记住的,忘掉该忘掉的“
人工智能·深度学习·算法·aigc
杀生丸学AI4 小时前
【世界模型】Lyra 2.0:可探索的生成式3D世界(NVIDIA)
人工智能·深度学习·3d·数据挖掘·transformer·世界模型·高斯泼溅
bittersuite4 小时前
BERT,fine-tuning
人工智能·深度学习·bert
今天AI了吗5 小时前
深度学习基础-Harness:从评估框架到工程落地
数据库·人工智能·sql·深度学习·机器学习
LaughingZhu5 小时前
Product Hunt 每日热榜 | 2026-08-18
人工智能·经验分享·深度学习·神经网络·产品运营
Eric.467 小时前
AI 漫剧量产实战:StableDiffusion 帧稳画算法 + ComfyUI 自动质检流水线搭建(附完整代码 + 配置)
人工智能·深度学习·stable diffusion·comfyui·ai漫剧
木棉知行者7 小时前
【第8篇】OverLock(CVPR2025):新型卷积神经网络OverLoCK,通用的即插即用Backbone!
人工智能·深度学习·神经网络·cnn
W_326007 小时前
Python-OpenCV边缘检测与阈值分割:Sobel、Scharr、Laplacian、Canny、全局与自适应阈值
开发语言·图像处理·python·opencv·机器学习