学习日记42

1.Finite Scalar Quantization: VQ-VAE Made Simple

这篇文章主要是提出了有限标量量化(FSQ) ,作为向量量化(VQ)的即插即用替代方案,解决传统 VQ-VAE 训练复杂、码本坍塌、工程技巧繁多等痛点,在图像生成、稠密视觉预测任务上取得与 VQ 持平的效果,同时大幅简化训练流程。

传统VQ的缺点:

1.量化操作不可微分,需要依靠直通估计器STE传递,还要引入额外的损失函数,以来大量工程trick才能收敛;

2.码本坍塌:码本规模越大,闲置码元越多。码本超过一定尺寸后利用率大幅下降。

3.参数量开销巨大:VQ 使用显式可学习码本,存储维度为「码本大小 × 隐向量维度」

4.VQ 在高维空间学习不规则 Voronoi 分区,优化不稳定,大码本场景易出现局部最优。

方法:

方法:

1.编码器输出一个极低维度的隐向量z

2.对每一维度单独进行值域压缩

3.逐维度四舍五入round,直通估计器 STE 传梯度(和 VQ 一样,但无额外损失)

4.把量化之后的向量映射为token

2.UniBiomed: A Universal Foundation Model for Grounded Biomedical Image Interpretation

这是一篇nature文章,主要做的就是提出首个生物医学图像真实解释通用基础模型 ,能同时生成诊断结论并分割对应生物医学目标。意思就是做一个模型,他能输出诊断性的文本描述并分割出对应的病灶

文章结构上没啥创新,分为两个分支:MLLM (解读多模态图像、生成诊断文本描述)+ SAM2(根据文本提示分割生物医学目标)。

具体来说,就是MLLM看图并生成诊断文本,把诊断文本喂给 SAM2 的 prompt encoder 指导分割。对比之前的模型,文本只告诉你问题,但是不会告诉具体问题发生在图片的哪个地方。具体训练方式就是如下图所示:

另外,通过消融实验能得到,加入语义理解能提升视觉分割能力,泛化性能提升明显。我复现了一下,结果如下:

3.Steerable-Vit

提出早融合轻量化图文调控框架,让任意冻结预训练 ViT(DINOv2/MAE/SigLIP)可通过自然语言动态调控全局 / 局部视觉特征,同时不破坏原有视觉表征质量,解决传统模型 "显著物体偏向" 与多模态模型 "语言主导、视觉能力退化" 的两难权衡。也就是说,之前的大模型,微调之后会破坏原有自然图像的处理能力,这个方法可以在保持自然图像的处理能力的条件下,融入自然语言方面的能力。

单模态自监督 ViT(DINOv2/MAE)缺陷:仅提取图像通用视觉特征,存在摄影师偏置 :强制聚焦画面最突出物体,无法根据文本指令关注次要物体、背景、部件、属性;无文本交互能力,检索、定位、细粒度识别任务受限;传统跨模态模型(CLIP/SigLIP)采用晚融合:视觉、文本编码器独立提取特征后简单相加,文本无法介入视觉编码过程,只能事后微调特征,不具备真正的表征调控能力;多模态大模型 MLLM(InternVL/Qwen3-VL)图文融合发生在 LLM 内部,表征偏向语言空间,视觉保真度下降;参数量达数十亿,算力开销巨大;可控性弱;开放词汇定位模型(SAM3/GroundingDINO)文本调控能力强,但特征专为分割 / 检测定制,泛化到分类、检索、异常检测等通用视觉任务时性能大幅下滑。

文章提出的模型想要文本能动态改变模型编码重点,不受物体显著性限制,调控后仍保持原 ViT 在分类、分割、检索等通用视觉任务的迁移能力,文本在视觉 Transformer 中间层介入编码流程,而非编码完成后融合

文章的一个核心就是,现有的VLM都是视觉输入语言模型,而steerVit反过来了,利用语言约束视觉编码器,仅新增21M 可训练参数,即可变为多模态模型。主要就是在视觉编码器的Block中插入图文链接模块(交叉注意力),让整个模型的各个阶段都与文本信息融合。

4.DCRM-ViT

单模型同时适配自然图像与多模态医学影像(超声 / CT/MRI) 的痛点:在冻结预训练 ViT 主干的前提下,实现样本级连续域自适应,既大幅提升医学图像任务精度,又不损害通用自然图像识别能力,同时参数量、计算开销极低,推理无需在线更新参数。

这篇文章很烦,每个小模块都命名了,然后提出了一堆东西,我直接梳理一下模型如何训练的:首先由冻结权重的 vit 生成的特征,先使用 DR 提取局部和全局特征,由 PSN 根据特征生成参数,这个参数是被 RMB 使用,对特征进行变换得到 h(两个,分别是hq和hv ), 对 q,v, 进行微调,然后加入偏置进行注意力计算。

具体的就是,有PSN生成的参数由TALer Unit完全使用,生成h。

然后使用这个h对已有的q,v进行微调,γ是输入特征:

之后计算自注意力机制,多加了一个B,这个输入是由DR中的一个单独的网络Domain Classifier 域分类器输出的对于当前图片是医学图像还是自然图像的概率,根据这个概率,计算得到偏执矩阵B。

另外,他的训练也不太普通,他训练分为两个循环,一个内一个外,先由 PSN 随机生成参数由内部循环使用,然后直接对这个参数反向传播进行调整,内循环结束后外循环对 PSN 根据这个参数对自己进行调整 和其他模块的参数调整。直接单层反向传播更新 PSN 会出现两大致命缺陷:跨域冲突、参数生成质量极差;双层嵌套优化(MAML 思路)就是专门解决这个问题的。

5.AVQ-Attention

向量量化注意力(VQ-Attention)通过将 N 个 key 聚类为 M 个码本(M << N),将复杂度降至 O(MN) ,但存在固有缺陷:固定码本均匀分配:所有 key 空间区域使用相同的量化精度资源错配:高注意力质量集中的区域可能被粗略近似,而低注意力区域浪费了不必要的表示容量

核心思想就是:根据注意力权重的分布,动态地将更多码本容量分配给接收高注意力质量的 key 空间区域。前向传播分为三个阶段:每个 key 先分配到最近的父码本,再在父码本内比较子码本,之后计算所有父码本的注意力,同时提取每个码本的重要性分数,最后选出注意力质量最高的 P 个父码本,用其子码本进行细粒度校正。

AVQ-Attention 最核心的结构设计就是分为父码本和子码本,父码本把整个 Key 空间切成大块区域,然后子码本细分,要保证任意一个父码本向量 = 它所有子码本向量的平均值。训练用 EMA 更新子码本后,子码本均值会偏离父码本,所以必须做质量加权投影:保证越多的子码本,位置越不容易被拉动,保证聚类中心贴合真实数据分布。

然后这种结构非常适合应用与flashatten,之后花了大量篇幅将怎么两者结合在一起。但是这并不能体现自适应,自适应其实隐藏其中,就是一张图片中有着很多patch,我们对着一张图片选出注意力最多的几个父码本对其进行细化,其余保持不变,这样就做到了自适应,即根据注意力权重的分布,动态地将更多码本容量分配给接收高注意力质量的 key 空间区域。

相关推荐
一只小菜鸡..2 小时前
南京大学 操作系统 (JYY) 学习笔记:导论与历史的轮回 (OS Introduction)
笔记·学习
小弥儿2 小时前
GitHub 今日热榜 | 2026-07-24:金融 K 线基础模型上榜
学习·金融·开源·github
520拼好饭被践踏2 小时前
JAVA+Agent学习day22
java·开发语言·后端·学习
懿路向前2 小时前
【HarmonyOS学习笔记】2026-07-24 | textProcessing 实体识别与踩坑实录
笔记·学习·边缘计算·harmonyos
菩提树下的打坐2 小时前
性能测试进阶:从 JMeter 基线到 SLO 驱动的压测体系
学习·jmeter
Albart5752 小时前
2026年Python入门路线图:从零到实战的30天逐日详解(三)
学习·flask·#python30 天入门·python 实战教程·pytest 单元测试·python 虚拟环境·logging 日志
minglie13 小时前
香橙派zero3的GPIO操作
学习
caimouse3 小时前
MM 学习笔记 09:进程会话与工作集
笔记·学习·reactos
星恒随风3 小时前
C++ 继承进阶:默认成员函数、多继承、虚继承与组合设计
开发语言·c++·笔记·学习