PictSure:通过视觉嵌入功能挑战 _Few-Shot _分类的新方法

概述

近年来,从少量样本中识别新类别的 "少镜头图像分类"(FSIC)在图像分类领域备受关注。

尤其是上下文学习(ICL)方法,这种方法在测试时只提供几张有标签的图像,无需训练即可进行推理,在灵活性和效率方面很有前景。然而,以往的研究并未充分研究图像特征(嵌入向量)的预处理和学习方法对 ICL 分类准确性的影响。

本研究提出了一种仅使用视觉信息的 ICL 模型 PictSure,并系统分析了嵌入模型的结构、预训练方法和学习时机等因素对 FSIC 性能的影响。结果表明,PictSure 的性能明显优于传统方法,尤其是在使用预训练嵌入模型时。

这表明,不依赖语义语言信息,只依赖视觉特征的质量,也能实现高精度分类。

建议的方法

所提出的 "PictSure "是一种仅使用图像和基于变换器架构的 ICL 模型,用于少镜头分类,可从输入支持集(图像及其标签)和查询图像的上下文中预测查询标签。转换器的输入是一串结合了图像嵌入和标签嵌入的标记,而专门设计的非对称注意力掩码提供了一种查询取决于支持的结构。

该模型的另一个特点是对视觉嵌入质量的依赖性很强。ResNet 和 Vision Transformer (ViT) 被用作嵌入模型,在使用 ImageNet 或其他模型进行预训练后,它们或被固定或被微调。

特别是在 ViT 中,通过引入三重损失(Triplet Loss)和通常的分类损失(Classification Loss),可以获得结构更合理的嵌入空间。这使得视觉上相似的图像彼此接近,有助于稳定 ICL 中的标签预测。

PictSure 不仅适用于自然图像,还适用于语言信息贫乏的领域,如医学和农业。

实验

为了测试 PictSure 的有效性,我们使用域内(接近训练数据)和域外(不同分布)数据集进行了少量分类任务。实验在 5 路 1 次和 5 路 5 次设置下进行,并将 PictSure 的性能与基准 KNN 和基于 CLIP 的 ICL 方法 CAML 进行了比较。

结果表明,使用 ResNet 和 ViT 以及预训练和冻结嵌入模型的 PictSure 明显优于其他方法,尤其是在医疗和专业图像领域(如脑肿瘤、器官CMNIST)。

相比之下,使用 CLIP 的 CAML 在自然图像中取得了较高的准确率,而在医学领域的准确率却有所下降。这表明 CLIP 基于语言的预训练并不适合识别视觉细节。

此外,PictSure 对过度学习表现出强大而稳定的学习行为,随着支持集(上下文长度)数量的增加,准确率也在提高,而在 8 个支持集之后就会出现性能领先的情况。

相关推荐
墨染天姬4 小时前
【AI】端侧AIBOX可以部署哪些智能体
人工智能
AI成长日志4 小时前
【Agentic RL】1.1 什么是Agentic RL:从传统RL到智能体学习
人工智能·学习·算法
2501_948114244 小时前
2026年大模型API聚合平台技术评测:企业级接入层的治理演进与星链4SAPI架构观察
大数据·人工智能·gpt·架构·claude
小小工匠4 小时前
LLM - awesome-design-md 从 DESIGN.md 到“可对话的设计系统”:用纯文本驱动 AI 生成一致 UI 的新范式
人工智能·ui
黎阳之光5 小时前
黎阳之光:视频孪生领跑者,铸就中国数字科技全球竞争力
大数据·人工智能·算法·安全·数字孪生
小超同学你好5 小时前
面向 LLM 的程序设计 6:Tool Calling 的完整生命周期——从定义、决策、执行到观测回注
人工智能·语言模型
2501_944934735 小时前
直播运营需要哪些数据分析能力?场观、停留、成交和投流怎么联动分析
数据挖掘·数据分析
智星云算力5 小时前
本地GPU与租用GPU混合部署:混合算力架构搭建指南
人工智能·架构·gpu算力·智星云·gpu租用
jinanwuhuaguo5 小时前
截止到4月8日,OpenClaw 2026年4月更新深度解读剖析:从“能力回归”到“信任内建”的范式跃迁
android·开发语言·人工智能·深度学习·kotlin
xiaozhazha_5 小时前
效率提升80%:2026年AI CRM与ERP深度集成的架构设计与实现
人工智能