视觉编码器

JoannaJuanCV6 天前
深度学习·学习·机器学习·大模型·视觉大模型·vlm·视觉编码器
VLM学习-SFT(监督微调)SFT = Supervised Fine-Tuning(监督微调)SFT 是在预训练模型基础上,用带标注的数据做进一步训练,让模型学会按人类意图回答问题。
JoannaJuanCV11 天前
大模型·vlm·视觉编码器
VLM学习-DINOv2三大损失DINO / iBOT / KoLeo 解析源码 code github 三个损失是 DINOv2 自监督训练的核心,分工是:DINO 损失管全局语义、iBOT 损失管局部细节、KoLeo 损失管特征空间不坍塌。逐个结合源码解析。
威化饼的一隅2 年前
人工智能·计算机视觉·大模型·transformer·vit·多模态模型·视觉编码器
ViT模型技术学习最近多模态模型特别火,模型也越来越小,MiniCPM-2.6只有8B,里面采用的图片编码器是SigLipViT模型,一起从头学习ViT和Transformer!本文记录一下学习过程,所以是自上而下的写,从ViT拆到Transformer。
大数据AI人工智能培训专家培训讲师叶梓2 年前
人工智能·深度学习·计算机视觉·语言模型·自然语言处理·大模型·视觉编码器
BRAVE:扩展视觉编码能力,推动视觉-语言模型发展视觉-语言模型(VLMs)在理解和生成涉及视觉与文本的任务上取得了显著进展,它们在理解和生成结合视觉与文本信息的任务中扮演着重要角色。然而,这些模型的性能往往受限于其视觉编码器的能力。例如,现有的一些模型可能对某些图像特征视而不见,或者在处理图像时产生视觉幻觉,这些局限严重制约了VLMs在复杂场景中的应用。
我是有底线的