LLM--VIT简介

文章目录

论文精度视频VIT论文精度,这里做简要概述

前言--CNN缺点

CNN神经网络是ai算法中最重要,最经典的算法之一,在vit出现之前,Resnet模型一直都是最好的视觉模型;当然CNN也不是没有缺点,其中有两个典型的缺点:局部性和平移不变性。

  1. 局部性 :这个即使有点也是缺点,CNN认为最重要的信息是局部的,像素点距离越近重要程度越高这一点也是优点 ,因为以一个物体的图像来说,像素点越近,重要程度肯定越高;但是同时也是缺点,如果需要找距离较长的关系,那么就需要堆叠CNN网络,使得感受野增大。
  2. 平移不变性:CNN认为一个物体,无论在一张图片什么位置,他的特征是一样的。

论文内容概述

VIT效果 :在大规模数据进行预训练 ,再微调 能和最好的CNN效果一样(ResNet)。

Transformer:

  • 参数量大,1000亿+参数 ,数据量也大。
  • 运用到视觉难点
    • 自注意机制时间复杂度高O(n^2)
    • transformer序列长度不大,如:512

视觉运用Transformer 难点举例*,以一张单色图片,参数为:1* 224 * 224 为例。

VIT解决方法

VIT模型结构解析

相关推荐
thesky1234562 小时前
27届大模型面试准备(六十六):大模型推理调度与弹性扩缩容工程——排队、优先级、抢占与弹性
大模型·抢占·连续批处理·推理调度·请求优先级·弹性扩缩容·chunked prefill
OpenBayes3 小时前
Qwen3.8-27B-FP8 降低大模型部署门槛,开启高效多模态智能体验;MiniMax H3-1K 发布千段视频测试数据集,全面评估 AI 视频生成能力
人工智能·深度学习·计算机视觉·自然语言处理·语音识别·多模态大模型
HyperAI超神经4 小时前
在线教程丨最高2K+原生双声道,MiniMax H3统一音视频生成
人工智能·文生视频·多模态大模型·图生视频·ai视频生成
Tom·Ge18 小时前
AI创业者通识日报 | 2026年8月28日
大模型·ai创业·ai创业者
桃西西呀20 小时前
GPT-5.6 的 ultra 模式凭什么开 4 个 Agent 并行跑?——多智能体协作,是把"一个聪明人"换成"一个团队"
人工智能·llm·agent
VIP_CQCRE21 小时前
在 WorkBuddy 里一键接入 Claude、GPT、Gemini、DeepSeek:Ace Data Cloud 让 AI 模型调用更简单
ai·大模型·openai·workbuddy·ace data cloud
澄怀21 小时前
Agent 说「我已经改好文件了」,这句话到底能不能信?
llm·agent
Web3&Basketball1 天前
从0到1落地Claude Playwright浏览器自动化Agent:踩坑全记录
深度学习·大模型·ai技术