你有没有想过,为什么现在对着手机拍张照,AI就能告诉你"这是一只在沙滩上奔跑的金毛犬"?为什么你可以上传一张商品图,然后问AI"帮我找一件同款但颜色是蓝色的"?
这些能力的背后,是一种正在改变AI交互方式的技术------视觉语言模型(Vision-Language Model,简称VLM)。
如果说大语言模型(LLM)让AI学会了"阅读",那么VLM就是给AI装上了"眼睛",让它同时看得见 又读得懂。
传统CV的困境:AI"看见"了,但没"看懂"
要理解VLM的革命性,先要看看它的"前任"------传统计算机视觉(CV)有多局限。
传统的基于卷积神经网络(CNN)的CV模型,本质上是个**"特长生"**。它在某个特定任务上非常擅长,但能力边界极其清晰:
-
一个分类模型,能识别"猫"和"狗",但你问它"这只猫在做什么",它答不上来
-
一个OCR模型,能读出图片里的文字,但完全不理解这段文字的含义
更麻烦的是,如果业务需求变了,比如原来只识别"猫狗",现在要识别"熊猫",开发者就必须重新收集数据、打标签、训练模型------这是昂贵且漫长的过程。
传统CV的问题是:它能"看见"像素,但无法"理解"场景。
VLM是什么?三个组件,让AI既"看"又"读"
VLM的本质,是将大语言模型(LLM)的推理能力 与视觉编码器的图像理解能力结合在一起。它的架构通常由三部分构成:
1. 视觉编码器(Vision Encoder)
负责"看"图像,把像素信息转换成计算机能理解的向量特征。现在主流方案是使用CLIP 这样的预训练视觉模型,或者视觉Transformer(ViT),它们已经在海量图像-文本对上训练过,天生就懂"什么图像对应什么文字"。
2. 连接器/投影器(Connector/Projector)
这是一个关键的"翻译官"。视觉编码器输出的向量和大语言模型能理解的向量"语言不通",投影器负责将两者对齐,把视觉特征"翻译"成LLM能处理的token。最简单的实现可以是一层线性层(如LLaVA),复杂的可以用交叉注意力机制(如Llama 3.2 Vision)。
3. 大语言模型(LLM)
这是VLM的"大脑",负责最终的理解和生成。任何现成的LLM都可以用来构建VLM------把前端传来的视觉token和文本token放在一起,进行推理,最终用自然语言回答用户的问题。
这三者配合的工作流程是:用户上传一张图片并提问 → 视觉编码器提取图像特征 → 投影器将特征转成LLM能懂的token → LLM结合图像token和文本token,生成最终回答。
主流VLM模型:开源与商业的"诸神之战"
目前,VLM领域已经形成了清晰的阵营,这里重点介绍几款代表性模型:
闭源商业模型:
- Gemini 2.5 Pro(Google):谷歌的旗舰VLM,特点是"思维模型"架构------在回答前会"深入思考"。支持文本、图像、视频、音频多模态输入,上下文窗口超100万token,在多模态基准测试中持续领先。
开源模型(三大主流系列):
根据Hugging Face社区在2025年的梳理,开源VLM主要由三个家族主导,各自有不同的定位:
| 模型系列 | 开发方 | 参数规模 | 核心特点 | 推荐场景 |
|---|---|---|---|---|
| InternVL系列 | 上海AI Lab | 1B~78B | 动态分辨率,工业级视觉推理能力强。InternVL3-78B在MMMU基准达72.2分,开源SOTA | 需要高精度图像推理的工业/科研场景 |
| Qwen2.5-VL系列 | 阿里 | 3B/7B/72B | 原生动态ViT,支持长视频(小时级),多语言,支持电脑/手机操作代理 | 视频理解、多语言全球化应用 |
| SmolVLM系列 | Hugging Face | 256M~2.2B | 极致轻量,最小版本<1GB显存即可运行,适合边缘设备 | 移动端、IoT设备、低资源环境 |
其他值得关注的模型 :Meta的Llama 3.2-VL (长上下文文档理解能力强)、DeepSeek-VL2 (采用MoE架构,推理延迟低)、Kimi-VL(MoE架构推理模型)等都在各自领域有出色表现。
VLM在做什么?三大应用场景正在落地
VLM的"看得懂"能力,已经渗透到了各个行业:
1. 智能视频分析(AI代理)
传统的视频监控只能检测"有没有人",而VLM驱动的AI代理能回答"那个人为什么在仓库里逗留?"。NVIDIA提出的"视频搜索与摘要(VSS)"方案,就是用VLM把海量视频转化为可搜索的元数据,让用户直接用自然语言查询视频内容。
实际案例:Uveye用VLM分析车辆检测图像,缺陷检出率达96%,比人工检测高出24%;Linker Vision用VLM验证50,000路智慧城市摄像头的警报,大幅降低误报率。
2. 机器人:视觉-语言-动作模型(VLA)
VLM的延伸应用是机器人控制。所谓VLA(视觉-语言-动作模型),就是在VLM基础上增加了"动作token",让模型不仅能"看"和"说",还能指挥机器人"做"。
典型案例:Physical Intelligence开发的π0 机器人基础模型,在7个机器人平台、68个任务上训练,能完成衣物折叠、餐桌整理等复杂操作。NVIDIA也推出了GR00T N1,专为人形机器人设计的VLA基础模型。
3. 智能电商与视觉搜索
零售场景中,VLM允许用户用"文字+图像"组合的方式搜索商品。比如上传一张名人穿搭照片,问"帮我找一件类似但颜色是蓝色的连衣裙",系统通过语义检索直接给出精准结果。
评测与优化:VLM好不好用,看这两个维度
评价一个VLM,不仅看它的"聪明程度"(功能正确性),还要看它的"反应速度"(推理性能)。
功能评测 :常用基准测试包括MMMU (多学科多模态理解)、MMBench 、DocVQA (文档问答)、OCRBench(文字识别)等。像InternVL3-78B在MMMU上达到72.2分,已经接近GPT-4o的水平。
性能优化 :VLM推理有两个阶段------Prefill (一次性计算所有输入token的上下文)和Decode(逐个生成回答token)。优化手段包括:
-
KV Cache优化(如PagedAttention减少显存碎片)
-
连续批处理(动态调度请求提高GPU利用率)
-
视觉Token压缩(减少图像带来的token数量)
-
模型量化(INT8/INT4降低显存占用)
未来趋势:更统一、更高效、更智能
VLM的发展正在向两个方向延伸:
-
原生统一架构 :传统VLM依赖"视觉编码器+LLM"的组合式设计,而商汤等机构已开始探索NEO-unify这类端到端原生架构,直接从像素和文字出发,统一完成理解与生成,无需单独的编码器
-
全模态融合 :从"图文"双模态向"文本+图像+视频+音频+语音"的全模态发展。MiniCPM-o、Qwen3-Omni等模型已支持全双工流式交互,接近真人对话体验
VLM是AI从"纯文本处理"走向"多模态认知"的关键一步。它让AI的"眼睛"和"大脑"真正连接了起来------不再只是认出画面里的物体,而是理解画面背后的故事。下一次当你用照片问AI问题时,可以想想:你正在和一台真正"看得懂"的机器对话