很多初学者容易混淆概念:
AI 就是大语言模型?计算机视觉 = AI 画图?VLM 多模态大模型 = 计算机视觉?
日常刷到的 AI 生图、识图、OCR、人脸检测、AI 短剧视频生成,背后全部离不开计算机视觉(Computer Vision,简称 CV)。 2026 年大模型大火之后,传统 CV 和新一代多模态大模型深度融合,很多人分不清二者边界。本文从底层定义、发展阶段、核心任务、技术栈、和大模型的关系、落地场景、求职方向完整梳理。
一、什么是计算机视觉
计算机视觉:让计算机看懂图片、视频的一门学科。 人类眼睛接收光信号,大脑识别物体、文字、动作、场景;计算机视觉就是给机器一套算法,把图片 / 视频的像素矩阵,转化成机器可以理解的符号、语义、目标信息。
图片本质对于计算机,不是照片,只是巨大的数字矩阵 。一张 1080P 图片,就是几十万上百万个 RGB 像素数字。计算机本身看不懂 "猫、汽车、人",计算机只能看见数字。 CV 的工作,就是从一堆像素数字里面提取语义信息。
核心矛盾:像素层信息海量、噪声巨大;高层语义抽象复杂。像素到语义之间存在巨大鸿沟,这就是计算机视觉要解决的根本问题。
二、计算机视觉属于 AI 吗?二者的从属关系
- 人工智能 (AI) 是总学科:目标让机器模拟人的智能,包含 NLP 自然语言处理、计算机视觉、语音识别、强化学习、规划决策、Agent 智能体等子领域。
- 计算机视觉 CV,是 AI 下面最重要的分支之一。
- 大语言模型 LLM,属于 AI 下面 NLP 分支,原生看不懂图片。
简单层级关系
人工智能 AI
├─自然语言处理 NLP(大语言模型LLM,处理文字)
├─计算机视觉 CV(处理图像、视频)
├─语音识别与合成
└─Agent智能体、规划、决策
早期:CV、NLP 完全分开,各做各的模型。 现在:VLM 视觉大模型,把 CV 能力和 LLM 语言能力融合,也就是多模态大模型。
关键点:LLM 本身没有视觉能力,必须接入 CV 模块,才能识图。就像前面讲的 Harness Agent,想要看懂截图,需要接入 MCP‑Vision,底层就是调用 CV/VLM 能力,文本大模型本身看不懂图片。
三、计算机视觉核心经典任务
1、图像分类 Image Classification
输入一张图,输出这张图是什么类别。例:图片里面是猫还是狗。
传统代表:ResNet、EfficientNet
2、目标检测 Object Detection
不仅知道是什么,还要知道在哪里,输出物体框 + 类别。 应用:监控行人检测、小程序扫码、自动驾驶识别车辆。
代表算法:YOLO 系列,工业界使用最广。
3、图像分割 Segmentation
把图片每一个像素归类。分为实例分割、语义分割。 应用:人像抠图、医学影像识别。
4、OCR 光学字符识别
图片里面提取文字。截图识别、票据识别,属于 CV 任务。MiniCPM‑V、PaddleOCR 底层就是 CV。
5、关键点检测 / 姿态估计
识别人体关节、人脸关键点;AI 数字人、动作捕捉底层依赖该能力。
6、视频理解 Video Understanding
对连续帧视频做分析:镜头切分、动作识别、VAD 画面内容解析,我们做 AI 短剧抽帧分析就属于这个范畴。
7、图像生成(生成式 CV)
输入文字,生成图片、视频。FLUX、LTX、Wan 视频模型都属于生成式计算机视觉。
注意:生成也是 CV,不是只有 "识别看懂图片" 才叫 CV,机器作画同样属于计算机视觉领域。
四、计算机视觉发展的三个时代
时代 1:传统 CV(手工特征,2012 年前)
工程师手写算法,手动设计特征算子:SIFT、HOG。 程序员人为告诉机器,猫的边缘、纹理长什么样。 缺点:复杂场景效果很差,鲁棒性弱,只能解决简单场景。不需要深度学习,纯图像处理。
时代 2:深度学习 CV(卷积神经网络 CNN 时代,2012‑2022)
AlexNet 开启深度学习 CV 时代。ResNet、YOLO、U‑Net 全部是 CNN 卷积网络。 不再人工写特征,大量标注数据喂给神经网络,网络自动学习图像特征。 工业界大规模落地:人脸识别、扫码、监控、OCR。 局限:模型只能干单一任务。训练一个 YOLO 做检测,训练另一个 OCR 做文字,模型之间不能通用;不能直接和语言模型对话。
时代 3:多模态大模型 VLM 时代(2023‑至今)
代表模型:Qwen‑VL、MiniCPM‑V、GLM‑V、GPT‑4o。 不再用 CNN 为主,使用 ViT 视觉 Transformer。 把图片编码成文本大模型可以读懂的向量,实现看图聊天。一张图,既可以做检测、OCR,也可以问答、写描述。
重大变化: 传统 CNN 模型 "一个模型干一件事";VLM 视觉大模型,一个模型同时支持看图问答、OCR、简单检测、描述图像。 但不代表 VLM 可以完全替代 YOLO 这类专用 CV 模型。在高速目标检测、工业流水线场景,专用小模型速度更快、显存占用更低。
五、硬核辨析:VLM 视觉大模型 ≠ 完整计算机视觉
很多新手产生误区:有了 VLM,传统 CV 就没用了。现实工程不是这样。
| 方案 | 优势 | 劣势 | 适合场景 |
|---|---|---|---|
| VLM 多模态大模型 | 通用性极强,看图对话,理解复杂语义、截图报错分析 | 推理速度慢,显存开销高,批量高频检测成本高 | Agent 识图、内容理解、聊天问答 |
| YOLO/OCR 等传统 CV 专用模型 | 速度极快、轻量、低成本,适合循环批量处理 | 任务单一,只能做指定一件事,无法做高层推理 | 视频抽帧检测、流水线预处理、工业识别 |
真实工程组合范式(比如我们前面 AI‑Worker 架构):
视频文件 → YOLO 做镜头 / 物体检测(轻量 CV 快速预处理) → 筛选关键帧 → 送入 VLM 大模型做高层语义理解。 专用 CV 做过滤,VLM 做深度思考,二者配合,而不是互相替代。
重要认知:Agent 能看懂截图,不是 LLM 本身长了眼睛,是调用 CV/VLM 模块,把图片转为文本描述,再交给文本大模型做思考。
六、计算机视觉现实落地场景
- 互联网产品:图片审核、OCR 识别、人像抠图;
- AIGC 内容生成:AI 绘画、AI 漫剧短剧、图生视频(生成式 CV);
- Agent 工具生态:MCP 识图服务,给 Harness、WorkBuddy 提供看图能力;
- 工业领域:产品缺陷检测;
- 自动驾驶:摄像头感知周围物体;
- 医疗 CV:X 光、CT 影像辅助判读。
七、计算机视觉和 Agent 智能体的关系(结合 Harness、MCP)
Agent 大模型本身只能处理文本。当任务涉及图片、截图、视频,Agent 必须调用外部 CV 能力。
典型链路:
Agent (Harness / WorkBuddy) → MCP 视觉服务 → 底层调用 CV/VLM 模型 → 返回图片文字描述 → LLM 继续完成任务
这里 CV 就是 Agent 的眼睛。
Agent 负责思考规划;计算机视觉负责感知图像世界。二者是协作关系,不是互相包含。
八、求职视角:2026 计算机视觉岗位现状
- 传统 CV 算法岗(YOLO、分割、检测) 岗位变少,门槛高,要求论文、项目;偏向工业、自动驾驶、医疗方向。
- 多模态 / VLM 工程方向(需求上涨) 不一定要精通底层网络训练,重点:模型部署、量化、推理优化、MCP 封装、AI‑Worker 服务开发、多模态 RAG。
应届生可以做的实战项目: 1)企业知识库,解析图片 PDF(VLM+RAG) 2)AI 短剧流水线,ComfyUI + 视频理解 3)MCP 识图服务,给 DeepSeek‑Harness 做视觉工具
- 区分岗位:
- CV 算法研究员:训练、改进网络模型;
- CV 工程工程师:把开源模型部署成服务,做流水线、封装 API,2026 应届生更容易切入。
九、常见误区总结
-
❌误区:AI 就是大语言模型
-
✅纠正:LLM 只是 AI 一个分支,CV、语音同样属于 AI。
-
❌误区:VLM 多模态大模型可以完全取代 YOLO、OCR
-
✅纠正:通用大模型通用性强,专用小模型速度、成本占优,工程上经常组合使用。
-
❌误区:Agent 自己可以看懂图片
-
✅纠正:文本 Agent 没有视觉能力,依赖外部 CV/VLM 工具调用。
-
❌误区:计算机视觉就等于 AI 画图
-
✅纠正:AI 生图只是生成式 CV,CV 包含识别、检测、分割、视频理解等大量任务。
总结
- 计算机视觉是人工智能的重要子领域,目标让机器从图片视频的像素数字中获取语义信息。
- 经历手工特征‑CNN 深度学习‑VLM 多模态大模型三代演进;VLM 带来通用性,但传统 CV 专用模型依旧在工业大量使用。
- LLM 大语言模型和 CV 是互补关系,Agent 通过调用 CV/VLM 工具获得看图能力,本身不能直接看懂图像。
- 工程落地往往是 "专用 CV 做预处理 + VLM 做高层理解" 组合方案,这也是很多 AI‑Worker、MCP 视觉服务底层架构。