【AI科普】什么是计算机视觉:硬核科普,它和大 AI 大模型到底是什么关系

很多初学者容易混淆概念:

AI 就是大语言模型?计算机视觉 = AI 画图?VLM 多模态大模型 = 计算机视觉?

日常刷到的 AI 生图、识图、OCR、人脸检测、AI 短剧视频生成,背后全部离不开计算机视觉(Computer Vision,简称 CV)。 2026 年大模型大火之后,传统 CV 和新一代多模态大模型深度融合,很多人分不清二者边界。本文从底层定义、发展阶段、核心任务、技术栈、和大模型的关系、落地场景、求职方向完整梳理。

一、什么是计算机视觉

计算机视觉:让计算机看懂图片、视频的一门学科。 人类眼睛接收光信号,大脑识别物体、文字、动作、场景;计算机视觉就是给机器一套算法,把图片 / 视频的像素矩阵,转化成机器可以理解的符号、语义、目标信息。

图片本质对于计算机,不是照片,只是巨大的数字矩阵 。一张 1080P 图片,就是几十万上百万个 RGB 像素数字。计算机本身看不懂 "猫、汽车、人",计算机只能看见数字。 CV 的工作,就是从一堆像素数字里面提取语义信息。

核心矛盾:像素层信息海量、噪声巨大;高层语义抽象复杂。像素到语义之间存在巨大鸿沟,这就是计算机视觉要解决的根本问题。

二、计算机视觉属于 AI 吗?二者的从属关系

  1. 人工智能 (AI) 是总学科:目标让机器模拟人的智能,包含 NLP 自然语言处理、计算机视觉、语音识别、强化学习、规划决策、Agent 智能体等子领域。
  2. 计算机视觉 CV,是 AI 下面最重要的分支之一。
  3. 大语言模型 LLM,属于 AI 下面 NLP 分支,原生看不懂图片。

简单层级关系

复制代码
人工智能 AI
├─自然语言处理 NLP(大语言模型LLM,处理文字)
├─计算机视觉 CV(处理图像、视频)
├─语音识别与合成
└─Agent智能体、规划、决策

早期:CV、NLP 完全分开,各做各的模型。 现在:VLM 视觉大模型,把 CV 能力和 LLM 语言能力融合,也就是多模态大模型。

关键点:LLM 本身没有视觉能力,必须接入 CV 模块,才能识图。就像前面讲的 Harness Agent,想要看懂截图,需要接入 MCP‑Vision,底层就是调用 CV/VLM 能力,文本大模型本身看不懂图片。

三、计算机视觉核心经典任务

1、图像分类 Image Classification

输入一张图,输出这张图是什么类别。例:图片里面是猫还是狗。

传统代表:ResNet、EfficientNet

2、目标检测 Object Detection

不仅知道是什么,还要知道在哪里,输出物体框 + 类别。 应用:监控行人检测、小程序扫码、自动驾驶识别车辆。

代表算法:YOLO 系列,工业界使用最广。

3、图像分割 Segmentation

把图片每一个像素归类。分为实例分割、语义分割。 应用:人像抠图、医学影像识别。

4、OCR 光学字符识别

图片里面提取文字。截图识别、票据识别,属于 CV 任务。MiniCPM‑V、PaddleOCR 底层就是 CV。

5、关键点检测 / 姿态估计

识别人体关节、人脸关键点;AI 数字人、动作捕捉底层依赖该能力。

6、视频理解 Video Understanding

对连续帧视频做分析:镜头切分、动作识别、VAD 画面内容解析,我们做 AI 短剧抽帧分析就属于这个范畴。

7、图像生成(生成式 CV)

输入文字,生成图片、视频。FLUX、LTX、Wan 视频模型都属于生成式计算机视觉。

注意:生成也是 CV,不是只有 "识别看懂图片" 才叫 CV,机器作画同样属于计算机视觉领域。

四、计算机视觉发展的三个时代

时代 1:传统 CV(手工特征,2012 年前)

工程师手写算法,手动设计特征算子:SIFT、HOG。 程序员人为告诉机器,猫的边缘、纹理长什么样。 缺点:复杂场景效果很差,鲁棒性弱,只能解决简单场景。不需要深度学习,纯图像处理。

时代 2:深度学习 CV(卷积神经网络 CNN 时代,2012‑2022)

AlexNet 开启深度学习 CV 时代。ResNet、YOLO、U‑Net 全部是 CNN 卷积网络。 不再人工写特征,大量标注数据喂给神经网络,网络自动学习图像特征。 工业界大规模落地:人脸识别、扫码、监控、OCR。 局限:模型只能干单一任务。训练一个 YOLO 做检测,训练另一个 OCR 做文字,模型之间不能通用;不能直接和语言模型对话。

时代 3:多模态大模型 VLM 时代(2023‑至今)

代表模型:Qwen‑VL、MiniCPM‑V、GLM‑V、GPT‑4o。 不再用 CNN 为主,使用 ViT 视觉 Transformer。 把图片编码成文本大模型可以读懂的向量,实现看图聊天。一张图,既可以做检测、OCR,也可以问答、写描述。

重大变化: 传统 CNN 模型 "一个模型干一件事";VLM 视觉大模型,一个模型同时支持看图问答、OCR、简单检测、描述图像。 但不代表 VLM 可以完全替代 YOLO 这类专用 CV 模型。在高速目标检测、工业流水线场景,专用小模型速度更快、显存占用更低。

五、硬核辨析:VLM 视觉大模型 ≠ 完整计算机视觉

很多新手产生误区:有了 VLM,传统 CV 就没用了。现实工程不是这样。

方案 优势 劣势 适合场景
VLM 多模态大模型 通用性极强,看图对话,理解复杂语义、截图报错分析 推理速度慢,显存开销高,批量高频检测成本高 Agent 识图、内容理解、聊天问答
YOLO/OCR 等传统 CV 专用模型 速度极快、轻量、低成本,适合循环批量处理 任务单一,只能做指定一件事,无法做高层推理 视频抽帧检测、流水线预处理、工业识别

真实工程组合范式(比如我们前面 AI‑Worker 架构):

视频文件 → YOLO 做镜头 / 物体检测(轻量 CV 快速预处理) → 筛选关键帧 → 送入 VLM 大模型做高层语义理解。 专用 CV 做过滤,VLM 做深度思考,二者配合,而不是互相替代。
重要认知:Agent 能看懂截图,不是 LLM 本身长了眼睛,是调用 CV/VLM 模块,把图片转为文本描述,再交给文本大模型做思考。

六、计算机视觉现实落地场景

  1. 互联网产品:图片审核、OCR 识别、人像抠图;
  2. AIGC 内容生成:AI 绘画、AI 漫剧短剧、图生视频(生成式 CV);
  3. Agent 工具生态:MCP 识图服务,给 Harness、WorkBuddy 提供看图能力;
  4. 工业领域:产品缺陷检测;
  5. 自动驾驶:摄像头感知周围物体;
  6. 医疗 CV:X 光、CT 影像辅助判读。

七、计算机视觉和 Agent 智能体的关系(结合 Harness、MCP)

Agent 大模型本身只能处理文本。当任务涉及图片、截图、视频,Agent 必须调用外部 CV 能力。

典型链路:

Agent (Harness / WorkBuddy) → MCP 视觉服务 → 底层调用 CV/VLM 模型 → 返回图片文字描述 → LLM 继续完成任务

这里 CV 就是 Agent 的眼睛。

Agent 负责思考规划;计算机视觉负责感知图像世界。二者是协作关系,不是互相包含。

八、求职视角:2026 计算机视觉岗位现状

  1. 传统 CV 算法岗(YOLO、分割、检测) 岗位变少,门槛高,要求论文、项目;偏向工业、自动驾驶、医疗方向。
  2. 多模态 / VLM 工程方向(需求上涨) 不一定要精通底层网络训练,重点:模型部署、量化、推理优化、MCP 封装、AI‑Worker 服务开发、多模态 RAG。

应届生可以做的实战项目: 1)企业知识库,解析图片 PDF(VLM+RAG) 2)AI 短剧流水线,ComfyUI + 视频理解 3)MCP 识图服务,给 DeepSeek‑Harness 做视觉工具

  1. 区分岗位:
  • CV 算法研究员:训练、改进网络模型;
  • CV 工程工程师:把开源模型部署成服务,做流水线、封装 API,2026 应届生更容易切入。

九、常见误区总结

  • ❌误区:AI 就是大语言模型

  • ✅纠正:LLM 只是 AI 一个分支,CV、语音同样属于 AI。

  • ❌误区:VLM 多模态大模型可以完全取代 YOLO、OCR

  • ✅纠正:通用大模型通用性强,专用小模型速度、成本占优,工程上经常组合使用。

  • ❌误区:Agent 自己可以看懂图片

  • ✅纠正:文本 Agent 没有视觉能力,依赖外部 CV/VLM 工具调用。

  • ❌误区:计算机视觉就等于 AI 画图

  • ✅纠正:AI 生图只是生成式 CV,CV 包含识别、检测、分割、视频理解等大量任务。

总结

  1. 计算机视觉是人工智能的重要子领域,目标让机器从图片视频的像素数字中获取语义信息。
  2. 经历手工特征‑CNN 深度学习‑VLM 多模态大模型三代演进;VLM 带来通用性,但传统 CV 专用模型依旧在工业大量使用。
  3. LLM 大语言模型和 CV 是互补关系,Agent 通过调用 CV/VLM 工具获得看图能力,本身不能直接看懂图像。
  4. 工程落地往往是 "专用 CV 做预处理 + VLM 做高层理解" 组合方案,这也是很多 AI‑Worker、MCP 视觉服务底层架构。
相关推荐
Bode_200216 分钟前
制造业的知识因果推理网
人工智能·智能工厂
whitelbwwww22 分钟前
RKNN静态量化
人工智能·深度学习
Henry-SAP24 分钟前
AI标准落地加速 安全与应用双突破
人工智能·云原生·sap·erp
zxsz_com_cn27 分钟前
深度学习在剩余寿命预测(RUL)中的应用综述
深度学习·工业4.0·预测性维护·剩余寿命·rul
zzzll111128 分钟前
LangChain4j:Java 生态的 AI 应用开发利器
java·开发语言·人工智能
卷无止境32 分钟前
社区里最好用的 Deep Research 技能,到底藏在哪几个仓库里
人工智能
飞哥数智坊39 分钟前
2步,TRAE SOLO 帮你画出架构图
人工智能
hahaha60161 小时前
HLS高层次综合设计技巧--循环merge和循环split
人工智能·算法·计算机视觉
JAI科研1 小时前
Deepseek Agent Harness教程(七) | Deepseek Harness不是一个内核加一堆插件
开发语言·人工智能·深度学习·算法·自然语言处理·transformer·vllm