视觉任务介绍
视觉任务,可谓是这十几年来AI崛起的第一波浪潮,而紧紧与其联系在一起的,是卷积神经网络。视觉任务一般与图像相关,要么输入图像,要么输出图像,或者输入输出都是图像。图像由像素点组成,一般采用RGB色彩空间。相比于文本,图像的信息密度很低,而且邻域相关性较强,非常适合用卷积计算来处理。传统计算机视觉,有各种滤波器来实现边缘提取、模式匹配等操作,而卷积层,则可以从数据中把所需的滤波器给直接学出来。
在提升通用图像分类精度的过程中,ResNet闪亮登场,成为了整个深度学习乃至AI的奠基性成就。而其他各类图像任务,包括检测、分割、编辑等,也往往少不了它。
在各类视觉任务中,检测相对特殊,它难度较大而且输出不规则。为了检出未知数量的大大小小的框,发展出了anchor的概念,在传统视觉架构的基础上进行了各种魔改。最终也是完全征服了检测,造就了人脸识别和智能安防摄像头的大规模应用。
而图像视频画质提升和美颜,随着手机厂商和视频行业竞争的白热化,也逐渐成为了热点。这些任务的难点在于如何获取大规模的高质量数据对,以及如何评价效果。毕竟图像好不好看是比较主观的,这又促成了图像视频主观质量评价的发展。
随着技术的发展,无中生有的实现高质量图像生成也渐渐可以做到了。当时有名的华为手机拍月亮事件,还有你我当年做的老照片修复都是这一技术发展的体现。

图像算法逐步成熟后,大家开始将目光转向视频和3D重建领域。视频处理需要更多考虑处理速度、帧间连续性的问题。
智驾对视觉有着强烈的需求,一开始都是各种分类检测分割任务。由于智驾的算法链路太过漫长,端到端的说法开始流行起来,这样视觉模型也成了整体端到端控制模型的一个模块。
到了大模型时代,视频生成的圣杯终于拿下,高质量的视频生成成为了现实。同时Agent和各类机器人的流行,也带来了一些新的需求场景。
大模型时代前的视觉算法
处理图像,首先要面临的就是尺度问题。图像有着各种各样的分辨率,图像中的核心物体位置和大小也不一。像StyleGAN虽然能生成高质量人脸,但只能生成固定的分辨率,固定的角度和大小。图像的场景跨度也极大,可能NLP领域主要就文字、代码、数学3类语言体系,可图像中,自然图像、文档图像、脸部图像、工件图像、航拍图像、屏幕截图等等各种场景区别可太大了。同时图像还有着NLP里没有的大量的退化现象,像失焦模糊、运动模糊、噪点、过曝、过暗、雨雾等都是家常便饭。因此,怎么在不同的退化、场景、分辨率下尽可能保持鲁棒性,是图像算法落地的核心问题。
在CNN时代,实际上算法也往往做不到较好的泛化性,一般也就靠着数据增强,对图像各种翻转、resize、裁切、退化甚至是拼接来尽可能提升。还有就是通过预处理,尽可能在实际推理时,把数据输入处理成尽可能简单的统一形式。此外还有些什么域自适应/域泛化的神奇技巧。但毕竟CNN容量有限,能把一个专业场景处理好就不错了。
到了ViT出现后,视觉模型的上限有了提升,特别是SAM的出现,让人们看到了通用视觉模型的曙光,确实太好用了。

而图像生成这边,VAE、GAN、自回归、流模型几大范式,GAN最终胜出,出现了pix2pix、CycleGAN、StyleGAN这样的优秀模型,带动了AIGC概念的出现,大量老片结合GAN技术进行了修复。同时自回归与量化思想的结合,出现了VQ-VAE,到了VQ-GAN,直接用Transformer建模视觉Token,也对后续工作有很大启发。到了2022年,扩散模型Latent Diffusion终于解决了通用图像生成任务,逐步取代了GAN的位置。结合ControlNet,同时也能实现各类图像编辑。
多模态大模型的视觉理解能力
多模态大模型出来后,靠着更大的模型容量,海量的多模态预训练数据****,****泛化性问题有了很大提升。以前CNN能"看到"的图像也就几十万几百万张,而且大多是标注好的特定场景。多模态大模型预训练图文对是亿级甚至十亿级,而且以前分类输出标签、检测输出框、分割输出掩码,换任务就得重新标数据重新训。多模态大模型不一样,输入图像输出自然语言,什么都能回答,很多没专门训过的任务零样本也能凑合用。
图文多模态理解,最早是"外挂式"的。CLIP通过对比学习,把图文对齐了,那把图像特征接LLM上不就能看图说话了?LLaVA最简单,投影层一连就完事,成了开源baseline,但细节能力有限。BLIP-2用Q-Former压缩视觉信息再传过去,效率高但损失大。这些方案本质上都是视觉和LLM两张皮,中间靠桥接层连,天花板受限于桥接质量和对齐数据。

真正的质变从GPT-4V开始。OCR效果显著提升,复杂图表能看懂,甚至能做点基础推理。这是大规模预训练+高质量对齐+强LLM基座三者结合的成果,视觉跟语言融合得更深,不再是简单外挂。
开源圈很快跟上。Qwen-VL、InternVL进步飞快,到2024年下半年很多测试集上已经接近GPT-4V了,但真实场景泛化效果还有差距。这期间两个趋势很明显:分辨率越来越高,从224到上千像素,细节和OCR上去了但Token也爆炸);视觉编码器也越来越大。
再后来是原生多模态。GPT-4o、Gemini 2.x,视觉从预训练开始就跟语言、音频在一起。最明显的区别就是视频理解和实时多模态------原生支持,更适合处理视频流音频流。延迟极低,真的像是在跟一个"能看能听"的智能对话。
到2026年,多模态大模型的视觉分类、通用OCR、开放域问答效果都很不错了。但空间度量和三维理解误差大,像素级精确分割还得靠SAM或者专用模型;幻觉问题也还没完全解决------看图编故事,编得有鼻子有眼。
这对产业也带来了改变,以前视觉公司的壁垒是"我模型比你准两个点",现在一个通用大模型下来,大量通用场景都被覆盖了,专用模型价值缩水。但高精度、端侧、低延迟、垂直长尾,这些地方专用模型还是更有优势。
大模型驱动的新一代图像生成与编辑
扩散模型虽然赢了GAN,但仍存在一些问题:训练推理不一致、UNet扩展性一般、采样慢、编辑弱。过去两年这些问题得到了改善,Flow Matching / Rectified Flow把训练目标和推理采样统一了,数学更干净效果更好;DiT换掉了UNet,骨干从卷积换成Transformer,扩展性也上一个台阶------SD3用MM-DiT双路融合,Flux.1上了12B纯DiT,进一步提升了开源生图模型的质量。再加上蒸馏技术把采样从50步砍到4步,实时生成从梦想变现实。DiT + Flow Matching基本成了标配。
开源这边共识很明确,闭源巨头却走出了三条不同的路线。纯扩散极致工程化派,代表Midjourney,把美学做到顶,但语义理解和编辑天然弱。纯自回归回归派,代表GPT-Image-2,跟大模型基座共享表征,语义对齐天生强,但高分辨率效率还是问题。混合架构派,代表Google的Nano Banana,LLM当大脑做理解和规划,扩散当画师做高清渲染,两边优势都占,但系统复杂度也高。三条线各有师承各有胜负手,长期谁赢不好说,很大程度看视觉Token的压缩效率什么时候能突破。

图像编辑的变化可能比生成本身还大。以前是改像素,后来靠ControlNet/Inpaint做条件控制,现在靠大模型理解指令自动定位自动改。开源还在卷Inpaint变体,闭源的差距核心在MLLM理解能力:它真的"懂"你想改什么。前沿像ChordEdit的和弦式编辑、Adobe的RetouchIQ专业修图,都在往更高保真、更可控的方向走。
产业上闭源四足鼎立(Midjourney/OpenAI/Google/快手),开源Flux替代SD成新标准,生态正在快速繁荣。电商、广告、游戏、影视这些领域生产效率提了5到10倍,但创作者的价值也在变化------从"手"转向"眼"和"脑",审美和创意比执行更重要了。
视频生成是图像架构的时空扩展,难度翻好几倍。主流是 3D DiT + 3D VAE,把视频当时空体处理。Sora 曾是最早的标杆,但因成本高、留存低,2026 年 3 月被 OpenAI 关停。取而代之的格局很清楚:国内 Seedance 2.5 和可灵 3.0 领跑,阿里万相、海螺 H3、Vidu 紧随;海外 Veo 3.1 在电影级品质上占优,Runway Gen-4 走专业工作流。趋势从"能生成"到"能控制",中国厂商凭借平台生态和短视频场景闭环,已形成初步领先。
高阶视觉任务
所谓"高阶",不是难度更大,而是任务范式超越了分类/检测/分割的经典框架------要么输出空间不同,要么需要结构化推理和跨模态知识。
OCR 的核心是个很具体的 trade-off:字符级精度 vs 语义纠错。 印刷体大幅受益,常见布局、主流语言都能对付,还能靠语言先验纠错------一个字糊了,它靠上下文"猜"回来。但代价是像素级定位退化:只输出文字内容,精确字符坐标给不准,对需要定位的下游是致命的。曲线文字、艺术字、潦草手写照样翻车,中文手写很多时候不如专用模型。
文档理解本质是另一个问题------不是逐字符定位,而是版面拓扑的结构还原。表格合并关系、标题层级、跨页连贯,这是"结构"问题。MLLM 强在内容侧:直接输出 Markdown、JSON,表格目录公式一起端。弱在结构侧可靠性:精确坐标、细粒度属性、批量高可靠处理都不够稳,漏脚注、错行列、坐标偏十几像素是常事。所以企业级方案多是"专用模型测结构 + MLLM 理解内容"。
几何图像的困难是分层的,而且多出在"视觉"而非"推理"。第一层是精确度量------点在不在线上、是否真垂直、坐标、边长角度比例,MLLM 很难看准:视觉编码器本为语义而生,分辨率低,patch 化后亚 patch 细节被抹平,注意力层层下来空间细节早糊了。它能认出"这是直角三角形",但直角顶点在哪、边比例多少,误差离谱。第二层是图文对应------"点 D""AB=CD"对应哪,经常搞错。第三层是辅助线构造,语义推理大模型擅长,空间推理就是另一回事了。

三维重建是另一个范式------2D 到 3D 本质是病态问题。技术换代快:SfM+MVS 精度高但需多角度;NeRF 效果惊艳但慢;3DGS 成了事实主流,训练快渲染实时;生成式三维单图秒级能出个样子,但几何精度差、细节糊。MLLM 的渗透要分清两个"3D":几何重建它几乎插不上手,精度是硬指标;但3D 理解有切入点------场景描述、具身导航的语义映射、开放词汇 3D 检索,虽同样不成熟。重建靠几何,理解靠语言,两层各走各的。另外,三维重建也牵涉到下一个大热点------世界模型。
所以,之后很可能MLLM 与视觉专用算法不是谁取代谁,而是各干各擅长的。中短期内,专用模型该用还得用。
Agent 对视觉算法的影响
以前视觉算法是给人用的工具,现在成了 Agent 的感知入口。人用的时候,看错了人能纠正。Agent 不一样,决策直接驱动行动,中间没人把关,误差一步步放大。设计目标因此变了:不光要"准",还要知道自己准不准、不准了怎么办。
输入本身也变了。 传统视觉的输入是"一张干净、单一、完整的图";Agent 的输入多了很多屏幕截图场景------GUI Agent 满屏的截图、带滚动条的局部视口、对话历史混着图片、连续的视频帧、上一秒的操作结果和这一秒的画面叠在一起。输入从"单图"变成了"多模态、多轮、带上下文的流"。这不是增量难度,是范式变化:视觉模型要会看"部分"(截图只是视口的局部)、要懂"时序"(上一帧和这一帧的关系)、要把画面和对话上下文对齐(用户说"那个按钮",得知道"那个"指哪张截图里的哪个)。

自我怀疑成了刚需。输出结果的同时输出置信度,没看清就主动要求再看一眼。多模态不确定性估计、多工具交叉验证、视觉-动作一致性检查,都是这一条逻辑的延伸。
从识别到操控。 CLIP 式对齐学的是"这是什么",学不到"它多远、推一下倒不倒、抓哪不会掉"------后者才是 Agent 要的。预训练目标在从"识别准确"转向"利于操控",数据从图文对转向视觉-动作-反馈。
视觉工具化、接口标准化。 以前每个模型接口各搞一套,人能迁就,Agent 迁就不了。接口得统一、语义化、容错。SAM 成了分割的标准工具,但它输入的是点/框/掩码提示,不是自然语言,"一句话调用"还得再叠一个 grounding 模型把话翻译成提示。
实时流式理解。 传统是给一张图出一个结果;Agent 得持续观察,有变化立刻感知。流式推理、增量更新、端侧快扫加云端细看,都是未来可能的方向。
生成编辑侧,变化也不小。对话式编辑把控制信号从像素级变成语义级。更关键的是两阶段架构:LLM 当大脑做规划调度,专业工具当手做精确执行。自动质量评估看着不起眼,其实是 Agent 自动迭代闭环的前提------没有它,Agent 连"生成得好不好"都不知道,更别说迭代了。而且它远没想象中简单,美学和一致性的自动评判至今是没解决的难题。
感知-行动闭环的误差累积、三维空间理解不足、端侧延迟和云端精度的矛盾、开放世界长尾的可靠性......每一个都是难点。还有一条:在线持续学习。它是研究热点没错,但"越用越强"现阶段在视觉上还很难做到------灾难性遗忘、分布漂移、出错没法回滚,让多数系统还是"在线只记日志、离线再重训"。
总结
计算机视觉、数字图像处理在计算机和AI领域,都是比较古老的学科了,lena图、均值滤波、滑窗法...很多CV的经典概念在计算机开发者里广为人知。过去10年,在ResNet出现后,视觉算法在各需求场景都成熟落地,塑造了人们对AI的广泛认知。算法工程师们构建高质量训练集,进行数据增强,解决退化、多尺度和长尾分布问题,通过半监督学习等技巧减少打标数据需求、提升泛化性。这些成就,最终使得人们有信心直面智驾,这个难度堪比登月的任务。时至今日,AI在语言上的能力已经远超人类,但即便有了多模态大模型,可智驾、对视频的多维度实时理解,似乎仍是个短期内难以解决的问题。

CNN和深度学习兴起了,传统CV仍在使用。同样,多模态、大模型和Agent兴起了,CNN视觉模型也不会消亡。不同的场景、推理速度、精度、可解释性、成本要求,注定会需要不同的视觉算法。视觉算法的演进,也是AI"看世界"不断接近人的过程------从 CNN 识别物体,到大模型理解语义,再到 Agent 主动观察、选择要看什么、以及评估自己看的准不准、再到持续学习在线进化。多模态大模型的视觉能力、效率、成本持续优化,Agent中分层的整体视觉能力设计、自我评估能力、自进化能力等,都是接下来视觉算法继续发展的方向。