从“看见“到“看懂“——工业视觉的大模型时刻到了吗?

**摘要:**7月17日 WAIC 2026刚结束,"从看见到看懂"成了行业热词。海康说检测效率提升80%,大华说零样本学习泛化。维视20年做的事,刚好就是这条路的完整切面------从规则算法到深度学习再到大模型,每一步都踩在真实的工厂里。本文用螺钉分类、鹌鹑公母识别、小龙虾分选、耳机外壳缺陷等真实案例,拆解"看见"到"看懂"到"用起来"的三步演进。

7月17日,WAIC 2026(世界人工智能大会)刚结束,"从看见到看懂"成了行业热词。

浙江日报7月8日的报道里有一句话很准:**视觉正在从"记录工具"变成"认知系统"。**海康说搭载观澜大模型后检测效率提升80%,大华的"驰光"相机说能零样本学习泛化。

维视做了20几年机器视觉,从规则算法到深度学习再到大模型,这条路是一步步走过来的。

"看见"时代:传统视觉能做什么

2010年代之前的机器视觉,本质是"规则匹配"。

工程师写一套算法:先定位产品在哪里,再判断有没有、尺寸对不对、字符是不是这个。所有的判断都来自"我事先定义好的规则"。

这套方法能解决一类问题------规则明确、特征稳定的场景。

某机械制造企业的螺纹表面缺陷检测,远心镜头+蓝色环光把螺纹齿廓打亮,斑块检出工具沿着螺纹走一遍,发现有破损、凹陷、压伤就标红。整套方案跑了几年,100%全覆盖,毫秒级检出。

▲ 传统视觉算法对螺纹表面缺陷的检出示意(绿框OK,红框NG)

这类场景的特点是:"我能用语言把规则描述出来"。"螺纹破损"是什么意思,工程师能写出来,机器就能照着做。

但问题也出在这里。

某企业有200多种螺钉,每种长得都差不多,差几毫米、差一个螺帽角度。规则匹配要写200多套特征参数,换个批次还要重写。换一次螺钉型号,调机要两天。

更深的问题是自然形态。鹌鹑的公母差别在胸羽的纹路、叫声的频率,毛茸茸的小龙虾每一只的形态都不一样,靠规则怎么写?写不出来。

这就是"看见"的天花板:能描述清楚的,就能干;说不清楚的,就干不了。

"看懂"时代:深度学习改变什么

深度学习的核心突破是:不需要你写规则,让机器从数据里自己学。

维视的VisionBank AI深度学习能力从2017年开始落地,到现在已经覆盖了200+工具组合。几个关键数字:小样本训练10张起步、0代码操作、训练时间从小时级压缩到分钟级。

它能做什么?举几个真实场景。

螺钉分类:200+种0漏检

还是那个换型调机两天的企业。维视给的方案是:500万像素相机+背光,深度学习定位螺帽+螺杆,自动识别当前批次的6种目标型号。

关键是"自适应换批"------不同批次要求的6种型号不同,系统自动切换识别模型。换型时间从两天压缩到一小时。0漏检,24小时不停机,节省3个人工。

这个案例的特别之处在于:传统算法要写200套规则,深度学习只需要标注每个型号几十张图片。

▲ 鹌鹑公母识别软件界面------绿框"公"、红框"母",深度学习从羽毛纹路中识别性别

鹌鹑公母识别:超越规则的"理解"

公鹌鹑的胸羽偏红,母鹌鹑的胸羽有黑斑。这个差别,传统算法几乎不可能写规则------每只鹌鹑的羽毛颜色都有差异,斑点大小不一。

维视方案:500W工业相机拍摄鹌鹑背部,深度学习全图分类模型,标注"公""母"训练。识别准确率高于人工。

这个案例最能说明"看懂"两个字------机器不是在匹配规则,是在从大量样本里学"公和母的整体差异"。

小龙虾分选:处理自然有机物

小龙虾分选过去纯靠人工。一筐小龙虾,3个/秒的速度,工人要分出"正反方向、叠虾、坏虾头、坏虾尾、颜色过深"五类。

▲ 小龙虾分选软件界面------红字"叠虾"标注深度学习对复杂自然形态的判别结果

维视方案:彩色相机+深度学习全图分类,对不同状态的小龙虾图片标记训练。3个/秒的速度不变,分类标准统一了,工人从分选台解放出来。

耳机外壳缺陷:像素级精确定位

耳机外壳要检出划痕、凹坑、脏污、毛刺等微小缺陷。维视用深度学习像素分割模型,绿色框标出合格区域,紫色/红色框标出缺陷位置,误差在亚像素级。

▲ 耳机外壳深度学习缺陷检出------绿框OK,紫色标注为划痕/凹坑,红色标注为NG点

这类任务传统算法能做,但需要为每种缺陷写一套规则。深度学习用一套模型覆盖所有缺陷类型,训练数据从几百张图片起步。

深度学习解决的是"看见"时代的核心痛点:**复杂形态、模糊规则、跨批次变化。**机器从数据里学规律,比人写规则覆盖的场景多得多。

"看懂"之后:检测数据反哺工艺

大模型的价值不只是检测------是把检测数据变成资产。

传统的检测流程是"产线→检测→NG件挑出来→人工复检→返工或报废"。检测数据和工艺优化是断的。

▲ 耳机外壳NG品视觉标注------缺陷类型、位置、严重度全部结构化输出,可上传MES系统

维视的方案里,检测结果不只是"通过/不通过"。耳机外壳NG时,软件会记录缺陷位置、类型、严重程度,**数据上传到MES系统。**生产主管看到的不是"今天NG了50个",而是"模具C区在14:00-16:00出现集中性凹坑,可能是冷却参数偏移"。

这就是从"看见"到"看懂"之后的第三步:看见缺陷、看清根因、调整工艺。

检测数据反哺工艺的关键是"标准化输出"。维视VisionBank AI的200+工具组合,每一类检测结果都有统一的格式------位置、类型、严重度、图像快照------可以直接喂给上游的MES或下游的工艺数据库。

8200+客户、50000+套设备、99.8%良品率------这些数字背后,是每个工厂每天产出的检测数据在沉淀。

大模型能"看懂"什么

WAIC上讨论的大模型概念很多。回到工业现场,大模型的价值有三层:

**第一层,降低使用门槛。**小样本训练10张起步,0代码操作,会用电脑的工艺工程师就能部署模型。

**第二层,提升泛化能力。**传统深度学习换一个产品要重训,大模型有零样本/少样本学习能力------大华驰光相机在这点上做了探索。

**第三层,打通数据闭环。**检测数据沉淀成工艺优化的输入,工厂的"眼睛"和"大脑"连起来。

维视在这三层都做了20年的积累。小样本训练是2017年的事,0代码操作是2019年的事,数据闭环是过去几年逐步在做的。WAIC上的新词,在维视的工厂里已经跑了很久。

看见到看懂,看见之后

大模型在消费端能聊天,在工业端得干活。

WAIC 2026的主题是"从看见到看懂"。维视20年做的事,是把这句话翻译成工厂能用的方案------

看,是相机和光源的事。看懂,是算法和数据的事。看完之后用起来,是工厂数字化的最后一公里。

西安、北京、深圳、苏州、成都五个城市都有维视的开放实验室。不确定算法能不能跑通?带样件和数据来测,测试结果说话,测完再决定投不投。

毕竟,工厂里的"看懂"和展会上的"看懂",不是一回事。

相关推荐
janeboe5 小时前
抖音黑科技兵马俑总站源头简博科技 | 抖音锚点不合规挂载新规今日生效,短视频引流直播间迈入三端全链路监管时代
大数据·人工智能·科技
lialaka5 小时前
「未来星途(Future_Odyssey)」——全语音_3D_AI_具身交互智能数字教官与全双工星际科普沉浸舱[1]
人工智能·3d·交互
hongmai6668885 小时前
ESP32-C61-WROOM-1-N8R2:Wi-Fi 6与RISC-V融合的中坚力量
人工智能·单片机·嵌入式硬件·物联网·智能家居·risc-v
正在走向自律6 小时前
用豆包Seed Evolving打造全功能【AI智能记账】小程序,开源可落地
人工智能·小程序·开源·智能记账
小保CPP6 小时前
OpenCV C++提取webp动图里的图片
c++·人工智能·opencv·计算机视觉
B8017913Y6 小时前
手动整理录音太慢错漏多?2026专业AI录音可高效整理内容
人工智能
梦想的颜色6 小时前
AI Agent 可观测性:破解多步推理黑盒|从概念、架构、指标到生产落地图鉴
人工智能·ai agent 可观测性·llm 追踪 trace·llmops 硬核实战·agent 生产运维
IT智慧客07316 小时前
Harness 到底指什么
人工智能
大模型任我行6 小时前
阿里:端到端文档解析模型OvisOCR2
人工智能·语言模型·自然语言处理·论文笔记