计算机视觉是人工智能领域中处理视觉输入分析的分支,例如照片、视频和实时摄像头画面。该技术通过使用大量图像训练模型来实现。
计算机视觉模型包含多种类型。
- 图像分类是计算机视觉的一种形式,通过标注图像主体(即图像所呈现的内容)的训练数据来训练模型,使其能够分析未标注图像并预测最匹配的标签------识别图像主体。
- 目标检测是计算机视觉的一种形式,模型通过训练能识别图像中特定物体的位置。
- 语义分割是目标检测的高级形式,模型不再通过绘制边框标注物体位置,而是能识别图像中属于特定物体的每个像素点。
- 多模态模型结合视觉特征与关联文本描述,能够生成图像的综合性描述。
计算机视觉应用场景
计算机视觉的常见用途包括:
- 能够解读视觉输入的人工智能代理。
- 照片自动添加字幕或生成标签。
- 视觉搜索。
- 零售场景中监控库存水平或识别待结账商品。
- 安防视频监控。
- 通过人脸识别进行身份验证。
- 机器人技术与自动驾驶车辆。