深度学习——图像分割

一、图像分割基础

  • 定义:对图像像素进行细粒度分类,明确目标轮廓,划分不同类别。
  • 应用场景:涵盖人像抠图、医学组织提取、遥感图像分析、自动驾驶、材料图像等领域。
  • 前景与背景:前景为可数目标(如行人),背景为不可数场景元素(如天空、草地)。
  • 三层境界:语义分割(像素单类别分配,输出掩膜) 实例分割(仅预测前景目标的类别、边框及个体 ID,像素可属多 ID) 全景分割(像素分配语义类别 + 唯一实例 ID)。

二、核心数据集

  • VOC 数据集:含 4 大类 20 小类,2007 年起支持语义与实例分割标注,2007 版有 9963 张图片 / 24640 个目标,2012 版有 23080 张图片 / 54900 个目标,另有 2913 张标注图(含训练、验证集)。
  • Cityscape 数据集:聚焦 50 个城市的街景图,含 30 个类别,提供 5000 张精细标注图(分训练、验证、测试集)和 20000 张粗略标注图,支持语义与实例分割。
  • COCO 数据集:侧重复杂日常场景,共 91 类(82 类有超 5000 个实例),以 4 岁小孩可辨识为分类基准。

三、评估指标

  • 基础指标:Pixel Accuracy(PA):逐像素分类精度 Mean Pixel Accuracy(MPA):类内正确分类像素比例。
  • 核心指标:IoU(前景目标交并比)、mIoU(各类 IoU 平均值)、FWIoU(带类别概率权重的 mIoU)。

四、技术核心

  • 网络模块:由卷积模块(提取图像特征)和反卷积模块(上采样恢复原图尺度)构成。
  • 转置卷积:卷积为 4×4 输入转 2×2 输出(3×3 卷积核),反卷积为 2×2 输入转 4×4 输出(3×3 卷积核),二者呈转置关系,通过稀疏矩阵运算实现。

五、典型网络结构

  • 采用 "编码器 (卷积模块)- 解码器(反卷积模块)" 架构,编码器为卷积网络(含多次最大池化),解码器为反卷积网络(含多次反池化),逐步完成特征提取与图像尺度恢复。
相关推荐
硅谷秋水几秒前
物理人工智能的驾驭工程:机器人中间件是驾驭层
人工智能·机器学习·语言模型·中间件·机器人
小白狮ww1 分钟前
3B 参数,毫秒级响应:LocateAnything 如何重新定义开放世界目标检测
人工智能·目标检测·计算机视觉·视觉检测·大语言模型·nvidia·locateanything
风华圆舞3 分钟前
鸿蒙 + Flutter 如何把 AI 助手嵌进应用页面里——以食界探味为
人工智能·flutter·harmonyos
大山佬3 分钟前
ONNX Runtime 边缘部署:ARM 平台上的模型优化与推理加速全链路
人工智能
优测云服务平台5 分钟前
AI 自动化拨测生成,让核心链路巡检从“人工编写”走向“智能生成”
人工智能·接口测试·云拨测
朱大喜6 分钟前
Spark/Hive/ClickHouse 大数据技术栈:从离线批处理到实时分析的选型与工程实践
人工智能
百度安全6 分钟前
2025 百度 ESG 报告发布:以 AI 筑盾,共建可信数字生态
人工智能·网络安全
Bruce_Liuxiaowei7 分钟前
2026年6月第2周网络安全形势周报
人工智能·安全·web安全·ai·大模型·智能体
霸道流氓气质9 分钟前
Spring AI Alibaba Graph 全解析:从入门到精通
java·人工智能·spring
AI客栈9 分钟前
云原生 AI 平台搭建:从集群规划到 GPU 调度的全链路设计实践
人工智能