深度学习——图像分割

一、图像分割基础

  • 定义:对图像像素进行细粒度分类,明确目标轮廓,划分不同类别。
  • 应用场景:涵盖人像抠图、医学组织提取、遥感图像分析、自动驾驶、材料图像等领域。
  • 前景与背景:前景为可数目标(如行人),背景为不可数场景元素(如天空、草地)。
  • 三层境界:语义分割(像素单类别分配,输出掩膜) 实例分割(仅预测前景目标的类别、边框及个体 ID,像素可属多 ID) 全景分割(像素分配语义类别 + 唯一实例 ID)。

二、核心数据集

  • VOC 数据集:含 4 大类 20 小类,2007 年起支持语义与实例分割标注,2007 版有 9963 张图片 / 24640 个目标,2012 版有 23080 张图片 / 54900 个目标,另有 2913 张标注图(含训练、验证集)。
  • Cityscape 数据集:聚焦 50 个城市的街景图,含 30 个类别,提供 5000 张精细标注图(分训练、验证、测试集)和 20000 张粗略标注图,支持语义与实例分割。
  • COCO 数据集:侧重复杂日常场景,共 91 类(82 类有超 5000 个实例),以 4 岁小孩可辨识为分类基准。

三、评估指标

  • 基础指标:Pixel Accuracy(PA):逐像素分类精度 Mean Pixel Accuracy(MPA):类内正确分类像素比例。
  • 核心指标:IoU(前景目标交并比)、mIoU(各类 IoU 平均值)、FWIoU(带类别概率权重的 mIoU)。

四、技术核心

  • 网络模块:由卷积模块(提取图像特征)和反卷积模块(上采样恢复原图尺度)构成。
  • 转置卷积:卷积为 4×4 输入转 2×2 输出(3×3 卷积核),反卷积为 2×2 输入转 4×4 输出(3×3 卷积核),二者呈转置关系,通过稀疏矩阵运算实现。

五、典型网络结构

  • 采用 "编码器 (卷积模块)- 解码器(反卷积模块)" 架构,编码器为卷积网络(含多次最大池化),解码器为反卷积网络(含多次反池化),逐步完成特征提取与图像尺度恢复。
相关推荐
政安晨2 小时前
政安晨【零基础玩转开源AI项目】- AutoGPT:全球首个自主AI Agent从入门到实战(致敬OpenClaw的小回顾)
人工智能·ai·autogpt·全球首个agent框架·致敬openclaw之作·参考价值·ai开源agent框架
Shawn_Shawn6 小时前
mcp学习笔记(一)-mcp核心概念梳理
人工智能·llm·mcp
33三 三like8 小时前
《基于知识图谱和智能推荐的养老志愿服务系统》开发日志
人工智能·知识图谱
芝士爱知识a8 小时前
【工具推荐】2026公考App横向评测:粉笔、华图与智蛙面试App功能对比
人工智能·软件推荐·ai教育·结构化面试·公考app·智蛙面试app·公考上岸
腾讯云开发者9 小时前
港科大熊辉|AI时代的职场新坐标——为什么你应该去“数据稀疏“的地方?
人工智能
工程师老罗10 小时前
YoloV1数据集格式转换,VOC XML→YOLOv1张量
xml·人工智能·yolo
yLDeveloper10 小时前
从模型评估、梯度难题到科学初始化:一步步解析深度学习的训练问题
深度学习
Coder_Boy_10 小时前
技术让开发更轻松的底层矛盾
java·大数据·数据库·人工智能·深度学习
啊森要自信10 小时前
CANN ops-cv:面向计算机视觉的 AI 硬件端高效算子库核心架构与开发逻辑
人工智能·计算机视觉·架构·cann