深度学习——图像分割

一、图像分割基础

  • 定义:对图像像素进行细粒度分类,明确目标轮廓,划分不同类别。
  • 应用场景:涵盖人像抠图、医学组织提取、遥感图像分析、自动驾驶、材料图像等领域。
  • 前景与背景:前景为可数目标(如行人),背景为不可数场景元素(如天空、草地)。
  • 三层境界:语义分割(像素单类别分配,输出掩膜) 实例分割(仅预测前景目标的类别、边框及个体 ID,像素可属多 ID) 全景分割(像素分配语义类别 + 唯一实例 ID)。

二、核心数据集

  • VOC 数据集:含 4 大类 20 小类,2007 年起支持语义与实例分割标注,2007 版有 9963 张图片 / 24640 个目标,2012 版有 23080 张图片 / 54900 个目标,另有 2913 张标注图(含训练、验证集)。
  • Cityscape 数据集:聚焦 50 个城市的街景图,含 30 个类别,提供 5000 张精细标注图(分训练、验证、测试集)和 20000 张粗略标注图,支持语义与实例分割。
  • COCO 数据集:侧重复杂日常场景,共 91 类(82 类有超 5000 个实例),以 4 岁小孩可辨识为分类基准。

三、评估指标

  • 基础指标:Pixel Accuracy(PA):逐像素分类精度 Mean Pixel Accuracy(MPA):类内正确分类像素比例。
  • 核心指标:IoU(前景目标交并比)、mIoU(各类 IoU 平均值)、FWIoU(带类别概率权重的 mIoU)。

四、技术核心

  • 网络模块:由卷积模块(提取图像特征)和反卷积模块(上采样恢复原图尺度)构成。
  • 转置卷积:卷积为 4×4 输入转 2×2 输出(3×3 卷积核),反卷积为 2×2 输入转 4×4 输出(3×3 卷积核),二者呈转置关系,通过稀疏矩阵运算实现。

五、典型网络结构

  • 采用 "编码器 (卷积模块)- 解码器(反卷积模块)" 架构,编码器为卷积网络(含多次最大池化),解码器为反卷积网络(含多次反池化),逐步完成特征提取与图像尺度恢复。
相关推荐
AI木马人16 小时前
9.人工智能实战:GPU 服务如何上 Kubernetes?从单机部署到 K8s + NVIDIA Device Plugin + HPA 的生产级改造
人工智能·容器·kubernetes
Slow菜鸟16 小时前
AI学习篇(四) | AI设计类Skills推荐清单(2026年)
人工智能·学习
迦南的迦 亚索的索16 小时前
AI_11_Coze_AI面试助手
人工智能·面试·职场和发展
pangtout16 小时前
国云强智:天翼云押注Token,争夺AI时代新入口
人工智能
dog25016 小时前
圆锥曲线和二次曲线
开发语言·网络·人工智能·算法·php
岛雨QA16 小时前
🎉Token自由-Ollama部署本地大模型超详细操作指南
人工智能·llm·ollama
云游16 小时前
从“人工打补丁”到“自主进化”:多轮对话文本转SQL智能体的技术跃迁
人工智能·文本转sql
区块block17 小时前
Infinity Alpha(无限阿尔法)即将发布纯链上AI收益引擎通证IA
人工智能·区块链
有为少年17 小时前
从概率估计到“LLM 训练是有损压缩”
人工智能·线性代数·机器学习·计算机视觉·矩阵
迦南的迦 亚索的索17 小时前
AI_10_Coze_Multi-Agent多智能体
人工智能