YOLOV8/11分割与分类输出参数说明

YOLOV8/11 输出三个尺度的特征图

对于640x640图像输入:

  1. 80x80 检测小目标
  2. 40x40 检测中目标
  3. 20x20 检测大目标

检测输出说明

对于640x640的图片输入,输出output084,8400,预测框的总数量是8400,每个预测框的维度是84(4+80),针对COCO数据集的80个类别而言

8400x84 = 80x80x84+40x40x84+20x20x84 = 80x80x(4+80)+40x40x(4+80)+20x20x(4+80)

其中4为预测框 cx,cy,w,h,代表预测框的中心点坐标与宽高;80为80个类别的置信度

输入图像大小不一样,输出的检测框数量不同

分割输出说明

分割有两个输出output0与output1,对于640x640 的图像输入,output0为检测头的输出其维度1x116x8400,output1为分割头的输出,其维度为1x32x160x160

output0维度1x116x8400,代表输出的检测框数量为8400,每个预测框的维度为116(4+80+32)

其中4为预测框 cx,cy,w,h,代表预测框的中心点坐标与宽高;80为80个类别的置信度,32维向量为与当前预测框关联的分割mask系数

output1分割头的输出维度为1x32x160x160,代表32个尺寸为160x160的基础mask,这些基础mask所有检测框共享,每个检测框的32维mask系数与output1做矩阵乘法得到当前检测框的最终mask

具体实现:

  1. Mask 系数(n×32) × 模型输出原型output1(32×160×160),n为筛选后预测框的数量
  2. 经过 sigmoid 激活
  3. 得到 n×160×160 的原始 Mask
  4. 把框从 640×640 → 缩放到 160×160,用于裁剪 Mask
  5. 把检测框以外的 Mask 全部设为 0
  6. 只保留框内的物体区域
  7. 把 160×160 中多余的灰色区域切掉(对于输入letterbox),得到有效小图
  8. 双线性插值缩放,把 Mask 缩放到 原图分辨率(如 1920×1080)
相关推荐
2601_9567436814 分钟前
上海GEO优化公司名单(2026年10月更新):GEO是什么业务、上海主流服务商盘点与选型避坑指南
大数据·人工智能·技术分享·geo·上海
倔强的石头10617 分钟前
Qwen系列解析_阿里巴巴大模型技术路线
人工智能·大模型
liuchangng31 分钟前
类Jev项目Kev从入门到实战(6):Jev / Kev / Laya 对比
人工智能·jev·kev
Rocky Ding*33 分钟前
深入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、Qwen-Image、GLM-Image核心基础知识
论文阅读·人工智能·深度学习·机器学习·aigc·扩散模型·ai-native
能源革命37 分钟前
AI 日报 · 2026-10-05
人工智能
Ivanqhz1 小时前
MLA、DSA、CSA、HCA
人工智能·算法·机器学习
网络毒刘1 小时前
GPT-6.1 Sol 定位速读:成本效率型编码模型与「何时该换本地 Agent」
人工智能·gpt·openai·agent·cursor
后端小肥肠1 小时前
Claude Opus 5.5 做视频:从口播稿到成片,全流程跑通
人工智能·aigc·agent
RockHopper20251 小时前
数字机制与未来企业运行模式(概要版)
人工智能·机器学习·智能体·agent 工程
星禾元亨1 小时前
同一件事有三份资料,AI 该信哪一份?冲突判定、优先级链与处置流程
前端·人工智能