YOLO26 计算机视觉 - YOLO26 简介 & Hello World项目搭建

大家好,我是 Java1234 小锋老师。最近正在更新《一天学会 YOLO26 计算机视觉 机器视觉 视频教程》系列专辑,感谢大家的支持与关注。

本课程将系统讲解 YOLO26 的完整知识体系,涵盖 YOLO26 简介、HelloWorld 项目实现、模型架构解析、图片与视频推理、摄像头实时检测、数据集与标注、训练自己的 YOLO26 模型、多任务(分割 / 姿态 / 分类 / OBB)以及模型导出等内容。

视频教程+课件+源码打包下载 :

链接:https://pan.baidu.com/s/1_NzaNr0Wln6kv1rdiQnUTg

提取码:0000

具体位置:进入【第三十一期】技术目录即可找到。

YOLO26 计算机视觉 - YOLO26 简介 & Hello World项目搭建

YOLO26 简介

官网:https://www.ultralytics.com/

中文官方文档:https://docs.ultralytics.com/zh

YOLO26是Ultralytics团队于2025年9月伦敦 YOLO Vision 2025 大会首次公开演示原型**,**2026‑01‑14,Ultralytics 官方正式对外发布,可直接通过 ultralytics 库使用 yolo26n.pt 等权重。它是一个统一的实时视觉模型系列,旨在为边缘计算和现实世界部署树立新标准。

🚀 核心特点:更快、更简、更准

YOLO26的核心创新在于其架构和训练策略的全面革新,主要特点包括:

  1. 原生端到端推理 (NMS-Free) :这是YOLO26最显著的改变。它默认采用"一对一"(one-to-one)的检测头,彻底移除了传统目标检测中依赖的非极大值抑制(NMS)后处理步骤。这简化了部署流程,降低了推理延迟。
  2. 更轻量的检测头:移除了分布焦点损失(DFL),在保持回归精度的同时,大幅降低了模型复杂度,使其更易于在边缘设备上部署。
  3. 先进的训练策略 :引入三项关键新技术协同提升精度并降低训练成本:
    • MuSGD优化器:融合了Muon与SGD的混合优化器,将大语言模型的训练思想引入计算机视觉,增强了训练稳定性。
    • 渐进式损失平衡(ProgLoss):在训练过程中将监督重点逐步转移到推理阶段的头部,优化最终性能。
    • 小目标感知标签分配(STAL):改进标签分配策略,确保小目标也能获得正标签,从而提升对小目标的检测能力。

📊 性能表现:速度与精度的新高度

与上一代YOLO11相比,YOLO26在速度和精度上均有显著提升:

  • 更快的推理速度 :其最小的nano模型在CPU上的推理速度最高可提升43%,使其成为边缘CPU部署的理想选择。
  • 更高的检测精度 :在著名的COCO数据集上,YOLO26五个模型变体的平均精度(mAP)达到了40.9%到57.5%
  • 极低的延迟 :在NVIDIA T4 GPU上使用TensorRT加速时,推理延迟仅为1.7毫秒到11.8毫秒

🎯 多任务能力与模型选择

YOLO26不仅仅是一个检测器,它是一个统一的多任务框架,开箱即用支持以下任务:

  • 目标检测 (Detection)
  • 实例分割 (Instance Segmentation)
  • 姿态估计 (Pose Estimation)
  • 图像分类 (Classification)
  • 旋转框检测 (Oriented Object Detection)
  • 目标追踪 (Tracking)

为了适应不同场景,YOLO26提供了五种不同大小的模型:Nano (n), Small (s), Medium (m), Large (l), 和 Extra Large (x)。

YOLO26 Hello World项目搭建

首先我们新建一个项目目录YOLO16_PRO1,然后Pycharm,新建项目,选Pure Python项目,Location定位到YOLO16_PRO1,python版本选11。

接下来安装 YOLO26库

复制代码
pip install ultralytics -i https://mirrors.aliyun.com/pypi/simple

我来先写一个简单测试代码test.py,看下YOLO26库是否安装成功:

python 复制代码
import torch
import ultralytics
from ultralytics import YOLO

print(f"PyTorch版本: {torch.__version__}")
print(f"CPU是否可用: {torch.cpu.is_available()}") # 有CPU会显示True
print(f"Ultralytics版本: {ultralytics.__version__}")

运行结果:

我们再来新建一个helloWorld.py程序,体验下YOLO16

python 复制代码
from ultralytics import YOLO

# 加载预训练模型(会自动下载)
model = YOLO("yolo26n.pt")
# model = YOLO("yolo26s.pt")

# 对一张图片进行推理
results = model("https://ultralytics.com/images/bus.jpg")

# 显示带有检测框的结果
results[0].show()

运行项目,控制台输出,第一次会先自动下载预训练模型

复制代码
Speed: 1.7ms preprocess, 41.2ms inference, 0.3ms postprocess per image at shape (1, 3, 640, 480) 

这个输出是 YOLO26 在推理一张图片时打印的性能日志,它告诉你了模型处理这张图片总共花了多少时间 ,以及每个环节分别用了多久。我们把它拆开来看:


⏱️ 三个时间阶段

  1. Preprocess (预处理) --- 1.7ms
    • 这是模型"读懂"图片前的准备工作。YOLO 需要把输入的原始图片(可能是任意尺寸、格式)统一缩放、归一化、转为模型能识别的张量格式
    • 这里的 1.7ms 表示这个转换过程只花了 1.7 毫秒,非常快。
  2. Inference (推理) --- 41.2ms
    • 这是最核心的计算阶段。模型把预处理后的图片"喂"给神经网络,进行前向传播,得到原始检测结果(比如数百个候选框和分类分数)。
    • 41.2ms 是模型"思考"并输出原始结果所用的时间。这个时间主要取决于模型的大小(如 yolo26n 最快,yolo26x 最慢)和硬件(CPU/GPU)性能。对于一般的边缘设备(如 CPU),这个速度已经相当不错了。
  3. Postprocess (后处理) --- 0.3ms
    • 这是对推理原始结果进行"精加工"的步骤。传统 YOLO 需要在这里执行**非极大值抑制(NMS)**来去除重复框,这一步往往耗时且不稳定。
    • YOLO26 的一大革新就是"端到端无 NMS" ,所以它的后处理极其轻量,只需要做简单的阈值过滤和格式整理。0.3ms 正体现了这一优势,几乎可以忽略不计。

📐 关于输入尺寸 (1, 3, 640, 480)

这四维数字表示模型实际接收的图片张量维度:

  • 1批次大小,即一次只处理了一张图片。
  • 3颜色通道数,RGB 三通道。
  • 640图片高度(像素)。
  • 480图片宽度(像素)。

也就是说,你的原始图片被缩放/填充到了 640×480 分辨率进行推理。这个尺寸通常由你在训练或预测时设置的 imgsz 参数决定。


📊 总耗时与性能评价

  • 总计耗时 ≈ 1.7 + 41.2 + 0.3 = 43.2ms ,意味着每秒大约可以处理 23 张图片(1000ms / 43.2ms ≈ 23 FPS)。
  • 这个速度对于大多数实时应用(如视频监控、无人机巡检)完全够用。如果是在 GPU(如 NVIDIA T4)上,这个数值会更低(可能小于 10ms);在 CPU 上,41.2ms 推理时间说明 YOLO26 的优化非常出色。
  • 特别留意 后处理只有 0.3ms,这直接证明了 YOLO26 "无 NMS"设计带来的效率提升------传统模型的后处理往往需要 5~10ms,甚至更多。

以及显示预测结果:

这些数字(如 0.910.53)在目标检测中叫作置信度分数(Confidence Score)

你可以把它直接理解为模型对自己判断的"把握程度" ,或者**"蒙对的概率"**。它是一个介于 0 和 1 之间的数值。

YOLO26默认可以识别的物体种类和单张图像最多检测出的物体数量,是两个不同的概念。

  • 可识别的物体类别:默认是 80 种。这些类别来自COCO数据集,覆盖了常见的人、车、动物等日常物体。
  • 单张图像最多检测数量:默认是 300 个。这得益于其默认的"一对一头"架构,能直接输出最多300个筛选后的检测结果,无需额外的后处理步骤。
相关推荐
阿图灵1 小时前
OpenCV 图像特征与匹配:SIFT 特征检测与 BFMatcher 暴力匹配
图像处理·人工智能·python·opencv·计算机视觉·sift
Mr数据杨1 小时前
商店商品销量预测助力库存优化
人工智能·数据分析·kaggle竞赛
东方佑1 小时前
202 个参数干掉 59 万个参数:ConvLinear 的设计、融合与实战
人工智能
唯创知音1 小时前
电动车仪表语音芯片方案 速度、电量、故障三语播报用WT588F02-8S-C
人工智能·语音识别·电动车仪表语音芯片方案
前沿在线1 小时前
Vbot ATOM发布,人形机器人进入产品化时刻
人工智能·ai·大模型
武子康1 小时前
Claude 已经给文本加水印了吗?真正缺的不是声明,而是逐模型状态
人工智能·llm·agent
人工智能培训1 小时前
通用人工智能AGI发展的潜在风险与管控思路
人工智能·agi
liukuang1101 小时前
商汤2026上半年盈利6.2亿元,生成式AI业务占比近80%
大数据·人工智能
poiu12346571 小时前
AI FDE技术学习平台对比测评 2026零基础技术学习参考
人工智能·学习