行人细分目标检测数据集:3类别、4,000张图像 | 目标检测
源码数据分享
通过网盘分享的文件:自动驾驶中行人目标检测数据集
链接: https://pan.baidu.com/s/1kf2rn-TAcibccWLAIAsepw?pwd=i4j7
提取码: i4j7
一、从"检测人"到"理解人":自动驾驶感知的语义跃迁
行人检测是自动驾驶视觉感知系统中最关键也最复杂的任务之一。说它关键,是因为在所有交通参与者中,行人是脆弱性最高的群体------一次检测失败可能导致不可挽回的后果;说它复杂,是因为行人的行为具有最强的不可预测性------他们可能突然横穿、折返、驻足或加速,这些行为的变化往往在毫秒之间发生。
传统的行人检测系统将所有人员统一标注为"person"单一类别,这种简化方式虽然在检测阶段降低了难度,但为下游的行为预测与决策模块带来了严重的语义信息缺失。当自动驾驶系统仅仅知道"前方有人"时,它无法判断这个人是否会进入行驶路径、是否正在等待过街、还是仅仅站在路边观望------而这三类行为对车辆决策的影响截然不同。
本数据集的创新之处在于,将行人目标细分为pedestrian、ped和people三类,从数据层面为自动驾驶系统注入了行为语义先验,使得检测模型的输出不再只是"人在哪里",而是"什么状态的人在做什么"。

1.1 三类行人的行为语义深度解读
pedestrian(行为行人):具有明显行为特征的行人目标,通常出现在车辆行驶路径附近。这是三类中对自动驾驶决策影响最大的类别------pedestrian正在进行某种与交通相关的行为(横穿道路、进入车道、在路边移动等),其下一步的动作方向直接关系到车辆的安全决策。
从驾驶策略角度看,检测到pedestrian时,系统应进入"高度警觉"状态:降低车速、预留制动距离、预测行人的可能运动轨迹。如果pedestrian正在横穿道路,系统需要判断其横穿速度和剩余距离,决定是减速让行还是紧急制动。
ped(旁观人员):远距离或旁观状态的人员目标,通常出现在道路两侧、隔离区域或远距离区域。与pedestrian的关键区别在于------ped当前并未处于与车辆产生交互的行为状态中,他们可能只是站在路边等车、在人行道上行走、或在商业街闲逛。
检测到ped时,系统应进入"持续关注"状态:不急于采取减速动作,但需要持续跟踪ped的状态变化------一旦ped开始向车道方向移动(即可能转化为pedestrian),系统应及时调整策略。这种"潜在风险"的预判能力,正是细粒度分类带来的核心价值。
people(人群):出现在人员密集区域的群体目标,如商圈、学校、景区等。人群的检测与单个行人的检测有本质差异------人群的行为不是单个行人行为的简单叠加,而是具有群体动力学特征的复杂现象:群体边缘的人可能被"裹挟"进入车道、人群中的个体行为更难以预测、人群的流动方向可能突然改变。
检测到people时,系统应进入"区域规避"状态:不是针对某个个体进行行为预测,而是将整个人群区域视为高风险区域,提前减速并规划远离人群的通行路径。这种"区域级"的风险评估,是粗粒度"person"标签无法支撑的。
1.2 三类行人的典型场景映射
| 场景 | 主要目标 | 系统策略 |
|---|---|---|
| 城市道路常规行驶 | pedestrian | 行为预测+轨迹规划 |
| 城郊公路行驶 | ped | 持续跟踪+状态监测 |
| 商圈/学校人流密集区 | people | 区域规避+减速通行 |
| 低速泊车/园区道路 | pedestrian+ped | 协同检测+精准避让 |
二、数据集全景解读
2.1 数据集基本信息
| 参数 | 数值 |
|---|---|
| 图像总量 | 近4000张 |
| 训练集 | 2680张 |
| 验证集 | 523张 |
| 测试集 | 525张 |
| 检测类别 | 3类(pedestrian/ped/people) |
| 标注格式 | YOLO格式 |
| 数据来源 | 真实道路场景 |
2.2 目录结构
plaintext
├── images/
│ ├── train/
│ ├── val/
│ └── test/
└── labels/
├── train/
├── val/
└── test/
2.3 配置文件
yaml
names:
- pedestrian
- ped
- people
nc: 3

三、数据构建方法论:自动驾驶场景数据的采集与标注
3.1 场景规划
数据集覆盖了自动驾驶中最典型的道路场景:
- 城市街道:交通路口、人行横道、公交站点,pedestrian的主要出现场景
- 城郊公路:道路两侧的行人与非机动车道,ped的主要出现场景
- 商圈与学校:人流密集区域,people的主要出现场景
- 园区道路:低速场景,三类目标混合出现
3.2 标注策略
三类行人的标注遵循以下判定标准:
pedestrian标注条件:
- 位于道路区域或即将进入道路区域
- 正在移动或表现出移动意图(身体朝向道路、脚步朝向车道)
- 与车辆行驶路径存在潜在交叉
ped标注条件:
- 位于人行道、广场等非道路区域
- 当前未表现出进入道路的意图
- 与车辆行驶路径暂无直接交叉风险
people标注条件:
- 多人密集聚集(≥3人紧密相邻)
- 位于商圈、校园等典型人流密集区域
- 群体行为特征明显(同向移动、聚集等待等)
3.3 标注难点与处理
状态转换:行人从pedestrian变为ped(如行人走过斑马线到达对岸),或从ped变为pedestrian(如路边行人突然向车道方向走),在单帧图像中难以判断。处理方式是按照当前帧的瞬时状态标注,时序转换由跟踪模块处理。
人群中的个体:在people标注区域内,可能同时存在个别pedestrian或ped目标的标注。这种情况下,先标注整体people区域,再对其中行为特征明确的个体单独标注为pedestrian或ped。
遮挡处理:被车辆或设施部分遮挡的行人,若行为特征仍可辨识则正常标注;若遮挡超过70%且无法判断行为状态,则不标注。
四、模型训练与优化实战
4.1 基准训练
python
from ultralytics import YOLO
model = YOLO("yolov8s.pt")
model.train(
data="dataset.yaml",
epochs=120,
imgsz=640,
batch=16,
patience=25
)
4.2 针对自动驾驶场景的优化
多尺度训练:自动驾驶场景中,行人的尺度变化范围极大------从远处仅占几个像素的小目标到近处占据大半个画面的行人。建议启用多尺度训练(imgsz范围480-1280),提升模型对不同尺度目标的适应能力。
时序一致性约束:在视频流中,同一行人的类别标签在连续帧间应保持一致(除非发生真实的状态转换)。可在推理时加入时序一致性约束,通过Viterbi解码等方式平滑类别标签序列,减少帧间抖动。
误检代价不对称:在自动驾驶场景中,漏检行人的代价远高于误检。因此,建议适当降低置信度阈值(如0.3而非0.5),以提升召回率。误检可以通过后续的行为分析模块过滤。
注意力机制:集成CBAM或SE注意力模块,帮助模型聚焦于行人的关键行为区域(如头部朝向、身体倾斜方向、脚步朝向等),提升细粒度分类能力。
4.3 类别混淆处理
pedestrian与ped之间的混淆是本数据集最常见的分类错误。缓解策略包括:
- 增加边界样本:在训练集中增加两类行为之间的过渡样本,帮助模型学习更精确的决策边界
- 对比学习:使用SupCon等对比学习损失函数,拉近同类样本的特征距离,推远不同类样本的特征距离
- 后处理规则:基于位置先验(如是否在人行横道附近)对分类结果进行修正

五、从检测到决策:自动驾驶感知系统的完整架构
5.1 感知-预测-决策流水线
摄像头 → 行人检测(YOLO) → 目标跟踪 → 行为预测 → 决策规划 → 车辆控制
↓ ↓
3类行人分类 轨迹预测+意图分析
行人检测模块:输出三类行人的位置、尺寸与类别信息
目标跟踪模块:使用BoT-SORT等算法,将逐帧检测结果关联为轨迹,计算行人的运动速度与方向
行为预测模块:基于检测类别(pedestrian/ped/people)与轨迹特征,预测行人未来3-5秒的运动轨迹
决策规划模块:根据行人预测轨迹与车辆规划路径的交叉关系,决定减速、让行或绕行策略
5.2 类别驱动的差异化决策
| 检测类别 | 预测优先级 | 决策策略 |
|---|---|---|
| pedestrian | 最高 | 主动减速+轨迹预测+预留安全距离 |
| ped | 中等 | 持续监测+状态转换预判 |
| people | 高 | 区域规避+群体行为分析 |
5.3 部署方案
硬件平台 :NVIDIA Orin/Xavier系列车载计算平台
推理框架 :TensorRT FP16量化
推理延迟 :640分辨率下单帧<10ms
多摄像头融合:支持6-8路摄像头输入的并行推理
六、扩展研究方向
6.1 行人意图预测
在检测分类的基础上,进一步预测行人的行为意图------是否要过马路、是否要改变方向、是否会突然停下。这需要更精细的行为建模与更丰富的时序信息。
6.2 跨域适应
将模型迁移到不同城市、不同天气条件下的道路场景。域适应技术(如Adaptive Teacher等)可以在不重新标注的情况下,将模型适配到新的环境。
6.3 多模态融合
融合激光雷达点云与视觉图像,利用点云提供的精确距离信息与视觉提供的语义信息,实现更全面的行人感知。
七、总结
本自动驾驶行人目标检测数据集(近4000张高质量标注图像),通过将行人细分为pedestrian、ped、people三类,从数据层面为自动驾驶感知系统注入了行为语义先验。这种细粒度分类设计不仅提升了检测模型的信息输出量,更为下游的行为预测与决策模块提供了更丰富的语义支撑。
对于从事自动驾驶、智能交通与计算机视觉研究的开发者而言,该数据集不仅是一份高质量的训练资源,更是一种"从检测到理解"的数据设计范式。随着自动驾驶技术向更高级别的自动化演进,对行人的细粒度感知与行为理解将成为系统安全性的关键保障,而高质量数据集将持续推动这一领域的技术突破。
