自动驾驶图像分割开源数据集指南(2026)

2026 年 8 月 · 开源数据笔记

做分割几乎都从 Cityscapes 下起,下完才发现:BDD 名字带 100K,有分割标签的只有 10K*_color.png 不能当监督;SYNTHIA 的 13/16 类 mIoU 和 Cityscapes 19 类不能写在同一格。下面按任务和场景整理我核对过官网的集合,只收带像素级或点级分割标注的。命令以 2026-08 仍能打开的入口为准,404 时回到项目主页,不要死磕旧直链。

目录

  1. 任务、指标、标签
  2. 怎么选、有多大
  3. [2D 语义分割](#2D 语义分割)
    1. Cityscapes
    2. BDD100K
    3. [Mapillary Vistas](#Mapillary Vistas)
    4. ApolloScape
    5. A2D2
    6. [KITTI / CamVid / KITTI-360 / comma10k](#KITTI / CamVid / KITTI-360 / comma10k)
  4. 实例、全景、视频
  5. 点云和多模态
  6. 恶劣天气和域偏移
  7. 合成数据
  8. 车道、鱼眼、非结构化、越野、开集
  9. 下载、许可、接到训练代码
  10. 参考文献
  11. [附录:Cityscapes 19 类](#附录:Cityscapes 19 类)

1. 任务、指标、标签

语义、实例、全景不是三种画法,是三种监督。标注格式和 Loss 对不上,后面全白做。

任务 每个像素 / 点输出 常用指标 典型用途
语义分割 类别(所有车都是 car mIoU 路面、天空、植被
实例分割 类别 + 实例 ID AP 跟踪、避障
全景分割 stuff 用语义,thing 用实例 PQ 完整场景
视频全景 / MOTS 再加跨帧(跨相机)ID STQ、VPQ 时序、跟踪分割
LiDAR 语义 / 全景 三维点类别 mIoU、PQ 夜间、测距、BEV
车道 / 可行驶区域 线或区域 mask F1、IoU 横向控制

Cityscapes 的 19 个评测类是默认协议。BDD100K、ACDC、GTA5、Foggy Cityscapes 都按它对齐,换协议要在论文里写清楚。

mIoU(忽略 255 / void):

式 (1) 语义分割 mIoU,计算时忽略 void / 255

PQ(IoU > 0.5 才算匹配)17

式 (2) 全景分割 PQ,匹配要求 IoU > 0.5 17

视频全景还要算时序关联,单帧 PQ 代替不了 STQ。异常分割看 AuPRC / FPR95,和 mIoU 不是一回事。

文件 是什么 训练时
*_gtFine_labelIds.png Cityscapes 0--33 的官方 ID 不要直接当 19 类目标
*_labelTrainIds.png 0--18,255 = ignore MMSeg 默认吃这个
*_color.png 伪彩可视化 不能算 CrossEntropy
*_instanceIds.png Cityscapes:labelId * 1000 + instId(stuff 常为 labelId),16-bit 存 JPEG 就坏了
BDD bitmask 通道里塞类别和实例 格式见 BDD 文档
COCO panoptic JSON + PNG Detectron2 / Mask2Former 和单通道 ID 图不是一种东西
SemanticKITTI .label 低 16 位语义,高 16 位实例 .bin 逐点对齐

Cityscapes 19 类颜色(trainId,数值见文末附录):

2. 怎么选、有多大

先定任务和域,再看谁更大。

你要做的事 先下这个 不够再加
复现论文、对榜 Cityscapes 精标 KITTI SemSeg 只有 200 张,只够冒烟
天气、昼夜 BDD100K 10k ACDC、WildDash
全球细类、杂设备 Mapillary Vistas v2 ---
中国城市、大分辨率 ApolloScape ---
非结构化混合交通 IDD ---
雨雾雪夜 ACDC Foggy Cityscapes、Dark Zurich
合成预训 / UDA GTA5 或 SYNTHIA SHIFT、VIPER
点云语义 SemanticKITTI SemanticPOSS
相机 + 激光(+ 雷达) nuScenes 或 A2D2 Waymo
跨帧跨相机实例 Waymo PVPS KITTI-STEP
鱼眼 / 泊车 WoodScape A2D2 环视
越野 RELLIS-3D、RUGD ORFD
开集障碍 Fishyscapes、LostAndFound RoadAnomaly21
磁盘紧、先跑通代码 CamVid、nuScenes mini ---

分割常用子集的体量:CamVid / KITTI 语义 / comma10k 小于 5 GB;Cityscapes 精标、BDD 10k、ACDC、IDD、GTA5 大约 5--30 GB;Mapillary、SemanticKITTI、KITTI-360 的 2D 部分到 150 GB;nuScenes / A2D2 / Waymo / Apollo 全套是几百 GB 到数 TB。不要为了训 SemSeg 去下 BDD 视频或 nuScenes 的全部 sweep。

下面这张表只列带分割监督、引用多的集合。测试集真值大多不公开,分数要交官方服务器。

数据集 任务 规模 入口
CamVid 2008 语义 701 32 / 常用 11 剑桥 主页
KITTI SemSeg 2018 语义+实例 200+200 19 卡尔斯鲁厄 评测页
Cityscapes 2016 语义+实例+全景 5k 精 + 20k 粗 评测 19 欧陆 50 城 cityscapes-dataset.com
Mapillary Vistas 2017 语义+实例 25k 66 / v2 为 124 六大洲 Vistas
BDD100K 2018 语义+实例+全景+车道 分割 10k 19 纽约、湾区,天气昼夜 下载文档
ApolloScape 2018 场景解析+车道 约 14.7 万帧 25+ 中国多城 apolloscape.auto
IDD 2019 语义+实例 10k 34(四级) 印度 IDD
A2D2 2020 语义+实例+3D 框 4.1 万标帧 38 德国,6 相机 5 激光 GitHub Pages
ACDC 2021 语义+实例+全景 5509 精标 19 雾/夜/雨/雪 acdc.vision.ee.ethz.ch
WildDash 2 2020 语义 4k+ 兼容 CS 长尾、脏镜头 wilddash.cc
KITTI-360 2022 2D/3D 语义+实例 32 万图 / 10 万扫描 标注 37 / 评测 19 73.7 km KITTI-360
SemanticKITTI 2019 点云语义+全景 4.3 万扫描 标注 28 / 单帧评测 19 KITTI 里程计 semantic-kitti.org
nuScenes-lidarseg 2020 点云语义+全景 4 万关键帧 32 波士顿、新加坡 nuscenes.org
nuImages 2020 2D 语义+实例 9.3 万 23 同 nuScenes nuImages
Waymo PVPS 2022 环视视频全景 10 万图 / 2860 段 28 美三城,5 相机 waymo.com/open
GTA5 2016 合成语义 24966 19 GTA V visinf
SYNTHIA 2016 合成语义 RAND-CS 约 9.4k 13 或 16 Unity synthia-dataset.net
SHIFT 2022 多任务合成 连续域偏移 多任务 CARLA SHIFT
VIPER 2017 语义+光流+位姿 25 万帧 32 GTA V 视频 playing-for-benchmarks.org
WoodScape 2019 鱼眼语义+实例 每任务约 8k--10k 40+ Valeo 四鱼眼 GitHub
comma10k 2020 实用语义 10k+ 控制向少数类 通勤前视 comma10k
RELLIS-3D 2020 越野图+点云 6235 图 / 13556 扫描 20 德州越野 GitHub
RUGD 2019 越野语义 7k+ 24 非结构化地面 RUGD
Fishyscapes 2019 异常分割 基于 CS / LostAndFound 开集 OOD fishyscapes.com

3. 2D 语义分割

Cityscapes

Cordts 等,CVPR 2016 1。到现在还是默认对照集。立体相机左图 leftImg8bit,2048×1024;精标 train/val/test = 2975/500/1525,另有约 2 万张粗标。30 类定义,评测用 19 类。白天、春夏秋,几乎没有夜晚和暴雨。须注册,默认非商用。

语义最低只要两个包:

文件 大约 packageID md5
gtFine_trainvaltest.zip 241 MB 1 4237c19de34c8a376e9ba46b495d6f66
leftImg8bit_trainvaltest.zip 11 GB 3 0a6e97e94b616a514066c9e2adb0c97f

常用扩展:gtCoarse(ID=2)、leftImg8bit_trainextra(ID=4,约 44 GB)、序列帧 leftImg8bit_sequence(标注帧是 30 帧片段里的第 20 帧,前面 19、后面 10)。注册后在 Downloads 拉,或:

复制代码
wget --keep-session-cookies --save-cookies=cookies.txt \
  --post-data '/cdn-cgi/l/email-protection&password=YOUR_PASSWORD&submit=Login' \
  --delete-after [https://www.cityscapes-dataset.com/login/](https://www.cityscapes-dataset.com/login/)

wget -c -t 0 --load-cookies cookies.txt --content-disposition \
  '[https://www.cityscapes-dataset.com/file-handling/?packageID=1](https://www.cityscapes-dataset.com/file-handling/?packageID=1)'
wget -c -t 0 --load-cookies cookies.txt --content-disposition \
  '[https://www.cityscapes-dataset.com/file-handling/?packageID=3](https://www.cityscapes-dataset.com/file-handling/?packageID=3)'

账号密码不要写进仓库。解压后应是:

复制代码
cityscapes/
├── leftImg8bit/{train,val,test}/<city>/*_leftImg8bit.png
└── gtFine/{train,val,test}/<city>/
        *_gtFine_labelIds.png
        *_gtFine_instanceIds.png
        *_gtFine_color.png
        *_gtFine_polygons.json

pip install cityscapesscripts
export CITYSCAPES_DATASET=/data/cityscapes
csCreateTrainIdLabelImgs

国内镜像可查 OpenDataLab,许可证不因镜像而改变。

BDD100K

Yu 等,CVPR 2020 2。100k 视频里抽帧做检测和车道;语义 / 实例 / 全景只标了 10k(7k/1k/2k),约 1280×720,19 类。天气和昼夜比 Cityscapes 全得多。

复制代码
# 文件名以 [https://doc.bdd100k.com/download.html](https://doc.bdd100k.com/download.html) 为准
# ETH 目录:[https://dl.cv.ethz.ch/bdd100k/data/](https://dl.cv.ethz.ch/bdd100k/data/)
wget -c [https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_images_10k.zip](https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_images_10k.zip)
wget -c [https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_sem_seg_labels_trainval.zip](https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_sem_seg_labels_trainval.zip)
# 需要实例 / 全景再下这两个
wget -c [https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_ins_seg_labels_trainval.zip](https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_ins_seg_labels_trainval.zip)
wget -c [https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_pan_seg_labels_trainval.zip](https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_pan_seg_labels_trainval.zip)

10k 图像文档里写过 md5 08f26aecceda982568063d3d5873378e。目录:

复制代码
bdd100k/images/10k/{train,val,test}/
bdd100k/labels/sem_seg/masks/{train,val}/

车道和可行驶区域用的是 100k 图像,不是这 10k。

Mapillary Vistas

Neuhold 等,ICCV 2017 3。众包街景,手机到车载都有。v1.2 为 66 类 / 37 个实例类,v2.0 扩到 124 / 70。划分 18k/2k/5k,大约 20--30 GB。申请页,现由 Meta 维护,条款以页面为准(长期是非商用)。包里的 config.json 有类别和颜色。网上的 HF 镜像代替不了官方授权。

ApolloScape

百度 Apollo 4。场景解析大约 14.7 万帧,分辨率到 3384×2710 量级,约 25 类,另有车道和三维语义。国内车流和标线比 Cityscapes 密。入口 apolloscape.auto,CDN 按路段打包:

复制代码
aria2c -x 16 -s 16 -c [https://ad-apolloscape.cdn.bcebos.com/road01_ins.tar.gz](https://ad-apolloscape.cdn.bcebos.com/road01_ins.tar.gz)

文件名以官网当前列表为准。社区有一份 aria2 清单,下载前对照一遍。

A2D2

Audi,arXiv:2004.06320 5。6×2.3MP 相机 + 5 个 16 线激光,已对好时间和外参。41,277 张非连续帧有语义和实例(38 类),其中 12,497 张带前视范围内的 3D 框;另有 392,556 帧连续序列(无语义标注,含配准深度)。总线里有方向盘、油门、IMU。许可证是 CC BY-ND 4.0:可商用,不能把改过的数据再分发。

官网现在推荐(无需 AWS 账号):

复制代码
aws s3 ls --no-sign-request s3://audi-autonomous-driving-dataset/
# 旧版整包 tar 仍在 s3://aev-autonomous-driving-dataset/

文件列表以 a2d2-dataset.github.io 为准,体积很大,先列目录再下子集。

KITTI SemSeg、CamVid、KITTI-360、comma10k

KITTI 语义 8 只有约 200/200,类别往 Cityscapes 靠,只够测流水线:评测页

CamVid 701 张,原 32 类,论文里常用 11 类:

复制代码
wget -c [https://s3.amazonaws.com/fast-ai-imagelocal/camvid.tgz](https://s3.amazonaws.com/fast-ai-imagelocal/camvid.tgz)

KITTI-360 9 是 73.7 km 连续跑,约 32 万图、10 万扫描;三维图元投影到图像,2D/3D 标签一致。标注 37 类(24 个 instance + 13 个 stuff),评测与 Cityscapes 对齐为 19 类。透视训练图大约 128 GB,注册后用官网脚本分块下:下载页

复制代码
pip install git+[https://github.com/autonomousvision/kitti360Scripts.git](https://github.com/autonomousvision/kitti360Scripts.git)
export KITTI360_DATASET=/data/KITTI-360

comma10k 把类压到路、线、不可行驶、可移动物、自车这种控制向标签,不追求 19 类 mIoU:GitHub

4. 实例、全景、视频

同一批图往往三种标签都有,缺哪个补哪个包。

语义 实例 全景
Cityscapes csCreatePanopticImgs
BDD 10k
Mapillary / ACDC / IDD 可转
nuImages 可转,约 9.3 万张
复制代码
csCreatePanopticImgs --dataset-folder /data/cityscapes \
  --output-folder /data/cityscapes/gtFine_panoptic

nuImages 是 nuScenes 的二维分割/检测集,不是 lidarseg。https://www.nuscenes.org/nuimages(https://www.nuscenes.org/nuimages)

单帧 mIoU 高,连续帧照样会闪。视频全景要 ID 跨帧稳定,环视还要跨相机。

  • Cityscapes 序列包 leftImg8bit_sequence:每段 30 帧,第 20 帧有精标;视频全景另需 Cityscapes-VPS 标注。
  • KITTI-STEP:评测页
  • Waymo PVPS 12:5 相机、28 类、约 10 万图、2860 段,ID 跨相机且跨时间。下载走 waymo.com/open 当前文档(需同意许可,路径以官网为准)。
  • BDD MOTS 2020 看下载页的 seg_track_20
  • DriveSeg(MIT-IBM)是连续视频逐帧语义,适合看闪不闪。

5. 点云和多模态

图像夜里和强光会挂,点云补测距。不少工作把点云投成球面/柱面,后面仍是 2D 分割网络。

SemanticKITTI 10:给 KITTI 里程计全序列打了点级标签,共 28 类(含移动/静止区分);单帧语义评测合并后为 19 类。划分 23,201 / 20,351。激光是 Velodyne HDL-64E。

复制代码
# 点云和标定:[https://www.cvlibs.net/datasets/kitti/eval_odometry.php](https://www.cvlibs.net/datasets/kitti/eval_odometry.php)
# data_odometry_velodyne.zip(约 80 GB)+ data_odometry_calib.zip
wget -c [http://www.semantic-kitti.org/assets/data_odometry_labels.zip](http://www.semantic-kitti.org/assets/data_odometry_labels.zip)

必须拼成 sequences/00/velodyne/*.binlabels/*.label 对齐,外加 calib.txtposes.txt

nuScenes-lidarseg 11:1000 个 20 秒场景,波士顿 + 新加坡,6 相机 + 32 线 + 5 雷达,32 类,约 4 万关键帧。先下 mini 看目录:

复制代码
wget -c [https://www.nuscenes.org/data/v1.0-mini.tgz](https://www.nuscenes.org/data/v1.0-mini.tgz)
wget -c [https://www.nuscenes.org/data/nuScenes-lidarseg-mini-v1.0.tar.bz2](https://www.nuscenes.org/data/nuScenes-lidarseg-mini-v1.0.tar.bz2)
mkdir -p /data/sets/nuscenes
tar -xf v1.0-mini.tgz -C /data/sets/nuscenes
tar -xf nuScenes-lidarseg-mini-v1.0.tar.bz2 -C /data/sets/nuscenes
pip install nuscenes-devkit

全量把 samples/sweeps/maps/v1.0-trainval/lidarseg/panoptic/ 解到同一根目录,别互相覆盖。只有关键帧有 lidarseg,sweep 不能套关键帧标签。

其余:PandaSet(Hesai 64 线)、SemanticPOSS(校园、人多)、ScribbleKITTI(涂鸦弱监督)。A2D2 和 KITTI-360 的图像标签可以投到已配准的激光上。

6. 恶劣天气和域偏移

只在 Cityscapes 上拟合,等于只认德国晴天。

ACDC 6 按 Cityscapes 19 类精标,可直接做 normal→adverse。雾 / 夜 / 雨 / 雪大约各 1000 张,另有对应晴天参考图;合计 5509 张有全景级标注,恶劣图还带不确定区域 mask。每条件大致 400/100/500(夜间 val 106)。https://acdc.vision.ee.ethz.ch(https://acdc.vision.ee.ethz.ch)

更小、更偏的:Dark Zurich(夜间精标 201 张 + 大量无标)、Nighttime Driving(50 张)、Foggy Cityscapes(在 CS 上渲染三级雾,标签复用 gtFine,下载)、Foggy Zurich / Foggy Driving、Raincouver。

WildDash 专门收过曝、脏镜头、畸变、罕见物,适合当压力测试,不宜当唯一训练集。https://wilddash.cc/(https://wilddash.cc/)

7. 合成数据

标签不要钱,域差在纹理和光学。常见协议是 GTA5 / SYNTHIA → Cityscapes / BDD / ACDC。

GTA5(Playing for Data)13:24,966 张,约 1914×1052,映射到 19 类。研究用途,还要遵守游戏发行条款。图像和标签各 10 个 part:https://download.visinf.tu-darmstadt.de/data/from_games/(https://download.visinf.tu-darmstadt.de/data/from_games/)

SYNTHIA 14:UDA 里最常用 RAND-CITYSCAPES,约 9,400 张。和 Cityscapes 重叠 13 或 16 类,混报 19 类 mIoU 会对不上。标签经常是 16-bit PNG。

复制代码
wget --no-check-certificate [http://synthia-dataset.cvc.uab.cat/SYNTHIA_RAND_CITYSCAPES.rar](http://synthia-dataset.cvc.uab.cat/SYNTHIA_RAND_CITYSCAPES.rar)
unrar x SYNTHIA_RAND_CITYSCAPES.rar

VIPER 是 GTA V 视频(语义+光流+位姿,约 25 万帧)。SHIFT 用 CARLA 做连续域偏移(天气、时刻、密度),见 SHIFT。自己刷数据可以直接上 CARLA。

8. 车道、鱼眼、非结构化、越野、开集

车道论文多用关键点或多项式;要按分割训,用 BDD / Apollo / Mapillary 的像素标签。

复制代码
# 图像用 BDD 100k,不是 10k
wget -c [https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_drivable_labels_trainval.zip](https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_drivable_labels_trainval.zip)
wget -c [https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_lane_labels_trainval.zip](https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_lane_labels_trainval.zip)

可行驶三类:本车道 / 其他可行驶 / 背景。Apollo 车道包名类似 road02_ins_lane.tar.gz。CULane、TuSimple、OpenLane 是检测/3D 车道,不是稠密 SemSeg 榜。

WoodScape 15 是 Valeo 四路鱼眼,还有深度和镜头脏污。针孔 Cityscapes 权重直接上环视,边缘会很难看。申请:https://github.com/valeoai/WoodScape(https://github.com/valeoai/WoodScape)

IDD 7:10,004 张、182 段、34 类四级层级(可塌成 7/16/26),有三轮车、动物、drivable fallback。目录仿 Cityscapes。https://idd.insaan.iiit.ac.in/dataset/download/(https://idd.insaan.iiit.ac.in/dataset/download/)

Kaggle 上别人转好的 mask 只能练手,正式实验用官方 JSON。

中国公开的稠密分割仍然主要是 ApolloScape。D²-City 以检测/跟踪为主,有没有分割看当年条款。

模态 规模 入口
RELLIS-3D 16 RGB + LiDAR 6235 / 13556,20 类 GitHub
RUGD RGB 7k+,24 类 主页
ORFD 越野可行驶 --- GitHub 搜 ORFD

城里训的模型零样本到越野基本不能用。

开集看的是没见过的掉落物、隔离桶,指标是异常像素的 TPR/FPR,不是 mIoU。LostAndFound(路上小障碍,成像接近 CS)、Fishyscapes、RoadAnomaly21、StreetHazards(CARLA)。LostAndFound:主页

9. 下载、许可、接到训练代码

注册 → 只下要用的子集 → wget -c / aria2 / gsutil → md5 → 按官方目录解压 → 转 trainIds 或 COCO panoptic。

复制代码
aria2c -x 16 -s 16 -c -o data.zip 'URL'
md5sum data.zip

官方源用于写论文和交榜。OpenDataLab 国内带宽好一些,原协议仍在。Hugging Face 上要先确认是不是官方授权。Cityscapes / KITTI / Waymo / nuScenes 不要把需登录的包传到网盘群里

常见限制(以官网 TOS 为准)
Cityscapes、KITTI、SemanticKITTI 非商用,禁止再分发
Mapillary Vistas 非商用、署名、相同方式共享
BDD100K 自有许可,研究可用
A2D2 CC BY-ND 4.0,可商用,不能改编后再分发数据
Waymo、nuScenes 注册;禁止用于监视等;商用另议
GTA5、VIPER 游戏素材,仅研究
ApolloScape Apollo 开放数据条款

2D 集接到 MMSeg,最后都是 leftImg8bit + gtFineimages + annotations,见 数据准备文档。Detectron2 走 COCO panoptic。

复制代码
from torchvision.datasets import Cityscapes
from torchvision.transforms import ToTensor

ds = Cityscapes("/data/cityscapes", split="val", mode="fine",
                target_type="semantic", transform=ToTensor())
img, mask = ds[0]  # mask 是 labelIds,先转 trainIds 再进 Loss

labelId → trainId 不要手抄一半,用 cityscapesscripts.helpers.labels,或直接读生成好的 *_labelTrainIds.png

磁盘紧的话:先 Cityscapes 精标,再 BDD 10k,再在 ACDC 和 GTA5 里按课题二选一,点云用 SemanticKITTI 或 nuScenes mini。

刷 CS 榜:精标 + ImageNet/Mapillary 预训练,UDA 再加 GTA5 或 SYNTHIA。

想覆盖真实驾驶:CS + BDD 10k + ACDC,目标地区再加 IDD 或 Apollo。

环视泊车不要只训针孔。越野用 RELLIS + RUGD。开集在主模型外加 Fishyscapes / LostAndFound。

实际栽过的:

  1. labelIds*_color.png 直接算 19 类 CE
  2. SYNTHIA 13/16 类和 CS 19 类写在同一张表
  3. 分割下成 BDD 100k
  4. 用非官方 test 真值(CS / ACDC / KITTI)
  5. 2048×1024 和 1280×720 随便 resize,细杆和灯没了
  6. 鱼眼不处理畸变,套针孔预训练
  7. 16-bit instance 图存成 JPEG
  8. nuScenes 非关键帧点云套了 lidarseg

参考文献

1 Cordts M, Omran M, Ramos S, et al. The Cityscapes Dataset for Semantic Urban Scene UnderstandingC//CVPR, 2016. Cityscapes Dataset -- Semantic Understanding of Urban Street Scenes

2 Yu F, Chen H, Wang X, et al. BDD100K: A Diverse Driving Dataset for Heterogeneous Multitask LearningC//CVPR, 2020. https://doc.bdd100k.com/

3 Neuhold G, Ollmann T, Rota Bulò S, et al. The Mapillary Vistas Dataset for Semantic Understanding of Street ScenesC//ICCV, 2017. https://www.mapillary.com/dataset/vistas

4 Huang X, Cheng X, Geng Q, et al. The ApolloScape Dataset for Autonomous DrivingJ. arXiv:1803.06184, 2018. http://apolloscape.auto/

5 Geyer J, Kassahun Y, Mahmudi M, et al. A2D2: Audi Autonomous Driving DatasetJ. arXiv:2004.06320, 2020. A2D2: Audi Autonomous Driving Dataset

6 Sakaridis C, Dai D, Van Gool L. ACDC: The Adverse Conditions Dataset with Correspondences for Robust Semantic Driving Scene PerceptionJ. arXiv:2104.13395. ACDC Dataset

7 Varma G, Subramanian A, Namboodiri A, et al. IDD: A Dataset for Exploring Problems of Autonomous Navigation in Unstructured EnvironmentsC//WACV, 2019. IDD

8 Geiger A, Lenz P, Urtasun R. Are we ready for Autonomous Driving? The KITTI Vision Benchmark SuiteC//CVPR, 2012. The KITTI Vision Benchmark Suite

9 Liao Y, Xie J, Geiger A. KITTI-360: A Novel Dataset and Benchmarks for Urban Scene Understanding in 2D and 3DJ. IEEE TPAMI, 2022. KITTI-360

10 Behley J, Garbade M, Milioto A, et al. SemanticKITTI: A Dataset for Semantic Scene Understanding of LiDAR SequencesC//ICCV, 2019. SemanticKITTI - A Dataset for LiDAR-based Semantic Scene Understanding

11 Caesar H, Bankiti V, Lang A H, et al. nuScenes: A Multimodal Dataset for Autonomous DrivingC//CVPR, 2020. https://www.nuscenes.org/

12 Mei J, Zhu A Z, Yan X, et al. Waymo Open Dataset: Panoramic Video Panoptic SegmentationC//ECCV, 2022. https://waymo.com/open

13 Richter S R, Vineet V, Roth S, et al. Playing for Data: Ground Truth from Computer GamesC//ECCV, 2016. Playing for Data: Ground Truth from Computer Games

14 Ros G, Sellart L, Materzynska J, et al. The SYNTHIA Dataset: A Large Collection of Synthetic Images for Semantic Segmentation of Urban ScenesC//CVPR, 2016. The SYNTHIA dataset

15 Yogamani S, Hughes C, Horgan J, et al. WoodScape: A Multi-Task, Multi-Camera Fisheye Dataset for Autonomous DrivingC//ICCV, 2019. GitHub - valeoai/WoodScape: The repository containing tools and information about the WoodScape dataset. · GitHub

16 Jiang P, Osteen P, Wigness M, et al. RELLIS-3D Dataset: Data, Benchmarks and AnalysisJ. arXiv:2011.12954, 2020. GitHub - unmannedlab/RELLIS-3D: RELLIS-3D: A Multi-modal Dataset for Off-Road Robotics · GitHub

17 Kirillov A, He K, Girshick R, et al. Panoptic SegmentationC//CVPR, 2019.

18 Sun T, Segu M, Postels J, et al. SHIFT: A Synthetic Driving Dataset for Continuous Multi-Task Domain AdaptationC//CVPR, 2022. https://www.vis.xyz/shift/

19 Blum H, Sarlin P E, Nieto J, et al. The Fishyscapes Benchmark: Measuring Blind Spots in Semantic SegmentationJ. IJCV, 2021. The Fishyscapes Benchmark - The Fishyscapes Benchmark

20 Zendel O, Honauer K, Murschitz M, et al. WildDash --- Creating Hazard-Aware BenchmarksC//ECCV, 2018. WildDash 2 Benchmark

MMSeg 数据准备:Tutorial 2: Prepare datasets --- MMSegmentation 1.2.2 documentation

nuScenes lidarseg 教程:nuscenes_lidarseg_panoptic_tutorial

附录 Cityscapes 19 类 trainId

trainId R,G,B
0 road 128, 64, 128
1 sidewalk 244, 35, 232
2 building 70, 70, 70
3 wall 102, 102, 156
4 fence 190, 153, 153
5 pole 153, 153, 153
6 traffic light 250, 170, 30
7 traffic sign 220, 220, 0
8 vegetation 107, 142, 35
9 terrain 152, 251, 152
10 sky 70, 130, 180
11 person 220, 20, 60
12 rider 255, 0, 0
13 car 0, 0, 142
14 truck 0, 0, 70
15 bus 0, 60, 100
16 train 0, 80, 100
17 motorcycle 0, 0, 230
18 bicycle 119, 11, 32
255 ignore 0, 0, 0

配图为示意。数据许可以各数据集官方条款为准。

相关推荐
A13345551 小时前
视频特效字幕怎么翻译?保姆级AI字幕与外挂字幕教程
人工智能·音视频
飞哥数智坊1 小时前
我给 DeepSeek 看了两次截图,才发现 Vision 真正的价值
人工智能·ai编程·deepseek
deepseek231 小时前
商汤开源SenseNova U1.5 Lite拆解:8B装下原生统一多模态,NEO-Unify架构与4K图像生成的三笔工程账
开源·多模态大模型·ai agent
飞哥数智坊1 小时前
AI提升了人效,但组织却接不住释放的生产力
人工智能
飞哥数智坊2 小时前
什么才叫真正的端到端?
人工智能
武科大许志伟2 小时前
从并行进化到分布式进化计算读 A Survey on Distributed Evolutionary Computation
人工智能·分布式·演化计算
长谷深风1112 小时前
好的 Tool Schema,不是字段越全越好
java·大数据·人工智能·ai agent·agent工作流·智能体设计·ai产品设计
Moon上有月亮2 小时前
Ollama 完全指南:本地大语言模型的“开箱即用”方案
人工智能·语言模型·自然语言处理·ollama
sel_92 小时前
【Docker】Docker 安装与使用详解:从零搭建到日常实战
人工智能·深度学习·算法·docker