2026 年 8 月 · 开源数据笔记
做分割几乎都从 Cityscapes 下起,下完才发现:BDD 名字带 100K,有分割标签的只有 10K ;*_color.png 不能当监督;SYNTHIA 的 13/16 类 mIoU 和 Cityscapes 19 类不能写在同一格。下面按任务和场景整理我核对过官网的集合,只收带像素级或点级分割标注的。命令以 2026-08 仍能打开的入口为准,404 时回到项目主页,不要死磕旧直链。

目录
- 任务、指标、标签
- 怎么选、有多大
- [2D 语义分割](#2D 语义分割)
- Cityscapes
- BDD100K
- [Mapillary Vistas](#Mapillary Vistas)
- ApolloScape
- A2D2
- [KITTI / CamVid / KITTI-360 / comma10k](#KITTI / CamVid / KITTI-360 / comma10k)
- 实例、全景、视频
- 点云和多模态
- 恶劣天气和域偏移
- 合成数据
- 车道、鱼眼、非结构化、越野、开集
- 下载、许可、接到训练代码
- 参考文献
- [附录:Cityscapes 19 类](#附录:Cityscapes 19 类)
1. 任务、指标、标签
语义、实例、全景不是三种画法,是三种监督。标注格式和 Loss 对不上,后面全白做。
| 任务 | 每个像素 / 点输出 | 常用指标 | 典型用途 |
|---|---|---|---|
| 语义分割 | 类别(所有车都是 car) |
mIoU | 路面、天空、植被 |
| 实例分割 | 类别 + 实例 ID | AP | 跟踪、避障 |
| 全景分割 | stuff 用语义,thing 用实例 | PQ | 完整场景 |
| 视频全景 / MOTS | 再加跨帧(跨相机)ID | STQ、VPQ | 时序、跟踪分割 |
| LiDAR 语义 / 全景 | 三维点类别 | mIoU、PQ | 夜间、测距、BEV |
| 车道 / 可行驶区域 | 线或区域 mask | F1、IoU | 横向控制 |
Cityscapes 的 19 个评测类是默认协议。BDD100K、ACDC、GTA5、Foggy Cityscapes 都按它对齐,换协议要在论文里写清楚。
mIoU(忽略 255 / void):

式 (1) 语义分割 mIoU,计算时忽略 void / 255
PQ(IoU > 0.5 才算匹配)17:

式 (2) 全景分割 PQ,匹配要求 IoU > 0.5 17
视频全景还要算时序关联,单帧 PQ 代替不了 STQ。异常分割看 AuPRC / FPR95,和 mIoU 不是一回事。
| 文件 | 是什么 | 训练时 |
|---|---|---|
*_gtFine_labelIds.png |
Cityscapes 0--33 的官方 ID | 不要直接当 19 类目标 |
*_labelTrainIds.png |
0--18,255 = ignore | MMSeg 默认吃这个 |
*_color.png |
伪彩可视化 | 不能算 CrossEntropy |
*_instanceIds.png |
Cityscapes:labelId * 1000 + instId(stuff 常为 labelId),16-bit |
存 JPEG 就坏了 |
| BDD bitmask | 通道里塞类别和实例 | 格式见 BDD 文档 |
| COCO panoptic JSON + PNG | Detectron2 / Mask2Former | 和单通道 ID 图不是一种东西 |
SemanticKITTI .label |
低 16 位语义,高 16 位实例 | 和 .bin 逐点对齐 |
Cityscapes 19 类颜色(trainId,数值见文末附录):


2. 怎么选、有多大
先定任务和域,再看谁更大。
| 你要做的事 | 先下这个 | 不够再加 |
|---|---|---|
| 复现论文、对榜 | Cityscapes 精标 | KITTI SemSeg 只有 200 张,只够冒烟 |
| 天气、昼夜 | BDD100K 10k | ACDC、WildDash |
| 全球细类、杂设备 | Mapillary Vistas v2 | --- |
| 中国城市、大分辨率 | ApolloScape | --- |
| 非结构化混合交通 | IDD | --- |
| 雨雾雪夜 | ACDC | Foggy Cityscapes、Dark Zurich |
| 合成预训 / UDA | GTA5 或 SYNTHIA | SHIFT、VIPER |
| 点云语义 | SemanticKITTI | SemanticPOSS |
| 相机 + 激光(+ 雷达) | nuScenes 或 A2D2 | Waymo |
| 跨帧跨相机实例 | Waymo PVPS | KITTI-STEP |
| 鱼眼 / 泊车 | WoodScape | A2D2 环视 |
| 越野 | RELLIS-3D、RUGD | ORFD |
| 开集障碍 | Fishyscapes、LostAndFound | RoadAnomaly21 |
| 磁盘紧、先跑通代码 | CamVid、nuScenes mini | --- |
分割常用子集的体量:CamVid / KITTI 语义 / comma10k 小于 5 GB;Cityscapes 精标、BDD 10k、ACDC、IDD、GTA5 大约 5--30 GB;Mapillary、SemanticKITTI、KITTI-360 的 2D 部分到 150 GB;nuScenes / A2D2 / Waymo / Apollo 全套是几百 GB 到数 TB。不要为了训 SemSeg 去下 BDD 视频或 nuScenes 的全部 sweep。
下面这张表只列带分割监督、引用多的集合。测试集真值大多不公开,分数要交官方服务器。
| 数据集 | 年 | 任务 | 规模 | 类 | 域 | 入口 |
|---|---|---|---|---|---|---|
| CamVid | 2008 | 语义 | 701 | 32 / 常用 11 | 剑桥 | 主页 |
| KITTI SemSeg | 2018 | 语义+实例 | 200+200 | 19 | 卡尔斯鲁厄 | 评测页 |
| Cityscapes | 2016 | 语义+实例+全景 | 5k 精 + 20k 粗 | 评测 19 | 欧陆 50 城 | cityscapes-dataset.com |
| Mapillary Vistas | 2017 | 语义+实例 | 25k | 66 / v2 为 124 | 六大洲 | Vistas |
| BDD100K | 2018 | 语义+实例+全景+车道 | 分割 10k | 19 | 纽约、湾区,天气昼夜 | 下载文档 |
| ApolloScape | 2018 | 场景解析+车道 | 约 14.7 万帧 | 25+ | 中国多城 | apolloscape.auto |
| IDD | 2019 | 语义+实例 | 10k | 34(四级) | 印度 | IDD |
| A2D2 | 2020 | 语义+实例+3D 框 | 4.1 万标帧 | 38 | 德国,6 相机 5 激光 | GitHub Pages |
| ACDC | 2021 | 语义+实例+全景 | 5509 精标 | 19 | 雾/夜/雨/雪 | acdc.vision.ee.ethz.ch |
| WildDash 2 | 2020 | 语义 | 4k+ | 兼容 CS | 长尾、脏镜头 | wilddash.cc |
| KITTI-360 | 2022 | 2D/3D 语义+实例 | 32 万图 / 10 万扫描 | 标注 37 / 评测 19 | 73.7 km | KITTI-360 |
| SemanticKITTI | 2019 | 点云语义+全景 | 4.3 万扫描 | 标注 28 / 单帧评测 19 | KITTI 里程计 | semantic-kitti.org |
| nuScenes-lidarseg | 2020 | 点云语义+全景 | 4 万关键帧 | 32 | 波士顿、新加坡 | nuscenes.org |
| nuImages | 2020 | 2D 语义+实例 | 9.3 万 | 23 | 同 nuScenes | nuImages |
| Waymo PVPS | 2022 | 环视视频全景 | 10 万图 / 2860 段 | 28 | 美三城,5 相机 | waymo.com/open |
| GTA5 | 2016 | 合成语义 | 24966 | 19 | GTA V | visinf |
| SYNTHIA | 2016 | 合成语义 | RAND-CS 约 9.4k | 13 或 16 | Unity | synthia-dataset.net |
| SHIFT | 2022 | 多任务合成 | 连续域偏移 | 多任务 | CARLA | SHIFT |
| VIPER | 2017 | 语义+光流+位姿 | 25 万帧 | 32 | GTA V 视频 | playing-for-benchmarks.org |
| WoodScape | 2019 | 鱼眼语义+实例 | 每任务约 8k--10k | 40+ | Valeo 四鱼眼 | GitHub |
| comma10k | 2020 | 实用语义 | 10k+ | 控制向少数类 | 通勤前视 | comma10k |
| RELLIS-3D | 2020 | 越野图+点云 | 6235 图 / 13556 扫描 | 20 | 德州越野 | GitHub |
| RUGD | 2019 | 越野语义 | 7k+ | 24 | 非结构化地面 | RUGD |
| Fishyscapes | 2019 | 异常分割 | 基于 CS / LostAndFound | 开集 | OOD | fishyscapes.com |
3. 2D 语义分割

Cityscapes
Cordts 等,CVPR 2016 1。到现在还是默认对照集。立体相机左图 leftImg8bit,2048×1024;精标 train/val/test = 2975/500/1525,另有约 2 万张粗标。30 类定义,评测用 19 类。白天、春夏秋,几乎没有夜晚和暴雨。须注册,默认非商用。
语义最低只要两个包:
| 文件 | 大约 | packageID | md5 |
|---|---|---|---|
gtFine_trainvaltest.zip |
241 MB | 1 | 4237c19de34c8a376e9ba46b495d6f66 |
leftImg8bit_trainvaltest.zip |
11 GB | 3 | 0a6e97e94b616a514066c9e2adb0c97f |
常用扩展:gtCoarse(ID=2)、leftImg8bit_trainextra(ID=4,约 44 GB)、序列帧 leftImg8bit_sequence(标注帧是 30 帧片段里的第 20 帧,前面 19、后面 10)。注册后在 Downloads 拉,或:
wget --keep-session-cookies --save-cookies=cookies.txt \
--post-data '/cdn-cgi/l/email-protection&password=YOUR_PASSWORD&submit=Login' \
--delete-after [https://www.cityscapes-dataset.com/login/](https://www.cityscapes-dataset.com/login/)
wget -c -t 0 --load-cookies cookies.txt --content-disposition \
'[https://www.cityscapes-dataset.com/file-handling/?packageID=1](https://www.cityscapes-dataset.com/file-handling/?packageID=1)'
wget -c -t 0 --load-cookies cookies.txt --content-disposition \
'[https://www.cityscapes-dataset.com/file-handling/?packageID=3](https://www.cityscapes-dataset.com/file-handling/?packageID=3)'
账号密码不要写进仓库。解压后应是:
cityscapes/
├── leftImg8bit/{train,val,test}/<city>/*_leftImg8bit.png
└── gtFine/{train,val,test}/<city>/
*_gtFine_labelIds.png
*_gtFine_instanceIds.png
*_gtFine_color.png
*_gtFine_polygons.json
pip install cityscapesscripts
export CITYSCAPES_DATASET=/data/cityscapes
csCreateTrainIdLabelImgs
国内镜像可查 OpenDataLab,许可证不因镜像而改变。
BDD100K
Yu 等,CVPR 2020 2。100k 视频里抽帧做检测和车道;语义 / 实例 / 全景只标了 10k(7k/1k/2k),约 1280×720,19 类。天气和昼夜比 Cityscapes 全得多。
# 文件名以 [https://doc.bdd100k.com/download.html](https://doc.bdd100k.com/download.html) 为准
# ETH 目录:[https://dl.cv.ethz.ch/bdd100k/data/](https://dl.cv.ethz.ch/bdd100k/data/)
wget -c [https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_images_10k.zip](https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_images_10k.zip)
wget -c [https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_sem_seg_labels_trainval.zip](https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_sem_seg_labels_trainval.zip)
# 需要实例 / 全景再下这两个
wget -c [https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_ins_seg_labels_trainval.zip](https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_ins_seg_labels_trainval.zip)
wget -c [https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_pan_seg_labels_trainval.zip](https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_pan_seg_labels_trainval.zip)
10k 图像文档里写过 md5 08f26aecceda982568063d3d5873378e。目录:
bdd100k/images/10k/{train,val,test}/
bdd100k/labels/sem_seg/masks/{train,val}/
车道和可行驶区域用的是 100k 图像,不是这 10k。
Mapillary Vistas
Neuhold 等,ICCV 2017 3。众包街景,手机到车载都有。v1.2 为 66 类 / 37 个实例类,v2.0 扩到 124 / 70。划分 18k/2k/5k,大约 20--30 GB。申请页,现由 Meta 维护,条款以页面为准(长期是非商用)。包里的 config.json 有类别和颜色。网上的 HF 镜像代替不了官方授权。
ApolloScape
百度 Apollo 4。场景解析大约 14.7 万帧,分辨率到 3384×2710 量级,约 25 类,另有车道和三维语义。国内车流和标线比 Cityscapes 密。入口 apolloscape.auto,CDN 按路段打包:
aria2c -x 16 -s 16 -c [https://ad-apolloscape.cdn.bcebos.com/road01_ins.tar.gz](https://ad-apolloscape.cdn.bcebos.com/road01_ins.tar.gz)
文件名以官网当前列表为准。社区有一份 aria2 清单,下载前对照一遍。
A2D2
Audi,arXiv:2004.06320 5。6×2.3MP 相机 + 5 个 16 线激光,已对好时间和外参。41,277 张非连续帧有语义和实例(38 类),其中 12,497 张带前视范围内的 3D 框;另有 392,556 帧连续序列(无语义标注,含配准深度)。总线里有方向盘、油门、IMU。许可证是 CC BY-ND 4.0:可商用,不能把改过的数据再分发。
官网现在推荐(无需 AWS 账号):
aws s3 ls --no-sign-request s3://audi-autonomous-driving-dataset/
# 旧版整包 tar 仍在 s3://aev-autonomous-driving-dataset/
文件列表以 a2d2-dataset.github.io 为准,体积很大,先列目录再下子集。
KITTI SemSeg、CamVid、KITTI-360、comma10k
KITTI 语义 8 只有约 200/200,类别往 Cityscapes 靠,只够测流水线:评测页
CamVid 701 张,原 32 类,论文里常用 11 类:
wget -c [https://s3.amazonaws.com/fast-ai-imagelocal/camvid.tgz](https://s3.amazonaws.com/fast-ai-imagelocal/camvid.tgz)
KITTI-360 9 是 73.7 km 连续跑,约 32 万图、10 万扫描;三维图元投影到图像,2D/3D 标签一致。标注 37 类(24 个 instance + 13 个 stuff),评测与 Cityscapes 对齐为 19 类。透视训练图大约 128 GB,注册后用官网脚本分块下:下载页
pip install git+[https://github.com/autonomousvision/kitti360Scripts.git](https://github.com/autonomousvision/kitti360Scripts.git)
export KITTI360_DATASET=/data/KITTI-360
comma10k 把类压到路、线、不可行驶、可移动物、自车这种控制向标签,不追求 19 类 mIoU:GitHub
4. 实例、全景、视频

同一批图往往三种标签都有,缺哪个补哪个包。
| 语义 | 实例 | 全景 | |
|---|---|---|---|
| Cityscapes | ✓ | ✓ | csCreatePanopticImgs |
| BDD 10k | ✓ | ✓ | ✓ |
| Mapillary / ACDC / IDD | ✓ | ✓ | 可转 |
| nuImages | ✓ | ✓ | 可转,约 9.3 万张 |
csCreatePanopticImgs --dataset-folder /data/cityscapes \
--output-folder /data/cityscapes/gtFine_panoptic
nuImages 是 nuScenes 的二维分割/检测集,不是 lidarseg。https://www.nuscenes.org/nuimages(https://www.nuscenes.org/nuimages)
单帧 mIoU 高,连续帧照样会闪。视频全景要 ID 跨帧稳定,环视还要跨相机。
- Cityscapes 序列包
leftImg8bit_sequence:每段 30 帧,第 20 帧有精标;视频全景另需 Cityscapes-VPS 标注。 - KITTI-STEP:评测页
- Waymo PVPS 12:5 相机、28 类、约 10 万图、2860 段,ID 跨相机且跨时间。下载走 waymo.com/open 当前文档(需同意许可,路径以官网为准)。
- BDD MOTS 2020 看下载页的
seg_track_20。 - DriveSeg(MIT-IBM)是连续视频逐帧语义,适合看闪不闪。
5. 点云和多模态

图像夜里和强光会挂,点云补测距。不少工作把点云投成球面/柱面,后面仍是 2D 分割网络。
SemanticKITTI 10:给 KITTI 里程计全序列打了点级标签,共 28 类(含移动/静止区分);单帧语义评测合并后为 19 类。划分 23,201 / 20,351。激光是 Velodyne HDL-64E。
# 点云和标定:[https://www.cvlibs.net/datasets/kitti/eval_odometry.php](https://www.cvlibs.net/datasets/kitti/eval_odometry.php)
# data_odometry_velodyne.zip(约 80 GB)+ data_odometry_calib.zip
wget -c [http://www.semantic-kitti.org/assets/data_odometry_labels.zip](http://www.semantic-kitti.org/assets/data_odometry_labels.zip)
必须拼成 sequences/00/velodyne/*.bin 与 labels/*.label 对齐,外加 calib.txt、poses.txt。
nuScenes-lidarseg 11:1000 个 20 秒场景,波士顿 + 新加坡,6 相机 + 32 线 + 5 雷达,32 类,约 4 万关键帧。先下 mini 看目录:
wget -c [https://www.nuscenes.org/data/v1.0-mini.tgz](https://www.nuscenes.org/data/v1.0-mini.tgz)
wget -c [https://www.nuscenes.org/data/nuScenes-lidarseg-mini-v1.0.tar.bz2](https://www.nuscenes.org/data/nuScenes-lidarseg-mini-v1.0.tar.bz2)
mkdir -p /data/sets/nuscenes
tar -xf v1.0-mini.tgz -C /data/sets/nuscenes
tar -xf nuScenes-lidarseg-mini-v1.0.tar.bz2 -C /data/sets/nuscenes
pip install nuscenes-devkit
全量把 samples/、sweeps/、maps/、v1.0-trainval/、lidarseg/、panoptic/ 解到同一根目录,别互相覆盖。只有关键帧有 lidarseg,sweep 不能套关键帧标签。
其余:PandaSet(Hesai 64 线)、SemanticPOSS(校园、人多)、ScribbleKITTI(涂鸦弱监督)。A2D2 和 KITTI-360 的图像标签可以投到已配准的激光上。
6. 恶劣天气和域偏移

只在 Cityscapes 上拟合,等于只认德国晴天。
ACDC 6 按 Cityscapes 19 类精标,可直接做 normal→adverse。雾 / 夜 / 雨 / 雪大约各 1000 张,另有对应晴天参考图;合计 5509 张有全景级标注,恶劣图还带不确定区域 mask。每条件大致 400/100/500(夜间 val 106)。https://acdc.vision.ee.ethz.ch(https://acdc.vision.ee.ethz.ch)
更小、更偏的:Dark Zurich(夜间精标 201 张 + 大量无标)、Nighttime Driving(50 张)、Foggy Cityscapes(在 CS 上渲染三级雾,标签复用 gtFine,下载)、Foggy Zurich / Foggy Driving、Raincouver。
WildDash 专门收过曝、脏镜头、畸变、罕见物,适合当压力测试,不宜当唯一训练集。https://wilddash.cc/(https://wilddash.cc/)
7. 合成数据

标签不要钱,域差在纹理和光学。常见协议是 GTA5 / SYNTHIA → Cityscapes / BDD / ACDC。
GTA5(Playing for Data)13:24,966 张,约 1914×1052,映射到 19 类。研究用途,还要遵守游戏发行条款。图像和标签各 10 个 part:https://download.visinf.tu-darmstadt.de/data/from_games/(https://download.visinf.tu-darmstadt.de/data/from_games/)
SYNTHIA 14:UDA 里最常用 RAND-CITYSCAPES,约 9,400 张。和 Cityscapes 重叠 13 或 16 类,混报 19 类 mIoU 会对不上。标签经常是 16-bit PNG。
wget --no-check-certificate [http://synthia-dataset.cvc.uab.cat/SYNTHIA_RAND_CITYSCAPES.rar](http://synthia-dataset.cvc.uab.cat/SYNTHIA_RAND_CITYSCAPES.rar)
unrar x SYNTHIA_RAND_CITYSCAPES.rar
VIPER 是 GTA V 视频(语义+光流+位姿,约 25 万帧)。SHIFT 用 CARLA 做连续域偏移(天气、时刻、密度),见 SHIFT。自己刷数据可以直接上 CARLA。
8. 车道、鱼眼、非结构化、越野、开集

车道论文多用关键点或多项式;要按分割训,用 BDD / Apollo / Mapillary 的像素标签。
# 图像用 BDD 100k,不是 10k
wget -c [https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_drivable_labels_trainval.zip](https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_drivable_labels_trainval.zip)
wget -c [https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_lane_labels_trainval.zip](https://bdd-data-storage-release.s3.us-west-2.amazonaws.com/bdd100k/2021/bdd100k_lane_labels_trainval.zip)
可行驶三类:本车道 / 其他可行驶 / 背景。Apollo 车道包名类似 road02_ins_lane.tar.gz。CULane、TuSimple、OpenLane 是检测/3D 车道,不是稠密 SemSeg 榜。
WoodScape 15 是 Valeo 四路鱼眼,还有深度和镜头脏污。针孔 Cityscapes 权重直接上环视,边缘会很难看。申请:https://github.com/valeoai/WoodScape(https://github.com/valeoai/WoodScape)

IDD 7:10,004 张、182 段、34 类四级层级(可塌成 7/16/26),有三轮车、动物、drivable fallback。目录仿 Cityscapes。https://idd.insaan.iiit.ac.in/dataset/download/(https://idd.insaan.iiit.ac.in/dataset/download/)
Kaggle 上别人转好的 mask 只能练手,正式实验用官方 JSON。
中国公开的稠密分割仍然主要是 ApolloScape。D²-City 以检测/跟踪为主,有没有分割看当年条款。

| 模态 | 规模 | 入口 | |
|---|---|---|---|
| RELLIS-3D 16 | RGB + LiDAR | 6235 / 13556,20 类 | GitHub |
| RUGD | RGB | 7k+,24 类 | 主页 |
| ORFD | 越野可行驶 | --- | GitHub 搜 ORFD |
城里训的模型零样本到越野基本不能用。
开集看的是没见过的掉落物、隔离桶,指标是异常像素的 TPR/FPR,不是 mIoU。LostAndFound(路上小障碍,成像接近 CS)、Fishyscapes、RoadAnomaly21、StreetHazards(CARLA)。LostAndFound:主页
9. 下载、许可、接到训练代码
注册 → 只下要用的子集 → wget -c / aria2 / gsutil → md5 → 按官方目录解压 → 转 trainIds 或 COCO panoptic。
aria2c -x 16 -s 16 -c -o data.zip 'URL'
md5sum data.zip
官方源用于写论文和交榜。OpenDataLab 国内带宽好一些,原协议仍在。Hugging Face 上要先确认是不是官方授权。Cityscapes / KITTI / Waymo / nuScenes 不要把需登录的包传到网盘群里。
| 常见限制(以官网 TOS 为准) | |
|---|---|
| Cityscapes、KITTI、SemanticKITTI | 非商用,禁止再分发 |
| Mapillary Vistas | 非商用、署名、相同方式共享 |
| BDD100K | 自有许可,研究可用 |
| A2D2 | CC BY-ND 4.0,可商用,不能改编后再分发数据 |
| Waymo、nuScenes | 注册;禁止用于监视等;商用另议 |
| GTA5、VIPER | 游戏素材,仅研究 |
| ApolloScape | Apollo 开放数据条款 |
2D 集接到 MMSeg,最后都是 leftImg8bit + gtFine 或 images + annotations,见 数据准备文档。Detectron2 走 COCO panoptic。
from torchvision.datasets import Cityscapes
from torchvision.transforms import ToTensor
ds = Cityscapes("/data/cityscapes", split="val", mode="fine",
target_type="semantic", transform=ToTensor())
img, mask = ds[0] # mask 是 labelIds,先转 trainIds 再进 Loss
labelId → trainId 不要手抄一半,用 cityscapesscripts.helpers.labels,或直接读生成好的 *_labelTrainIds.png。
磁盘紧的话:先 Cityscapes 精标,再 BDD 10k,再在 ACDC 和 GTA5 里按课题二选一,点云用 SemanticKITTI 或 nuScenes mini。
刷 CS 榜:精标 + ImageNet/Mapillary 预训练,UDA 再加 GTA5 或 SYNTHIA。
想覆盖真实驾驶:CS + BDD 10k + ACDC,目标地区再加 IDD 或 Apollo。
环视泊车不要只训针孔。越野用 RELLIS + RUGD。开集在主模型外加 Fishyscapes / LostAndFound。
实际栽过的:
labelIds或*_color.png直接算 19 类 CE- SYNTHIA 13/16 类和 CS 19 类写在同一张表
- 分割下成 BDD 100k
- 用非官方 test 真值(CS / ACDC / KITTI)
- 2048×1024 和 1280×720 随便 resize,细杆和灯没了
- 鱼眼不处理畸变,套针孔预训练
- 16-bit instance 图存成 JPEG
- nuScenes 非关键帧点云套了 lidarseg
参考文献
1 Cordts M, Omran M, Ramos S, et al. The Cityscapes Dataset for Semantic Urban Scene UnderstandingC//CVPR, 2016. Cityscapes Dataset -- Semantic Understanding of Urban Street Scenes
2 Yu F, Chen H, Wang X, et al. BDD100K: A Diverse Driving Dataset for Heterogeneous Multitask LearningC//CVPR, 2020. https://doc.bdd100k.com/
3 Neuhold G, Ollmann T, Rota Bulò S, et al. The Mapillary Vistas Dataset for Semantic Understanding of Street ScenesC//ICCV, 2017. https://www.mapillary.com/dataset/vistas
4 Huang X, Cheng X, Geng Q, et al. The ApolloScape Dataset for Autonomous DrivingJ. arXiv:1803.06184, 2018. http://apolloscape.auto/
5 Geyer J, Kassahun Y, Mahmudi M, et al. A2D2: Audi Autonomous Driving DatasetJ. arXiv:2004.06320, 2020. A2D2: Audi Autonomous Driving Dataset
6 Sakaridis C, Dai D, Van Gool L. ACDC: The Adverse Conditions Dataset with Correspondences for Robust Semantic Driving Scene PerceptionJ. arXiv:2104.13395. ACDC Dataset
7 Varma G, Subramanian A, Namboodiri A, et al. IDD: A Dataset for Exploring Problems of Autonomous Navigation in Unstructured EnvironmentsC//WACV, 2019. IDD
8 Geiger A, Lenz P, Urtasun R. Are we ready for Autonomous Driving? The KITTI Vision Benchmark SuiteC//CVPR, 2012. The KITTI Vision Benchmark Suite
9 Liao Y, Xie J, Geiger A. KITTI-360: A Novel Dataset and Benchmarks for Urban Scene Understanding in 2D and 3DJ. IEEE TPAMI, 2022. KITTI-360
10 Behley J, Garbade M, Milioto A, et al. SemanticKITTI: A Dataset for Semantic Scene Understanding of LiDAR SequencesC//ICCV, 2019. SemanticKITTI - A Dataset for LiDAR-based Semantic Scene Understanding
11 Caesar H, Bankiti V, Lang A H, et al. nuScenes: A Multimodal Dataset for Autonomous DrivingC//CVPR, 2020. https://www.nuscenes.org/
12 Mei J, Zhu A Z, Yan X, et al. Waymo Open Dataset: Panoramic Video Panoptic SegmentationC//ECCV, 2022. https://waymo.com/open
13 Richter S R, Vineet V, Roth S, et al. Playing for Data: Ground Truth from Computer GamesC//ECCV, 2016. Playing for Data: Ground Truth from Computer Games
14 Ros G, Sellart L, Materzynska J, et al. The SYNTHIA Dataset: A Large Collection of Synthetic Images for Semantic Segmentation of Urban ScenesC//CVPR, 2016. The SYNTHIA dataset
15 Yogamani S, Hughes C, Horgan J, et al. WoodScape: A Multi-Task, Multi-Camera Fisheye Dataset for Autonomous DrivingC//ICCV, 2019. GitHub - valeoai/WoodScape: The repository containing tools and information about the WoodScape dataset. · GitHub
16 Jiang P, Osteen P, Wigness M, et al. RELLIS-3D Dataset: Data, Benchmarks and AnalysisJ. arXiv:2011.12954, 2020. GitHub - unmannedlab/RELLIS-3D: RELLIS-3D: A Multi-modal Dataset for Off-Road Robotics · GitHub
17 Kirillov A, He K, Girshick R, et al. Panoptic SegmentationC//CVPR, 2019.
18 Sun T, Segu M, Postels J, et al. SHIFT: A Synthetic Driving Dataset for Continuous Multi-Task Domain AdaptationC//CVPR, 2022. https://www.vis.xyz/shift/
19 Blum H, Sarlin P E, Nieto J, et al. The Fishyscapes Benchmark: Measuring Blind Spots in Semantic SegmentationJ. IJCV, 2021. The Fishyscapes Benchmark - The Fishyscapes Benchmark
20 Zendel O, Honauer K, Murschitz M, et al. WildDash --- Creating Hazard-Aware BenchmarksC//ECCV, 2018. WildDash 2 Benchmark
MMSeg 数据准备:Tutorial 2: Prepare datasets --- MMSegmentation 1.2.2 documentation
nuScenes lidarseg 教程:nuscenes_lidarseg_panoptic_tutorial
附录 Cityscapes 19 类 trainId
| trainId | 类 | R,G,B |
|---|---|---|
| 0 | road | 128, 64, 128 |
| 1 | sidewalk | 244, 35, 232 |
| 2 | building | 70, 70, 70 |
| 3 | wall | 102, 102, 156 |
| 4 | fence | 190, 153, 153 |
| 5 | pole | 153, 153, 153 |
| 6 | traffic light | 250, 170, 30 |
| 7 | traffic sign | 220, 220, 0 |
| 8 | vegetation | 107, 142, 35 |
| 9 | terrain | 152, 251, 152 |
| 10 | sky | 70, 130, 180 |
| 11 | person | 220, 20, 60 |
| 12 | rider | 255, 0, 0 |
| 13 | car | 0, 0, 142 |
| 14 | truck | 0, 0, 70 |
| 15 | bus | 0, 60, 100 |
| 16 | train | 0, 80, 100 |
| 17 | motorcycle | 0, 0, 230 |
| 18 | bicycle | 119, 11, 32 |
| 255 | ignore | 0, 0, 0 |
配图为示意。数据许可以各数据集官方条款为准。