遇见数据集

checo1092/Continual_Learning_for_Autonomous_Driving

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

Carla Doker Final Packed 是一个用于自动驾驶领域持续学习的基准数据集,基于CARLA 0.9.15模拟器构建。该数据集包含7个不同的城镇,每个城镇有7个紧凑域(涵盖不同天气和NPC条件),共49个基础任务,490个episodes,总计490,000帧数据。数据以tar分片格式存储,包含RGB图像、语义分割标签、LiDAR点云和车辆状态(state.csv)等多种模态。数据集采用固定的空间划分(训练、验证、测试集),确保同一驾驶走廊在不同条件下不会同时出现在训练和评估中。该数据集旨在研究领域转移下的持续学习,评估自动驾驶感知和控制模型的灾难性遗忘问题,并支持基于KAN的模块化持续学习实验和从多模态数据进行的模仿学习基线研究。

Carla Doker Final Packed is a benchmark dataset for continual learning in autonomous driving, built on the CARLA 0.9.15 simulator. It includes 7 towns, each with 7 compact domains (covering various weather and NPC conditions), resulting in 49 base tasks, 490 episodes, and 490,000 frames. The data is distributed as tar shards and contains multiple modalities: RGB images, semantic segmentation labels, LiDAR point clouds, and vehicle state (state.csv). The dataset uses a frozen spatial split (train, validation, test sets) to prevent the same driving corridor from appearing in both training and evaluation under different conditions. It is designed for continual learning under domain shift, evaluating catastrophic forgetting in autonomous driving perception and control models, and supports KAN-based modular continual learning experiments and imitation learning baselines from multimodal data.

提供机构:
checo1092
搜集汇总
数据集介绍
checo1092/Continual_Learning_for_Autonomous_Driving 数据集图片
构建方式
该数据集基于CARLA 0.9.15仿真器构建,专为自动驾驶领域的持续学习任务设计。数据收集覆盖7个城镇,每个城镇包含7个紧凑域,共计49个基础任务和490个完整驾驶片段,帧数达49万。每个片段由RGB图像、语义分割标签、激光雷达点云及车辆状态数据组成,并以tar分片形式存储,通过Git LFS追踪。数据划分采用空间冻结策略,依据CARLA生成索引将10个代表性起点分为8个训练、1个验证和1个测试,确保同一驾驶走廊不会以不同天气或NPC条件同时出现在训练与评估集中,有效降低空间泄漏。
特点
本数据集的显著特色在于其精心设计的域迁移结构。视觉语义分析表明,城镇间的域迁移幅度显著大于天气与NPC变化,使城镇成为主导的分布偏移维度;而控制感知分析进一步揭示,NPC变化对驾驶难度的影响远超单纯天气变化,尤其在速度轮廓、制动行为和转向修正方面。每个紧凑域通过天气、光照与NPC密度的组合(如夜间、浓雾、暴雨、高车辆密度等)实现多层级域渐变,为评估持续学习模型的灾难性遗忘与适应能力提供了极具挑战性的基准环境。
使用方法
推荐的数据使用流程为先克隆不含数据文件的代码仓库,再利用Git LFS按需下载特定城镇的tar分片,随后解压至本地文件系统以进行训练与评估。解压后每个城镇的数据以train/val/test子目录组织,每个驾驶片段包含同步对齐的多模态帧。研究者可根据实验目标选择性下载部分城镇,无需获取全量数据。高级用户也可直接基于tar分片实现流式加载,避免磁盘占用。该数据集适用于模仿学习、持续学习、域迁移分析及基于KAN的模块化持续学习实验。
背景与挑战
背景概述
该数据集于2024年由研究人员基于CARLA 0.9.15模拟器创建,旨在为自动驾驶领域的持续学习研究提供标准化基准。其核心研究问题聚焦于自动驾驶系统在遭受领域偏移(如城镇变化、天气条件、交通参与者密度差异)时,如何通过持续学习机制克服灾难性遗忘并保持鲁棒性能。数据集由七个不同城镇、每个城镇七个紧凑域(涵盖晴朗、夜晚、雾天、暴雨、高车流等场景)构成,共计490个情节、49万个标注帧,包含RGB图像、语义分割、激光雷达点云及车辆状态等多模态数据。该数据集通过冻结空间划分和轨迹质量筛选,确保了训练、验证和测试集之间的低空间泄露,为持续学习、模仿学习及灾难性遗忘评估提供了高质量、可复现的实验平台。
当前挑战
数据集旨在应对两大核心挑战:其一,自动驾驶感知与控制系统在连续面对不同城镇、天气和交通条件时,如何有效适应领域分布转移并抑制灾难性遗忘,这是持续学习领域亟待突破的难题——传统独立同分布假设下的模型在动态驾驶环境中往往性能急剧退化。其二,数据集构建过程中面临严苛的空间泄漏控制挑战:为避免同一驾驶走廊在不同领域条件下同时出现在训练和评估集,需通过冻结空间划分、轨迹质量与路线多样性筛选,从数百个候选生成点中精确选取10个代表性空间位置(8训练、1验证、1测试),并确保每个城镇的7个紧凑域复用相同空间槽位。此外,还需通过CLIP、MMD-RBF及控制感知分析等多元度量严格验证域分离程度,确保数据集的多样性和挑战性。
常用场景
经典使用场景
该数据集专为自动驾驶领域的持续学习(Continual Learning)研究而设计,其核心使用场景聚焦于模拟域迁移(Domain Shift)环境下智能体感知与决策能力的渐进式演化。通过在CARLA模拟器中精心构建跨越7个城镇、7种紧凑域(涵盖昼夜交替、雨雾天气、交通参与者密度变化等复杂条件)的49个基任务,研究者能够系统性地评估模型在遭遇视觉外观、场景语义及控制动态显著差异时,如何在不遗忘旧知识的前提下适应新环境。经典实验范式以模仿学习为基线,利用多模态输入(RGB图像、语义分割、LiDAR点云及车辆状态)训练端到端驾驶策略,并在冻结的空间划分(8训练/1验证/1测试轨迹)下反复评测遗忘曲线与泛化边界,从而量化持续学习算法的鲁棒性。
衍生相关工作
该数据集已催生一系列具影响力的持续学习驾驶研究工作。基于其精心划分的域层级,衍生工作探索了渐进式语义分割框架,在连续接纳新城镇数据时通过知识蒸馏维持旧场景的分割精度;另有工作利用其控制特征分析结论,专门设计了关注制动与转向修正概率分布的遗忘损失函数,使得模型在遭遇NPC密度突变时能优先保持安全关键策略。沿着基任务链式评估协议,研究者构建了基于模仿学习的增量训练管道,提出基于记忆簇的回顾机制,其性能曲线在该基准上揭示了简单回放策略在高域间方差下的局限性。最新趋势是将KAN(Kolmogorov-Arnold Networks)模块嵌入持续学习管线,利用其可解释性分析域间特征重用的退化模式。这些衍生工作共同将该基准确立为持续学习自动驾驶社区的标准评估环,推动着理论算法向实际部署的跨越。
数据集最近研究
最新研究方向
在自动驾驶领域,持续学习正逐步成为应对动态环境变化与域迁移挑战的核心范式。该数据集基于CARLA 0.9.15模拟器构建,涵盖7座城镇、49个基础任务及约49万帧多模态数据(RGB、语义分割、LiDAR与车辆状态),专为评估域迁移下的连续学习性能而设计。其创新之处在于采用冻结空间划分策略,通过轨迹质量与路径多样性指标选取10个代表性出生点,并跨7个紧致域复用同一空间槽位,从而有效隔绝训练与评测之间的路线泄露。结合CLIP视觉语义、MMD-RBF分布差异及控制感知分析,研究揭示了城镇差异是驱动视觉与控制域偏移的主导因素,而NPC扰动相较于天气变化在驾驶难度上更具影响。该工作为模仿学习、灾难性遗忘缓解及KAN模块化连续学习实验提供了标准化基准,推动了自动驾驶系统在非平稳环境下鲁棒泛化的前沿探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务