遇见数据集

基于AVstack和CARLA的合成数据集

收藏
arXiv2026-06-03 更新2026-06-05 收录
官方服务:

资源简介:

该数据集是一个基于AVstack框架和CARLA模拟器生成的大规模多传感器、多智能体合成数据集,由杜克大学研究团队创建。数据集内容涵盖地面车辆、空中平台和基础设施部署的同步感知数据,包括RGB图像、深度图、语义分割、激光雷达和雷达等多种模态,总规模可达TB级别,例如一个10分钟的多传感器实例即包含20万图像和310万标注对象。数据集通过可配置的生成流程创建,支持对智能体数量、传感器配置、天气条件和交通场景的灵活控制,并利用几何可见性算法进行精准标注。该数据集旨在支持自动驾驶领域中的特定应用感知训练、跨域评估以及多智能体协同算法研究,为解决真实数据稀缺性、视角多样性和协同感知复杂性等挑战提供可控实验平台。

This large-scale multi-sensor, multi-agent synthetic dataset is generated based on the AVstack framework and CARLA simulator, and developed by the research team from Duke University. It covers synchronized perception data collected from ground vehicles, aerial platforms and infrastructure deployments, including multiple modalities such as RGB images, depth maps, semantic segmentation outputs, LiDAR and radar data. The total scale of the dataset can reach the terabyte level; for example, a 10-minute multi-sensor instance contains 200,000 images and 3.1 million annotated objects. The dataset is built through a configurable generation pipeline, which enables flexible control over the number of agents, sensor configurations, weather conditions and traffic scenarios. It leverages geometric visibility algorithms to generate precise annotations. This dataset is designed to support application-specific perception training, cross-domain evaluation and multi-agent collaborative algorithm research in the autonomous driving field, providing a controllable experimental platform to address challenges including real-world data scarcity, viewpoint diversity and the complexity of collaborative perception.

创建时间:
2026-06-03
搜集汇总
数据集介绍
基于AVstack和CARLA的合成数据集 数据集图片
构建方式
该数据集依托AVstack框架与CARLA仿真器,构建了一套模块化的数据生成管线。管线通过人类可读的配置文件定义智能体、非玩家角色及传感器套件,经由同步CARLA客户端推进场景,并以固定仿真速率记录传感器数据与物体真实状态。后处理阶段借助AVstack参考帧系统,将全局物体真值转化为每个局部传感器坐标系下的标签,并通过几何可见性算法滤除被遮挡物体。最终,数据被整理为兼容COCO等标准格式的结构,支持下游任务直接调用。
特点
该数据集的核心特点在于其高度的可配置性与领域覆盖的广度。用户能够独立调控智能体数量、传感器类型与安装几何、天气条件、交通密度及通信拓扑等关键参数,从而实现从地面车辆、空中平台到基础设施传感器的多领域数据生成。这一设计突破了传统固定数据集在传感器高度、视角、域迁移及罕见场景(如严重遮挡、传感器退化)上的局限性,为多传感器、多智能体系统的可控实验提供了前所未有的灵活性。
使用方法
数据集通过AVstack数据集管理器暴露标准接口,可直接加载至MMDetection、MMDetection3D等主流训练框架中。研究人员可利用生成的数据进行领域特定的感知模型训练,如评估从车辆视角训练的目标检测模型在基础设施或空中视角下的迁移性能。此外,数据支持多智能体协同融合研究,可通过调整关联假设(如无相关、弱相关、强相关)来评估不同融合策略在分布式传感器网络中的鲁棒性,亦可用于安全与信任评估的实验场景构建。
背景与挑战
背景概述
在自主系统领域,多传感器、多智能体与多域学习的规模化发展长期受限于真实世界数据集的获取成本高、标注难度大以及场景覆盖有限等瓶颈。杜克大学电气与计算机工程系的R. Spencer Hallyburton、David Hunt与Miroslav Pajic于2026年提出了基于AVstack框架与CARLA仿真器的合成数据集生成管道,该工作发表于arXiv预印本。其核心研究问题在于构建一个可配置、可重复的模块化数据生成流程,以支持地面、空中及基础设施等多种平台下的协同感知与学习任务。该管道的出现弥补了KITTI、nuScenes等经典数据集在平台类型、传感器布局、天气条件及多智能体交互等方面的维度缺失,为探索视点偏移、通信拓扑与传感器退化等控制变量下的自主系统研究提供了实验基底,对推动协作式自动驾驶的规模化评估具有重要影响力。
当前挑战
该数据集所解决的领域问题聚焦于自主感知与融合体系在多样化场景下的泛化性与可控性挑战。传统数据集往往受限于单一平台与传感器配置,难以系统性地评估视角高度、传感器退化、遮挡模式及多智能体通信拓扑对性能的影响。构建过程中面临的挑战主要涵盖三方面:其一,如何在CARLA仿真环境中生成跨越地面、空中及基础设施的异构传感器数据,并保证各坐标系下的标签一致性;其二,必须开发基于几何可视性算法的后处理管道,以精确判断物体在视锥内的遮挡状态,避免简单地将所有视野内物体视为可见正样本;其三,需要设计模块化配置接口,使得采集过程支持对智能体数量、传感器套件、天气与交通组成等参数的灵活控制,同时保持与下游训练框架的兼容性,从而支持安全分析、融合策略与视觉-语言模型等应用研究。
常用场景
经典使用场景
该数据集广泛用于多传感器、多智能体与多领域自主系统的可扩展学习研究。其经典使用方式包括作为可控的实验平台,生成带有精确地面真值标签的合成数据,覆盖地面车辆、空中平台与基础设施传感器等多种部署形态。研究者可通过配置文件灵活调节传感器类型、视角高度、天气条件、交通密度以及智能体数量,从而系统性地评估感知算法在不同场景下的鲁棒性与泛化能力。这一特性使其成为研究域迁移、传感器布局优化以及多视角融合策略的理想基准,尤其适用于需要大规模、多样性标注数据的监督学习任务。
衍生相关工作
围绕该数据集生成框架,已衍生出一系列重要的研究工作。在感知层面,基于生成的领域特定数据训练并评估了Frustum PointNets、SECOND与PointPillars等检测器,揭示了视角偏移对相机模型性能的显著影响。在协同融合方面,研究者利用多智能体数据对比了检测级融合与跟踪后分布式融合在不同相关性假设下的表现,证实了协方差交叉在去中心化场景中的优势。安全性研究方面,依托该数据构建了ROS2多智能体安全测试平台,系统分析了贝叶斯信任更新与信任加权融合方法在对抗攻击下的韧性。此外,该数据还支持视觉-语言-动作模型、轨迹预测模型以及视场估计等前沿算法研究,展现出作为可控实验控制面的广泛价值。
数据集最近研究
最新研究方向
基于AVstack和CARLA的合成数据集正引领多传感器、多智能体与多域自主系统研究的前沿方向。该框架通过模块化数据生成流程,产出TB级标注数据,覆盖地面、空中及基础设施系统,突破了传统数据集固定平台与场景的局限。最新研究聚焦于应用特定的感知模型适应性,揭示了相机模型在不同视角间的迁移脆弱性;同时,协同融合实验验证了保守的分布式融合策略在应对航迹相关性挑战时的鲁棒性。此外,生成数据被用于安全与信任评估,支持对恶意协作攻击的重复性测试,并延伸至视觉-语言模型与几何场景理解等高级算法,显著提升了自主系统在复杂、罕见工况下的可控实验能力与泛化潜力。
相关研究论文
  • 1
    Scaling Datasets for Multi-Sensor, Multi-Agent, and Multi-Domain Learning in Autonomous Systems杜克大学·电气与计算机工程系 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务