遇见数据集

nuplan

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

nuPlan 123D 是一个基于 nuPlan v1.1 的自动驾驶数据集,采用 123D Apache Arrow 格式存储。该数据集包含全部 15910 个日志,总大小为 7.8 TiB。数据由三部分构成:1) 传感器日志(1457个),包含摄像头、激光雷达等传感器数据以及同步和标注元数据,以10Hz同步时钟组织;2) 无传感器日志(14453个),仅包含元数据,以每100个日志为一组的tar压缩包形式提供;3) 4个城市地图。此外提供了一个索引文件 index.parquet,记录每个日志的名称、划分、是否有传感器等信息。数据集适用于自动驾驶规划等任务,用户可通过 py123d 库进行访问。该数据集衍生自 nuPlan,使用 nuPlan 数据集许可证。

nuPlan 123D is an autonomous driving dataset based on nuPlan v1.1, stored in the 123D Apache Arrow format. The dataset contains all 15910 logs, with a total size of 7.8 TiB. The data consists of three parts: 1) Sensor logs (1457), including camera, LiDAR and other sensor data along with synchronization and annotation metadata, organized at a 10Hz synchronized clock; 2) Non-sensor logs (14453), containing only metadata, provided as tar archives grouped by every 100 logs; 3) 4 city maps. Additionally, an index file index.parquet is provided, recording information such as log name, split, and whether it has sensors. The dataset is suitable for tasks such as autonomous driving planning, and users can access it via the py123d library. This dataset is derived from nuPlan and uses the nuPlan dataset license.

创建时间:
2026-09-02
原始信息汇总

nuPlan 123D 数据集概述

基本信息

  • 数据集名称: nuPlan 123D
  • 许可协议: 自定义许可(遵循 nuPlan 数据集许可协议,详见 nuScenes 使用条款
  • 数据集规模: 10,000 < n < 100,000(样本量级)
  • 标签: 123D、nuplan、自动驾驶

数据集内容

这是 nuPlan v1.1 数据集的 123D Apache Arrow 格式版本,包含 全部 15,910 个日志及所有模态数据,总容量为 7.8 TiB。具体内容分为四部分:

1. 传感器日志(logs/ 目录)

包含 1,457 个带传感器的日志,按训练/验证/测试划分,每个日志以独立文件存储,涵盖多种模态数据:

  • 摄像头数据camera.pcam_{f0,l0,r0,l1,r1,l2,r2,b0}(共8个视角)
  • 激光雷达数据lidar.lidar_merged
  • 元数据syncego_state_se3box_detections_se3traffic_light_detectionsroute_positioncustom.scenario
  • 所有数据均基于 10 Hz 同步时钟

2. 无传感器日志(logs_sensorless/ 目录)

包含 14,453 个无传感器日志(仅元数据),以每 100 个日志为一个未压缩 tar 包存储。解压后可得到与传感器日志相同的目录结构。

3. 地图数据(maps/ 目录)

包含 4 个城市地图

4. 索引文件(index.parquet

每行对应一个日志,包含 log_namesplithas_sensorssensorless_tarbytes 字段。

使用指南

环境搭建

需安装 py123d 库,并设置 PY123D_DATA_ROOT 环境变量指向数据目录。

按需下载示例

  • 仅规划任务(无传感器):下载约 0.4 TiB 数据,包括无传感器日志、地图和索引文件。
  • 传感器日志(仅元数据):下载约 50 GiB 数据。
  • 特定模态补充下载:例如单独下载前摄像头数据(约 0.7 TiB)。

数据规格说明

  • 所有数据均采用 Apache Arrow 格式.arrow 文件)。
  • 无传感器日志通过 tar 包分发,解压后可获得标准目录结构。

文档与许可

搜集汇总
数据集介绍
nuplan 数据集图片
构建方式
nuPlan 123D数据集是在nuPlan v1.1基础上,采用Apache Arrow格式构建的高规格自动驾驶测试集。其构建过程精细分层:包含1457个传感器日志,每个日志按模态拆分存储,如相机、激光雷达及多种元数据,统一在10Hz同步时钟下;另含14453个无传感器日志,仅提供元数据,压缩于tar文件中以便高效管理。地图数据单独存放,覆盖四座城市。所有条目由索引parquet文件统一索引,记录日志名称、数据集划分、传感器有无及文件路径等,形成结构清晰、层次分明的数据集合。
特点
此数据集规模宏大,总数据量达7.8 TiB,容纳15910个日志片段,覆盖训练、验证与测试集,兼顾传感器丰富数据与纯元数据。日志文件以平面树结构组织,便于按需调取;无传感器日志采用每百个打包的tar格式,节省存储并利于批量处理。该数据集创新性融合了nuPlan的复杂驾驶场景与py123d的轻量级格式,兼容多模态信息,包括相机多视角图像、激光雷达点云、自车状态、障碍物检测及交通灯信号,为自动驾驶规划算法研究提供了全面且灵活的数据支撑。
使用方法
使用者可通过pip安装py123d库,并设置环境变量PY123D_DATA_ROOT指向数据缓存路径。借助Hugging Face库的hf download命令,按需下载数据子集:例如,仅需传感器和地图时,可通过--include参数精准获取logs_sensorless、maps及index.parquet,随后使用tar命令解压至日志目录;也可仅下载传感器元数据或特定模态(如前置摄像头)数据。之后利用py123d的Scene与Map API,即可读取并处理场景数据。此流程赋予研究者高度灵活性,可依具体研究需求定制数据加载,实现高效的数据利用。
背景与挑战
背景概述
nuPlan数据集由nuTonomy(现为Aptiv)团队于2021年创建,旨在推动自动驾驶规划领域的研究与发展。该数据集提供了大规模、高质量的驾驶场景数据,包含15910个日志,涵盖传感器数据、地图信息及标注,支持多模态感知与规划任务。其核心研究问题聚焦于开发可泛化的运动规划算法,以应对复杂城市环境中的自动驾驶挑战。nuPlan的发布填补了规划领域缺乏统一benchmark的空白,促进了学术与工业界对规划算法的系统评估与比较,对自动驾驶研发具有深远影响。
当前挑战
nuPlan数据集面临的挑战主要涉及两方面。领域问题方面,自动驾驶规划需处理动态环境下的不确定性、多智能体交互、复杂交通规则及实时性要求,现有算法在安全性与效率间难以平衡,且缺乏对长尾场景的覆盖。构建过程中,数据采集需在多个城市进行,协调传感器时间同步、校准及大规模标注,成本高昂;同时,数据存储与管理面临巨大压力,如nuPlan v1.1格式转换需处理7.8 TiB数据,确保一致性及可访问性成为工程技术难题。此外,数据隐私与合规要求进一步增加了构建复杂性。
常用场景
经典使用场景
nuPlan数据集作为自动驾驶领域大规模驾驶规划基准,其经典使用场景集中于运动规划与预测模型的离线训练与在线评估。研究者基于其涵盖15910段真实驾驶日志、四种城市地图及多模态传感器数据,构建从感知到规划的端到端学习系统,尤其在传感器缺失条件下探索纯元数据驱动的规划策略,以应对真实世界中感知噪声与缺失的挑战。该数据集被广泛用于验证各类轨迹预测算法与行为决策模型,其标准化数据接口与预定义日志划分促进了跨研究工作的公平对比,成为衡量规划系统性能的公认基石。
实际应用
在实际应用中,nuPlan被广泛部署于自动驾驶系统开发的关键环节,包括作为仿真环境中规划模块的压力测试台,用于评估新算法在复杂交通流下的表现;亦用于生成高保真的驾驶训练数据增强既有规划模型的泛化能力。其高效的数据存取格式(Apache Arrow)与模块化设计支持实时场景回放与闭环模拟,加速了企业级研发团队的算法迭代,同时为法规认证中的场景库构建提供真实驾驶数据基础,尤其助力于处理无传感器模式下的车路协同规划与应急冗余系统的设计,彰显了从理论验证到产业落地的桥梁作用。
衍生相关工作
基于nuPlan,衍生出一系列影响深远的学术工作,例如PlanBench、PlanT等归一化规划评测框架以该数据为基座,通过引入轻量级索引与分布式读取机制扩展了数据处理边界;此外,基于其构建的闭环模拟器被用于强化学习与模仿学习算法的对比研究,催生出多任务规划基座模型,并带动了自监督预训练策略在驾驶场景中的探索。传感器缺失子集亦启发了跨模态知识蒸馏与规划鲁棒性研究,众多后续数据集如nuPlan v1.2在扩展新城市与恶劣天气时均借鉴其统一坐标体系与注释规范,形成了以nuPlan为核心的数据生态,持续驱动自动驾驶规划研究前沿。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务