Impromptu VLA Dataset
收藏资源简介:
Impromptu VLA数据集是一个针对自动驾驶中非结构化场景的大型数据集,由超过80,000个精心挑选和验证的视频剪辑组成,这些视频剪辑来自8个开源的大型数据集。该数据集专注于四种具有挑战性的非结构化场景类型:边界不清晰的路面、临时交通规则变化、非常规动态障碍和具有挑战性的道路条件。数据集支持包括场景理解、预测、元规划和轨迹规划在内的相互关联的VLA任务。
Impromptu VLA Dataset is a large-scale dataset targeting unstructured driving scenarios in autonomous driving, comprising over 80,000 carefully selected and validated video clips curated from 8 open-source large-scale datasets. This dataset focuses on four challenging categories of unstructured driving scenarios: poorly delineated road surfaces, temporary traffic rule changes, unconventional dynamic obstacles, and demanding road conditions. It supports a suite of interconnected VLA tasks including scene understanding, prediction, meta-planning, and trajectory planning.
Impromptu-VLA 数据集概述
数据集基本信息
- 名称: Impromptu-VLA
- 类型: 驾驶视觉-语言-动作模型数据集
- 许可证: GitHub仓库显示为开源许可证
- 相关论文: arXiv:2505.23757
- 项目主页: Impromptu-VLA.c7w.tech
数据集内容
- 数据来源: 包含
waymo和mapillary_sls数据集的处理数据 - 数据组织:
- 原始数据需按
data_raw目录组织 - 需创建
navsim符号链接指向原始数据路径
- 原始数据需按
- 数据处理: 提供数据生成脚本
scripts/data_qa_generate.sh
数据集访问
- 下载地址: HuggingFace数据集页面
相关模型
- 预训练模型: 提供6个不同配置的预训练模型,包括3B和7B版本
- 3B Base+nuScenes
- 3B Base+Impromptu
- 3B Base+Impromptu+nuScenes
- 7B Base+nuScenes
- 7B Base+Impromptu
- 7B Base+Impromptu+nuScenes
- 模型下载: 所有模型均托管在HuggingFace模型库
性能评估
开环轨迹预测性能(nuScenes数据集)
- 评估指标: L2误差(m)
- 最佳表现:
- 1s: 0.13m (3B/7B Base+Impromptu+nuScenes)
- 2s: 0.27m (3B/7B Base+Impromptu+nuScenes)
- 3s: 0.48m (DriveVLM-Dual)
- 平均: 0.29m (EMMA+)
NeuroNCAP评估
- 评估指标:
- NeuroNCAP评分(越高越好)
- 碰撞率(%)(越低越好)
- 最佳表现:
- NeuroNCAP平均分: 2.15 (Base+Impromptu+nuScenes)
- 平均碰撞率: 65.5% (Base+Impromptu+nuScenes)
使用工具
- 主要依赖库:
- sglang: 高效大语言模型服务
- LLaMA-Factory: 大语言模型微调框架
- vLLM: 高吞吐量推理库
- 1Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models清华大学 · 2025年



