遇见数据集

RACER-Mini

收藏
Hugging Face2026-03-20 更新2026-03-21 收录
官方服务:

资源简介:

RACER-Mini 是一个专为自动驾驶中视觉-语言-动作(VLA)模型训练设计的推理字幕数据集。该数据集包含约1,000个样本,每个样本由以下三部分组成:1) 前摄像头图像的时间序列;2) 自我车辆的未来轨迹;3) 对应的推理说明文本。数据集中所有图像均已通过Dashcam Anonymizer工具对人脸和车牌进行了匿名化处理以保护隐私。该数据集采用CC BY-NC-SA 4.0许可协议发布,由日本新能源产业技术综合开发机构(NEDO)资助的项目JPNP20017开发,并使用Qwen团队开发的Qwen3-VL系列模型进行标注。

RACER-Mini is a reasoning captioning dataset specifically designed for training vision-language-action (VLA) models in autonomous driving scenarios. This dataset contains approximately 1,000 samples, with each sample comprising three components: 1) a temporal sequence of front-facing camera images; 2) the future trajectory of the ego vehicle; 3) corresponding reasoning explanation texts. All images in the dataset have been anonymized for faces and license plates via the Dashcam Anonymizer tool to protect personal privacy. This dataset is released under the CC BY-NC-SA 4.0 license, developed under project JPNP20017 funded by the New Energy and Industrial Technology Development Organization (NEDO) of Japan, and annotated using the Qwen3-VL series models developed by the Qwen team.

创建时间:
2026-03-18
搜集汇总
数据集介绍
构建方式
RACER-Mini数据集是RACER(Rationale-Aware Captioning of Edge-Case Driving Scenarios)的一个精简子集,专为训练自动驾驶领域的视觉-语言-动作(VLA)模型而设计。该数据集包含约1,000个样本,每个样本由一系列时间序列的前视摄像头图像、自车的未来轨迹以及对应的推理描述组成。数据集的构建过程中,采用了Qwen3-VL-235B-A22B-Instruct和Qwen3-VL-235B-A22B-Thinking模型进行标注,确保了推理描述的高质量生成。此外,为保护隐私,所有图像中的人脸和车牌均通过Dashcam Anonymizer工具进行了匿名化处理。
特点
RACER-Mini数据集的核心特点在于其聚焦于边缘驾驶场景的推理描述,为自动驾驶模型提供了超越简单行为指令的深层情境理解。每个样本不仅包含自车的未来轨迹,还附带了详尽的文本解释,例如车辆因交通指挥员示意停止或施工阻塞车道而必须等待的原因。这种理性感知的标注方式,使得VLA模型能够从视觉输入中学习到背后的逻辑和决策依据,从而提升在复杂、非常规交通环境中的鲁棒性和可解释性。数据集采用CC BY-NC-SA 4.0许可协议发布,并获得了日本新能源产业技术综合开发机构(NEDO)的资助。
使用方法
使用RACER-Mini数据集时,研究者可直接从HuggingFace页面下载约1,000个样本。每个样本的JSON格式清晰定义了关键帧、前后帧图像路径、推理描述及轨迹数据。用户可将图像序列与描述文本配对,用于训练VLA模型以生成基于视觉输入的推理式驾驶指令。轨迹数据以15维向量形式提供,包含位置、速度和方向信息,便于与模型的动作预测模块对接。建议结合Qwen3-VL等大型视觉语言模型进行微调,以充分利用数据集中的理性描述能力。详细的使用指南可参考配套的技术博客(日文)。
背景与挑战
背景概述
在自动驾驶领域,视觉-语言-动作(VLA)模型的训练依赖于高质量、富含推理信息的标注数据,以应对长尾边缘场景下的决策挑战。RACER-Mini数据集由日本Turing Motors团队于2025年构建,作为RACER数据集的一个小型子集,提供约1000个样本,每个样本包含时序前视摄像头图像序列、自车未来轨迹以及对应的推理描述。该数据集聚焦于边缘驾驶场景,旨在通过详细的因果推理标注,提升VLA模型对复杂交通情境的理解与泛化能力。其发布依托于日本新能源与工业技术开发机构(NEDO)资助的项目JPNP20017,并借助Qwen3-VL系列大模型进行自动化标注,为自动驾驶安全性与可解释性研究提供了关键资源。
当前挑战
RACER-Mini所解决的领域问题在于自动驾驶模型对边缘场景的认知不足,尤其是缺乏对交通管制、施工区域等复杂情境的因果推理能力,现有数据集多侧重常规驾驶行为而忽视此类长尾分布。构建过程中面临的挑战包括:如何从海量驾驶数据中精准筛选出具有代表性的边缘案例,确保样本的多样性与稀疏事件覆盖;如何利用大语言模型生成既符合物理规则又具备逻辑连贯性的推理描述,避免幻觉或语义偏差;以及如何在时序图像与轨迹数据中统一标注格式,同时通过匿名化技术保护隐私,避免人脸和车牌信息泄露。这些挑战共同决定了数据集的质量与实用性。
常用场景
经典使用场景
RACER-Mini 数据集专为自动驾驶领域中视觉-语言-动作(VLA)模型的训练而设计,其经典使用场景在于为边缘驾驶场景提供带有推理描述的时空图像序列与自车未来轨迹。通过融合前置摄像头时序图像、推理式文本描述及轨迹数据,该数据集使模型能够理解复杂交通情境中的因果关系与决策依据,例如施工区域、交通指挥等罕见但关键的驾驶事件。
实际应用
在实际应用中,RACER-Mini 可部署于高级驾驶辅助系统(ADAS)与全自动驾驶平台的开发与验证环节。其推理描述有助于提升自动驾驶系统在突发路况下的决策透明性与安全性,例如在施工区、行人闯入或交通管制等场景中,车辆能够生成可理解的行动理由,增强人机信任度。此外,该数据集还可用于仿真环境中的边缘案例测试与算法鲁棒性评估。
衍生相关工作
基于 RACER 数据集的设计理念,衍生出一系列相关经典工作,包括融合因果推理的端到端驾驶模型、基于大语言模型的驾驶场景理解框架,以及多模态轨迹预测与行为解释联合学习方法。这些工作进一步探索了如何将语言先验知识注入视觉-动作空间,推动了 VLA 模型在开放世界驾驶任务中的泛化能力与可解释性研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务