遇见数据集

VLM-CASE_carla_dataset

收藏
github2026-07-08 更新2026-07-09 收录
数据链接:
官方服务:

资源简介:

该数据集包含10,560个在CARLA中收集的前置摄像头帧(1280×720),涵盖三种路面条件(干燥、湿润、雪地)、三种天气类型(晴朗、大雨、浓雾)、白天/夜晚以及三种照明辅助级别,每个帧都标有四个场景上下文字段。数据集分为训练集(8,448帧)、验证集(1,056帧)和测试集(1,056帧),并按联合标签分布分层。

This dataset contains 10,560 front-facing camera frames (1280×720) collected in CARLA, covering three road surface conditions (dry, wet, snow-covered), three weather types (clear, heavy rain, dense fog), day/night scenarios, and three levels of lighting assistance. Each frame is annotated with four scene context fields. The dataset is split into a training set (8,448 frames), a validation set (1,056 frames), and a test set (1,056 frames), with stratification performed based on the joint label distribution.

创建时间:
2026-07-03
原始信息汇总

数据集概述

数据集名称:VLM-CASE 场景上下文数据集(Scene-Context Dataset)

数据集规模:共 10,560 张前视摄像头帧图像,分辨率为 1280×720。

数据来源:使用 CARLA 仿真模拟器采集。

场景覆盖:图像覆盖三种路面(干燥、湿滑、积雪)、三种天气(晴朗、大雨、浓雾)、白天/夜晚以及三种照明辅助等级。

标注内容:每张图像标注了四个场景上下文字段。

数据集划分

  • 训练集:8,448 张
  • 验证集:1,056 张
  • 测试集:1,056 张
  • 划分方式:基于联合标签分布进行分层抽样。

下载地址:Hugging Face 数据集页面 ytj254/VLM-CASE_carla_dataset

标签说明:详细标签模式见仓库中的 dataset/README.md 文件。

用途:该数据集用于微调视觉语言模型(VLM),使其能够根据前视摄像头画面推理驾驶场景,并参数化生成上下文自适应安全包络(CASE),进而用于模型预测控制器的安全自主驾驶。

许可协议:数据、图表和视频以 CC-BY-4.0 许可发布。

搜集汇总
数据集介绍
构建方式
该数据集名为VLM-CASE_carla_dataset,依托CARLA仿真平台构建,旨在为视语言模型赋能的自适应安全包络研究提供场景上下文标注数据。数据集包含10,560帧1280×720分辨率的前视摄像头图像,覆盖干燥、湿润、积雪三种路面条件,晴朗、暴雨、浓雾三种天气类型,以及昼夜与三种照明辅助等级的组合。每帧图像均被标注四个场景上下文标签。数据集按8,448训练、1,056验证、1,056测试的分割比例划分,并基于联合标签分布进行分层抽样,确保类别均衡。
使用方法
数据集托管于Hugging Face平台,用户可通过指定仓库链接直接下载。下载后,需参照数据集中提供的README文件了解标签模式与目录结构。数据集的典型使用方式是作为场景上下文分类任务的训练与评估基准,其分层划分的验证集与测试集便于公平比较模型性能。用户还可结合论文中定义的66种评估场景配置,在CARLA仿真环境中复现闭环控制实验,以检验所训练的模型在真实驾驶任务中的有效性。
背景与挑战
背景概述
VLM-CASE_carla_dataset是由Tianjia Yang、Ke Li、Ruwen Qin和Xianbiao Hu于2026年创建的一个面向自动驾驶安全性的场景理解数据集,依托CARLA仿真平台采集了10,560帧前视摄像头图像,覆盖干、湿、雪三种路面,晴朗、暴雨、浓雾三种天气,以及昼夜与不同照明辅助级别,旨在为视觉-语言模型提供细粒度场景上下文标注。该数据集的核心研究问题在于如何让自动驾驶系统在复杂多变环境中具备前瞻性、类人的谨慎驾驶能力,通过微调视觉-语言模型推理场景并参数化上下文自适应安全包络,实现制动与转向的耦合控制。作为VLM-CASE框架的关键支撑,该数据集推动了自动驾驶安全前沿研究,展示了在集成化前车制动测试中100%的完成率,显著超越非自适应包络与基线模型。
当前挑战
该数据集面临的核心领域挑战是恶劣驾驶条件下的环境感知与决策不确定性,例如湿滑路面、低能见度及夜间照明不足如何影响车辆动力学与安全边界界定,需要模型能从视觉输入中精准推理出摩擦系数、视距等隐式上下文。在构建过程中,挑战包括在CARLA仿真中系统化生成横跨多种路面、天气与光照的复合场景,确保标签覆盖场景上下文四字段且分布均衡;同时需设计66个评估场景涵盖无前车、恒定跟车及前车制动三种模式,以验证安全包络在不同行驶速度与道路类型下的鲁棒性。数据集的规模与标注复杂性也对模型微调与闭环验证提出了高要求。
常用场景
经典使用场景
VLM-CASE_carla_dataset的核心应用场景在于为自主驾驶车辆提供一种基于视觉-语言模型的前瞻性安全包络自适应决策框架。该数据集包含10560张CARLA仿真环境下的前视摄像头图像,覆盖干、湿、雪三种路面条件,晴朗、大雨、浓雾三种天气类型,以及昼夜与三种照明辅助水平,每张图像均标注了四个场景上下文字段。研究者可借此训练或微调视觉-语言模型,使其能够从前方视觉场景中推理出当前驾驶环境的复杂性,进而动态参数化一个结合制动与转向的摩擦预算共享安全包络,使模型预测控制器在包络内自主驾驶,实现类似人类驾驶员在恶劣条件下的谨慎操控。
解决学术问题
该数据集旨在解决自主驾驶在复杂环境下面临的感知-决策鸿沟问题,尤其是传统安全包络无法根据场景上下文(如能见度、路面摩擦系数)动态调整的局限性。通过将视觉-语言模型的场景理解能力与形式化安全包络相结合,研究工作解决了如何在不同天气、光照和路面条件下自动缩放跟车距离与横向安全裕度的学术难题。在包含66个场景的评估中,基于该数据集训练的VLM-CASE-MPC在综合紧急制动测试中实现了100%的成功率,显著超越非自适应包络(81.5%)和基线MPC(51.9%),为自适应安全决策提供了可解释、可验证的理论框架。
实际应用
在实际应用中,该数据集驱动的自主驾驶系统能够为量产车辆的主动安全功能提供场景自适应的能力。例如,当车辆从干燥晴朗的城市道路驶入夜间湿滑且有浓雾的高速路段时,系统可自动收窄横向安全余量并延长跟车距离,避免因固定阈值导致的误判或碰撞。该技术适用于高级驾驶辅助系统中的自动紧急制动、自适应巡航控制以及车道保持辅助,尤其对在复杂气候区域运营的自动驾驶出租车和物流车队具有显著价值,能够提升全天候、全场景下的行驶安全性与乘客舒适度。
数据集最近研究
最新研究方向
在自动驾驶安全领域,面对复杂多变的气象与路面条件,传统预设安全包络方法常因缺乏场景感知而表现脆弱。VLM-CASE数据集应运而生,其核心贡献在于利用微调后的视觉语言模型(VLM)从前视摄像头中推理驾驶场景语义,动态参数化一个结合制动与转向、共享摩擦预算的上下文自适应安全包络(CASE)。基于该数据集训练的模型在CARLA模拟器中,于干、湿、雪三种路面及晴朗、暴雨、浓雾等天气组合下,实现了对前车紧急制动场景的100%成功率,显著超越非自适应包络、现有VLM集成控制器及基础MPC方法。该研究不仅推动了多模态大模型在端到端安全决策中的前沿应用,更为全气候条件下自主驾驶的鲁棒性验证提供了标准化基准与数据支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务