遇见数据集

VIENA2

收藏
arXiv2018-10-30 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

VIENA2是由澳大利亚国立大学和Data61-CSIRO联合创建的大规模驾驶预测数据集,涵盖5种通用驾驶场景和25个不同的动作类别。该数据集包含超过15,000个全高清、5秒长的视频,总计超过225万帧,每帧都标注了动作标签。VIENA2通过使用GTA V视频游戏环境,模拟了多种驾驶条件、天气、时间和环境,以支持自动驾驶中的动作预测研究。数据集旨在通过提供丰富的多模态信息,解决自动驾驶中的复杂预测问题,如驾驶员行为、交通规则遵守、事故预测等。

VIENA2 is a large-scale driving prediction dataset jointly created by The Australian National University and Data61-CSIRO, covering 5 general driving scenarios and 25 distinct action categories. This dataset contains over 15,000 full high-definition 5-second-long videos, totaling more than 2.25 million frames, with each frame annotated with action labels. VIENA2 leverages the GTA V video game environment to simulate diverse driving conditions, weather patterns, times of day and environmental settings, supporting action prediction research in autonomous driving. This dataset aims to address complex prediction problems in autonomous driving, such as driver behavior, traffic rule compliance, accident prediction and more, by providing rich multimodal information.

创建时间:
2018-10-22
搜集汇总
数据集介绍
VIENA2 数据集图片
构建方式
VIENA2数据集基于GTA V游戏环境构建,通过模拟真实驾驶场景,利用方向盘、踏板等设备采集数据。数据集包含超过15,000个全高清视频,每个视频时长5秒,帧率为30fps,总帧数超过225万。视频覆盖五种通用驾驶场景(驾驶员操作、交通规则、事故、行人意图、前车意图),共25个动作类别,每类至少600个样本。数据采集时同步记录方向盘转角、车速等车辆动力学信息,并通过OCR模块提取速度数据,确保多模态信息的完整性。
使用方法
VIENA2数据集适用于动作预测、识别和时序定位等任务。研究者可使用外观特征(如DenseNet提取的帧特征)、运动特征(光流堆栈)和车辆动力学特征(速度、转向角的时序向量)作为输入,训练LSTM或多模态LSTM模型。数据集提供了随机、昼夜、天气三种划分方式,便于评估模型在不同条件下的泛化能力。预训练于VIENA2的模型可通过微调迁移至真实数据集(如JAAD),有效减少对真实标注数据的依赖。
背景与挑战
背景概述
在自动驾驶与高级驾驶辅助系统领域,对车辆、行人及交通参与者行为的提前预判是保障行车安全的核心技术之一。然而,现有数据集多聚焦于单一驾驶子任务,如车道变更检测或行人意图预测,且依赖特定传感器配置,缺乏统一框架下的多场景覆盖。为填补这一空白,澳大利亚国立大学、Data61-CSIRO等机构的研究人员于2018年提出了VIENA2数据集。该数据集基于GTA V虚拟环境构建,包含超过1.5万段5秒全高清视频,覆盖驾驶员操作、交通规则遵守、事故、行人意图及前车意图五大通用驾驶场景,共计25个动作类别,每类样本数逾600个。其核心研究问题在于:如何在动作完成前尽早且准确地预判驾驶意图,以支撑实时决策。VIENA2以其大规模、多模态(融合视觉、方向盘角度与车速传感器数据)及环境多样性(涵盖不同天气、昼夜与道路类型)显著推动了驾驶预判研究的发展,成为该领域重要的基准数据集。
当前挑战
VIENA2所解决的领域核心挑战在于驾驶场景下的动作预判,即从视频早期帧中预测尚未完成的动作。不同于事后识别,预判需在动作准备阶段即输出可靠结果,这要求模型能捕捉细微的时空线索。具体挑战包括:1) 动作类别的模糊性,如变道与直行在视觉和动力学上的高度相似,易导致初期误判;2) 环境多样性带来的域适应难题,模型需在晴雨、昼夜等不同条件下保持稳健;3) 多模态信息融合的复杂性,需动态权衡视觉外观、光流运动与车辆传感器数据的重要性。在数据集构建层面,挑战同样显著:1) 真实世界难以收集事故等危险场景数据,需依赖合成环境模拟,但需确保虚拟数据的逼真度以支撑迁移学习;2) 大规模标注成本高昂,VIENA2通过游戏内自动化采集与驾驶设备同步记录动作标签,实现了高效标注;3) 需保证数据集的扩展性与公平性,设计明确训练/测试划分,并验证合成数据对真实场景的泛化能力。
常用场景
经典使用场景
VIENA2数据集专为驾驶场景中的动作预测任务而设计,其经典使用场景涵盖五大核心驾驶情境:驾驶员操控意图预测、行人过街意图判断、前车行为推测、交通规则遵守状态识别以及事故预警。通过提供超过15,000段5秒全高清视频,每段视频标注了25种动作类别,并同步采集方向盘转角与车速等车辆动力学数据,该数据集为构建多模态预测模型提供了标准化基准。研究者可基于视频帧序列与传感器信号的融合,训练模型在动作发生前(通常在视频后半段)进行早期预判,从而模拟真实驾驶中“未雨绸缪”的决策需求。
解决学术问题
VIENA2解决了驾驶场景下动作预测研究长期面临的碎片化难题——此前数据集多聚焦单一子问题(如仅关注驾驶员意图或行人轨迹),且传感器配置各异,缺乏统一基准。该数据集通过覆盖驾驶员、行人、前车、交通规则及事故五大场景,首次实现了多任务预测的标准化评估。其核心学术贡献在于:第一,提供了足够数量的样本(每类600个)以支撑深度学习模型的训练;第二,通过合成数据(基于GTA V)规避了真实事故数据难以采集的困境;第三,提出的多模态LSTM架构(MM-LSTM)证明了动态学习不同模态(外观、运动、车辆动力学)重要性可显著提升预测精度,为后续研究奠定了方法论基础。
实际应用
在实际应用中,VIENA2的训练模型可直接集成至高级驾驶辅助系统与自动驾驶感知模块。例如,在驾驶员操控场景中,模型可提前1-2秒预测变道或转向意图,触发盲区预警或自动制动;在行人意图场景中,模型能区分行人是否即将横穿马路,为城市复杂路况下的避撞策略提供时间余量。此外,该数据集在跨域迁移上展现出实用价值:预训练于VIENA2的模型仅需60%的真实标注数据(如JAAD数据集)即可达到从零训练100%数据的性能,显著降低了真实场景的标注成本。这一特性使其成为工业界快速部署预测模型的理想预训练资源。
数据集最近研究
最新研究方向
VIENA2数据集聚焦于自动驾驶场景中的动作预判(action anticipation)这一前沿研究方向,覆盖了驾驶员操作、行人意图、前车行为、交通规则遵守情况及事故预测五大类共25种动作类别。该数据集通过GTA V游戏引擎采集了超过1.5万段高清视频,并同步记录方向盘转角与车速等车辆动力学数据,为多模态时序预测提供了丰富资源。其意义在于突破了传统数据集仅关注单一子问题的局限,首次以统一传感器配置整合了多种预判任务,尤其对事故、违规等难以在真实环境中收集的关键场景进行了系统建模。当前研究重点包括基于多模态LSTM的预判模型优化、合成数据向真实场景的迁移学习,以及利用该数据集验证预判算法在恶劣天气、夜间等复杂条件下的鲁棒性,推动了自动驾驶系统从被动感知向主动预判的演进。
相关研究论文
  • 1
    VIENA2: A Driving Anticipation Dataset澳大利亚国立大学 · 2018年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务