遇见数据集

AdityaNG/BengaluruDrivingDatasetRaw

收藏
Hugging Face2024-05-17 更新2024-03-04 收录
官方服务:

资源简介:

我们在印度班加罗尔收集了一个跨越114分钟和165K帧的数据集。该数据集由校准的相机传感器拍摄的视频数据组成,分辨率为1920×1080,帧率为30 Hz。我们利用仅使用视频作为输入的深度数据集生成管道,生成高分辨率的视差图。

We collected a dataset spanning 114 minutes and 165K frames in Bengaluru, India. This dataset consists of video data captured by calibrated camera sensors, with a resolution of 1920×1080 and a frame rate of 30 Hz. We utilized a depth dataset generation pipeline that takes only video as input to generate high-resolution disparity maps.

提供机构:
AdityaNG
原始信息汇总

Bengaluru Driving Dataset

数据集概述

该数据集收集了在印度班加罗尔的114分钟和165K帧的视频数据。数据集包含从校准的摄像头传感器获取的视频数据,分辨率为1920×1080,帧率为30 Hz。通过使用仅以视频为输入的深度数据集生成管道,生成高分辨率的视差图。

论文

Bengaluru Driving Dataset: 3D Occupancy Convolutional Transformer Network in Unstructured Traffic Scenarios

引用

bibtex @misc{analgund2023octran, title={Bengaluru Driving Dataset: 3D Occupancy Convolutional Transformer Network in Unstructured Traffic Scenarios}, author={Ganesh, Aditya N and Pobbathi Badrinath, Dhruval and Kumar, Harshith Mohan and S, Priya and Narayan, Surabhi }, year={2023}, howpublished={Spotlight Presentation at the Transformers for Vision Workshop, CVPR}, url={https://sites.google.com/view/t4v-cvpr23/papers#h.enx3bt45p649}, note={Transformers for Vision Workshop, CVPR 2023} }

搜集汇总
数据集介绍
AdityaNG/BengaluruDrivingDatasetRaw 数据集图片
构建方式
在非结构化交通场景分析领域,针对印度班加罗尔复杂交通环境的特殊性,研究者构建了Bengaluru Driving Dataset原始数据集。该数据集通过搭载标定摄像头的传感器,以30赫兹帧率采集了长达114分钟、总计16.5万帧的1920×1080分辨率视频数据。其核心构建亮点在于采用了一套仅以视频为输入的深度数据集生成流水线,能够从原始视频流中自动推导并输出高分辨率视差图,从而为三维场景理解提供了高质量的深度信息基础。
特点
该数据集最显著的特征在于其来源环境的独特性和数据规模的完整性。它专注于印度班加罗尔这一非结构化、高动态的驾驶场景,涵盖了常规自动驾驶数据集较少涉及的拥挤街道、不规则车道和混合交通流等复杂情况。同时,114分钟持续录制与16.5万帧的体量,确保了数据在时间序列上的连续性,为时序模型训练提供了丰富素材。经标定传感器采集与专用流水线生成的视差图,进一步保证了深度信息的空间精度与一致性。
使用方法
在应用层面,该数据集主要服务于三维占用预测与自动驾驶感知模型的研发。研究者可将其作为训练或评估数据,用于构建能够应对非结构化交通场景的深度神经网络。具体使用时,建议将视频帧与对应的视差图配对输入,以监督学习方式训练模型学习从单目图像到深度空间的映射。数据集以原始格式提供,便于用户根据自身需求进行预处理或增强,同时其MIT许可协议也允许广泛的学术与商业二次开发。
背景与挑战
背景概述
自动驾驶技术在全球范围内蓬勃发展,但现有驾驶数据集多聚焦于结构化交通环境,难以应对发展中国家道路场景的复杂性与非结构化特征。在此背景下,由Aditya N. Ganesh及其合作者于2023年创建的Bengaluru Driving Dataset(BDD)应运而生。该数据集采集于印度班加罗尔,涵盖114分钟、165,000帧高清视频(1920×1080分辨率,30 Hz帧率),通过独创的深度数据集生成流水线,仅以视频输入即可输出高分辨率视差图。BDD的核心研究问题在于填补非结构化交通场景下3D占用预测的空白,其代表性成果——3D Occupancy Convolutional Transformer Network(OCTraN)在CVPR 2023的Transformers for Vision Workshop上获得亮点展示。该数据集为自动驾驶在拥挤、无序的交通环境中感知建模提供了关键基准,显著推动了领域向更广泛地理与交通场景的泛化。
当前挑战
BDD所解决的领域挑战在于,现有数据集(如KITTI、Cityscapes)多聚焦于欧美结构化道路,无法有效应对印度等地缺乏车道线、信号灯混乱、车辆与行人密集交织的非结构化场景。具体而言,OCTraN模型需在动态遮挡严重、物体尺度多变及光照不均的复杂条件下,实现精准的3D占用网格预测。在数据集构建过程中,挑战尤为显著:从单目视频中生成高分辨率视差图需克服运动模糊与纹理稀疏问题,而班加罗尔拥挤的交通环境导致传感器标定与数据同步面临巨大困难。此外,大规模人工标注成本高昂,BDD通过自监督流水线缓解了这一瓶颈,但视差图的质量仍受限于原始视频的噪声与动态物体边界的不连续性。
常用场景
经典使用场景
该数据集由印度班加罗尔的真实驾驶场景构成,涵盖114分钟、165K帧的高清视频(1920×1080,30 Hz),并配有经由深度生成管道导出的高分辨率视差图。其经典使用场景聚焦于非结构化交通环境下的自动驾驶视觉感知研究,尤其适用于训练与评估基于单目视频的深度估计、视差图预测以及3D场景重建模型。研究者可利用该数据集探索在拥挤、无序的混合交通流中,如何从连续视频帧中稳健地提取空间几何信息,为后续的3D占用预测奠定基础。
衍生相关工作
基于该数据集,衍生出了一系列代表性研究工作,其中最核心的是与其同步发布的3D占用卷积Transformer网络(OCTraN)。该工作将视差图转换为3D占用网格,并利用Transformer结构捕捉空间长程依赖,在非结构化交通场景中实现了优于传统CNN方法的占用预测精度。此外,该数据集还被用于验证无监督深度估计模型在极端光照与遮挡条件下的鲁棒性,并启发了后续针对低资源区域驾驶场景的数据增强与域自适应方法研究。
数据集最近研究
最新研究方向
在当前自动驾驶与计算机视觉领域,结构化道路环境下的感知研究已趋于成熟,而针对非结构化、高密度交通场景的深度估计与三维占据建模正成为前沿热点。Bengaluru Driving Dataset 作为聚焦印度班加罗尔复杂交通环境的原始驾驶数据集,收录了114分钟、165K帧的1920×1080高清视频,并基于视频输入生成高分辨率视差图,为缺乏激光雷达标注的城市场景提供了关键的深度信息。该数据集支撑了3D占据卷积Transformer网络的提出,在CVPR 2023 Transformer视觉工作坊中以亮点报告形式展示,推动了深度学习模型在无序交通流、多类障碍物混杂环境下的鲁棒感知能力。其意义在于弥补了现有主流数据集(如KITTI、nuScenes)对南亚典型非结构化交通场景覆盖的空白,为自动驾驶系统在发展中国家城市环境中的泛化部署提供了数据基础与算法验证平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务