CrashSight
收藏资源简介:
CrashSight是由威斯康星大学麦迪逊分校等机构联合构建的大规模路侧摄像头交通事故基准数据集,包含250个真实碰撞视频及13K带阶段标注的多选题问答对。数据集通过四阶段标注流程(预碰撞、碰撞动态、事后结果、潜在原因)构建时空语义结构,覆盖场景识别、责任判定等7类认知任务,支持对视觉语言模型在安全关键场景中的因果推理能力评估。其核心价值在于填补了基础设施视角下交通事故理解的数据空白,为车路协同自动驾驶的感知算法开发提供标准化测试平台。
CrashSight is a large-scale roadside camera-based traffic accident benchmark dataset jointly developed by the University of Wisconsin-Madison and other institutions. It contains 250 real collision videos and 13K multiple-choice question-answer pairs with phase-level annotations. The dataset constructs a spatiotemporal semantic structure through a four-stage annotation workflow (pre-crash, crash dynamics, post-crash consequences, and potential causes), covering 7 types of cognitive tasks including scene recognition and liability determination. It supports the evaluation of causal reasoning capabilities of vision-language models in safety-critical scenarios. Its core value lies in filling the data gap in traffic accident understanding from the infrastructure perspective, and providing a standardized test platform for the development of perception algorithms for vehicle-road collaborative autonomous driving.
CrashSight 数据集概述
数据集基本信息
- 数据集名称:CrashSight: A Phase-Aware, Infrastructure-Centric Video Benchmark for Traffic Crash Scene Understanding and Reasoning
- 发布信息:CVPR 2026 Workshop DriveX · Archival Track · Poster
- 作者:Rui Gan1, Junyi Ma1, Pei Li2, Xingyou Yang1, Kai Chen3, Sikai Chen1, Bin Ran1
- 机构:1University of Wisconsin–Madison, 2University of Wyoming, 3Columbia University
- 相关资源:arXiv, Code
数据集简介
- 核心目标:为合作自动驾驶提供从基础设施视角(路边摄像头)进行交通场景理解的评估基准,弥补现有基准主要关注自车视角的不足。
- 数据内容:包含 250个真实世界的交通事故视频,并标注了 13,016个多项选择题-答案对。
- 标注框架:采用两层级、七类别的分类法组织问答对。
- 第一层级(事故理解):评估场景背景、涉及方和事故后结果的视觉基础。
- 第二层级(事故推理):探究更高层次的推理,包括事故机制、因果归因、时间进程和事故后结果。
数据集亮点
- 首个基础设施侧的事故视觉问答基准:包含250个专家标注的监控视频片段,具有阶段感知的密集描述和覆盖7个类别的13K多项选择题-答案对。
- 四阶段标注流程:VLM辅助起草 → 人类专家细化 → LLM驱动的VQA生成 → 验证与增强。
- 微调带来显著提升:领域特定微调带来高达+16.1%的平均准确率提升;一个30亿参数的微调模型超越了所有80亿参数的零样本基线模型。
- 系统化的错误分类:通过转变分析,将持续性失败归因于视觉令牌预算、冻结的编码器和预训练分布不匹配。
数据集统计
- 问答对总数:13,016对。
- 答案位置分布:经过选项打乱后,答案位置分布大致均匀(23.3%–27.8%),消除了位置偏差。
- 最大问题类别:“涉及方”类别占比28.0%,反映了实体识别的复杂性。
- 主要事故类型:侧面碰撞和T型碰撞是最常见的事故类型。
关键实验结果
- 评估模型:在四个模型系列中评估了8种VLM配置。
- 最佳零样本模型:InternVL3-8B,平均准确率为68.7%。
- 最佳微调模型:Qwen2.5-VL (FT) 7B,平均准确率为76.4%。
- 人类专家表现:平均准确率为94.7%。
- 人机差距:存在18.3个百分点的持续性人机差距,主要集中在“涉及方”和“事故机制”等视觉要求高的类别。
定性分析
- 主要失败模式:确定了两种微调无法解决的主要持续性失败模式。
- 时间推理失败:当稀疏的均匀帧采样遗漏了短暂但具有因果决定性的碰撞前交互时,导致事件重建不完整。
- 空间基础失败:当有限的像素分辨率和冻结的视觉编码器阻碍了模型在倾斜监控视角下区分细粒度实体细节时发生。
引用格式
@inproceedings{gan2026crashsight, title={CrashSight: A Phase-Aware, Infrastructure-Centric Video Benchmark for Traffic Crash Scene Understanding and Reasoning}, author={Gan, Rui and Ma, Junyi and Li, Pei and Yang, Xingyou and Chen, Kai and Chen, Sikai and Ran, Bin}, booktitle={Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)}, year={2026} }

- 1CrashSight: A Phase-Aware, Infrastructure-Centric Video Benchmark for Traffic Crash Scene Understanding and Reasoning威斯康星大学麦迪逊分校; 怀俄明大学; 哥伦比亚大学 · 2026年



