AccidentBench
收藏资源简介:
AccidentBench是一个用于车辆事故及更广泛领域的多模态理解和推理基准数据集,包含陆地、水域和空中三种空间设置,涵盖时间、空间和意图推理等多种推理任务。
AccidentBench is a benchmark dataset for multimodal understanding and reasoning in the context of vehicle accidents and a broader range of related fields. It includes three spatial settings: land, water, and air, and covers various reasoning tasks such as temporal, spatial, and intentional reasoning.
AccidentBench 数据集概述
数据集基本信息
- 数据集名称: AccidentBench
- 核心功能: 评估车辆事故及更广泛场景中的多模态理解和推理能力
- 数据规模: 约2,000个视频和19,000个人工标注的问答对
- 样本集: 约4,000个示例(从完整数据集中随机选取)
数据特征
空间场景覆盖
- 陆地空间: 交通事故场景
- 水域空间: 水上场景
- 空中空间: 航空场景
推理类型
- 时序推理: 理解事件序列和随时间变化的运动
- 空间推理: 关注空间中的相对位置和方向
- 意图推理: 评估动态环境中目标导向行为和决策的理解
难度级别
- 困难级别: 原始设计任务
- 中等级别: 基于困难任务构建
- 简单级别: 基于困难任务构建
数据格式
JSON结构
json { "id": "唯一标识", "dataset": "子数据集文件名", "scene_name": "视频文件名", "reasoning_style": "推理类型", "question": "与场景相关的推理问题", "ground_truth": "正确答案键", "options": ["多个选择题选项"] }
视频特性
- 多种视频长度:短、中、长
- 不同类别和帧数
- 多样化的视频时长分布
标注质量
- 标注人员: 至少持有工程相关领域(如数学或计算机科学)硕士学位的受过高等教育的标注者
- 标注流程: 首先设计困难级别任务并标注每个问题的真实答案,然后基于这些构建中等和简单任务
评估基准
模型性能对比
在困难、中等和简单三个难度级别上评估了多个大型多模态模型的性能,包括:
- GPT 4o
- Gemini 系列
- Claude 3.5
- InternVL2.5
- LLaVA 系列
- Qwen2.5 VL
评估指标
- 总体平均分
- 时序推理得分
- 空间推理得分
- 意图推理得分
数据获取
- 主要来源: https://huggingface.co/datasets/Open-Space-Reasoning/Benchmark
- 备用下载: https://huggingface.co/datasets/Open-Space-Reasoning/M4R-zip
引用信息
bibtex @article{gu2025accidentbench, title={AccidentBench: Benchmarking Multimodal Understanding and Reasoning in Vehicle Accidents and Beyond}, author={Gu, Shangding and Wang, Xiaohan and Ying, Donghao and Zhao, Haoyu and Yang, Runing and Jin, Ming and Li, Boyi and Pavone, Marco and Yeung-Levy, Serena and Wang, Jun and others}, journal={arXiv preprint arXiv:2509.26636}, year={2025} }




