Box-QAymo
收藏资源简介:
Box-QAymo数据集是一个面向自动驾驶的视觉问答数据集,旨在评估和微调视觉语言模型在用户指定对象上的时空推理能力。该数据集包含1,662个二元问答对,5,403个属性问答对和13,714个运动问答对。数据集的建设过程包括三个阶段:增强对象标注、基于对象特征和时态动态的框引用视觉问答数据集生成,以及问答分布和难度控制的采样和平衡策略。数据集支持真实世界的感知约束和丰富的语义注释,为开发更鲁棒、可解释的自动驾驶系统提供了基础。
The Box-QAymo dataset is an autonomous driving-oriented visual question answering (VQA) dataset designed to evaluate and fine-tune the spatiotemporal reasoning capabilities of vision-language models on user-specified objects. This dataset comprises 1,662 binary question-answer pairs, 5,403 attribute-based question-answer pairs, and 13,714 motion-based question-answer pairs. The dataset construction process involves three stages: enhanced object annotation, generation of box-referenced VQA samples based on object features and temporal dynamics, and sampling and balancing strategies to regulate question-answer distribution and difficulty levels. The dataset supports real-world perceptual constraints and rich semantic annotations, serving as a foundational resource for developing more robust and interpretable autonomous driving systems.
Box-QAymo: Box-Referring VQA Dataset for Autonomous Driving
数据集概述
- 名称: Box-QAymo
- 类型: 自动驾驶领域的视觉问答(VQA)数据集
- 主要特点: 通过边界框标注实现用户指定对象的空间和时间推理
- 应用场景: 评估和微调视觉语言模型(VLMs)在复杂驾驶场景中的表现
核心贡献
- 提出分层评估协议:
- 基础能力测试(二元问题)
- 属性预测(框标注对象)
- 运动理解(目标实例)
- 时空推理(跨帧对象动态)
数据集统计
- 总问题数: 20,779
- 二元问题: 1,662
- 属性问题: 5,403
- 运动问题: 13,714
- 场景数: 202
- 标注对象比例: 50%
问题类别
二元问题
- 运动状态: "是否有静止车辆?"
- 方向判断: "是否有车辆朝向摄像头移动?"
属性问题
- 细粒度分类: "红色框中的物体是什么类型?"
- 颜色识别: "红色高亮物体是什么颜色?"
- 朝向判断: "红色框中的物体朝向哪个方向?"
运动问题
- 速度评估: "蓝色轿车移动速度多快?"
- 运动方向: "红色框中的物体向哪个方向移动?"
- 相对运动分析: "绿色皮卡是否比本车行驶更快?"
- 轨迹分析: "本车和卡车是否会碰撞?"
技术支持
核心组件
- 数据处理: Waymo数据集提取和预处理
- 问题生成: 分层提示生成器
- 模型评估: 支持多种VLMs和评估指标
- 答案处理: 支持多选、文本和边界框答案
支持模型
- VLMs: LLaVA, Qwen-VL, SENNA
- 评估指标: F1, Precision, Recall
关键发现
- 性能随问题复杂度下降: 二元(66.1%) > 运动(37.6%) > 属性(18.3%)
- 边界框标注平均提升Qwen-VL模型1.39% F1分数
- 当前VLMs在短期时间整合方面表现欠佳
- 领域专用模型(Senna)表现出脆弱性
引用格式
bibtex @article{etchegaray2024boxqaymo, title={Box-QAymo: Box-Referring VQA Dataset for Autonomous Driving}, author={Etchegaray, Djamahl, Fu, Yuxia, Huang, Zi and Luo, Yadan}, journal={arXiv preprint}, year={2025} }



