Spatial-VQA-Bench
收藏资源简介:
Spatial-VQA-Bench 是一个专注于多模态大语言模型空间视觉推理的小型基准测试,涵盖左/右、前/后、近/远以及旋转等任务。它包含3,200个手动审核的项目,分为五个任务族:2D关系、3D关系、旋转、遮挡和视角。图像来源于室内场景(ScanNet渲染、OpenImages室内)和合成3D场景。
Spatial-VQA-Bench is a compact benchmark focusing on spatial visual reasoning for multimodal large language models, covering tasks including left/right, front/back, near/far, and rotation. It contains 3,200 manually reviewed items, divided into five task families: 2D relations, 3D relations, rotation, occlusion, and viewpoint. The images are sourced from indoor scenes (ScanNet renders, indoor OpenImages) and synthetic 3D scenes.
Spatial-VQA-Bench 数据集概述
基本信息
- 数据集名称:Spatial-VQA-Bench
- 来源:GitHub (sitodowubb/spatial-vqa-bench)
- 许可证:MIT
核心目标
一个专注于空间视觉推理的轻量级基准测试,用于评估多模态大语言模型在处理空间关系(左/右、后/前、近/远、旋转90°等问题)时的推理能力。
数据集规模
包含 3,200 个经人工筛选的样本,涵盖五大任务类别。
任务类别
| 任务类别 | 说明 |
|---|---|
| 2D-relations(2D关系) | 左/右、上/下、之间等空间位置关系 |
| 3D-relations(3D关系) | 前/后、近/远等三维空间关系 |
| Rotation(旋转) | 物体旋转90°后的方向判断 |
| Occlusion(遮挡) | 隐藏或部分遮挡物体的识别与推理 |
| Viewpoint(视角) | 物体背面或不同视角的想象推理 |
图像来源
- 室内场景:ScanNet渲染图、OpenImages室内图像
- 合成3D场景:用于旋转和视角任务
数据格式
每条样本包含:id(标识)、task(任务类别)、image(图像)、question(问题)、choices(选项)、answer(答案)。样本为开放式提问,但均提供CMC版本。
模型评估结果
| 模型 | 2D关系 | 3D关系 | 旋转 | 遮挡 | 视角 | 平均 |
|---|---|---|---|---|---|---|
| 随机基线 | 25.0 | 25.0 | 25.0 | 25.0 | 25.0 | 25.0 |
| LLaVA-1.5-7B | 51.2 | 38.4 | 30.2 | 47.0 | 32.1 | 39.8 |
| LLaVA-1.5-13B | 54.0 | 41.7 | 32.4 | 50.5 | 34.9 | 42.7 |
| Qwen2-VL-7B | 66.3 | 52.0 | 42.1 | 61.2 | 45.7 | 53.5 |
| InternVL2-8B | 65.1 | 50.6 | 41.4 | 60.0 | 44.9 | 52.4 |
| GPT-4o-mini | 70.4 | 56.7 | 47.8 | 65.3 | 51.0 | 58.2 |
| GPT-4o | 76.5 | 63.4 | 55.2 | 71.1 | 58.9 | 65.0 |
| 人类 | 92.8 | 89.5 | 84.7 | 91.0 | 86.4 | 88.9 |
关键发现
- 所有模型在旋转和视角任务上表现最差(需要心理模拟而非直接感知)
- Qwen2-VL-7B相比LLaVA-1.5-7B在3D关系上有显著提升(+13.6分),表明其更强的3D先验能力




