Open3DVQA
收藏资源简介:
Open3DVQA是一个新颖的基准测试,用于从空中视角评估多模态大语言模型对复杂空间关系的推理能力。它包含89k个问答对,涵盖7种空间推理任务类型,包括多项选择、真假判断和简答格式,支持视觉和点云数据。问题是从真实世界和模拟空中场景中提取的空间关系自动生成的。
Open3DVQA is a novel benchmark for evaluating the reasoning capabilities of multimodal large language models (LLMs) on complex spatial relations from an aerial perspective. It contains 89k question-answer pairs, covering 7 types of spatial reasoning tasks including multiple-choice, true/false judgment, and open-ended question formats, and supports both visual and point cloud data. The questions are automatically generated based on spatial relations extracted from real-world and simulated aerial scenes.
Open3DVQA 数据集概述
数据集简介
Open3DVQA 是一个用于评估多模态大语言模型(MLLMs)从空中视角推理复杂空间关系能力的新型基准数据集。该数据集包含来自真实世界和模拟空中场景的空间关系自动生成的问答对。
数据集规模
- 问答对数量:89,000
- 任务类型:7种
- 数据格式:支持视觉数据和点云数据
- 问答格式:包括多项选择、真/假和简答形式
核心特点
- 涵盖四种空间视角和七种任务类型,用于全面的开放3D空间推理评估
- 引入可扩展的问答生成流程,从单个RGB图像提取3D空间关系并创建多样化问答格式
- 通过多模态校正流程确保数据质量
- 对主流MLLMs进行基准测试,揭示其当前空间推理局限性和模拟到现实的泛化能力
任务类型
1. 他中心大小推理
推断空间中两个对象之间的相对大小关系,如更长/更短、更宽/更窄、更高/更矮、更大/更小。
2. 他中心距离推理
推断对象之间的直线、垂直或水平距离。
3. 自我中心方向推理
推断对象相对于智能体的方向,如左、右、上、下。
4. 自我中心距离推理
推断对象与智能体之间的直线距离。
5. 他中心-自我中心转换方向推理
智能体基于自身移动推断对象相对于自身的方向。
6. 他中心-自我中心转换距离推理
智能体推断对象在水平或垂直方向上相对于自身的距离。
7. 对象中心大小推理
推断单个对象的绝对大小,如其长度、宽度或高度。
多模态支持
数据集支持以下模态:
- RGB图像
- 深度图
- 标题和边界框
- 掩码
- 点云数据
相关资源
- 论文地址:https://www.arxiv.org/abs/2503.11094
- 数据集地址:https://huggingface.co/datasets/EmbodiedCity/Open3DVQA-v2
- 代码许可证:Apache 2.0
- 数据许可证:Apache 2.0




