遇见数据集

ReasonCore/open-spatial-reasoning

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

Open Spatial Reasoning是一个用于评估从单张驾驶图像中进行3D空间推理的多选题数据集。该数据集旨在揭示前沿视觉语言模型在复杂驾驶场景(如高架道路、斜坡、弯道和交叉口)中依赖像素布局启发式方法(例如图像中位置较低表示更近、边界框更大表示更近)进行错误推理的失败模式。数据集包含由PlusAI运营的自动驾驶车辆收集的驾驶场景图像,每张图像带有编号的边界框,问题涉及度量3D推理,包括距离、横向位置、排序和方向。每个样本包括一张图像、一个问题、四个答案选项和正确答案。问题类别涵盖识别绝对距离、相对距离、选择更近物体、识别最右侧物体、左到右排序、识别位置和识别方向等任务类型。

Open Spatial Reasoning is a multiple-choice dataset for evaluating 3D spatial reasoning from single driving images. It is designed to surface the failure mode of frontier vision-language models that often answer questions correctly by luck while reasoning incorrectly, leaning on pixel-layout heuristics (e.g., lower in the frame = closer, bigger box = nearer) that break down on elevated roads, slopes, curves, and intersections. The dataset includes driving-scene images collected by autonomous vehicles operated by PlusAI, each with numbered bounding boxes referencing objects in the scene. Questions probe metric 3D reasoning about distance, lateral position, ordering, and heading. Each sample pairs an image with a question, four answer choices, and the correct answer letter. Question categories include identifying absolute distance, relative distance, picking closer objects, identifying the rightmost object, ordering leftmost objects, identifying position, and identifying heading.

提供机构:
ReasonCore
搜集汇总
数据集介绍
ReasonCore/open-spatial-reasoning 数据集图片
构建方式
Open Spatial Reasoning数据集由PlusAI采集的自动驾驶场景图像构建而成,专注于评估模型从单张驾驶图像中进行3D空间推理的能力。每个样本包含一张带有编号边界框的道路图像、一个空间推理问题、四个候选答案及正确答案标记。问题涵盖绝对距离估计、相对距离判断、近物选择、最右侧物体识别、左右顺序排列、相对位置分类及朝向判定等任务类型,旨在迫使模型依赖真实的3D场景理解而非像素布局捷径。
特点
该数据集的核心特点在于精心设计的问题集,能够有效暴露当前视觉-语言模型在空间推理中的系统性缺陷,例如模型常利用‘图像中位置越低越近’或‘边界框越大越近’等平面线索猜测答案,而在高架路、坡道、弯道和交叉路口等复杂场景中准确率骤降。数据集包含七类空间推理任务,全面覆盖距离、横向位置、顺序和朝向等维度,以严格的多选题形式推动模型走向真正的3D度量推理。
使用方法
该数据集以多选题形式呈现,适用于评估和微调视觉-语言模型在自动驾驶场景下的3D空间理解能力。使用方法为向模型输入带有编号边界框的单张驾驶图像,模型需从四个选项中选择正确答案。默认评估指标为准确率,可通过与现有生成或预训练模型结合,如指令微调版本的视觉大语言模型,进行零样本或少样本测试。数据集同时支持兼容HuggingFace Datasets库的标准化加载方式,便于集成至自动化评测流程。
背景与挑战
背景概述
在自动驾驶与三维视觉理解领域,从单目图像中推理度量级空间关系是赋予智能体真实场景感知能力的核心挑战。现有的视觉-语言模型虽在平面语义任务上表现卓越,却常依赖像素布局启发式(如“图像中靠下即更近”)来回答空间问题,导致在坡道、弯道、立交桥等非标场景中谬误频出。由PlusAI自动驾驶车队采集,Anurag Ganguli、Anshuman Lall等研究者于2026年创建并公开的Open Spatial Reasoning数据集,旨在系统性地暴露这一缺陷。该数据集包含近千组涵盖七类空间推理任务的单项选择题,要求模型基于单张驾驶图像中的编号边框,对物体距离、横向位置、前后序次及朝向进行真实的3D度量判断,而非借助平面捷径,为衡量模型的三维空间推理能力提供了严谨的基准测试工具。
当前挑战
该数据集所应对的核心领域挑战在于,主流的视觉-语言模型在三维度量推理上存在系统性盲区:它们能“猜对”答案,却无法基于真实3D结构进行因果推断,尤其在起伏路面、斜坡、多弯道及交叉路口等几何复杂性高的场景中,其依赖的像素布局启发式策略会全面失效。此外,构建过程也面临双重困境:一是需要从真实的自动驾驶路采数据中,精确标注出每张图像内物体的度量级空间属性(如绝对距离分档、相对方位、朝向等),人工标注的质量控制极为困难;二是必须设计出能杜绝平面启发式的对抗性提问逻辑,确保模型无法通过“更大边框即更近”等浅层线索正确作答,这对问题模板与场景的选择提出了极高要求。
常用场景
经典使用场景
Open Spatial Reasoning 数据集专为评估与提升驾驶场景中三维空间推理能力而设计,其经典应用场景聚焦于多模态大模型在单目驾驶图像上的空间理解。每张图像包含带有编号的边界框,用于标记场景中的物体,而问题涉及距离估计、横向位置判断、物体排序及朝向推理等任务,例如识别最远物体、判断相对距离或排列左右顺序。该数据集通过精心设计的问题,迫使模型从真实三维结构进行推理,而非依赖图像中的平面线索,如“画面下方更近”或“更大框更近”等启发式规则。这种设定使其成为测试前沿视觉-语言模型空间推理鲁棒性的标准基准,尤其适用于自动驾驶感知系统的能力验证。
实际应用
在实际应用中,该数据集直接服务于自动驾驶和智能机器人领域,用于评估与改进感知系统对周围三维环境的理解能力。具体而言,它可被嵌入自动驾驶汽车的视觉语言模型训练流程,通过对抗性地测试模型在带有坡道、弯曲道路或交叉口的驾驶图像上的空间推理表现,帮助识别并修正依赖平面坐标的偏见。此外,数据集还可用于验证机器人导航中的空间关系判断,如相对于自车的物体定位与跟驰距离估算。其轻量化规模(样本数少于一千)使其成为快速迭代测试的理想工具,便于算法开发者高效诊断模型在真实世界驾驶场景中的空间认知短板,从而提升系统的安全性与鲁棒性。
衍生相关工作
自发布以来,Open Spatial Reasoning 已引发一系列衍生工作,主要围绕三维空间推理的仿真数据增强与推理链条的可解释性分析。研究者基于该数据集的分类体系(如相对距离、朝向角识别等),开发出针对复杂路况(如多层立交桥、隧道出口)的扩展版,并引入对抗性场景生成方法以强化测试难度。此外,部分工作致力于将数据集的评估范式迁移至端到端自动驾驶模型,通过构建空间推理头(spatial reasoning head)来显式对齐三维坐标预测与语言输出。在可解释性方面,相关工作利用该数据集的错误案例,提出了基于神经符号推理的混合架构,将空间关系建模为结构化知识,从而提升模型在极端几何条件下的泛化能力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务