遇见数据集

etri-vilab/MultihopSpatial

收藏
Hugging Face2026-07-21 更新2026-03-29 收录
官方服务:

资源简介:

MultihopSpatial 是一个基准测试数据集,旨在评估视觉语言模型(VLMs)在多跳组合空间推理方面的鲁棒性。与仅评估单步空间关系的现有基准不同,MultihopSpatial 包含1到3个推理跳数的查询,并配有视觉定位评估,揭示了一个关键盲点:在多项选择题中准确率高的模型往往缺乏正确的空间定位能力。所有4,500个基准QA对和边界框均由十名训练有素的人类专家严格标注,内部评分者一致性为90%(Krippendorffs α = 0.90)。该数据集支持自我中心和外中心视角,涵盖属性、位置和关系三种空间类别,并可组合成多跳问题。此外,还提供训练数据MultihopSpatial-Train(6,791个样本),支持通过强化学习进行后训练。

MultihopSpatial is a benchmark designed to evaluate whether vision-language models (VLMs) demonstrate robustness in multi-hop compositional spatial reasoning. Unlike existing benchmarks that only assess single-step spatial relations, MultihopSpatial features queries with 1 to 3 reasoning hops paired with visual grounding evaluation, exposing a critical blind spot: models achieving high multiple-choice accuracy often lack proper spatial localization. All 4,500 benchmark QA pairs and bounding boxes are strictly annotated by ten trained human experts with an inter-rater agreement of 90% (Krippendorffs α = 0.90). It includes perspective-taking (ego-centric and exo-centric viewpoints) and three spatial categories (Attribute, Position, and Relation) composable into multi-hop questions. The dataset also provides training data, MultihopSpatial-Train (6,791 samples), to support post-training via reinforcement learning.

提供机构:
etri-vilab
搜集汇总
数据集介绍
etri-vilab/MultihopSpatial 数据集图片
构建方式
MultihopSpatial数据集专为评估视觉语言模型的多跳组合空间推理能力而构建。该数据集包含4500个问答对及对应的边界框标注,所有数据均由十位经严格训练的人类专家完成标注,标注者间信度达到90%(Krippendorff's α = 0.90)。数据集涵盖1跳至3跳的推理复杂度,并整合了自我中心视角与外部中心视角两种空间参照系。在数据组织形式上,研究者提供了原始JSON图像文件、Parquet嵌入格式以及TSV格式,以满足不同评估框架的需求。
特点
MultihopSpatial的核心特点在于其多跳组合与视觉定位的联合评估机制。与仅评估单跳空间关系的基准不同,该数据集要求模型在完成多项选择的同时,还需通过边界框定位正确答案,从而有效规避模型仅凭猜测获得高分的问题。数据集内嵌了属性、位置和关系三种空间类别的可组合逻辑,支持1跳至3跳的推理链。此外,数据集包含6791个训练样本,可通过GRPO等强化学习方法进行后训练,进一步提升了其在真实具身智能场景中的应用潜力。
使用方法
使用MultihopSpatial数据集时,研究人员可通过Hugging Face datasets库直接加载Parquet格式数据,快速获取训练集与测试集。对于使用lmms-eval或VLMEvalKit评估框架的用户,数据集提供了开箱即用的配置,无需额外格式转换。每个样本包含问题文本、答案、像素坐标下的边界框及推理跳数等字段,便于进行细粒度分析。在自定义流水线中,可直接解析JSON文件并关联图像文件,通过对比预测边界框与真值框的IoU,衡量模型在空间定位方面的鲁棒性。
背景与挑战
背景概述
视觉语言模型在复杂空间推理任务中的表现一直是人工智能领域的研究热点,然而现有基准大多局限于单步空间关系评估,难以揭示模型在组合式、多跳推理中的真实能力。MultihopSpatial数据集由韩国电子通信研究院(ETRI)的Youngwan Lee、Soojin Jang等研究人员于2026年在欧洲计算机视觉大会(ECCV)上提出,旨在系统评测视觉语言模型在多跳组合空间推理中的鲁棒性。该数据集包含4,500个严格由十名训练有素的人类专家标注的问答对,标注者间信度高达0.90(Krippendorff's α)。通过引入1至3跳的推理复杂度、视觉定位评估以及自我中心与外部中心双视角,MultihopSpatial为空间推理研究提供了更具挑战性的基准,推动了视觉语言模型在具身智能等现实场景中的应用。
当前挑战
当前视觉语言模型在多跳空间推理中面临双重挑战。领域问题层面,现有模型在单步空间关系判断上表现优异,但当面临多步组合推理(如属性、位置与关系的顺序整合)时,常出现“幸运猜测”现象——虽能选出正确答案,却无法通过边框定位正确区域,暴露出空间理解与语言输出的脱节。构建过程层面,设计多跳、多视角且具有可组合性的空间问题需要精细的标注协议,既要确保推理链的逻辑连贯性,又要平衡自我中心与外部中心视角的多样性;同时,十名标注员需达到高达0.90的信度标准,对标注指南的清晰性与一致性提出了极高要求,任何歧义都会削弱基准的可靠性与泛化性。
常用场景
经典使用场景
在视觉与语言交叉领域,空间推理一直是衡量模型理解物理世界的关键维度。MultihopSpatial作为多跳组合空间推理基准,其经典使用场景是评估视觉语言模型(VLM)对复杂空间关系的逐层推理能力。数据集精心设计了从1跳至3跳的递进式查询,涵盖属性、位置和关系三大空间类别,并融合自我中心与外部中心双视角。通过要求模型不仅给出正确答案,还需输出目标边界框进行定位验证,该基准有效规避了传统多项选择测试中模型依赖统计捷径的"瞎猜"问题,为多步空间推理的鲁棒性评估树立了全新标杆。
实际应用
多跳空间推理能力是具身智能体在真实世界中行动的认知基石。MultihopSpatial所评估的技能直接影响一系列实际应用场景的表现:在家用服务机器人中,理解"从沙发右侧拿起放在茶几上的遥控器"这类多步空间指令需要模型依次推理物体属性、相对位置与视角依赖关系;在自动驾驶领域,从自我中心视角判断"左前方车辆后方的行人"同样依赖多跳空间解析。该数据集为验证VLM在这些复杂环境中的可靠性提供了标准化测试床,帮助研究者识别模型在空间链式推理中的薄弱环节,进而推动视觉语言模型向更安全、更可信的实际部署迈进。
衍生相关工作
MultihopSpatial的发布催生了若干富有影响力的衍生工作。一方面,其训练集(6,791样本)已成功用于基于GRPO等强化学习方法的模型后训练,证明多跳空间数据能有效增强VLMs的组合推理能力,代表性工作包括研究者在此基础上微调的MultiHopSpatial-Qwen3-VL-4B-Instruct模型。另一方面,该基准的数据格式设计(同时提供JSON、Parquet和TSV三种格式)极大降低了不同评估框架(如lmms-eval、VLMEvalKit)的接入门槛,推动了社区内多跳空间推理评测的标准化进程。此外,其详细的组合空间类别标签(ATT、POS、REL)为后续针对特定推理类型进行故障分析和模型改进的研究提供了精细的维度划分参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务