遇见数据集

Perspective Taking; Path Tracing; Multiview Counting

收藏
arXiv2026-06-03 更新2026-06-04 收录
数据链接:
官方服务:

资源简介:

该研究构建了三个空间想象力数据集,由华盛顿大学、艾伦人工智能研究所等机构联合创建,旨在训练和评估视觉语言模型的空间推理能力。数据集包含约8.6万条样本,涵盖模拟和真实环境,数据来源于AI2-THOR、Habitat、Matterport3D等平台,通过渲染和模板生成技术创建。这些数据集应用于空间推理任务,解决视角转换、路径追踪和多视图计数等问题,提升模型对未观察空间结构的想象力。

This study constructs three spatial imagination datasets, jointly created by institutions including the University of Washington, the Allen Institute for AI, and others. The datasets are designed to train and evaluate the spatial reasoning capabilities of vision-language models. They contain approximately 86,000 samples, covering both simulated and real-world environments, with data sourced from platforms such as AI2-THOR, Habitat, and Matterport3D, and generated through rendering and template generation techniques. These datasets are applied to spatial reasoning tasks, addressing problems like viewpoint transformation, path tracing, and multi-view counting, to enhance the model's imagination of unobserved spatial structures.

创建时间:
2026-06-03
搜集汇总
数据集介绍
Perspective Taking; Path Tracing; Multiview Counting 数据集图片
构建方式
该数据集围绕空间想象推理构建,包含三大任务:透视取景(Perspective Taking)、路径追踪(Path Tracing)和多视角计数(Multiview Counting)。数据来源涵盖AI2-THOR、Habitat等合成模拟环境,以及Matterport3D、MessyTable等真实场景。每个任务均生成约2万条样本,通过3D引擎渲染获得第一人称视图、鸟瞰地图或侧面视野作为中间想象表征,并配有最终答案。以透视取景为例,模型需根据单张第一人称图像及其标记的目标位置,模拟新视角下的场景并回答物体相对位置或距离变化。路径追踪则要求从俯视地图和端点视角推测中间点的可见物体。多视角计数任务整合多个第一人称帧,生成俯视聚合图以消除跨视角重复计数。数据集还通过TIFA过滤、人类验证及平衡子类别设计确保质量。
特点
该数据集的核心特点在于显式提供中间想象表征作为监督信号,填补了传统空间推理中“不可直接观测结构”的空白。每个任务均包含地面真值的想象目标(如新视角渲染图、侧面图或鸟瞰图),使模型能够学习从输入证据中推断未观测空间配置。数据集覆盖合成与真实场景,并引入人类验证的评估基准,确保推理的真实性。其任务设计强调空间想象而非简单特征提取,例如透视取景中的视角变换、路径追踪中的遮挡推理、多视角计数中的跨视角对应。此外,数据集通过平衡子类别(如左右/远近关系)和去偏采样避免模型依赖表面线索,迫使模型真正进行空间计算。
使用方法
该数据集适用于训练和评估多模态大语言模型的空间推理能力。使用时可分阶段进行:首先,基于输入图像和空间问题,模型需生成中间想象表征(如新视角图像或鸟瞰地图),这一过程可通过连续潜变量(如BAGEL的流匹配损失)或离散令牌(如VQGAN码本)实现。随后,模型基于生成的想象表征最终输出答案。训练时,可采用“想象令牌+答案”的多任务损失,或混合训练策略将想象监督与纯答案监督结合。推理时,模型可选择显式生成想象图像后再回答,或直接以无图像模式推理,实验表明后一种方式仍能受益于训练阶段的想象监督。该数据集还支持跨环境和跨任务迁移测试,如从合成场景迁移至真实世界数据。
背景与挑战
背景概述
视觉语言模型在诸多任务上表现卓越,然而空间推理依旧是横亘于前的一大挑战。许多空间问题要求模型进行想象性感知,例如模拟未见视角、追踪遮挡空间的轨迹或将部分视图整合为连贯空间地图,这些能力人类可通过想象自然完成。为系统探究此能力,来自华盛顿大学、艾伦人工智能研究所、微软及OpenAI的研究团队于2026年提出了Imaginative Perception Tokens(IPT)方法,并构建了三个专用数据集:Perspective Taking(PET)、Path Tracing(PT)及Multiview Counting(MVC),每个数据集包含约2万个涵盖仿真与现实场景的样本,并配有真实空间想象中间表示。这些数据集首次为训练和评估视觉语言模型在空间推理中的视觉中间表征提供了标准化基础,对推动空间智能研究具有里程碑意义。
当前挑战
当前视觉语言模型面对的核心挑战在于,许多空间推理问题无法通过直接分析输入信息解决,而需要构建并未直接观测到的空间表征。例如,Perspective Taking要求模型从第一人称视角预测新视点下的场景,Path Tracing需要根据俯视图推断路径中点的第一人称可见性,Multiview Counting则需整合多个局部视角以消除遮挡与跨视角重复带来的歧义。数据构建过程同样面临挑战:PET需从3D场景中精准采样源/目标相机对并渲染新视点图像,PT需严格筛选那些无法单从端点视图回答的样本以确保真实想象需求,MVC则需在复杂场景中处理物体跨帧重复的消歧问题。此外,数据集的规模平衡、真实世界样本的标注质量控制以及不同环境间的泛化能力,均为构建过程中需要克服的难题。
常用场景
经典使用场景
在空间推理领域,该数据集被经典地应用于训练和评估多模态语言模型在面对不可直接观测的空间结构时的想象力构建能力。具体而言,研究者利用Perspective Taking、Path Tracing和Multiview Counting三个子任务,要求模型分别完成视角转换下的相对位置判断、路径中点的侧视物体识别,以及多视角融合后的物体计数。这些任务共同构成了一个标准化的评估框架,用以衡量模型是否具备从有限观测中推断缺失空间信息的能力,从而为空间智能的量化研究提供了可复现的基准。
实际应用
在实际应用中,该数据集所训练的空间想象能力可赋能多种需要空间感知的智能系统。在自主导航领域,移动机器人可以借助视角预测能力推断障碍物后方的场景布局,从而规划更安全的路径;在增强现实与虚拟现实场景中,系统能够根据用户视点变化实时生成合理的物体相对位置关系,提升沉浸式交互的自然度;在智能监控与场景重建任务中,多视角融合技术则可用于跨摄像头对象的去重与计数,降低人工标注成本。这些应用场景共同受益于模型从该数据集中习得的、对未观测空间结构的稳健推断能力。
衍生相关工作
该数据集衍生了一系列围绕空间想象与中间视觉表征的经典工作。一方面,研究者借鉴Imaginative Perception Tokens的思想,在更广泛的视觉推理任务中引入视觉草图板(Visual Sketchpad)或视觉思维链(Visualization-of-Thought)等方法,将中间推理步骤外化为可操作的视觉缓冲。另一方面,后续工作如Mull-Tokens与Mirage等聚焦于模态无关的潜在思维令牌,探索在统一解码器架构中融合理解与生成能力。此外,该数据集直接催生了针对视角转换、路径推理和多视角计数的专项基准测试(如SAT、MindCube等),形成了空间智能评估的衍生生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务