遇见数据集

IDEAL-Scenes

收藏
arXiv2026-07-04 更新2026-07-07 收录
数据链接:
官方服务:

资源简介:

IDEAL-Scenes是由达特茅斯学院研究团队构建的合成室内场景数据集,包含1000个跨10种房间类型的可重新渲染三维环境。该数据集通过程序化生成流程创建,每个场景均包含渲染图像、Blender源文件、实例分割图和精确的三维布局标注,支持对视觉语言模型进行几何精度与感知一致性的双重评估。数据集采用基于InfiniGen的改进生成框架,在可控光照与视角下实现资产完全替换,确保评估结果纯粹反映空间推理能力,广泛应用于三维布局推断、视觉语言模型空间智能诊断等前沿研究领域。

IDEAL-Scenes is a synthetic indoor scene dataset developed by a research team at Dartmouth College. It comprises 1,000 re-renderable 3D environments spanning 10 room types. Created through a procedural generation pipeline, each scene in the dataset contains rendered images, Blender source files, instance segmentation maps, and precise 3D layout annotations, supporting dual evaluations of geometric accuracy and perceptual consistency for vision-language models. The dataset adopts an improved generation framework based on InfiniGen, which enables full asset replacement under controllable lighting and viewing angles, ensuring that evaluation results purely reflect spatial reasoning capabilities. It is widely applied to cutting-edge research fields such as 3D layout inference and spatial intelligence diagnosis of vision-language models.

提供机构:
达特茅斯学院
创建时间:
2026-07-04
原始信息汇总

数据集概述

  • 名称: IDEAL-Scenes

  • 简介: 一个用于评估视觉语言模型(VLM)3D空间推理能力的合成室内场景数据集。包含1000个室内场景,覆盖10种房间类型,每个场景都配有程序化生成的精确3D布局标注和可重新渲染的Blender源文件。

  • 规模: 1000个场景,每种房间类型100个场景。

  • 房间类型: 卧室、家庭工作室、客厅、厨房、浴室、餐厅、办公室、会议室、教室、图书馆。

  • 数据构成: 每个场景包含一个渲染的RGB图像、程序化生成的地面真值标注、scene.blend源文件、实例分割图以及场景元数据。

  • 生成方式: 基于InfiniGen的程序化管线构建,该管线已开源,支持扩展以涵盖更多房间类型、资产库和任意相机视点的渲染。

  • 任务定义: 从单张RGB图像、候选物体类别列表和候选房间类型集合中,模型必须输出全局一致的3D布局,包括房间类型、房间尺寸,以及对每个可见物体的类别、3D中心位置、边界框尺寸和偏航旋转的预测。不提供深度、相机参数或实例掩码。

  • 评估协议:

    • 数值评估: 通过11个指标对五个维度(D1: 场景有效性、D2: 物理合理性、D3: 几何精度、D4: 物体识别、D5: 网格布局)进行评分。综合得分为所有适用指标的无权重均值。
    • 感知评估: 将预测的物体位姿替换到原始Blender场景中重新渲染,由Judge VLM(Claude Opus 4.7)对重建结果与参考图像进行1-5分的空间相似度打分及严格排名,重复五次取平均。该评估仅限于排名前六的模型,在200个场景上进行。
  • 主要发现:

    • 场景有效性和物体识别普遍较强,但几何精度在所有模型上表现不佳,表明当前VLM擅长描述场景而非测量场景。
    • 性能并不随参数规模增长,较小的模型有时能超越更大的模型,说明度量3D理解更多取决于训练构成而非原始规模。
    • 模型生成的内部规则网格往往无法与世界正确对齐,暴露了一个新的盲点。

排行榜摘要

数值排行榜

领先模型: Gemini 2.5 Pro,综合得分最高(62.1/100)。

模型 综合得分 排名
Gemini 2.5 Pro 62.1 1
GPT-4o 60.4 2
Gemma-4-31B-IT 59.7 3
Claude Sonnet 4.6 59.2 4
GPT-5.4 56.7 5
  • 关键观察: D1(场景有效性)接近饱和,D4(物体识别)普遍强劲,但在D3(几何精度)方面性能急剧下降。两个模型(InternVL3.5-30B-A3B、Janus-Pro-7B)未能解析出有效的输出。

感知排行榜

模型 平均感知评分 平均排名 Top-1 (%)
Gemini 2.5 Pro 3.56 2.40 41.2
GPT-5.4 3.49 2.45 23.5
Gemma-4-31B-IT 3.22 3.26 11.8
  • 关键观察: 感知排名与数值排名大致一致,但有一个例外:GPT-4o数值排名第二,但在感知评估中排名倒数第二,表明其高数值得分来自单个物体的粗略正确,而整体布局的连贯性较差。
搜集汇总
数据集介绍
IDEAL-Scenes 数据集图片
构建方式
在室内场景理解领域,现有的数据集往往无法同时满足精确标注与可重渲染的双重需求。IDEAL-Scenes数据集基于InfiniGen程序化生成引擎构建,包含1,000个涵盖10种房型的室内场景。每个场景均经过严格的质量过滤,剔除无可见家具或存在网格穿插的样本,并辅以视角内物体判定流程,确保标注的精确性。生成的每个场景均包含渲染的RGB图像、地面真实布局标注、可重渲染的Blender源文件、实例分割图及元数据,为后续评估提供了完整且可控的数据基础。
特点
IDEAL-Scenes的核心特色在于其精心设计的场景多样性与可控性。数据集覆盖卧室、教室、图书馆等10种房型,并针对居住空间与工作空间分别设计了非对称与网格状布局,以全面探测模型在不同空间结构下的泛化能力。每个场景均通过标准化光照与渲染参数严格控制视觉质量,消除了生成伪影对评估的干扰。更重要的是,数据集保留了完整的Blender源文件,使得预测布局可被重渲染并与原始图像进行像素级对比,从而将空间推理误差从材质、光照等混淆因素中剥离。
使用方法
该数据集专为视觉-语言模型的室内场景布局推理能力评估而设计。使用时,研究人员将单张RGB图像输入模型,并配合提供候选物体类别列表与房型候选集,要求模型输出结构化的3D布局预测,包括每个可见物体的类别、位置(三维坐标)、尺寸及朝向。预测结果可通过两条路径进行验证:一是与地面真实标注进行数值化比较,涵盖场景有效性、物理合理性、几何精度、物体识别及网格布局五个维度;二是将预测布局重渲染为图像,由人类或判别型模型进行感知相似性评估,从而全面衡量模型的空间理解能力。
背景与挑战
背景概述
三维空间理解是视觉语言模型迈向通用智能的核心瓶颈之一。尽管现有模型在场景描述与关系问答上表现卓越,但能否从单张图像中精确推断出每个可见物体的三维位置、朝向与尺度,始终缺乏系统化的度量标准。为填补这一空白,达特茅斯学院计算机科学系的蔡月宁、周俊伟、屈悠然与戴宇荣于2026年提出了IDEAL-Scenes数据集。该数据集包含1000个涵盖10种室内类型的照片级真实场景,每个场景均配备程序化生成的真实布局标注与可重新渲染的Blender源文件。通过将空间智能评估从定性问答推进至定量几何推理,IDEAL-Scenes为揭示模型在全局三维布局推断上的真实能力提供了首个可复现的诊断平台,对机器人导航、增强现实等空间关键型应用具有深远影响。
当前挑战
IDEAL-Bench所揭示的核心挑战源于语言描述与几何测量之间的结构性鸿沟。一方面,现有视觉语言模型在物体识别与场景有效性上接近饱和,但在几何回归维度上普遍崩溃——即使最强模型的位置精度也仅达10.8%,旋转精度不足37.7%,揭示了模型擅长描述场景却无法度量场景的本质缺陷。另一方面,数据集的构建本身充满挑战:需要同时保证合成场景的物理合理性、标注的无噪声提取以及可重新渲染性,为此研究团队对InfiniGen引擎进行了针对性改造,包括限制矩形房间几何、标准化光照参数、实施严格的家具无穿透筛选与物体可见性过滤。这些挑战共同将三维布局推理确立为一个远未解决的任务,其难度远超基于问答的传统基准所能暴露的程度。
常用场景
经典使用场景
在三维视觉与多模态智能的交叉领域中,IDEAL-Scenes数据集被设计为评估视觉语言模型(VLM)全局三维布局推理能力的核心基准。其经典使用场景在于,从单张RGB图像出发,要求模型以结构化格式预测场景中每个可见物体的三维位置、朝向与尺度,涵盖卧室、教室、图书馆等十种室内空间类型。这种布局推理任务强调模型从离散语言描述转向连续几何测量的能力,通过数值几何度量与感知重渲染对比的双重评估范式,揭示出传统空间问答基准所无法捕捉的几何缺陷。
实际应用
在实际应用层面,IDEAL-Scenes所检验的全局布局推理能力构成了增强现实锚定、自主机器人导航、三维内容生成等物理世界交互技术的基石。例如,在机器人执行室内抓取任务时,准确预估目标物的姿态与包围体尺寸比单纯识别其类别更为关键;在AR场景中,虚拟物体的正确嵌入离不开对真实空间边界的精确理解。该数据集通过可复现的合成场景与程序化标注,为这些下游系统提供了评估空间智能的扎实起点。
衍生相关工作
IDEAL-Scenes的发布催生了一系列聚焦于空间推理诊断的衍生工作。其核心贡献IDEAL-Bench评估套件被设计为空间问答与基元重建基准的互补工具,揭示了模型排名在交互验证中的非对称性——顶尖模型共识稳固,而中游梯队排序显著漂移。此外,该数据集的双评估通路(数值度量与感知判分)启发后续研究者将Judge VLM引入空间质量评估,其与人类感知的高度一致性(斯皮尔曼相关系数0.79)为可扩展的感知评价范式建立了方法论标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务