IDEAL-Scenes
收藏资源简介:
IDEAL-Scenes是由达特茅斯学院研究团队构建的合成室内场景数据集,包含1000个跨10种房间类型的可重新渲染三维环境。该数据集通过程序化生成流程创建,每个场景均包含渲染图像、Blender源文件、实例分割图和精确的三维布局标注,支持对视觉语言模型进行几何精度与感知一致性的双重评估。数据集采用基于InfiniGen的改进生成框架,在可控光照与视角下实现资产完全替换,确保评估结果纯粹反映空间推理能力,广泛应用于三维布局推断、视觉语言模型空间智能诊断等前沿研究领域。
IDEAL-Scenes is a synthetic indoor scene dataset developed by a research team at Dartmouth College. It comprises 1,000 re-renderable 3D environments spanning 10 room types. Created through a procedural generation pipeline, each scene in the dataset contains rendered images, Blender source files, instance segmentation maps, and precise 3D layout annotations, supporting dual evaluations of geometric accuracy and perceptual consistency for vision-language models. The dataset adopts an improved generation framework based on InfiniGen, which enables full asset replacement under controllable lighting and viewing angles, ensuring that evaluation results purely reflect spatial reasoning capabilities. It is widely applied to cutting-edge research fields such as 3D layout inference and spatial intelligence diagnosis of vision-language models.
数据集概述
-
名称: IDEAL-Scenes
-
简介: 一个用于评估视觉语言模型(VLM)3D空间推理能力的合成室内场景数据集。包含1000个室内场景,覆盖10种房间类型,每个场景都配有程序化生成的精确3D布局标注和可重新渲染的Blender源文件。
-
规模: 1000个场景,每种房间类型100个场景。
-
房间类型: 卧室、家庭工作室、客厅、厨房、浴室、餐厅、办公室、会议室、教室、图书馆。
-
数据构成: 每个场景包含一个渲染的RGB图像、程序化生成的地面真值标注、
scene.blend源文件、实例分割图以及场景元数据。 -
生成方式: 基于InfiniGen的程序化管线构建,该管线已开源,支持扩展以涵盖更多房间类型、资产库和任意相机视点的渲染。
-
任务定义: 从单张RGB图像、候选物体类别列表和候选房间类型集合中,模型必须输出全局一致的3D布局,包括房间类型、房间尺寸,以及对每个可见物体的类别、3D中心位置、边界框尺寸和偏航旋转的预测。不提供深度、相机参数或实例掩码。
-
评估协议:
- 数值评估: 通过11个指标对五个维度(D1: 场景有效性、D2: 物理合理性、D3: 几何精度、D4: 物体识别、D5: 网格布局)进行评分。综合得分为所有适用指标的无权重均值。
- 感知评估: 将预测的物体位姿替换到原始Blender场景中重新渲染,由Judge VLM(Claude Opus 4.7)对重建结果与参考图像进行1-5分的空间相似度打分及严格排名,重复五次取平均。该评估仅限于排名前六的模型,在200个场景上进行。
-
主要发现:
- 场景有效性和物体识别普遍较强,但几何精度在所有模型上表现不佳,表明当前VLM擅长描述场景而非测量场景。
- 性能并不随参数规模增长,较小的模型有时能超越更大的模型,说明度量3D理解更多取决于训练构成而非原始规模。
- 模型生成的内部规则网格往往无法与世界正确对齐,暴露了一个新的盲点。
排行榜摘要
数值排行榜
领先模型: Gemini 2.5 Pro,综合得分最高(62.1/100)。
| 模型 | 综合得分 | 排名 |
|---|---|---|
| Gemini 2.5 Pro | 62.1 | 1 |
| GPT-4o | 60.4 | 2 |
| Gemma-4-31B-IT | 59.7 | 3 |
| Claude Sonnet 4.6 | 59.2 | 4 |
| GPT-5.4 | 56.7 | 5 |
- 关键观察: D1(场景有效性)接近饱和,D4(物体识别)普遍强劲,但在D3(几何精度)方面性能急剧下降。两个模型(InternVL3.5-30B-A3B、Janus-Pro-7B)未能解析出有效的输出。
感知排行榜
| 模型 | 平均感知评分 | 平均排名 | Top-1 (%) |
|---|---|---|---|
| Gemini 2.5 Pro | 3.56 | 2.40 | 41.2 |
| GPT-5.4 | 3.49 | 2.45 | 23.5 |
| Gemma-4-31B-IT | 3.22 | 3.26 | 11.8 |
- 关键观察: 感知排名与数值排名大致一致,但有一个例外:GPT-4o数值排名第二,但在感知评估中排名倒数第二,表明其高数值得分来自单个物体的粗略正确,而整体布局的连贯性较差。




