遇见数据集

FloorplanQA

收藏
github2026-05-25 更新2026-06-07 收录
官方服务:

资源简介:

FloorplanQA是一个用于评估大语言模型和视觉语言模型在俯视平面图布局上进行空间推理的基准数据集。它包含三种渲染风格、八个任务生成器,以及用于LLM/VLM评估的提示构建器。数据集提供布局JSON的俯视渲染、AI生成的真实感俯视图像,以及针对不同任务家族的问题生成代码。

FloorplanQA is a benchmark dataset for evaluating Large Language Models (LLMs) and Vision-Language Models (VLMs) on spatial reasoning over top-down floorplan layouts. It encompasses three rendering styles, eight task generators, and a prompt builder for LLM/VLM evaluation. The dataset provides top-down renderings of layout JSON files, AI-generated photorealistic top-down images, as well as question generation code tailored for different task families.

创建时间:
2026-05-25
原始信息汇总

数据集概述

  • 数据集名称:FloorplanQA
  • 论文收录:ICML 2026(韩国首尔)
  • 项目主页:https://olddelorean.github.io/FloorplanQA/

核心内容

FloorplanQA 是一个用于评估空间推理能力的基准数据集,基于俯视建筑平面图布局。数据集包含八个任务族,并提供布局渲染管线、问题生成代码,以及用于评估 LLM 和 VLM 的提示构建代码。

任务族

数据集覆盖八类空间推理任务,每类任务在 src/qa_generation/ 下对应独立模块:

  • pair_distance(成对距离)
  • free_space(自由空间)
  • max_box(最大包围盒)
  • view_angle(视角角度)
  • obstruction(遮挡判断)
  • placement(摆放位置)
  • repositioning(重新定位)
  • shortest_path(最短路径)

每个模块暴露 generate(layout, ...) 函数,返回 (question, answer) 对;shortest_path 额外返回有效路径。

布局数据

  • 布局数据发布在 Hugging Face 上:https://huggingface.co/papers/2507.07644
  • 本仓库仅包含代码及示例布局(data/examples/)。

评估方式

src/evaluation/ 下包含多种评估条件下的提示构建代码:

  • preparation.py:仅 JSON 基线
  • preparation_2_0.py:JSON + 图像条件(Boxes / Icons)
  • preparation_tools.py:Python 代码解释器增强
  • src/image_gen/preparation_3_0.py:AI 生成图像下的 VLM 批次

图像生成

src/image_gen/generate_nanobana.py 使用 Gemini 3.1 Flash Image 的图到图模式,将示意性渲染图转换为逼真俯视图,保持家具位置不变。需设置环境变量 GOOGLE_API_KEY

许可证

MIT 许可证

引用

bibtex @inproceedings{rodionov2025floorplanqa, title = {FloorplanQA: A Benchmark for Spatial Reasoning in LLMs using Structured Representations}, author = {Rodionov, Fedor and Eldesokey, Abdelrahman and Birsak, Michael and Femiani, John and Ghanem, Bernard and Wonka, Peter}, booktitle = {Proceedings of the 43rd International Conference on Machine Learning (ICML)}, year = {2025}, address = {Seoul, South Korea} }

搜集汇总
数据集介绍
FloorplanQA 数据集图片
构建方式
FloorplanQA数据集的构建以结构化布局为基础,通过自上而下的渲染管线将JSON格式的室内平面图转化为视觉布局。数据集涵盖了八类空间推理任务,包括成对距离、自由空间、最大包围盒、视角、遮挡、放置、重定位及最短路径。每类任务均设有独立的生成模块,调用统一的几何工具库,以布局数据为输入输出问答对。部分布局进一步通过Gemini 3.1 Flash模型在图像到图像模式下生成为逼真的俯视图,保持家具位置不变,形成多模态条件样本。
特点
FloorplanQA的一大亮点在于其对空间推理能力的系统性评估,既支持以纯结构化JSON为输入的基线测试,也融合了视觉图像(如边框标注与图标渲染)与AI生成的逼真图像作为条件,从而衡量大语言模型与视觉语言模型在不同信息表现形式下的表现。此外,数据集支持Python代码解释器的工具增强,为模型提供了计算辅助的推理途径,提升了任务复杂度与多样性的覆盖。
使用方法
使用FloorplanQA时,用户可通过conda环境安装依赖并运行渲染示例脚本验证管线。问答生成依赖各任务模块的generate函数,用户只需准备布局数据即可产出问答对。评估阶段采用preparation系列脚本组装提示批次,可分别选择纯JSON或结合图像条件的模式,甚至启用代码解释器增强。图像生成需设置Google API密钥以调用Gemini模型进行风格转换,产生用于视觉语言模型测试的逼真图像批次。
背景与挑战
背景概述
空间推理能力作为人工智能迈向通用智能的关键一环,近年来受到广泛关注。尽管大语言模型(LLMs)与视觉语言模型(VLMs)在自然语言处理与图像理解任务上取得了显著突破,其在结构化空间场景中的推理能力仍缺乏系统性的评测基准。在此背景下,FloorplanQA数据集于2025年由Fedor Rodionov、Abdelrahman Eldesokey、Michael Birsak、John Femiani、Bernard Ghanem及Peter Wonka等研究者共同构建,并收录于ICML 2026会议论文集。该数据集聚焦于自上而下建筑平面图中的空间关系理解,涵盖八类任务族,旨在系统评估模型在空间位置、距离、视角、遮挡、放置与路径规划等复杂场景下的推理水平。FloorplanQA的提出填补了当前空间推理基准领域的空白,推动了大型模型在结构化空间理解方向的研究进展。
当前挑战
FloorplanQA所应对的核心挑战在于现有大模型在结构化空间推理任务中普遍存在的能力瓶颈。具体而言,传统自然语言评测多聚焦于语义或常识推理,难以捕捉空间实体间的几何关系与拓扑结构;而视觉问答基准虽然引入图像信息,却缺乏对精细布局与尺寸关系的深入考察。FloorplanQA通过定义八类空间推理任务,覆盖相对位置、自由空间、最大包围盒、视点角度、遮挡检测、物件摆放、重定位及最短路径等多维度评估,系统性地揭示了当前LLMs与VLMs在空间理解方面的不足。构建过程中,研究者面临渲染平面图几何信息、设计可靠自动问答生成流程、以及生成逼真遥感图像以测试模型多模态融合能力等挑战。此外,确保任务不依赖训练数据记忆,而是真正考察模型的几何推理与空间认知能力,也是数据构建中的关键难点。
常用场景
经典使用场景
FloorplanQA 基准测试在人工智能与空间智能交叉领域占据着举足轻重的地位,其最经典的使用场景聚焦于评估大型语言模型与视觉语言模型在结构化环境中的空间推理能力。该数据集通过自上而下的平面布局图,精心设计了八大任务家族(包括配对距离、自由空间、最大箱子、视角、遮挡、放置、重定位及最短路径),系统性地测试模型在真实室内空间中的几何理解、方位判断与路径规划能力。研究者可借助其开源的渲染管线与问题生成代码,快速复现从布局JSON到空间问答对的全流程,从而在统一框架下横向对比不同模型的推理精度与鲁棒性。
解决学术问题
在学术研究层面,FloorplanQA 精准解决了当前多模态模型中空间推理能力缺乏系统性评测的痛点。以往基准多聚焦于视觉问答或常识推理,而忽视了结构化空间关系中蕴含的几何约束与拓扑逻辑。该数据集通过将抽象的空间关系(如物体间的相对位置、遮挡遮蔽程度、可行区域计算)量化为可重复验证的问答任务,为研究者提供了评估模型是否真正理解空间概念的“试金石”。其意义在于揭示了语言模型在空间泛化上的瓶颈,推动了从表格感知向结构化空间理解的研究范式转变,并为后续构建更接近人类空间认知的智能体奠定了评测基础。
衍生相关工作
FloorplanQA 的面世催生了诸多富有洞察力的衍生工作。研究者基于其八大任务家族,探索了在JSON结构化输入、矢量图标渲染与AI生成实景图三种模态下模型表现的差异,进而揭示了视觉细节对空间推理的双刃剑效应——虽能提供上下文线索,却可能引入噪声干扰。此外,该数据集启发了面向Python代码解释器增强的评测分支,验证了工具增强型模型(如借助几何库进行计算)能否弥补原生Transformer在几何运算上的短板。这些工作共同推动了空间推理领域从纯神经方法向神经符号融合方向的演进,也为设计更高效的室内场景理解架构提供了实证参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务