遇见数据集

BIM-Edit

收藏
arXiv2026-06-22 更新2026-06-24 收录
数据链接:
官方服务:

资源简介:

BIM-Edit是由罗斯托克大学与克劳斯塔尔工业大学联合构建的基准数据集,旨在评估大语言模型在建筑信息模型自然语言编辑任务中的性能。该数据集包含324项编辑任务,覆盖11个真实建筑模型与36个合成场景,数据以行业基础类格式存储,平均每个复杂模型包含614.88个元素与2088.88组关系。数据集通过专家手动构建,采用模块化任务语法设计,涵盖创建、更新、删除三大操作类型,并区分直接、空间、拓扑三种指令变体。该数据集主要应用于建筑信息建模领域,致力于解决大语言模型在结构化工程设计工作流中存在的场景理解不足、语义拓扑一致性维护困难等核心问题。

BIM-Edit is a benchmark dataset jointly constructed by the University of Rostock and Clausthal University of Technology, aiming to evaluate the performance of Large Language Models (LLMs) in natural language editing tasks for Building Information Modeling (BIM). This dataset includes 324 editing tasks, covering 11 real-world building models and 36 synthetic scenarios, with data stored in industry-standard basic formats. On average, each complex model contains 614.88 elements and 2088.88 relationship groups. The dataset was manually built by domain experts, designed with modular task grammar, covering three operation types: creation, update and deletion, and distinguishing three instruction variants: direct, spatial and topological. This dataset is mainly applied in the field of building information modeling, and is committed to solving core problems existing in LLMs in structured engineering design workflows, such as insufficient scene understanding and difficulties in maintaining semantic and topological consistency.

创建时间:
2026-06-18
搜集汇总
数据集介绍
BIM-Edit 数据集图片
构建方式
BIM-Edit基准数据集以工业基础类(IFC)格式的建筑信息模型(BIM)为操作对象,系统性地构建了324项自然语言编辑任务。数据集的构建遵循模块化语法模式,每项任务由操作算子、目标元素和指令类型三个核心要素组成。其中,操作算子涵盖创建、更新与删除三类;指令类型包括直接指令、空间指令和拓扑指令,分别对应不同层次的上下文理解需求。场景复杂度分为简单合成场景与复杂真实建筑场景,前者包含平均21个元素,后者则高达615个元素。所有任务均配有人工标注的基准模型,确保评价的准确性与一致性。
特点
该数据集最显著的特点在于其多维度的评价体系,超越了传统CAD基准仅关注几何精度的局限。BIM-Edit从几何准确性、语义有效性和拓扑一致性三个维度对模型输出进行全面评估,其中语义维度检查IFC类与属性的正确性,拓扑维度验证元素间连接关系的完整性。此外,数据集通过直接、空间和拓扑三类指令引入不同层次的隐式推理需求,能够系统性地测试模型在场景理解与关系推理方面的能力。实验表明,当前最优模型的平均得分仅为49.5%,且无模型能完全解决超过3.4%的任务,充分揭示了现有大语言模型在结构化工程编辑任务中的显著能力差距。
使用方法
使用BIM-Edit时,模型需在代码执行环境中接收自然语言指令与IFC模型路径,通过生成Python代码(基于IfcOpenShell库)对模型进行查询与修改。模型可进行多次工具调用,先通过查询理解场景上下文,再执行编辑操作,最终输出修改后的IFC文件。评价系统通过轻量级IFC差异工具提取编辑子图,仅对实际变更的元素进行几何、语义与拓扑三个维度的评分,避免未变更部分对评价结果的干扰。该评价协议独立于具体的代理设计,任何能够读写IFC文件的系统均可按照相同的流程进行性能评估。
背景与挑战
背景概述
建筑信息模型(BIM)作为土木工程领域中确保工具互操作性的全生命周期数据管理范式,超越了传统计算机辅助设计(CAD)仅关注几何表征的局限,通过面向对象的语义模型封装了构件类别、属性及显式关系。然而,当前大多数CAD基准测试聚焦于从零生成新模型,忽视了工程实践中对既有模型进行编辑、保持语义与拓扑一致性的核心需求。为此,罗斯托克大学与克劳斯塔尔工业大学的研究人员于2026年联合推出了BIM-Edit数据集,旨在评估大语言模型在基于工业基础类(IFC)格式的BIM自然语言编辑任务上的表现。该数据集包含324项编辑任务,覆盖11个真实建筑模型与36个合成场景,通过直接、空间与拓扑三类指令系统评估模型在几何精度、语义有效性与拓扑一致性三个维度的综合能力,为推进语言驱动型结构化工程设计工作流提供了关键基准。
当前挑战
BIM-Edit数据集所应对的核心挑战在于弥合当前大语言模型能力与结构化工程设计工作流需求之间的显著差距。首先,编辑任务要求模型不仅理解现有场景,还需对建筑信息模型进行正确修改并维持语义与关系结构的完整性,而大多数CAD基准仅评估几何正确性。其次,构建过程面临指令歧义性难题——真实场景中的编辑请求常通过空间、语义或拓扑关系间接指代元素,模型需具备隐式自然语言理解与上下文推理能力。实验表明,性能最佳的大语言模型仅达到49.5%的平均得分,且无一模型能完全解决超过3.4%的任务,充分揭示了现有模型在同时保证几何准确性、语义有效性与拓扑一致性方面的系统性不足。
常用场景
经典使用场景
在建筑信息模型(BIM)领域,BIM-Edit 最为经典的使用场景是评估大语言模型(LLM)在自然语言驱动的 Industry Foundation Classes(IFC)模型编辑任务上的综合能力。该基准测试跨越了创建、更新与删除三类基本操作,并涵盖了直接、空间与拓扑三种语义粒度的指令类型,系统性地衡量 LLM 在面对真实建筑场景时,进行几何变换、语义属性修改与关系一致性维护的表现,为结构化工程设计环境下的智能辅助提供了标准化的评测范式。
衍生相关工作
BIM-Edit 的提出催生了若干具有代表性的延伸研究工作,主要包括两个方面:一是在基准评测框架的基础上,研究如何构建更高效的 IFC 编辑代理,例如结合检索增强生成(RAG)机制与 IFC 模式感知工具来提升语义与拓扑操作的准确性;二是受该数据集揭示的几何与语义一致性挑战启发,后续工作开始探索多步、跨构件的联合编辑任务,以及利用视觉-语言模型在物理合理性验证与结构安全性约束方面的适配能力,从而推动 AI 辅助结构化工程设计从单步编辑向复杂协作场景演进。
数据集最近研究
最新研究方向
当前,BIM-Edit数据集聚焦于评估大型语言模型在基于IFC标准的建筑信息模型编辑任务中的表现,这标志着该领域从传统的几何生成向结构化工程语义理解的转变。前沿研究方向主要包括:通过自然语言指令执行创建、更新、删除等操作,并严格从几何精度、语义有效性和拓扑一致性三个维度进行综合评价。研究热点集中在处理空间和拓扑关系隐含的间接指令,这要求模型不仅理解场景布局,还需动态查询IFC图结构以完成推理。该基准的发布揭示了当前LLM在该任务上的显著能力鸿沟——最佳模型平均得分不足50%,完全正确率低于3.4%,凸显了实际工程应用中可靠性与实时性的巨大挑战,并为未来研发更高精度的BIM编辑智能体提供了关键评估框架。
相关研究论文
  • 1
    BIM-Edit: Benchmarking Large Language Models for IFC-Based Building Information Modeling罗斯托克大学; 克劳斯塔尔工业大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务