遇见数据集

ScenePart

收藏
arXiv2026-06-05 更新2026-06-08 收录
数据链接:
官方服务:

资源简介:

ScenePart是由厦门大学研究团队构建的合成三维室内场景数据集,旨在支持细粒度部件感知的三维多模态大语言模型训练与评估。该数据集包含800个场景、21K+物体实例、44K+部件掩码及200K+语言指令,数据源自3D-CoMPaT的部件标注三维资产与3D-FRONT的室内布局。其创建过程通过四阶段流程实现:预处理部件标注资产、生成室内布局、场景合成点云采样、以及基于模板与LLM优化的语言任务标注。该数据集主要应用于三维场景理解领域,通过提供物体-部件层级的密集标注与语言指令,解决现有三维模型在功能部件感知、空间推理及具身交互等细粒度任务上的能力局限。

ScenePart is a synthetic 3D indoor scene dataset constructed by the research team from Xiamen University, aiming to support the training and evaluation of fine-grained part-aware 3D multimodal large language models. This dataset contains 800 scenes, over 21,000 object instances, more than 44,000 part masks and over 200,000 language instructions. Its data is sourced from part-annotated 3D assets of 3D-CoMPaT and indoor layouts of 3D-FRONT. The dataset is constructed through a four-stage workflow: preprocessing part-annotated assets, generating indoor layouts, scene synthesis and point cloud sampling, as well as language task annotation optimized using templates and LLMs. This dataset is primarily applied in the field of 3D scene understanding. By providing dense object-part hierarchical annotations and language instructions, it addresses the performance limitations of existing 3D models in fine-grained tasks such as functional part perception, spatial reasoning and embodied interaction.

创建时间:
2026-06-05
原始信息汇总

数据集概述:PAR3D 与 ScenePart

PAR3D 是一个统一的、具有部件感知能力的 3D 多模态大语言模型(3D-MLLM),旨在实现对 3D 场景中物体及其细粒度部件的理解、推理与定位。该模型由厦门大学多媒体可信感知与高效计算教育部重点实验室的研究团队提出。

核心能力

  • 能够同时处理物体级别和部件级别的 3D 视觉理解任务,包括视觉问答、指代分割和推理。
  • 超越了现有仅关注物体级别的 3D-MLLM 的局限性,支持更精细的部件级交互与理解。

数据集:ScenePart

研究团队同时引入了 ScenePart,一个用于训练和评估部件感知 3D 场景理解的数据集。

  • 数据规模
    • 800 个场景
    • 21K 个物体掩码
    • 44K 个部件掩码
    • 273K 条语言标注
  • 数据类型:包含物体掩码、部件掩码、物体-部件对应关系、场景上下文以及多任务语言指令。该数据集将带有部件标注的 3D 物体组合成合成的室内布局。

方法框架

PAR3D 框架通过三个关键组件实现部件感知:

  1. ScenePart 监督:利用完整的 3D 场景中物体和部件级别的掩码及其对应关系提供密集监督。
  2. 部件感知表示学习:通过部件感知对比学习和表示保持正则化,用细粒度的部件语义丰富视觉特征。
  3. 层级分割查询生成:利用粒度感知的定位标记区分物体级和部件级目标,用于统一的文本响应和掩码预测。

性能表现

  • PAR3D 在物体级别的 3D 视觉-语言任务(如指代分割、问答、密集描述)上保持强劲性能,同时作为一个统一的通用型 3D-MLLM。
  • 在 ScenePart 基准测试中,PAR3D 在物体、粗粒度部件和细粒度部件三种粒度级别上,均持续提升了指代分割和部件感知问答的性能。

参考信息

  • 论文:arXiv: 2606.06485
  • 代码:即将发布
  • 数据:即将发布
搜集汇总
数据集介绍
ScenePart 数据集图片
构建方式
ScenePart数据集的构建遵循一套系统化的四阶段流程。首先,从3D-CoMPaT数据集中筛选出具有部件级标注的三维模型,并进行尺寸归一化与语义描述生成。其次,利用MiDiffusion模型基于3D-FRONT的室内平面图合成多样化的布局方案,包括家具的类别、位置、朝向与尺度。随后,将预处理后的部件标注模型实例化至布局中,并采样生成完整的点云场景,在此过程中继承并维护物体与部件的掩码对应关系。最后,通过模板规则结合大语言模型精炼,生成涵盖物体描述、部件语义、空间关系及物体—部件关联的多任务语言指令,构建出包含273K条标注的完整数据集。
特点
ScenePart数据集在三维场景理解领域呈现出显著的结构化优势。它首次在场景级别提供了44K个部件掩码与21K个物体掩码的精确配对,并明确了每个部件与其宿主物体之间的归属关系。数据集覆盖800个合成室内场景,包含粗粒度部件与细粒度部件的层级划分,极大丰富了部件感知的语义粒度。此外,ScenePart集成了多种任务类型,包括视觉问答与指代表达分割,其中问答任务涵盖部件存在性、计数、颜色、空间关系及跨物体推理等五类问题,为评估模型在细粒度部件级理解能力提供了全面而严谨的基准。
使用方法
ScenePart数据集的设计紧密契合三维多模态大语言模型的训练与评估流程。在使用时,研究者可将其划分为200K条训练指令构成的ScenePart-200K用于模型微调,以及两个各含10K样本的测试集ScenePart-QA与ScenePart-Seg分别评估问答与分割性能。模型通过接收场景点云与语言指令,利用数据集提供的物体及部件掩码监督,训练生成粒度感知的层次化分割查询令牌。该数据集特别适用于训练需同时理解物体与部件层级结构的统一模型,并可结合扫描场景数据实现跨域泛化,推动部件级三维理解从合成场景向真实世界的迁移。
背景与挑战
背景概述
在三维场景理解领域,现有的多模态大语言模型(3D-MLLMs)虽已能够统一处理视觉问答、描述生成和指代分割等任务,但其认知粒度仍局限于物体级别,难以捕捉功能部件等细粒度结构信息。为突破这一瓶颈,厦门大学多媒体可信感知与高效计算教育部重点实验室的研究团队于2026年提出了ScenePart数据集。该数据集由Shaohui Dai、Yansong Qu等人构建,包含800个合成室内场景、超过2.1万个物体掩码、4.4万个部件掩码以及27.3万条语言指令,首次在场景层级提供了部件级标注与物体-部件对应关系,为发展部件感知的三维场景理解奠定了数据基础。ScenePart的提出填补了现有三维视觉语言数据在部件级监督上的空白,对推动具身智能、增强现实等需要细粒度交互的领域具有重要的方法论意义和实际应用价值。
当前挑战
ScenePart数据集面临的核心挑战来自三个层面。首先,在领域问题层面,现有3D-MLLMs普遍存在物体中心偏见,无法建模部件与宿主物体之间的层次依赖关系,导致对功能性部件(如椅子坐垫、冰箱把手)的推理与定位能力薄弱;其次,在数据构建层面,部件级场景标注严重缺失——室内场景数据集仅提供物体级标注,而部件数据集集中于孤立物体,二者之间存在明显的语义鸿沟;最后,在算法实现层面,部件感知要求视觉主干网络同时捕捉场景语义与细粒度几何线索,且指代分割机制需要解耦物体级与部件级的查询表征,以避免粒度冲突。这些挑战共同制约着部件感知三维理解的进展,而ScenePart通过合成场景、规则模板与语言模型精炼相结合的策略,为应对上述难题提供了可行的数据基础。
常用场景
经典使用场景
在三维场景理解领域,ScenePart数据集的核心价值在于为细粒度的部件级感知与推理提供标注基准。该数据集通过将带有部件级注释的合成对象嵌入室内场景,构建了包含超过800个场景、44000余个部件掩码以及27万条语言指令的语料库。其典型应用场景涉及部件级视觉问答与指代分割,例如定位冰箱把手或统计橱柜抽屉数量,从而突破了现有三维多模态大语言模型仅局限于物体级理解的瓶颈。
解决学术问题
ScenePart数据集解决了现有三维场景理解研究中部件级标注缺失的学术难题。此前,室内场景数据集仅提供物体级注释,而部件数据集则局限于孤立物体,两者间的鸿沟使得模型难以学习物体与部件间的层次化关系。ScenePart通过提供物体-部件对应关系及场景图,使得研究人员能够训练模型理解部件的功能依赖性和上下文语义,为三维多模态大语言模型从物体级向部件级推理的范式跨越提供了关键数据支撑。
衍生相关工作
ScenePart数据集的出现催生了一系列具有代表性的后续研究工作,其中最为突出的当属PAR3D框架。PAR3D基于ScenePart提出了部件感知的三维表示学习和层次化分割查询生成机制,显著提升了部件级的问答与分割性能。这一工作启发了后续关于开放词汇部件感知、真实场景部件注释以及具身交互推理的研究方向。此外,许多三维多模态大语言模型在评估部件级能力时,均将ScenePart作为标准基准,推动了领域内从物体中心向部件感知的范式转型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务