遇见数据集

idekoh/BeyondSingleObject

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

BeyondSingleObject数据集是一个用于学习3D关系的大型语言模型数据集,包含多个基准测试。数据集涵盖以下内容:MO3D(多对象位置、比较和整体问答)、Shape Mating(几何对选择和推理)、Change Captioning(验证和差异描述)以及ModelNet40(零样本分类评估)。数据集中包含注释文件和PointLLM兼容的ModelNet40测试文件,但不包括点云资产;注释引用点云的相对路径,用户需从现有设置中重用点云根目录以解析路径。该数据集用于评估和训练,支持多对象3D关系理解任务。

The BeyondSingleObject dataset is a large language model dataset for learning 3D relations, comprising multiple benchmarks. It covers: MO3D (multi-object positional, comparative, and holistic QA), Shape Mating (geometric pair selection and reasoning), Change Captioning (verification and delta-captioning), and ModelNet40 (zero-shot classification evaluation). The dataset includes annotation files and a PointLLM-compatible ModelNet40 test file but does not include point-cloud assets; annotations reference point clouds by relative paths, requiring users to reuse point-cloud roots from existing setups to resolve paths. It is designed for evaluation and training, supporting multi-object 3D relation understanding tasks.

提供机构:
idekoh
搜集汇总
数据集介绍
idekoh/BeyondSingleObject 数据集图片
构建方式
BeyondSingleObject数据集围绕多物体三维场景中的关系推理任务构建,其核心是借助大语言模型实现对三维物体间空间、几何及语义关系的理解。数据集的标注框架覆盖四个子任务:MO3D、Shape Mating、Change Captioning及ModelNet40。MO3D专注于多物体位置、比较与整体性问答;Shape Mating涉及几何配对选择与推理;Change Captioning则包含变化验证与增量描述;ModelNet40用于零样本分类评估。每个子任务的数据以JSON格式组织,并依据Hugging Face的配置划分为训练集与测试集,其中Change Captioning还额外提供了一个经过精心平衡的评估子集。值得注意的是,该仓库仅公开标注信息与路径索引,不含原始点云资产,使用者需自行准备或复用已有的PointLLM风格点云数据目录,并通过符号链接确保路径解析正确。
特点
该数据集最显著的特点在于其跨任务的多模态设计,将三维点云与自然语言紧密耦合,推动从单一物体识别迈向多物体关系推理。不同于传统单一物体基准,BeyondSingleObject强调物体间的相对位置、几何匹配及变化描述,涵盖问答、生成与验证等多种输出形式。其子任务设计覆盖了位置性问答、几何配对选择、变化验证与增量描述等核心能力,为评估大语言模型在三维场景中的综合推理能力提供了全面而细致的测试平台。此外,数据集兼容PointLLM生态,并提供专用的评估子集与脚本,便于研究者进行高效且一致性的模型评测,尤其适用于零样本分类与关系推理场景。
使用方法
使用BeyondSingleObject数据集时,推荐从官方GitHub仓库获取配套代码与脚本,并将数据集下载至项目根目录,确保其data/目录与项目期望的结构一致。由于各子数据集具有不同的JSON结构,加载时应直接指定文件路径,而不依赖Hugging Face的默认数据集视图或加载器。对于点云资产,需复用现有PointLLM风格或其他本地副本中的点云根目录,并通过软链接将路径对齐。ModelNet40的测试文件为Python pickle格式,仅适用于专属评估脚本。在评估MO3D和Shape Mating时宜直接使用其test.json文件,并可通过MAX_SAMPLES参数控制样本数量;Change Captioning则建议使用提供的eval_subset.json进行固定分布的LLM评估,以确保验证与增量描述样本的平衡性。
背景与挑战
背景概述
三维点云理解是计算机视觉与图形学交叉领域的重要研究方向,传统方法多聚焦于单物体识别与分割,难以应对现实场景中多物体间复杂几何与语义关系的推理需求。BeyondSingleObject数据集由Kohsuke Ide等研究人员于2026年提出,旨在利用大语言模型驱动三维关系学习,填补了多物体交互感知与推理的空白。该数据集整合了MO3D、Shape Mating、Change Captioning及ModelNet40等子集,覆盖多物体空间位置比较、几何配对选择、变化描述与零样本分类等核心任务,显著推动了三模态联合推理领域的发展,成为评估三维关系理解能力的重要基准。
当前挑战
该数据集面临的核心挑战在于多物体间三维关系的复杂性与推理深度。MO3D等子集要求模型不仅感知物体个体属性,还需理解空间相对性、几何兼容性及变化语义,这对现有大语言模型的空间认知能力构成严峻考验。构建过程中,数据标注需依赖PointLLM等上游资源,引入对点云资产的外部依赖,导致数据加载与训练流程复杂度增加;同时,不同子集采用异构JSON格式,需显式加载而非统一接口,降低了数据集易用性。此外,版权限制与多方许可处理也为后续扩展与共享带来法律与操作上的困难。
常用场景
经典使用场景
BeyondSingleObject数据集在三维视觉与语言交叉领域开创性地聚焦于多物体关系理解,其经典使用场景包括多物体空间关系问答(MO3D),其中模型需回答关于三维场景中物体间相对位置、比较属性及整体布局的复杂问题。此外,几何配对与推理任务(Shape Mating)要求算法从候选集合中识别出能够完美拼接的几何对,测试对三维形状互补性的深层理解。变化描述任务(Change Captioning)则涉及验证场景变化是否发生并生成描述变化细节的文本,评估模型在多视角三维场景中的差异感知与语言生成能力。这些任务共同构成了评估大语言模型在三维多物体交互中推理能力的综合基准。
衍生相关工作
基于BeyondSingleObject,研究者已衍生出多项经典工作。在模型层面,PointLLM的指令微调框架被适配以融合该数据集的多样化任务,形成了多任务三维理解模型的基础。随后,一些工作探索了将对比学习与场景图结合,利用MO3D中的关系问答数据增强三维场景图生成模型的空间关系预测能力。在方法创新方面,基于Shape Mating的几何配对任务催生了面向残缺三维形状的补全与匹配联合学习框架。此外,变化描述子集被用于开发差异感知的跨视角三维描述模型,推动了叙事型语言模型在三维动态场景中的应用。这些衍生工作共同巩固了BeyondSingleObject在三维多物体推理研究中的核心基准地位。
数据集最近研究
最新研究方向
BeyondSingleObject数据集聚焦于推动三维视觉与大型语言模型在复杂物体关系理解中的深度融合。该数据集涵盖多物体问答、几何配对推理及变化描述等前沿任务,为三维场景中超越单物体层面的空间关系、属性比较与全局语义交互提供了系统性评估基准。其在零样本分类上的拓展能力,更是对三维多模态模型泛化性能的重要检验,显著推进了具身智能与场景理解领域的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务