遇见数据集

leggedrobotics/funthor-dataset

收藏
Hugging Face2026-06-14 更新2026-06-21 收录
官方服务:

资源简介:

FunTHOR是一个用于功能3D场景理解的合成数据集,基于AI2-THOR模拟器构建。它提供了12个室内场景(如厨房、客厅、卧室、浴室)的部分级地面真实几何和密集的、基于规则的功能关系标注(例如“刀切苹果”、“把手拉开门”、“炉灶旋钮打开/关闭燃烧器”)。数据集包含每个场景的位姿RGB-D序列,总共有621个地面真实节点(对象+功能部件),其中92个是功能部件,以及164个功能关系边。每个场景有60个位姿RGB-D帧(分辨率1200×680),从可达视点随机采样。此外,数据集还提供对象和部件中心点云、对象-部件层次结构,以及每个场景的可见子集(仅包含从采样RGB-D帧中可观察的节点和边)。标注通过可检查的规则自动生成,覆盖部件-对象关系和对象-对象关系,旨在支持概率性、开放词汇功能3D场景图的构建。

FunTHOR is a synthetic dataset for functional 3D scene understanding, built on top of the AI2-THOR simulator. It provides part-level ground-truth geometry and dense, rule-based functional-relation annotations (e.g., knife slices apple, handle pulls to open door, stove knob turns on/off burner) for 12 indoor scenes, together with posed RGB-D sequences for each scene. The dataset includes 621 ground-truth nodes total (objects + functional parts), with 92 being functional parts, and 164 functional-relation edges. Each scene has 60 posed RGB-D frames (1200×680) randomly sampled from reachable viewpoints. It also offers object- and part-centric point clouds, an object-part hierarchy per scene, and a visible subset per scene that retains only nodes/edges observable from the sampled RGB-D frames. Annotations are generated automatically from inspectable rules, covering both part-object and object-object relations, and designed as a benchmark for constructing probabilistic, open-vocabulary functional 3D scene graphs.

提供机构:
leggedrobotics
搜集汇总
数据集介绍
leggedrobotics/funthor-dataset 数据集图片
构建方式
FunTHOR数据集基于AI2-THOR模拟器构建,从12个室内场景(包括厨房、客厅、卧室和浴室)中随机采样了720帧带位姿的RGB-D图像(每场景60帧,分辨率1200×680)。数据集的标注采用一套透明且可复现的规则化流程:通过精确匹配、邻近匹配、部件匹配和手动标注四种策略,自动生成部件-对象及对象-对象间的功能关系边(如“刀切苹果”)。每个场景均提供密集的部件级几何信息,包括节点列表、对象-部件层级、点云标注索引及功能关系文件,并附带可见性子集用于评估。
使用方法
FunTHOR适用于3D场景图构建、功能场景理解及具身AI等研究。使用时可通过加载node_list.pkl获取节点信息,结合functional_relations.json提取功能关系边。RGB-D序列位于dataset目录下,包括彩色图、深度图(16位毫米单位)和相机外参矩阵(4×4相机到世界变换),内参矩阵共享。点云数据以PLY格式存储,节点标签支持开放词汇推理。建议优先使用visible子集进行模型评估,以排除不可见对象的干扰。
背景与挑战
背景概述
FunTHOR数据集由苏黎世联邦理工学院和Meta等机构的研究人员于2026年提出,旨在推动具身智能体对三维场景的功能性理解。该数据集基于AI2-THOR模拟器构建,包含12个室内场景(厨房、客厅、卧室、浴室),提供621个语义节点、92个功能部件和164条功能关系边,以及720帧从可达视角采样的RGB-D图像。与传统手动标注数据集不同,FunTHOR通过透明、可复现的规则自动生成密集的功能关系标注,涵盖部件-物体和物体-物体两类关系。该数据集作为Probabilistic Functional 3D Scene Graphs基准的核心评估资源,在计算机视觉和机器人领域具有重要影响力,为开放词汇的功能场景图构建提供了标准化测试平台。
当前挑战
FunTHOR所解决的领域问题挑战在于:现有三维场景图研究多聚焦于空间或语义关系,缺乏对物体间功能性交互(如刀切苹果、把手开门)的系统标注,导致具身智能体难以理解场景中物体间的因果操作逻辑。构建过程中面临的挑战包括:如何在合成场景中确保自动生成的功能关系兼具物理合理性与完整性,而非依赖昂贵的人工标注;如何从模拟器中提取复杂的部件层级结构并转化为统一的节点表示;以及如何从有限视角的RGB-D数据中准确推断可见与不可见的功能关系,避免因遮挡导致的信息缺失对评估结果产生偏差。
常用场景
经典使用场景
在功能性三维场景理解领域,FunTHOR数据集为从姿态RGB-D图像中构建概率性、开放词汇的功能性场景图提供了标准化的评测基准。研究者可利用其包含的12个室内场景、621个地面真值节点(涵盖物体与功能部件)以及164条功能关系边,训练和评估能够推理物体间功能交互(如“刀切割苹果”、“把手拉动开门”)的模型。该数据集特别适用于验证基于因子图推理的3D场景图构建方法,通过其提供的稠密部件级几何标注和可见性子集,可系统性地评估模型在部分遮挡条件下的鲁棒性和泛化能力。
解决学术问题
该数据集的核心贡献在于解决了现有3D场景理解研究中功能关系标注稀疏且依赖昂贵人工的问题。FunTHOR通过可审计的规则自动生成稠密的功能关系边,覆盖部件-物体和物体-物体两个层次的交互,为研究开放集功能关系识别提供了可复现的基准。它推动了从单纯几何和语义理解向功能性理解的范式转变,使学术研究能够深入探究物体间的因果操作逻辑,例如旋钮控制炉灶开关、手柄开启柜门等日常行为,从而为具身智能体在未知环境中执行任务提供理论支撑。
实际应用
在实际应用中,FunTHOR数据集为家用服务机器人、智能家居系统等具身智能体提供了关键的功能性知识库。机器人可借助其功能关系标注,学习如何操作物体(如识别炉灶旋钮与控制功能),从而在厨房、卧室等复杂场景中自主完成烹饪准备、物品整理等任务。此外,该数据集还支持增强现实应用中场景理解算法的开发,帮助虚拟助手理解真实世界物体的交互逻辑,进而提供更自然的用户指导。其基于规则的标注方式也便于扩展到新场景。
数据集最近研究
最新研究方向
FunTHOR数据集聚焦于功能性三维场景理解的前沿探索,通过合成室内场景中零件级别的几何与密集的规则化功能关系标注(例如“刀切苹果”、“把手拉开”),为具身智能体赋予语义化的物体交互推理能力。该研究面向开放词汇概率性三维场景图构建,突破传统人工标注在密度与可扩展性上的局限,推动机器人、增强现实等领域从静态场景感知向动态功能性理解的跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务