OBJECTFOLDER REAL
收藏数据链接:
官方服务:
资源简介:
OBJECTFOLDER REAL数据集由斯坦福大学创建,包含100个真实世界家用物品的多感官测量数据,旨在推动计算机视觉、机器人学及虚拟现实等领域的多感官物体中心学习研究。数据集通过精细的数据收集管道获取,包括3D网格、视频、冲击声和触觉读数,为多感官感知和物体中心学习任务提供了丰富的数据资源。
The OBJECTFOLDER REAL dataset was created by Stanford University. It encompasses multi-sensory measurement data for 100 real-world household objects, aiming to advance multi-sensory object-centric learning research in fields such as computer vision, robotics, and virtual reality. The dataset is collected via a rigorous data acquisition pipeline that includes 3D meshes, videos, impact sounds, and tactile readings, providing a rich data resource for multi-sensory perception and object-centric learning tasks.
提供机构:
斯坦福大学创建时间:
2023-06-02
搜集汇总
数据集介绍

构建方式
OBJECTFOLDER REAL数据集的构建围绕视觉、听觉与触觉三种模态展开,针对每种感官通道设计了精密的采集流水线。在视觉方面,采用EinScan Pro HD 2020手持式三维扫描仪获取物体高质量网格与彩色纹理,并提供16K、64K及全分辨率三种版本,同时录制物体在灯箱中旋转的高清视频。听觉数据的采集则在专业消声室中进行,利用PCB冲击锤敲击物体表面30至50个代表性点,并同步记录接触力与自由场麦克风捕捉的声音信号。触觉数据通过配备GelSight触觉传感器的Franka Emika Panda机器人手臂自动采集,在冲击声采集的相同表面点上记录凝胶形变过程的RGB图像,并辅以手部相机与第三方视角摄像机的同步视频。
特点
该数据集的核心特点在于首次提供了包含100种真实家用物品的多感官测量数据,涵盖三维网格、高清视频、冲击声音与触觉读数四类信息,填补了此前仅有仿真神经物体的空白。其视觉、听觉与触觉数据均在同一物体表面位置对齐,支持跨模态的联合学习与对比分析。数据采集过程注重高保真度:三维扫描精度达0.2毫米,冲击声在专业消声室中录制以确保纯净,触觉传感器具有32×24平方毫米的高分辨率感知区域。此外,数据集为每种模态提供了丰富的标注信息,包括接触力、接触位置坐标及材料类别,为多感官物体中心学习的研究提供了标准化的基准。
使用方法
OBJECTFOLDER REAL数据集适用于多种物体中心学习任务,包括跨感官检索、接触定位、材料分类、三维形状重建以及机器人操作等。用户可根据任务需求,直接使用提供的三维网格、视频帧、冲击声波形或触觉图像作为模型输入。数据以实例对形式组织,便于进行模态间的配对学习或融合实验。对于模拟到现实的迁移研究,该数据集可作为真实基准,量化仿真与真实数据之间的差异。同时,数据集开放了完整的代码与数据,支持研究人员在统一的框架下开发并评估多感官感知算法,推动计算机视觉、机器人学与虚拟现实领域的创新。
背景与挑战
背景概述
在计算机视觉领域,长期以来对物体的感知主要依赖视觉模态,然而现实世界中物体的存在是多感官的,其声音与触觉信息同样承载着丰富的内在属性。为突破这一局限,斯坦福大学的研究团队于2023年推出了OBJECTFOLDER REAL数据集,由Ruohan Gao、Yiming Dou、Hao Li等学者联合构建。该数据集的核心研究问题在于如何系统性地收集并利用真实世界物体的视觉、听觉与触觉多模态数据,以推动多感官物体中心学习的发展。通过精心设计的采集流水线,团队为100个真实家庭物体获取了高保真3D网格、高清视频、冲击声音与触觉读数,填补了此前纯仿真数据集在真实感与可迁移性上的空白,为计算机视觉、机器人学及虚拟现实等领域提供了重要的基准资源。
当前挑战
该数据集面临的主要挑战集中于多感官数据获取的复杂性与任务泛化能力的不足。在构建过程中,需针对每种感官模态设计专门的硬件方案:视觉数据依赖高精度手持扫描仪与专业摄影设备,听觉数据需在消声室中利用冲击锤精确激发物体振动,而触觉数据则要求机械臂搭载GelSight传感器在精确表面点自动采集,整个过程受限于机器人关节极限与运动学约束。此外,现有基准测试表明,不同感官模态在物体识别、重建与操作任务中扮演着互补但非对称的角色——触觉因信息局部性强而难以独立完成全局识别,听觉虽能指示物体尺度却无法捕捉精细几何,视觉则易受遮挡影响。如何有效融合这些异质信息以实现鲁棒的跨模态学习与仿真到现实的迁移,仍是亟待解决的核心难题。
常用场景
经典使用场景
在计算机视觉与机器人学交叉领域,多感官物体理解正成为突破传统单一视觉感知局限的关键方向。OBJECTFOLDER REAL数据集提供了100个真实世界家用物品的3D网格、视频、撞击声与触觉读数,为多模态物体学习研究奠定了坚实基础。该数据集最经典的使用场景是作为多感官物体中心学习的基准平台,研究人员可基于其标准化的10项任务套件,系统性地探索视觉、听觉与触觉在物体识别、三维重建及机器人操作中的协同作用与各自贡献。例如,在跨感官检索任务中,模型需根据物体的声音检索对应图像,或在触觉引导下完成接触点定位,这些任务共同构成了多模态感知研究的核心试验场。
解决学术问题
OBJECTFOLDER REAL数据集的核心学术贡献在于系统性地解决了多感官物体学习中长期存在的两大难题:模拟到现实的鸿沟以及标准化基准的缺失。此前,多模态物体研究多依赖于纯模拟数据或针对单一任务的定制数据集,导致不同方法之间难以公平比较,且模拟环境中的表现往往无法迁移至真实场景。该数据集通过提供经过精确实物采集的多感官数据,使得研究者能够量化模拟与真实感知之间的差异,并开发出更具鲁棒性的跨模态融合算法。其意义在于,它不仅验证了多感官融合在物体识别、重建与操作任务中优于单一模态的结论,更揭示了各模态在不同任务中的独特价值——例如视觉提供全局结构,触觉补充局部几何细节,从而推动了具身智能与认知科学中冗余感知理论的实证研究。
衍生相关工作
OBJECTFOLDER REAL数据集的发布催生了一系列具有深远影响的衍生研究工作。在方法层面,研究者基于其多模态数据开发了多感官接触回归模型(MCR),实现了端到端的接触点定位,突破了传统滤波方法不可微分的局限。在任务拓展方面,该数据集启发了动态物体声音生成与视觉-触觉跨模态生成等新方向,例如利用RegNet和SpecVQGAN等模型从视频中预测物体坠落时的撞击声,或将局部触觉读数转换为对应的视觉图像块。这些工作不仅丰富了多感官学习的理论体系,还推动了Taxim等触觉仿真框架的校准优化,为模拟到现实的迁移提供了系统性指南。此外,该数据集还被用于预训练可迁移的触觉表征,在抓取稳定性预测等下游任务中展现出超越ImageNet和Touch and Go等数据集的优异性能。
以上内容由遇见数据集搜集并总结生成



