遇见数据集

ai4ce/EgoPAT3Dv2

收藏
Hugging Face2024-08-02 更新2024-03-04 收录
官方服务:

资源简介:

EgoPAT3Dv2数据集包含11个场景,每个场景下有2到6个视频文件夹。每个视频文件夹包含RGB、深度、点云和变换矩阵文件夹。注释和变换矩阵存储在annotation_transformation.hdf5文件中。由于HuggingFace对单个文件大小有限制,用户需要下载所有压缩文件并解压,然后使用提供的Python脚本构建HDF5文件。

The EgoPAT3Dv2 dataset includes 11 distinct scenes, with 2 to 6 video folders per scene. Each video folder contains subfolders for RGB, depth, point clouds, and transformation matrices. Annotations and transformation matrices are stored in the annotation_transformation.hdf5 file. Due to the single-file size limit imposed by HuggingFace, users need to download all compressed files, extract their contents, and then use the provided Python script to build the final HDF5 file.

提供机构:
ai4ce
原始信息汇总

EgoPAT3Dv2 数据集概述

数据集介绍

EgoPAT3Dv2 数据集包含 11 个场景,对应文件夹 1 到 11。每个场景文件夹包含 2 到 6 个视频文件夹,每个视频文件夹包含一个 RGB 文件夹、一个 深度 文件夹、一个 点云 文件夹和一个 变换矩阵 文件夹。(请忽略压缩文件中的其他文件夹或文件。)标注(真实数据)和变换矩阵(与上述变换矩阵相同)包含在 annotation_transformation.hdf5 文件中。我们使用 HDF5 组织实验中的数据集,GitHub 仓库中的数据加载器也相应编写。

数据集文件夹结构

bash Dataset/ ├── 1 # 场景 1 ├── 1.1.zip -> 1.1 # 场景 1 中的视频 1 ├── d2rgb # 深度文件 ├── color # RGB 文件 ├── pointcloud # 点云文件 └── transformation # 变换矩阵 ├── 1.2.zip -> 1.2 # 与 1.1 结构相同 ├── ... └── 1.4.zip -> 1.4 ├── 2/ # 所有场景/视频目录结构与上述相同 └── ... . . .

└── 11

构建 HDF5 数据集文件

由于 Hugging Face 上单个文件大小限制为 50GB,请使用 make_RGB_dataset.py 自行构建 HDF5 文件。

  1. 下载所有压缩文件。解压并仅保留每个视频文件夹中的 RGB(“color” 文件夹)文件夹。
  2. 在步骤 1 之后运行 make_RGB_dataset.py
搜集汇总
数据集介绍
ai4ce/EgoPAT3Dv2 数据集图片
构建方式
EgoPAT3Dv2数据集由11个不同场景构成,每个场景下包含2至6个视频文件夹。每个视频文件夹内细致组织了RGB图像、深度图、点云数据及变换矩阵文件。为突破HuggingFace平台单文件50GB的上限限制,数据以压缩包形式分场景存储。用户需下载全部压缩文件并解压,仅保留各视频文件夹中的RGB图像数据,随后运行官方提供的make_RGB_dataset.py脚本,即可自主构建统一的HDF5格式数据集文件,该文件整合了标注真值与变换矩阵,便于后续高效调用。
特点
该数据集具有多模态与结构化两大显著特点。其多模态属性体现在同时提供RGB图像、深度图与点云数据,为三维感知任务提供了丰富的视觉与几何信息。数据结构层次分明,按场景、视频逐级组织,每个视频文件夹内各模态数据独立存放,并附有对应的变换矩阵,便于实现坐标系统一与数据对齐。此外,标注信息与变换矩阵被整合于HDF5文件中,支持快速随机访问,显著提升了数据加载与预处理效率。
使用方法
使用EgoPAT3Dv2数据集时,首先需按照官方指南下载并解压所有场景的压缩文件,仅保留RGB文件夹。接着运行make_RGB_dataset.py脚本生成HDF5格式的数据文件。在模型训练或评估中,可直接加载该HDF5文件,利用其内建的索引机制按需读取RGB图像、深度图、点云及对应的标注与变换矩阵。数据集在GitHub仓库中提供了配套的DataLoader实现,用户可参考其接口设计,快速集成至PyTorch等深度学习框架,实现高效的数据流水线。
背景与挑战
背景概述
EgoPAT3Dv2数据集由ai4ce研究团队于近期发布,聚焦于机器人感知与操作中的核心问题——从第一人称视角(Egocentric)进行三维场景理解与物体抓取。该数据集包含11个精心设计的室内场景,每个场景包含2至6段视频序列,总计提供同步的RGB图像、深度图、点云数据及变换矩阵,为研究视觉-触觉融合与空间关系推理提供了丰富的多模态基准。其核心研究问题在于如何利用第一人称视觉信息准确推断物体的可抓取姿态,这一方向对于服务机器人、自主导航等应用具有深远意义。EgoPAT3Dv2的提出填补了现有数据集在细粒度、多视角场景覆盖上的不足,推动了三维交互感知领域的发展,成为相关研究的重要参考标准。
当前挑战
EgoPAT3Dv2所解决的领域挑战在于,第一人称视角下的三维物体抓取姿态估计面临严重的遮挡、视角变化和光照不均问题,传统方法难以从单一模态中鲁棒地提取几何与语义特征。构建过程中,数据集面临多重技术难题:首先,多传感器(RGB-D相机与点云采集设备)的精确时空同步要求高精度标定,任何偏差都会影响数据一致性;其次,11个场景的复杂布局与动态物体(如可移动家具)增加了数据标注的难度,需要人工逐帧校验以保证抓取点标注的准确性;此外,HDF5文件组织方式虽便于实验,但原始数据(50GB以上)的压缩与解压流程繁琐,用户需自行运行脚本重构数据集,这可能导致版本兼容性问题。这些挑战共同构成了从数据采集到应用落地的关键瓶颈。
常用场景
经典使用场景
在机器人感知与自主导航领域,EgoPAT3Dv2数据集为第一人称视角下的三维空间理解提供了宝贵的资源。该数据集涵盖了11个精心设计的场景,每个场景包含多段视频,并同步提供了RGB图像、深度图、点云数据以及变换矩阵,构建了一个多模态的感知基准。其最经典的使用场景在于训练和评估基于第一人称视觉的3D物体检测与定位模型,尤其是那些需要利用深度信息与点云数据进行空间推理的任务。研究者可借助该数据集,探索如何从连续的视频流中实时构建环境的三维表示,并精确估计物体相对于观察者的位置与姿态,这对于提升机器人在复杂动态环境中的交互能力具有奠基性意义。
衍生相关工作
自EgoPAT3Dv2数据集发布以来,其衍生出一系列具有影响力的经典工作。许多研究以其为基础,探索了第一人称视觉中三维目标检测与跟踪的新范式,例如提出了利用时序信息与几何约束的端到端检测网络,显著提升了自我中心视角下的定位精度。此外,该数据集还催生了多模态融合领域的创新,研究者通过联合处理RGB、深度与点云数据,设计了能够应对遮挡与光照变化的鲁棒感知模型。在场景理解方面,部分工作利用该数据集训练了能够从第一人称视频中重建完整场景拓扑结构的生成模型,为后续的机器人导航与交互任务奠定了坚实的方法论基础。
数据集最近研究
最新研究方向
EgoPAT3Dv2数据集作为机器人感知领域的前沿资源,聚焦于第一人称视角下的三维空间理解与路径规划。该数据集涵盖11个场景的多模态数据,包括RGB图像、深度图、点云及变换矩阵,为自主导航、物体操作等任务提供了丰富的训练与评估基准。当前研究方向紧密结合具身智能与空间智能的热点,推动机器人从静态环境理解向动态、交互式场景的迁移学习发展。其多视角、多模态的数据结构尤其适用于探索基于隐式神经表示的三维重建与场景图生成,对提升机器人在复杂非结构化环境中的鲁棒性与泛化能力具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务