遇见数据集

EgoTouch_hdf5

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

EgoTouch HDF5是TouchAnything项目发布的一个大规模多视角触觉数据集,专注于自我中心视角下的双手-物体交互。该数据集包含208个多样化的操作任务,共计1,891个交互序列(episodes),采集环境涵盖家庭、办公室、户外、零售店和工作台等多种室内外场景。数据集的核心内容为多模态同步数据:包括自我中心视角(胸部摄像头)和双腕摄像头的RGB视频流(分辨率480x640,30 FPS)、精确的双手3D姿态标注(每只手21个关节点的3D坐标,并附带有效性掩码)、来自可穿戴传感器的密集连续压力图(左右手各21x21的归一化压力网格),以及相应的摄像头位姿信息。数据以HDF5格式组织,每个episode为一个独立的HDF5文件,内部结构清晰地划分为images(视频帧)、hands(手部姿态)、pressure(压力数据)、poses(相机位姿)、masks(物体/手套分割掩码)、metadata(任务名称、轨迹ID、帧率等元数据)和timestamps等组。数据集提供了官方的数据划分:训练集1665个episodes,验证集208个episodes,测试集(seen场景)208个episodes,测试集(unseen场景)147个episodes。该数据集适用于计算机视觉、机器人学习、触觉感知、手部姿态估计、多模态融合以及自我中心视频理解等领域的研究与模型开发。

EgoTouch HDF5 is a large-scale multi-view tactile dataset released by the TouchAnything project, focusing on two-hand object interaction from an egocentric view. This dataset contains 208 diverse manipulation tasks, totaling 1,891 interaction episodes, with acquisition environments covering various indoor and outdoor scenarios such as homes, offices, outdoors, retail stores and workbenches. The core content of the dataset is multimodal synchronous data: including RGB video streams from the egocentric view (chest-mounted camera) and dual wrist-mounted cameras (resolution 480×640, 30 FPS), accurate two-hand 3D pose annotations (3D coordinates of 21 keypoints per hand with validity masks), dense continuous pressure maps from wearable sensors (normalized 21×21 pressure grids for left and right hands respectively), as well as corresponding camera pose information. The data is organized in HDF5 format, with each episode stored as an independent HDF5 file, and its internal structure is clearly divided into groups including images (video frames), hands (hand poses), pressure (pressure data), poses (camera poses), masks (object/glove segmentation masks), metadata (meta data such as task name, trajectory ID, frame rate and other information) and timestamps. The dataset provides official data splits: 1665 episodes for the training set, 208 episodes for the validation set, 208 episodes for the seen-scenario test set, and 147 episodes for the unseen-scenario test set. This dataset is applicable to research and model development in fields such as computer vision, robotic learning, tactile perception, hand pose estimation, multimodal fusion and egocentric video understanding.

创建时间:
2026-05-25
原始信息汇总

数据集概述

  • 名称: EgoTouch HDF5
  • 来源: TouchAnything 项目,一个面向自我中心手-物交互的大规模多视角触觉数据集。
  • 许可协议: MIT

规模与内容

  • 任务: 包含 208 种不同的操作任务。
  • 片段: 总计 1,891 个片段。
  • 环境: 涵盖室内和室外环境。
  • 数据模态:
    • 同步的自我中心 (chest) 和双腕 (left/right) 摄像头视频。
    • 双手手部姿态标注。
    • 来自可穿戴触觉传感器的密集连续压力图。

数据组织

  • 顶级目录:
    • Home/, Office/, Outdoor/, Retail/, Workbench/: 按环境和任务分组存储的 HDF5 片段。
    • pose3d/: 预计算的 3D 手部姿态相关文件。
    • vipe_chest_depth_camera/: 辅助处理文件。
    • split.json: 官方训练/验证/测试集划分文件。
  • 数据划分:
    • train: 1,665 个片段
    • val: 208 个片段
    • test_seen: 208 个片段
    • test_unseen: 147 个片段

HDF5 格式结构

每个片段存储为一个 HDF5 文件,其内部结构如下:

  • images/: 图像数据
    • chest_color: (T, 480, 640, 3) 自我中心 RGB 图像
    • left_color: (T, 480, 640, 3) 左手腕 RGB 图像
    • right_color: (T, 480, 640, 3) 右手腕 RGB 图像
  • hands/: 手部姿态
    • wilor_left_joint_xyz: (T, 21, 3) 左手姿态
    • wilor_right_joint_xyz: (T, 21, 3) 右手姿态
    • wilor_left_valid: (T,) 左手姿态有效性掩码
    • wilor_right_valid: (T,) 右手姿态有效性掩码
  • pressure/: 压力数据
    • left_pressure_grid: (T, 21, 21) 归一化压力图
    • right_pressure_grid: (T, 21, 21) 归一化压力图
  • poses/: 相机姿态
    • chest_pose: (T, 7) 相机姿态 [xyz, quat]
    • left_pose: (T, 7) 左手腕相机姿态
    • right_pose: (T, 7) 右手腕相机姿态
  • masks/: 掩码
    • glove_masks: (T, N, 480, 640) 手套/物体掩码
    • glove_obj_ids: (T, N) 对象 ID
    • glove_valid_frames: (T,) 掩码有效帧标志
  • metadata/: 元数据
    • attrs: 任务名称、轨迹 ID、帧率、帧数等
  • timestamps: (T,) 帧时间戳

注:T 表示一个片段中的帧数。发布的数据使用 30 FPS,片段长度可变。此 HDF5 版本的数据集排除了原始的 depth/pose3d_dynhamr/ 目录。

使用与引用

  • 加载示例: 使用 h5pyhuggingface_hub 库。
  • 引用论文: Zhou 等人,2026年,arXiv:2605.13083。
搜集汇总
数据集介绍
EgoTouch_hdf5 数据集图片
构建方式
EgoTouch HDF5数据集的构建源于TouchAnything项目,旨在从第一人称视角捕捉手-物交互过程中的触觉与视觉信息。通过在室内外多样场景中设计208项精细化操作任务,研究团队利用可穿戴触觉传感器与多视角相机系统同步采集数据。每个episode被组织为HDF5文件,分别存储来自胸部与双腕的RGB帧、经WiLoR算法提取的21关节点手部姿态、21×21网格化的手指压力分布图,以及相机位姿、掩膜和元数据信息。数据以30 FPS的帧率记录,轨迹长度可变,为后续研究提供了结构统一且内容丰富的多模态基础。
特点
该数据集的核心特点在于其大规模、多视角、触觉与视觉紧密对齐的属性。总计包含1891个演示片段,划分为训练、验证、测试已知与测试未知四个子集,有助于泛化能力的评估。数据不仅提供了左、右手腕的彩色视频与胸部正面视角的自我中心视频,还同步记录了双手在操作过程中手指关节的精确三维坐标与压力网格,压力值被归一化至[0,1]区间。此外,掩膜字段支持对手套及目标物体的检测,为触觉感知、手部重建与机器人模仿学习等研究方向提供了珍贵的同步多模态资源。
使用方法
研究者可通过Hugging Face Hub便捷获取该数据集,利用hf_hub_download函数按需下载特定环境与任务对应的HDF5文件。加载时借助h5py库打开文件,即可按层级索引访问图像序列、手部姿态、压力图及相机位姿等核心数据通道。例如,通过f['images/chest_color']获取自我中心RGB视频帧,或通过f['pressure/left_pressure_grid']读取左手压力分布。数据集提供了清晰的train/val/test_seen/test_unseen划分文件,便于实施标准化训练与评估流程,兼容主流深度学习框架以支持视觉-触觉融合建模任务。
背景与挑战
背景概述
在机器人灵巧操作与具身智能研究领域,触觉感知与视觉信息的融合是实现精细手物交互的核心瓶颈。EgoTouch HDF5数据集由Jianyi Zhou等研究人员于2026年基于TouchAnything项目创建,旨在为基于自我中心视频的双臂触觉估计提供大规模多视角触觉数据。该数据集涵盖家庭、办公室、室外、零售及工作台等五类环境下的208种操作任务,共包含1891个片段,并同步提供自我中心及双腕相机视频、双手手部姿态标注以及来自可穿戴触觉传感器的密集连续压力图。作为触觉与视觉跨模态学习的重要基准,EgoTouch推动了手物交互场景中触觉感知的规模化研究,对机器人技能学习与增强现实交互等领域产生了深远影响。
当前挑战
该数据集所解决的领域挑战主要体现在两方面:其一,在手物交互场景中,触觉信息(如接触压力分布)的获取通常依赖昂贵的专用传感器或受限的实验室环境,EgoTouch通过可穿戴触觉手套实现了自然场景下大规模触觉数据的采集,为触觉估计与视觉触觉融合提供了关键基准;其二,构建过程中面临了多模态数据高度同步、大规模标注精度控制以及跨场景泛化难题。具体而言,需保证30FPS下三路视频、手部姿态与压力网格的严格时间对齐,同时处理手套遮挡导致的手部姿态估计误差,以及不同环境光照与物体材质对压力传感信号造成的噪声干扰,这些因素共同构成了数据质量与可用性的核心挑战。
常用场景
经典使用场景
EgoTouch HDF5数据集以其大规模、多视角的触觉与视觉同步数据,成为研究自我中心视角下手-物交互行为的理想平台。它涵盖了家居、办公、户外、零售及工作台等多种复杂环境中的208项不同操作任务,共计1891个交互片段,为构建和理解人机交互中的触觉反馈与手部运动提供了丰富且结构化的数据支撑。研究者常利用该数据集训练模型,从穿戴式传感器获取的连续压力图与双腕相机视频中,学习手部姿态与触觉信号的映射关系,从而实现对精细操作过程的感知与建模。
解决学术问题
该数据集的提出,有效填补了真实场景下大规模、多模态触觉与视觉数据匮乏的空白,解决了传统数据集在触觉传感精度、视角多样性和动作复杂度上的局限。它推动了触觉估计、手部姿态重建以及物体操作分类等学术难题的突破,尤其在双腕相机视角与可穿戴触觉手套结合的条件下,显著提升了模型对于非结构环境中手部动作的理解能力。其高分辨率、时间同步的多维数据,为跨模态感知研究奠定了基准,促进了具身智能体在复杂动态任务中获取可靠触觉反馈的能力。
衍生相关工作
基于EgoTouch HDF5数据集,衍生了一系列具有影响力的学术工作。其中,TouchAnything项目本身提出了一个双腕触觉估计框架,利用该数据集的同步多视角视频与压力图,实现了从单目视频中预测触觉信息。后续研究探索了将其与其他大模型结合,应用于机器人灵巧操作的强化学习策略中。还有一些工作专注于利用其手部姿态标注进行3D手部重建算法的改进,或在触觉辅助下的无接触物体识别任务中验证模型泛化性。这些衍生工作充分体现了该数据集作为触觉感知研究基准的重要地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务