EgoTouch
收藏资源简介:
EgoTouch是由哈尔滨工业大学·深圳等机构联合创建的大规模多视角自我中心数据集,旨在为双手物体交互提供密集的触觉监督。该数据集包含208个操作任务、1891个交互片段,总计超过20小时的多模态数据,涵盖1000余个物体,帧数达210万,数据来源于头戴式及腕戴式摄像头同步采集的RGB视频、双手三维姿态及可穿戴触觉传感器获取的连续压力图。其创建过程通过可穿戴捕获系统在多样室内外环境中记录自然双手操作行为,并实现多模态数据的帧级时间对齐。该数据集主要应用于具身智能领域,旨在解决从视觉观测中推断触觉反馈的核心问题,支持物理交互动力学的跨模态学习,为视觉到触觉的预测研究提供基准。
EgoTouch is a large-scale multi-view egocentric dataset jointly developed by Harbin Institute of Technology (Shenzhen) and other institutions, aiming to provide dense tactile supervision for two-handed object interaction. The dataset contains 208 manipulation tasks, 1891 interaction segments, with a total of over 20 hours of multimodal data, covering more than 1000 objects and 2.1 million frames. The data consists of RGB videos synchronously captured by head-worn and wrist-worn cameras, 3D hand poses, and continuous pressure maps acquired from wearable tactile sensors. During its construction, natural two-handed manipulation behaviors were recorded in diverse indoor and outdoor environments using wearable capture systems, and frame-level temporal alignment of multimodal data was achieved. This dataset is primarily applied in the field of embodied intelligence, aiming to solve the core problem of inferring tactile feedback from visual observations, supporting cross-modal learning of physical interaction dynamics, and serving as a benchmark for vision-to-tactile prediction research.
好的,根据您提供的HTML内容,以下是该数据集的详情总结:
数据集概述:EgoTouch & TouchAnything
EgoTouch 是一个大规模、多视角、以自我为中心的触觉数据集,旨在通过自我中心视频进行双手触觉估计。
核心信息
- 名称: EgoTouch (项目名称为 TouchAnything)
- 作者/机构: 哈尔滨工业大学(深圳)、美团机器人研究院、清华大学深圳国际研究生院
- 规模: 包含 208 个不同操作任务,共计 1,891 个片段。
- 数据模态: 提供同步的多模态数据,包括:
- 多视角视频: 头戴式第一人称视角 + 双手腕佩戴相机视角。
- 双手3D手部姿态: 共 42 个手部关节。
- 密集连续压力图: 来自可穿戴触觉传感器的真实压力分布数据。
- 环境: 涵盖室内和室外多种环境。
主要特点
- 多视角采集: 首个整合了多视角同步视频(自我中心视角+双腕部视角)与真实触觉压力数据的数据集。
- 密集触觉感知: 提供来自可穿戴传感器的真实连续压力分布,可捕捉精细的接触动态。
- 双手交互: 提供带 42 个关节3D手部姿态标注的双手操作数据,支持协调手-物体交互分析。
- 模态同步: 实现了视频、姿态和压力数据在帧级别的精确同步。
数据集统计
- 操作任务: 208 个
- 片段数: 1.9K (1,891)
- 相机视角: 3 个
- 手部关节: 42 个
基线框架:TouchAnything
TouchAnything 是基于 EgoTouch 数据集建立的多视角视觉到触觉预测基线框架。它是一个视觉到触觉的预测模型,具备以下特点:
- 输入: 主要以自我中心视角为主,推理时可灵活利用可用的腕部相机视角。
- 方法: 采用共享的 DINOv2 视觉编码器、可学习的视角嵌入、跨视角Transformer注意力机制和视角丢弃训练策略。
- 性能: 实验表明,加入腕部视角通常能提升触觉预测效果,在接触交并比上最高可实现 5.0% 的相对提升,在体积交并比上最高可实现 6.1% 的相对提升。




