遇见数据集

inclusionAI/OpenAoE-2000h

收藏
Hugging Face2026-07-15 更新2026-07-21 收录
官方服务:

资源简介:

Open-AoE是一个以自我为中心(第一人称)视角的手部操作数据集,包含3D手部重建数据、相机轨迹和细粒度原子动作注释。数据来源于真实世界智能手机拍摄的视频,经过基于视觉SLAM的相机轨迹估计和参数化手部重建(使用MANO模型)处理。数据集提供完整的MANO 3D手部姿态参数(包括15个手指关节姿态和10维形状参数)、度量尺度的相机轨迹(世界坐标系和相机坐标系下的变换矩阵),以及细粒度的原子动作注释(分段级别,包括场景、手部归属和动作描述)。数据规格包括30 FPS帧率、1280×720或1920×1080分辨率。数据集还包含原始视频、去失真视频、相机参数文件(如video_info.json和undistorted_video_info.json)和可视化结果。该数据集适用于手部姿态估计、动作识别、增强现实和机器人操作等研究。

Open-AoE is an egocentric (first-person) hand manipulation dataset containing 3D hand reconstruction data, camera trajectories, and fine-grained atomic action annotations. The data originates from real-world smartphone-captured videos, processed via a visual-SLAM-based camera trajectory estimation and parametric hand reconstruction (using the MANO model). The dataset provides complete MANO 3D hand pose parameters (including 15 finger joint poses and 10-dimensional shape parameters), metric-scale camera trajectories (transformation matrices in world and camera coordinate systems), and fine-grained atomic action annotations (segment-level, including scene, hand attribution, and action descriptions). Specifications include 30 FPS frame rate and 1280×720 or 1920×1080 resolution. The dataset also includes raw videos, undistorted videos, camera parameter files (e.g., video_info.json and undistorted_video_info.json), and visualization results. It is suitable for research in hand pose estimation, action recognition, augmented reality, and robotic manipulation.

提供机构:
inclusionAI
搜集汇总
数据集介绍
inclusionAI/OpenAoE-2000h 数据集图片
构建方式
OpenAoE-2000h数据集基于智能手机第一视角(egocentric)拍摄的真实世界操作视频构建而成。原始视频经由一套自主研发的处理管线进行精细化加工:首先通过视觉SLAM技术估计摄像机轨迹,获取公制尺度的相机位姿;随后利用参数化手部模型MANO进行三维手部重建,输出包含手指关节姿态与形状参数的完整手部数据;最后结合原子动作识别算法,对视频片段进行自动化的时序分割与语义标注,形成细粒度的操作动作标签。
特点
该数据集以大规模、多模态和精细化标注为核心特色。其涵盖2000小时的第一人称操作视频,提供30FPS的1280×720/1920×1080分辨率画面,包含完整的MANO手部三维重建参数(15个手指关节姿态与10维形状参数)、公制尺度相机轨迹以及逐帧有效性掩码。此外,数据集还提供了以动作基元(如抓取、扭转、滑动)为基础的原子动作分段注释,每段均关联场景、手部归属及边界框,实现了从底层手部运动到高层操作语义的多层次信息覆盖。
使用方法
用户可通过HuggingFace渐进式发布获取不同规模子集(nano/tiny/full)。核心数据位于`hands.npz`与`camera_traj.npz`中,前者包含世界及相机坐标系下的手部MANO参数,后者提供4×4齐次变换矩阵与内参矩阵。使用时应先通过`pred_valid`掩码过滤无效帧,并将时间戳与帧号由字符串转换为数值。注解文件`ego_action_annotation.json`为JSON数组,遵循无间隙无重叠的时序覆盖约定,可直接用于动作识别模型的训练与评估。
背景与挑战
背景概述
OpenAoE-2000h数据集发布于2024年,由研究团队基于智能手机采集的第一人称视角视频构建而成,旨在提供大规模的自我中心手部操控数据。该数据集的核心研究问题集中于三维手部重建、相机轨迹估计以及细粒度原子动作理解,涵盖了30帧每秒的1280×720分辨率视频,并提供了MANO手部模型参数、度量尺度相机轨迹及细粒度动作标注。通过整合视觉SLAM与参数化手部重建技术,OpenAoE-2000h为手-物交互分析、动作识别及人机交互等领域提供了重要的基准资源,推动了自我中心视觉研究方向的发展。
当前挑战
在领域问题方面,OpenAoE-2000h主要解决自我中心视角下手部操控的精确重建与理解挑战,包括复杂环境下的手部遮挡、快速运动导致的姿态估计不稳定性,以及多场景(如卧室、洗衣房)中光照和背景变化的干扰。在构建过程中,团队面临数据标注一致性难题,如原子动作的时间分割与手部标签归属的精确性;同时,视觉SLAM在长时间序列中累积误差的修正、相机畸变矫正与手部重建坐标系统的对齐,以及跨设备(不同智能手机型号)标定参数的统一化,均构成了显著的技术挑战。
常用场景
经典使用场景
OpenAoE-2000h数据集以第一人称视角为核心,提供了大规模、高质量的双手操控3D重建数据,涵盖MANO手部姿态参数、相机轨迹及细粒度原子动作标注。它支持从真实手机拍摄视频中提取手部与物体的交互信息,适用于手部分割、2D/3D手部关键点检测、手部网格重建等视觉任务的训练与评测。研究者可通过30 FPS的同步视频与3D数据,构建端到端的自我中心手部解析模型,推动面向日常生活的精细操控理解。
解决学术问题
该数据集系统解决了现有自我中心视角数据集规模小、标注粒度粗、缺乏3D空间一致性等瓶颈。通过提供跨场景的2000小时真实世界数据,它使得从平面像素理解跃迁至3D时空手部运动建模成为可能。在学术层面,它促进了手部姿态估计与相机轨迹的联合优化,解决了多帧间手部形变与遮挡下的鲁棒重建问题,并对细粒度原子操作识别提供了基准,推动了对人类灵巧操控行为的量化分析。
衍生相关工作
基于OpenAoE-2000h数据集的特性,已衍生出多项代表性研究工作,包括面向双手交互的时域一致性手部网格恢复算法,以及融合视觉SLAM与手部参数模型的端到端重建管线。经典成果如利用跨帧注意力机制提升遮挡下的手部姿态追踪精度,或基于原子动作时序图进行操控行为解析。这些工作不仅验证了数据集在复杂场景下的适用性,还为自我中心视角下的人机交互、动作理解等前沿方向奠定了数据与算法基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务