遇见数据集

humanplus-1000

收藏
Hugging Face2026-09-13 更新2026-09-14 收录
官方服务:

资源简介:

HumanPlus-1000是一个大规模多模态人类行为数据集,旨在为具身智能、人体运动建模和机器人技术提供学习与建模的基础。该数据集在真实世界环境中捕获同步的自我中心视觉观察、全身运动、手部运动、相机运动和3D环境信息,提供与人类感知-动作配对的数据。每个录制单元(session)包含同步的传感器数据、运动重建、标定信息和元数据。当前发布的预览子集包含100个session,用于展示数据格式、模态、标注和研究用例;完整数据集规模更大,需申请访问。主要模态包括:自我中心视觉(立体鱼眼视频、矫正视频、深度估计)、人体运动(全身运动、SMPL/SMPL-H参数、全局平移与朝向、手部姿态)、世界运动(相机轨迹、SLAM轨迹、相机位姿)、惯性测量(可穿戴IMU数据)、标定(相机内参、畸变参数、立体外参、人-相机标定)以及语义元数据(场景、任务、时长、可用模态、质量指标)。数据以HDF5文件存储时间同步的多模态标注,所有模态通过共享时间戳对齐,人体运动与相机轨迹在共同世界坐标系中对齐。数据集支持的行为任务包括长时间跨度的人类活动、手-物交互、移动感知等,可用于多模态学习、运动预测、3D场景理解等研究。

HumanPlus-1000 is a large-scale multimodal human behavior dataset designed to provide a foundation for learning and modeling in embodied intelligence, human motion modeling, and robotics. The dataset captures synchronized egocentric visual observations, full-body motion, hand motion, camera motion, and 3D environmental information in real-world settings, offering human perception-action paired data. Each session contains synchronized sensor data, motion reconstruction, calibration information, and metadata. The current preview subset includes 100 sessions for demonstrating data format, modalities, annotations, and research use cases; the full dataset is larger and requires access application. Main modalities include: egocentric vision (stereo fisheye video, rectified video, depth estimation), human motion (full-body motion, SMPL/SMPL-H parameters, global translation and orientation, hand pose), world motion (camera trajectory, SLAM trajectory, camera pose), inertial measurement (wearable IMU data), calibration (camera intrinsic parameters, distortion parameters, stereo extrinsics, human-camera calibration), and semantic metadata (scene, task, duration, available modalities, quality metrics). Data is stored in HDF5 files with time-synchronized multimodal annotations, all modalities aligned via shared timestamps, and human motion and camera trajectory aligned in a common world coordinate system. The dataset supports behavioral tasks including long-duration human activities, hand-object interactions, and mobile perception, and can be used for research in multimodal learning, motion prediction, 3D scene understanding, etc.

创建时间:
2026-09-07
原始信息汇总

HumanPlus-1000 数据集概述

基本信息

  • 数据集名称:HumanPlus-1000
  • 许可证:CC-BY-NC-4.0
  • 标签:human-motion、egocentric-vision、motion-capture、embodied-ai、robotics、slam、smpl、multimodal
  • 数据集地址:https://huggingface.co/datasets/humanplus-ai/humanplus-1000

数据集简介

HumanPlus-1000 是一个大规模多模态人类行为数据集,旨在用于学习和建模真实世界环境中的人类感知、运动和交互。

数据集捕获同步的自我中心视觉观测、全身运动、手部运动、相机运动和 3D 环境信息,目标是为具身智能、人体运动建模和机器人学提供配对的"人类感知–动作"数据。

当前发布版本

当前仓库提供 HumanPlus-1000 的 100 个 session 的预览子集,用于展示数据集格式、模态、标注和研究用例。

如需申请访问完整的 HumanPlus-1000 数据集,请联系:info@humanplus.xyz

预览版本说明

当前 Hugging Face 发布包含 100 个演示 session,作为 HumanPlus-1000 数据基础设施的预览,旨在帮助研究人员:

  • 检查数据集格式
  • 开发数据加载器
  • 测试多模态学习流程
  • 探索人体运动与自我中心感知
  • 复现示例 HumanPlus 任务

该预览子集不代表 HumanPlus-1000 的最终规模或完整分布。

模态(Modalities)

根据 session 不同,HumanPlus 可能提供以下模态:

自我中心视觉

  • 立体鱼眼视频
  • 校正/去畸变的自我中心视频
  • 深度估计

人体运动

  • 全身运动
  • SMPL / SMPL-H 参数
  • 全局身体平移与朝向
  • 手部姿态

世界运动

  • 相机轨迹
  • SLAM 轨迹
  • 重建世界坐标系中的相机位姿

惯性传感

  • 可穿戴 IMU 测量
  • 同步的朝向/加速度信号

标定

  • 相机内参
  • 相机畸变参数
  • 立体外参
  • 相机到人体的标定
  • 坐标系变换

语义元数据

  • Session 信息
  • 场景
  • 任务/活动
  • 时长
  • 可用模态
  • 数据质量指标

HDF5 标注结构

annotation.hdf5 文件存储时间同步的多模态标注,包括自我中心视觉、人体运动、手部运动、IMU 测量、SLAM 轨迹和 3D 环境信息。所有模态通过共享的时间戳进行时间对齐。人体运动和相机轨迹进一步在共同的世界坐标系中对齐,从而支持人体行为与环境交互的联合建模。

text annotation.hdf5 │ ├── calibration/ │ ├── @transform_convention │ ├── fisheye_left/ │ │ ├── intrinsics │ │ ├── distortion │ │ ├── camera_model │ │ ├── distortion_model │ │ └── image_size │ ├── fisheye_right/ │ │ ├── intrinsics │ │ ├── distortion │ │ ├── camera_model │ │ ├── distortion_model │ │ └── image_size │ ├── stereo/ │ │ └── T_right_left │ ├── rectified_stereo/ │ │ ├── @left_half │ │ ├── @hamer_camera_side │ │ ├── R_rect_left │ │ ├── R_rect_right │ │ ├── image_size │ │ └── intrinsics │ ├── T_head_camera │ ├── T_mocapworld_slamworld │ └── body_imu/ │ ├── R_mocapworld_imuworld │ └── device2bone │ ├── video/ │ ├── fisheye_left_file │ ├── fisheye_right_file │ ├── image_size │ └── timestamp_ns │ ├── slam/ │ ├── @camera_frame │ ├── T_slamworld_camera │ └── point_cloud │ ├── depth/ │ ├── @min_depth_m │ ├── @max_depth_m │ ├── @invalid_value │ ├── depth │ └── intrinsics │ ├── imu/ │ ├── body/ │ │ ├── timestamp_ns │ │ ├── accel_xyz │ │ ├── orientation │ │ ├── acc │ │ └── rot │ └── head/ │ ├── timestamp_ns │ ├── accel_xyz │ ├── gyro_xyz │ ├── acc │ └── rot │ ├── body_motion/ │ ├── T_mocapworld_root │ ├── smplh_pose │ ├── body_keypoints │ └── foot_contact_probability │ ├── hand_motion/ │ ├── left/ │ │ ├── mano_hand_global_orient │ │ ├── mano_hand_pose │ │ ├── mano_betas │ │ ├── joints_3d │ │ ├── wrist_position_camera │ │ ├── valid │ │ └── confidence │ └── right/ │ ├── mano_hand_global_orient │ ├── mano_hand_pose │ ├── mano_betas │ ├── joints_3d │ ├── wrist_position_camera │ ├── valid │ └── confidence │ ├── synchronization/ │ ├── utc_ns │ └── video_frame_indices │ └── behavior_annotation/ ├── activity_summarization ├── motion_narration └── atomic_action

数据组织

一条 HumanPlus 记录以 session 为单位组织。

示例结构:

text HumanPlus-1000/ ├── metadata/ │ └── sessions.parquet │ └── data/ ├── HP_S000001/ │ ├── fisheye_left.mp4 │ ├── fisheye_right.mp4 │ ├── annotation.hdf5 │ └── metadata.json │ ├── HP_S000002/ │ └── ... │ └── ...

搜集汇总
数据集介绍
humanplus-1000 数据集图片
构建方式
面向具身智能与人类行为建模的研究需求,HumanPlus-1000通过多模态同步采集框架构筑了大规模真实场景下的人类行为数据集。每个记录以会话为基本单元,融合立体鱼眼视频、全身运动捕捉、手部姿态估计、惯性测量单元信号以及SLAM轨迹等多源异构数据。采集流程采用统一时间戳对齐机制,将第一人称视觉观测与人体运动参数映射至共同的世界坐标系,并借助标定模块完成相机内外参、相机至人体变换及坐标系统转换。运动数据以SMPL-H参数表示,手部采用MANO模型重建,同步生成深度图与三维环境点云,最终以HDF5格式分层存储所有模态的注释信息。
特点
该数据集的核心特质在于其多模态对齐的深度与广度,不仅提供第一人称视角的立体视觉与深度感知,还囊括全身运动、手部精细操作、相机轨迹及穿戴式惯性传感数据,形成感知与动作的配对样本。所有模态经同步机制在时间维度精确对齐,人体运动与相机轨迹统一于同一世界坐标系,支持联合建模人与环境的交互。语义元数据涵盖场景、任务、活动摘要与原子动作标注,辅以数据质量指标,为长时段人类行为理解提供结构化支撑。当前公开的百个会话子集虽为预览规模,却完整展示了数据格式与模态多样性。
使用方法
研究者可通过Hugging Face平台获取预览版数据,其目录结构以会话为单元组织,每个会话包含左右鱼眼视频、annotation.hdf5注释文件与元数据JSON。使用HDF5文件时,可依据组层级访问标定参数、视频时间戳、SLAM轨迹、深度图、惯性信号、身体与手部运动参数以及行为注释,所有模态通过共享时间戳与帧索引实现同步。数据加载器可基于会话元数据筛选特定场景、任务或模态组合,用于多模态学习、运动重定向、第一人称视觉导航及具身策略训练等任务。完整数据集需通过指定联系方式申请获取,预览子集适用于格式验证与流程测试。
背景与挑战
背景概述
具身智能与机器人学习的发展亟需能够弥合人类感知与动作之间鸿沟的多模态数据资源。HumanPlus-1000数据集由HumanPlus团队构建,于2024年前后公开发布预览版本,旨在通过同步采集第一人称视觉、全身运动、手部动作、相机轨迹及三维环境信息,为建模真实世界环境中的人类行为提供大规模配对感知-动作数据。该数据集的核心研究问题在于如何将人类在自然场景中的长时程活动转化为可供机器人模仿学习的结构化表示。其发布对具身智能、运动建模与机器人操控等领域具有重要推动作用,为多模态学习与人类行为理解提供了新的基准平台。
当前挑战
HumanPlus-1000所应对的领域问题在于真实环境中人类行为的多模态联合建模,这要求系统能够同时理解第一人称视觉输入、全身与手部运动、以及三维空间中的相机位移,其难度远超单一模态的识别或生成任务。在构建过程中,数据集面临多重挑战:多传感器之间的时间同步与空间标定精度要求极高,第一人称鱼眼视觉与运动捕捉系统之间的坐标系对齐复杂,手部动作在遮挡与快速运动下的标注可靠性难以保证,长时程活动中语义行为的自动切分与标注亦存在显著困难。此外,预览版本与完整数据集之间的规模差异,也对数据加载与学习流程的可扩展性提出了考验。
常用场景
经典使用场景
在具身智能与以自我为中心感知的研究中,HumanPlus-1000的经典使用场景集中于长时程人类活动的多模态联合建模。研究者利用其同步采集的自我中心视频、全身运动、手部姿态、相机轨迹与三维环境信息,构建从感知到动作的配对学习范式。具体任务涵盖第一人称视角下的动作识别与预测、基于视觉的人体运动重建、手-物交互建模以及人体与场景的联合理解。该数据集通过共享时间戳与世界坐标系对齐,为训练端到端的多模态模型提供了高度结构化的监督信号,尤其在需要融合视觉、惯性、运动捕捉与语义标注的复杂场景中展现出独特优势。
实际应用
在实际应用层面,HumanPlus-1000为机器人示教学习、人机协作、虚拟现实与运动分析等场景提供了高保真的人类行为数据支撑。借助该数据集,开发者能够训练机器人从第一人称人类演示中习得复杂操作技能,实现基于视觉与运动信号的动作模仿;在AR/VR领域,其手部与全身运动数据可用于驱动虚拟化身并优化交互体验;在运动科学与康复工程中,惯性测量与足部接触概率等标注有助于步态分析与异常检测。数据的多模态特性还支持开发鲁棒的环境感知与定位系统,服务于自主导航与智能监控等现实需求。
衍生相关工作
围绕HumanPlus-1000,学术界已衍生出一系列经典研究工作,涵盖多模态人体运动预测、自我中心视觉下的手-物交互识别、以及基于SLAM与IMU融合的定位与建图算法。部分工作利用该数据集验证了视觉-惯性-运动联合优化框架在复杂环境中的有效性,另一些则将其作为预训练资源,推动跨域动作生成与机器人技能迁移。这些衍生研究不仅拓展了数据集的适用边界,也促进了具身智能领域基准测试的标准化,为后续大规模人类行为建模提供了可借鉴的范式与评估协议。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务