遇见数据集

HumanPlus-1000

收藏
Hugging Face2026-09-09 更新2026-09-10 收录
官方服务:

资源简介:

HumanPlus-1000是一个大规模多模态人类行为数据集,专为学习与建模真实环境中的人类感知、运动与交互而设计。数据集同步记录了自我中心视觉观察、全身运动、手部运动、相机运动及3D环境信息,旨在提供配对的感知-动作数据,以支持具身智能、人类运动建模和机器人研究。当前发布版本为100个会话的预览子集,用于展示数据格式、模态、标注及研究用途。数据模态包括:自我中心视觉(立体鱼眼视频、校正/去畸变视频、深度估计)、人体运动(全身运动、SMPL/SMPL‑H参数、全局身体平移与朝向、手部姿态)、世界运动(相机轨迹、SLAM轨迹、在世界坐标系中的相机位姿)、惯性传感(可穿戴IMU测量、同步方向/加速度信号)、标定信息(相机内参、畸变参数、立体外参、相机到人体的标定、坐标系变换)以及语义元数据(会话信息、场景、任务/活动、时长、可用模态、数据质量指标)。每个会话文件夹内包含立体鱼眼视频、HDF5标注文件和元数据JSON。该数据集适用于人类运动分析、自我中心视觉、多模态学习、机器人模仿学习等任务。

HumanPlus-1000 is a large-scale multimodal human behavior dataset designed for learning and modeling human perception, motion, and interaction in real-world environments. The dataset synchronously records egocentric visual observations, full-body motion, hand motion, camera motion, and 3D environmental information, aiming to provide paired perception-action data to support embodied intelligence, human motion modeling, and robotics research. The current release is a preview subset of 100 sessions, demonstrating data formats, modalities, annotations, and research applications. Data modalities include: egocentric vision (stereo fisheye video, rectified/dewarped video, depth estimation), human motion (full-body motion, SMPL/SMPL-H parameters, global body translation and orientation, hand pose), world motion (camera trajectory, SLAM trajectory, camera pose in world coordinates), inertial sensing (wearable IMU measurements, synchronized orientation/acceleration signals), calibration information (camera intrinsics, distortion parameters, stereo extrinsics, camera-to-human calibration, coordinate transformations), and semantic metadata (session information, scene, task/activity, duration, available modalities, data quality indicators). Each session folder contains stereo fisheye videos, HDF5 annotation files, and metadata JSON. The dataset is suitable for human motion analysis, egocentric vision, multimodal learning, robot imitation learning, and other tasks.

创建时间:
2026-09-07
原始信息汇总

HumanPlus-1000 数据集概述

基本信息

  • 许可证:cc-by-nc-4.0(知识共享-非商业使用4.0)
  • 标签:人体运动、第一人称视觉、动作捕捉、具身智能、机器人、SLAM、SMPL、多模态

数据集简介

HumanPlus-1000 是一个大规模多模态人体行为数据集,旨在支持现实世界中人体感知、运动与交互的学习和建模。数据集同步采集了第一人称视觉观测、全身运动、手部运动、相机运动以及3D环境信息,为具身智能、人体运动建模和机器人技术提供配对的人体感知-行动数据。

当前版本说明

目前发布的是 100个会话(sessions)的预览子集,用于展示数据集格式、模态、标注和研究用例。完整版 HumanPlus-1000 数据集正在积极开发中。

包含的模态

根据具体会话不同,数据集可能包含以下内容:

第一人称视觉

  • 立体鱼眼视频
  • 校正/去畸变的自我中心视频
  • 深度估计

人体运动

  • 全身运动
  • SMPL / SMPL-H 参数
  • 全局身体平移和朝向
  • 手部姿态

世界运动

  • 相机轨迹
  • SLAM 轨迹
  • 在重建世界坐标系中的相机位姿

惯性传感

  • 可穿戴IMU测量数据
  • 同步的朝向/加速度信号

标定信息

  • 相机内参
  • 相机畸变参数
  • 立体外参
  • 相机到人体的标定
  • 坐标系变换

语义元数据

  • 会话信息
  • 场景
  • 任务/活动
  • 时长
  • 可用模态
  • 数据质量指标

数据组织方式

数据围绕“会话(session)”组织,目录结构示例如下:

  • 每个会话包含:鱼眼左右视频、标注文件(.hdf5)和元数据(.json)
  • 所有会话的汇总信息存储在 metadata/sessions.parquet 文件中
搜集汇总
数据集介绍
HumanPlus-1000 数据集图片
构建方式
面向具身智能与机器人学习对真实世界人类行为多模态数据的迫切需求,HumanPlus-1000通过同步采集以自我为中心视觉观测、全身运动、手部动作、相机运动与三维环境信息,构建了感知与动作配对的大规模数据集。每个记录以会话为单位组织,涵盖长期人类活动,集成传感器数据、重建运动、标定信息与元数据,并采用会话目录结构存储多模态文件,如鱼眼视频、HDF5注释与JSON元数据,同时提供会话级索引文件以确保数据的系统性与可访问性。
特点
该数据集的核心特点在于多模态对齐与长时程活动覆盖,能够同时提供人类所见、身体运动、手部交互、三维世界移动及任务语义信息。模态涵盖立体鱼眼视频、校正视频、深度估计、SMPL/SMPL-H参数、全局平移与朝向、手部姿态、相机与SLAM轨迹、IMU测量、相机内参畸变外参及人机标定等。元数据包含场景、任务、时长与质量指标,且当前发布为100个会话的预览子集,旨在展示数据格式与研究用例,而非最终规模。
使用方法
研究人员可通过Hugging Face仓库获取预览子集,利用会话目录结构加载多模态数据,开发数据加载器以测试多模态学习管道。数据集支持探索人类运动与自我中心感知,复现示例任务如运动建模与机器人学习。使用时应遵循CC BY-NC 4.0许可,仅限非商业用途,并注意预览子集不代表完整分布,需关注后续全量发布。
背景与挑战
背景概述
具身智能与人类行为建模的蓬勃发展,对同步捕捉感知与动作的多模态数据提出了迫切需求。HumanPlus-1000数据集应运而生,由研究团队于近年创建,旨在通过同步采集第一人称视觉、全身运动、手部姿态、相机轨迹及三维环境信息,构建大规模真实世界人类行为的多模态资源。其核心研究问题在于为机器人学习与人类运动建模提供感知-动作配对数据,推动具身智能从仿真向现实迁移。该数据集凭借其多模态对齐与长时程活动记录的特性,在机器人学、计算机视觉与人机交互领域展现出显著影响力,为模仿学习与运动生成等任务奠定了数据基础。
当前挑战
在领域问题上,该数据集需应对真实环境下人类行为建模的复杂性,包括第一人称视角下的动态遮挡、光照变化与运动模糊,以及跨模态时间同步与空间对齐的精确性要求。构建过程中,同步采集立体鱼眼视频、惯性测量单元与运动捕捉数据面临硬件校准与时间戳对齐的工程难题;从多源传感器重建全身运动与手部姿态时,需解决遮挡与噪声带来的歧义性;此外,构建大规模长时程会话并保持数据质量一致性,对存储、标注与分发流程提出了严峻挑战。
常用场景
经典使用场景
在具身智能与多模态学习领域,HumanPlus-1000的经典使用场景聚焦于从第一人称视角观测中联合建模人类感知与动作。研究者常利用其同步的第一人称立体鱼眼视频、全身SMPL运动序列、手部姿态及相机轨迹,训练视觉-运动联合嵌入模型,以完成如第一人称动作识别、跨模态运动生成与手-物交互预测等任务。该数据集提供的长时程会话结构,尤其适合评估模型在真实世界连续行为中的时序一致性与泛化能力。
衍生相关工作
基于HumanPlus-1000,学术界已衍生出一系列经典工作。例如,有研究利用其第一人称视频与SMPL标注开发了跨模态运动预测框架,实现了从视觉到全身动作的端到端生成;另有工作以其手部姿态与相机轨迹为基础,提出了手-物交互重建与机器人灵巧操作迁移方法。此外,该数据集还激发了第一人称视觉SLAM与人体运动联合优化、以及多模态预训练模型在具身任务中的适应性研究,持续拓展着人类行为建模的边界。
数据集最近研究
最新研究方向
在具身智能与多模态学习交叉领域,HumanPlus-1000正推动以第一人称视角为核心的人类行为建模研究。当前前沿方向聚焦于利用其同步采集的立体鱼眼视频、SMPL全身运动、手部姿态与SLAM相机轨迹,构建感知-动作联合表征,以支撑机器人从人类演示中学习复杂长时程操作技能。该数据集对真实环境中人体运动与视觉信息的精细对齐,为灵巧手操作、人-环境交互以及基于视觉的全身运动重定向提供了关键资源。其发布恰逢具身智能基础模型兴起,有望促进跨模态对齐、世界模型构建及仿真到现实迁移等热点问题的突破,对下一代自主机器人学习范式具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务