HiPHI
收藏数据链接:
官方服务:
资源简介:
HiPHI是一个用于人形机器人学习和全身运动建模的光学运动捕捉数据集。它提供标准化的BVH运动数据,以及人-物交互的同步物体轨迹和原始高分辨率OBJ网格。
创建时间:
2026-08-17
原始信息汇总
HiPHI 数据集详解
数据集概述
HiPHI(High-Precision Human Motion and Object Interaction)是一个大规模、高精度的人体运动与物体交互光学动捕数据集,专为人形机器人学习和全身运动建模设计。数据以标准化BVH格式提供人体运动,对于人-物交互(HOI)数据,同步提供物体轨迹和对应的原始高分辨率OBJ网格。
核心数据规模
| 子集 | 时长 | 运动帧数 |
|---|---|---|
| HiPHI 总量 | 617.5 小时 | 200.1M |
| 纯人体运动 (Body-only) | 371.8 小时 | 120.5M |
| 人-物交互 (HOI) | 245.7 小时 | 79.6M |
- HOI 占总时长的 39.8%
- 前10、前20、前50个Frame-LU标签分别占总时长的 20.4%、31.8%、53.7%
数据特性
| 属性 | 详情 |
|---|---|
| 采集方式 | 光学动作捕捉 |
| 采样率 | 90 Hz |
| 人体运动格式 | 标准化55关节 BVH |
| 表演者数量 | 132 人(76男,56女) |
| 语义体系 | 22个Frames,214个Frame-LU标签 |
| 表演者覆盖度 | 每个Frame-LU中位数24人;154个标签至少有10人 |
| HOI资产 | 包内物体轨迹 + 共享原始高分辨率OBJ网格 |
人体运动格式
所有人体运动使用统一的55关节BVH层级结构:
| 项目 | 格式 |
|---|---|
| 根关节 | Hips |
| 关节数 | 55个关节 + 13个End Sites |
| 坐标系 | 右手系,Y轴向上 |
| 线性单位 | 厘米 |
| 旋转单位 | 度 |
| 关节通道 | Xposition Yposition Zposition Zrotation Xrotation Yrotation |
| 欧拉顺序 | Z-X-Y |
| 采样率 | 90 Hz |
| 身体比例 | 每文件独立关节偏移 |
HOI格式
每个HOI包包含:
motion_actor.bvh(人体运动文件)- 每个跟踪物体对应的轨迹CSV文件
metadata.json(关联运动、轨迹与共享OBJ网格的元数据)
物体轨迹CSV格式
csv frame,time_sec,px,py,pz,qx,qy,qz,qw
| 列 | 类型 | 含义 |
|---|---|---|
| frame | int | 基于零的BVH帧索引 |
| time_sec | float | 从首帧开始的时间(秒) |
| px, py, pz | float | 物体位置(米,右手Y-up坐标系) |
| qx, qy, qz, qw | float | 物体局部到世界的四元数(XYZW顺序) |
物体网格
- 使用原始高分辨率Wavefront OBJ几何
- 顶点以厘米存储在物体局部坐标系,轨迹位置以米存储
- 仓库级
object_meshes/目录包含 40个标准网格 和 40个局部X反射__mirror变体 - OBJ文件不在运动包内重复存储
元数据文件
hiphi_metadata.csv(每行一个运动序列)
| 字段 | 含义 |
|---|---|
| motion_id | 运动标识符,格式为{frame_lu}_{xxxx} |
| frame | 帧标签,第一目录层级 |
| lu | LU标签,第二目录层级 |
| frame_lu | Frame-LU组合标签 |
| duration_sec | 从BVH头文件获得的时长 |
| frame_count | BVH帧数 |
| actor_id | 匿名表演者ID,格式A001 |
| text_annotation | 英文动作描述 |
| is_hoi | 是否包含被跟踪物体交互 |
| object_categories | 被跟踪物体类别(分号分隔) |
| mirrored | 是否为镜像包 |
hiphi_actor_metadata.csv
| 字段 | 含义 |
|---|---|
| actor_id | 匿名表演者ID(A001格式) |
| height_cm | 身高(厘米) |
| weight_kg | 体重(千克) |
| gender | 性别 |
frame_lu_index.csv
每个Frame-LU一行,包含序列数量、总时长、总帧数和唯一表演者数量。
Frame-LU语义组织
每个Frame-LU由一个Frame和一个LU配对组成,目录顺序为Frame优先,然后LU。示例:
| Frame | 示例LU |
|---|---|
| Self_motion | walk, run, jog, stride |
| Change_posture | crawl |
| Posture | kneel, lean, squat |
| Body_movement | bend, toss, shake, clap |
| Cause_motion | push, pull, lift |
| Bringing | carry |
| Cause_to_move_in_place | rotate, shake, swing |
镜像副本机制
每个原始运动都有一个对应的镜像版本,通过追加__mirror后缀命名(如Body_movement-bob_0001__mirror)。对于HOI数据,人体BVH、物体轨迹和物体局部网格会一起镜像。镜像OBJ顶点取局部X负值,面绕向反转,镜像网格ID追加__mirror后缀。
预期应用场景
- 人形机器人的运动跟踪、模仿学习和重定向
- 运动表示学习、生成和补全
- 基于Frame-LU的运动检索
- 物体感知的全身运动与控制
- 运动空间覆盖度分析
数据获取与工具
- Hugging Face 仓库: 数据以32个独立
.tar.zst压缩归档存储 - HiPHI Motion Viewer: 内置轻量级本地浏览器,支持按Frame和LU浏览、播放55关节BVH运动及同步物体、查看运动元数据
- 配套文档:
docs/data_format.md、docs/mirroring.md、docs/repository_layout.md提供详细格式说明 - 论文访问: https://arxiv.org/abs/2608.16222
搜集汇总
数据集介绍

构建方式
HiPHI是一个大规模、高精度的光学动作捕捉数据集,专为类人机器人学习与全身运动建模设计。该数据集采用光学动作捕捉系统,以90Hz的采样率捕获人体运动,并标准化为55关节的BVH格式。对于人-物交互,数据集同步记录了物体的轨迹和原始高分辨率OBJ网格,确保多模态信息的时间对齐。数据集包含617.5小时的运动数据,总计2.001亿帧,其中HOI占39.8%,涵盖132位匿名表演者,并通过镜像技术扩充数据。运动序列按Frame-LU语义标签组织,形成22个Frame和214个Frame-LU标签的层级结构,每个运动序列附带文本注释和演员元数据。
特点
HiPHI数据集的显著特点在于其大规模、高精度和丰富的语义标注。它提供了标准化的人体运动数据,与同步的物体轨迹和网格相结合,支持人-物交互的精确建模。数据集中每个运动序列都有对应的镜像版本,提升了数据多样性。更重要的是,HiPHI引入了基于Frame-LU的语义组织体系,每个标签包含至少10位表演者的运动数据,覆盖广泛的动作类别,如行走、奔跑、推拉等,为运动检索、表示学习和生成提供了细粒度的标注。此外,数据集包含演员的身高、体重、性别等元数据,便于进行个性化运动分析,其规模之大在同类数据集中处于领先地位。
使用方法
使用时,研究者可通过Hugging Face平台下载数据集,但需注意数据以32个独立的.tar.zst压缩包形式存储,每个原始运动及其镜像版本位于同一压缩包内。BVH文件遵循统一的55关节层次结构和Z-X-Y欧拉角旋转顺序,可直接用于运动学分析。对于人-物交互,需结合CSV格式的物体轨迹和OBJ网格文件,通过提供的变换公式将物体坐标映射到世界坐标系。数据集提供了详尽的元数据CSV文件,包括运动序列、演员和Frame-LU索引,方便用户按需筛选和检索。同时,内置的HiPHI Motion Viewer工具支持本地浏览运动数据,便于快速预览和质量检查。在应用前,需根据目标机器人平台对BVH进行重定向和验证。
背景与挑战
背景概述
HiPHI数据集由Noitom Robotics研究团队于2026年创建,旨在为高精度人体运动与物体交互(HOI)研究提供大规模基准。该数据集采用光学动捕技术,以90Hz帧率采集了132名表演者的运动数据,总时长超过617小时,包含超过2亿帧的运动序列。其核心研究问题在于支持人形机器人的运动追踪、模仿学习、重定向以及运动表示学习等任务。HiPHI通过标准化55关节BVH格式和同步的物体轨迹及高分辨率OBJ网格,为HOI研究提供了丰富而精确的数据资源。该数据集的出现填补了现有数据集在规模、精度和交互多样性方面的空白,对推动人形机器人学习和全身运动建模领域的发展具有重要意义。
当前挑战
HiPHI数据集面临的挑战包括:一,领域问题的挑战:虽然HiPHI覆盖了22个Frame和214个Frame-LU标签,但运动语义的多样性仍受限于预定义的标签体系,难以涵盖真实世界中的所有交互动作;同时,尽管HOI数据占比达39.8%,但物体类别和交互模式相对有限,可能影响模型泛化能力。二,构建过程中的挑战:光学动捕系统对环境要求严苛,数据采集过程需保证标记点可见性并避免遮挡,导致数据采集成本高昂且耗时;此外,多表演者数据的一致性和匿名化处理难度较大,需确保不同个体间的数据可比性,同时去除身份信息。最后,数据集的庞大体积(200M帧)为存储、传输和处理带来了巨大压力,尽管采用压缩格式和分卷归档,仍对用户的硬件和计算资源提出了较高要求。
常用场景
经典使用场景
HiPHI作为大规模光学动捕基准,其核心使用场景在于高精度人体运动建模与人-物交互分析。凭借其标准化的55关节BVH格式及同步的物体轨迹与高分辨率OBJ网格,该数据集为全身运动追踪、模仿学习与再定向提供了统一的数据基础。研究者可借此探索运动表征学习、生成与补全,以及基于Frame-LU语义标签的运动检索,进而推动类人机器人学习与全身运动建模的学术进展。
实际应用
在实际应用中,HiPHI直接赋能于人形机器人的运动控制与交互策略开发,其高保真动捕数据可用于训练机器人执行精细操作,如携带、推拉与旋转物体。此外,该数据集支持运动重定向至不同机器人形态,辅助虚拟现实中的全身虚拟化身驱动,以及体育科学中的人体运动分析。其丰富的语义标签亦为智能监控与行为识别系统提供了训练素材,展现了广阔的工业与消费级应用前景。
衍生相关工作
HiPHI的发布预期将催生一系列衍生学术工作。其大规模数据与语义框架,有望推动基于Transformer或扩散模型的全身运动生成与交互预测研究,促使研究者开发更高效的运动表征学习方法。Frame-LU标签体系亦可能衍生出细粒度的运动检索与语义理解任务,而镜像数据机制则可能促进数据增强与域适应技术的进步。此外,该数据集的高精度网格与轨迹同步特性,为人-物接触建模与物理仿真提供了新基准,启发后续研究者在真实与仿真场景中拓展其应用。
以上内容由遇见数据集搜集并总结生成



