遇见数据集

HumanTracker

收藏
arXiv2026-08-14 更新2026-08-15 收录
官方服务:

资源简介:

HumanTracker是一个大规模、高质量的人形运动跟踪基准数据集,由南开大学、清华大学、Galbot、上海交通大学、北京大学和上海期智研究院联合创建,旨在解决传统运动学指标与人类感知不一致的问题。数据集包含约153小时的光学运动轨迹,共25,000个剪辑片段,覆盖日常任务、高度动态运动、交互运动和地面运动四大类别,每个片段附带类别标签和自然语言描述。数据由24名专业表演者在多摄像头光学系统下录制,经通用运动重定向和人工检查后形成高保真参考轨迹。该基准专门用于评估人形机器人运动跟踪算法,尤其关注接触丰富、长时间行为的稳定性和物理合理性,并提供与人类偏好对齐的HumanScore评分指标。

HumanTracker is a large-scale, high-quality benchmark dataset for human motion tracking, co-developed by Nankai University, Tsinghua University, Galbot, Shanghai Jiao Tong University, Peking University, and Shanghai Qi-Zhi Institute. It aims to address the discrepancy between traditional kinematic metrics and human perception. The dataset contains approximately 153 hours of optical motion trajectories, totaling 25,000 clip segments, covering four major categories: daily tasks, highly dynamic motions, interactive motions, and ground-based motions. Each segment is accompanied by category labels and natural language descriptions. The data was recorded by 24 professional performers using a multi-camera optical system, and high-fidelity reference trajectories were generated after general motion retargeting and manual inspection. This benchmark is specifically designed for evaluating humanoid robot motion tracking algorithms, with a particular focus on the stability and physical plausibility of contact-rich, long-duration behaviors, and it provides the HumanScore scoring metric aligned with human preferences.

创建时间:
2026-08-14
原始信息汇总

HumanTracker 数据集概览

HumanTracker 是一个面向人形机器人运动跟踪的综合基准数据集,旨在通过人类偏好对齐的轨迹度量(HumanScore)与大规模、类别感知的基准,提升运动跟踪质量评估的全面性与人类对齐程度。


数据集核心特点

  • HumanScore 指标:一个基于人类偏好学习的轨迹级质量评估指标,在测试集上达到 90.83% 的人类偏好对齐率,比最强传统诊断指标高出 6.78 个百分点
  • 数据规模
    • 153 小时光学运动捕捉数据
    • 25,000 个标注运动片段
    • 24 位专业表演者
    • 4 类诊断性运动家族
  • 偏好数据构建
    • 6 位专家标注者 提供严格偏好、相似判断和不可比较判断。
    • 原始 6,000 对 运动片段,通过双侧镜像扩充至 12,000 条 偏好记录。
    • 每个样本包含 5 秒上下文(250 帧),编码为 539 维帧令牌序列,并带有显式填充掩码。
    • 输出为 0-100 的窗口奖励分数,按实际帧数加权平均。

运动家族分类及数据分布

家族类别 描述 时长(小时) 片段数
Daily 稳定行走、转弯、常规姿态,评估稳定性与残余漂移 89.29 9,739
Highly Dynamic 跳跃、踢腿、杂技、快速步法,测试冲击处理与相位时序 11.01 2,676
Interaction 物体与环境交互,要求手、臂、全身协调 47.78 10,940
Ground 低姿态与多接触转换,检验接触几何、平衡与恢复 4.59 1,640

HumanScore 与传统诊断指标的对比(测试集)

指标 对齐率(%)
HumanScore 90.83
KPT 位置 MAE 84.05
关节速度误差 84.04
MPJPE 80.49
足部接触准确率 78.82

注:对齐率基于运动不相交测试集上的原始、非镜像严格偏好比较。


HumanScore 的评估维度

  • 感知质量:总结轨迹级偏好,涵盖接触、稳定性、平滑度与参考保真度,在同一评估设置下分数越高越好。
  • 成功度:衡量运动完成情况,避免早期失败但看似准确的轨迹被误判为鲁棒跟踪。
  • 运动学误差诊断:MPJPE 等误差仍用于定位具体姿态错位问题,HumanScore 并非替代所有分析诊断,而是补充。

数据内容与格式

  • 每个运动片段包含:
    • 家族标签(Family Label)
    • 自然语言描述
    • 拟合的 SMPL 序列
    • 机器人空间参考轨迹

引用信息

  • 论文标题:HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark
  • 作者:Dairu Liu, Zekun Qi, Jiayu Zeng, 等
  • 机构:南开大学、清华大学、Galbot、上海交通大学、北京大学、上海期智研究院
  • 预印本:arXiv:2608.13555
  • 代码与数据集:即将发布(Coming Soon)
搜集汇总
数据集介绍
HumanTracker 数据集图片
构建方式
人类动作追踪是机器人遥操作与全身模仿学习的核心环节,然而现有评估基准在规模与多样性上存在明显不足。HumanTracker基准数据集由此应运而生,旨在构建一个兼具规模与细粒度诊断能力的评测平台。该数据集依托多相机光学动作捕捉系统,邀请24位专业表演者,涵盖舞蹈教师、健身教练等多元背景,录制约153小时的高保真动作轨迹。所有动作经General Motion Retargeting技术映射至统一的人形机器人模型,并严格筛查去除浮空、穿地等物理异常片段。数据以9:1划分训练与测试集,每个片段均附带运动族标签、自然语言描述及SMPL序列,形成结构化的评测语料库。
使用方法
HumanTracker为研究者提供了一套标准化、可复现的评估协议。使用该数据集时,研究者可依据JSON格式的清单文件加载相应分区的动作数据,并通过统一的MuJoCo评估入口执行追踪策略。数据集支持按运动族进行分层评估,便于定位特定失效模式。同时,HumanScore指标可直接用于量化评估结果,其输入为模拟状态时间序列,兼容任意追踪算法的输出格式。研究者亦可利用训练分区的数据与配套的偏好标签,微调或训练自定义奖励模型,进而拓展至强化学习等下游应用场景。
背景与挑战
背景概述
HumanTracker数据集由南开大学、清华大学及Galbot等多家机构于2026年联合推出,旨在解决人形机器人运动跟踪评估中存在的关键问题。该数据集包含了约153小时、由24位专业表演者(包括舞蹈教师、健身教练等)录制的光学运动轨迹,覆盖日常活动、高动态运动、交互运动及地面运动四大类,并配备文本标签以支持细粒度诊断。其核心研究问题在于,传统的运动学指标(如MPJPE)无法准确反映人类对运动质量的感知,尤其是在接触、稳定性等方面。为此,HumanTracker引入了基于人类偏好训练的HumanScore指标,通过12K组运动对(含24K个运动)来更准确地评估跟踪效果。该数据集为相关领域提供了大规模、多样化的基准,推动了人形机器人运动跟踪评估的标准化与感知对齐,对遥操作、全身模仿学习等应用具有重要影响力。
当前挑战
HumanTracker数据集所面临的挑战主要源自其解决的核心问题及构建过程。在领域问题层面,传统的运动跟踪评估指标(如关节平均误差)虽能衡量姿态差异,却无法捕捉足部滑动、接触时机错误等物理伪影,导致评估结果与人类感知脱节;同时,现有测试集规模小、多样性不足,难以全面评估接触丰富、长时程的行为。在构建过程中,需将人体运动数据重定向至机器人形态,并确保其在接触处的物理合理性,这要求对捕捉数据中出现的漂浮、地面穿透及接触不连续等伪影进行严格筛查与处理。此外,为训练HumanScore,需收集大量人类偏好标注,涉及多视角视频同步、标注者一致性及偏好数据的平衡划分等复杂环节,均构成数据集构建中的关键挑战。
常用场景
经典使用场景
HumanTracker数据集的核心应用在于为仿人机器人运动追踪提供大规模、多样化的基准测试平台。该数据集包含约153小时由24位专业表演者采集的光学运动轨迹,涵盖日常任务、高动态运动、交互运动及地面运动四大类别,并配备文本标签以支持细粒度诊断。研究者可利用该基准对现有追踪器进行标准化评估,通过统一的机器人模型、参考表示和评估协议,实现跨方法的公平比较,从而深入洞察不同追踪器在各运动类别下的表现差异与失败模式。
解决学术问题
该数据集解决了运动追踪评估中度量与人类感知不一致的学术难题。传统运动学指标(如MPJPE)虽能量化逐帧位姿误差,却难以捕捉足部滑动、接触时机错位等物理伪影,导致评估结果与主观视觉判断相悖。HumanTracker引入人类偏好对齐的HumanScore指标,基于12K对偏好数据训练奖励模型,准确预测人类对追踪质量的感知,并揭示了运动学指标常忽略的接触稳定性问题,为仿人运动追踪领域提供了更符合人类直觉的评估范式。
实际应用
在实际应用中,HumanTracker为仿人机器人的遥操作与全身模仿学习提供了高质量的参考运动库。其丰富的运动类别和细粒度标签可支持机器人技能的泛化训练,例如通过高动态运动提升机器人的快速响应能力,利用交互运动优化手-臂-全身协调,以及借助地面运动增强低姿态下的多接触控制。此外,标准化的评估协议可加速追踪算法的迭代验证,推动从仿真到真实世界的迁移,并为工业级仿人机器人控制系统的性能监测与故障诊断提供可靠依据。
数据集最近研究
最新研究方向
HumanTracker数据集的发布标志着人形机器人运动跟踪评估领域正经历一场范式变革,其核心趋势是从传统运动学指标向人类偏好对齐的感知质量评估转变。该数据集包含153小时专业表演者的光学运动轨迹,覆盖日常、高动态、交互及地面运动四类场景,并引入HumanScore这一基于偏好学习的评估指标。前沿研究聚焦于借助大规模分级标注数据训练奖励模型,以捕捉人类对稳定性、接触正确性和自然度的感知判断,进而揭示运动学误差无法反映的物理伪影,如足部滑动和接触时序偏差。这项工作推动评估体系从单值平均走向细粒度、类别化诊断,为人形机器人的遥操作和全身模仿学习性能提供更符合人类直觉的衡量标准,对推动跨实体泛化和真实世界部署具有基础性意义。
相关研究论文
  • 1
    HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark南开大学; 清华大学; Galbot; 上海交通大学; 北京大学; 上海期智研究院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务