遇见数据集

Human3.6Mplus

收藏
arXiv2026-07-10 更新2026-07-11 收录
官方服务:

资源简介:

Human3.6Mplus是由德克萨斯大学圣安东尼奥分校研究团队构建的大型对齐数据集,旨在桥接三维人体姿态估计与生物力学分析。该数据集将Human3.6M视频与三维关键点序列,同其生物力学标签空间进行精确配对,涵盖七名受试者的三十种活动,实现了帧级准确的跨模态监督。其创建过程通过建立并验证两种模态坐标系间的解剖学对应关系,以共享骨盆根节点为锚点,确保生物力学模拟标签与视觉姿态数据的无缝对齐。该数据集主要应用于康复医学、运动科学及临床运动分析领域,旨在解决传统姿态估计缺乏生理学意义量化的问题,为无标记生物力学分析提供大规模监督数据支持。

Human3.6Mplus is a large-scale aligned dataset constructed by the research team from the University of Texas at San Antonio, with the goal of bridging the gap between 3D human pose estimation and biomechanical analysis. This dataset precisely pairs Human3.6M videos and 3D keypoint sequences with their matching biomechanical label spaces, covering thirty types of activities performed by seven subjects, thereby enabling frame-level accurate cross-modal supervision. In the process of creating this dataset, the anatomical correspondence between the two modal coordinate systems was established and validated, taking the shared pelvic root node as the anchor point to ensure seamless alignment between biomechanical simulation labels and visual pose data. This dataset is mainly applied in the fields of rehabilitation medicine, exercise science and clinical motion analysis, aiming to resolve the problem that traditional pose estimation approaches lack physiologically meaningful quantification, and provide large-scale supervised data support for markerless biomechanical analysis.

创建时间:
2026-07-10
搜集汇总
数据集介绍
Human3.6Mplus 数据集图片
构建方式
Human3.6Mplus数据集的构建基于Human3.6M与Human3.6Mplus两大开源数据资源的跨模态对齐。研究团队首先从Human3.6M中提取多视角视频、二维关键点标注以及三维人体姿态序列,同时获取Human3.6Mplus中经OpenSim肌肉骨骼仿真生成的每帧生物力学标签。为了解决两个数据源坐标系不兼容的问题,通过共享的相机标定矩阵将Human3.6M三维关节与OpenSim标志点分别投影至同一图像平面,并以骨盆根节点为锚点实现帧级别的精确几何配准,验证表明重投影误差小于0.28像素。最终产出包含17个标准关节的三维姿态与涵盖运动学、动力学及神经肌肉三大类共17种生物力学属性的逐帧配对数据集。
特点
该数据集的核心特点在于建立了视觉姿态与生物力学状态之间的密集对应关系。每个视频帧不仅关联常规的三维人体关节点坐标,还提供了广义关节坐标、主动与被动关节力矩、地面反作用力、肌肉激活信号及神经兴奋信号等模拟仿真输出的高维生物力学量。数据涵盖7名受试者执行的30种标准化活动,总计超过52万帧,训练集与测试集按受试者严格分离。通过骨盆锚点的坐标系对齐方案,确保了跨模态标签的时空一致性,为从稀疏骨架序列学习生理可解释的运动分析提供了高质量的监督信号。
使用方法
数据集的使用直接服务于BioModule这一时序变换器模型的训练与评估。使用者可将17关节三维姿态序列作为输入,以根节点居中处理并展平为51维向量,在81帧(约1.62秒)的时间窗口内进行密集采样。模型通过共享线性嵌入与四层多头自注意力编码器提取运动表征,再由独立预测头分别输出归一化后的运动学、动力学及神经肌肉属性。训练阶段采用分层加权多任务损失函数,运动学权重最高,动力学次之,神经肌肉最低,以避免高维输出主导优化目标。评估时仅取窗口中心帧的预测结果,提供平均绝对误差、均方根误差及归一化误差等指标,并可对接七种主流三维姿态估计器进行冻结或微调测试。
背景与挑战
背景概述
Human3.6Mplus数据集由德克萨斯大学圣安东尼奥分校计算机科学系的Ayda Eghbalian与Kevin Desai于2026年创建,旨在弥合三维人体姿态估计与生物力学属性预测之间的鸿沟。该数据集以经典的Human3.6M为基础,通过OpenSim肌肉骨骼仿真为其每帧视频和三维关节点标注了全面的生物力学量,涵盖运动学、动力学及神经肌肉三大层级共17项指标。核心研究问题在于:能否借助一个轻量模块,从标准17关节三维骨架中精确推断出关节力矩、地面反作用力、肌肉激活等物理量,从而将视觉姿态估计延伸至可解释的运动分析。Human3.6Mplus的提出为该领域提供了首个大规模对齐的配对监督信号,使得跨模态的逐帧生物力学预测训练成为可能,对康复工程、运动科学及临床步态分析产生了重要推动作用。
当前挑战
Human3.6Mplus所应对的领域挑战在于,传统三维姿态估计仅优化关节位置的几何精度,却无法输出力矩、肌肉激活等物理意义明确的生物力学量,而这些量正是临床评估与运动科学中不可或缺的指标。构建过程面临的技术困难包括:Human3.6M的世界坐标系与OpenSim的人体坐标系完全异构,无法直接建立对应关系。为了解决这一难题,研究者利用共享的摄像机标定矩阵,分别将两套坐标系的点投影至同一像平面,通过几何验证实现了以骨盆为锚点的帧精确对齐,确保投影误差小于0.28像素。此外,不同生物力学量的物理维度和不确定性差异巨大,训练时需要设计分层加权多任务损失以平衡各目标的贡献,防止高维输出主导梯度更新。
常用场景
经典使用场景
在三维人体姿态估计与生物力学分析的交叉领域,Human3.6Mplus数据集最为经典的应用在于为无标记运动捕捉系统提供物理一致性的生物力学监督信号。研究者可通过该数据集将常规的17关节点三维骨架序列映射至包含运动学、动力学及神经肌肉属性的多层次生物力学状态空间,从而在无需力板、肌电设备或逆向动力学仿真的前提下,实现从视频到人体运动物理量的端到端推断。该数据集的核心价值在于建立了计算机视觉中稀疏骨架表示与生物力学分析中物理量空间之间的桥梁,使得传统姿态估计模型能够被扩展为兼具几何精度与生理可解释性的运动分析工具。
实际应用
在实际应用层面,Human3.6Mplus数据集赋能了多种无需实验室级设备的生物力学分析场景。在康复医学中,临床医生可基于普通单目摄像头采集的患者运动视频,借助该数据集训练的模型实时评估关节负荷、步态对称性及肌肉激活模式,从而替代传统依赖标记点运动捕捉与测力台的昂贵评估流程。在竞技体育领域,教练员可利用移动设备拍摄的运动员训练视频,快速获取下肢关节力矩、功率输出及地面反作用力等关键指标,用于运动技术优化与损伤风险预警。此外,该数据集还支持人因工程中的工作姿势生物力学分析,为工位设计与职业健康干预提供量化依据。
衍生相关工作
Human3.6Mplus数据集直接催生了多项具有里程碑意义的后续工作。BioModule作为其核心衍生产物,提出了一种轻量级时序变换器架构,能够无缝接入任意三维姿态估计器并同时预测17项生物力学指标,开创了姿态无关的生物力学推断范式。在此基础上,研究者进一步探索了多假设姿态融合机制与频域时序建模方法,提升了在深度模糊与遮挡场景下的物理量预测鲁棒性。该数据集还启发了针对运动学与动力学联合约束的姿态恢复研究,以及将物理仿真嵌入学习目标的自监督训练框架,推动了计算机视觉与计算生物力学交叉领域的系统性发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务