遇见数据集

Real-World Video Motion Dataset

收藏
github2026-08-21 更新2026-08-28 收录
官方服务:

资源简介:

来自10名参与者的132个视频(14878帧/743.9秒),与通过ViTPose估计的2D运动、通过TRACE和WHAM估计的3D运动以及HumanML3D数据集配对。

132 videos (14878 frames / 743.9 seconds) from 10 participants, paired with 2D motion estimated via ViTPose, 3D motion estimated via TRACE and WHAM, and the HumanML3D dataset.

创建时间:
2026-08-11
原始信息汇总

2D Motion Interface 数据集详情

该项目提出了一种用于现实世界动作语言模型的即插即用2D运动接口,相关数据集为单目真实世界视频运动数据集,已公开发布。

数据集概览

  • 视频数量:132个视频片段
  • 参与者:10名参与者(男女均有,年龄20-50岁)
  • 帧数/时长:14,878帧,总计743.9秒
  • 采集设备:iPhone SE第二代(单目RGB摄像头)
  • 标注内容:人类动作文本描述(HumanML3D标注)

数据采集方式

研究人员从HumanML3D测试集中随机采样动作片段,展示给参与者并要求其模仿,同时通过单目RGB摄像头进行录制,在录制过程中变化参与者与相机之间的相对视角。

数据内容与配对信息

每个视频片段均配有以下数据:

  • 2D姿态估计:使用ViTPose提取的2D关键点
  • 3D姿态估计:使用TRACE和WHAM提取的3D运动
  • 文本描述:对应采样片段的原始HumanML3D文本标注

质量控制

  • 由3名标注员进行人工验证
  • 86.4% 的视频-文本配对被判定为语义一致

数据集的用途

该数据集用于训练和评估2D运动接口中的真实视频适配器(A_real),该适配器可以弥合干净2D投影与真实视频中经过姿态估计的2D数据之间的差距,使得预训练的运动语言模型(如TM2T、MotionGPT、MG-MotionLLM)无需3D姿态估计即可处理真实单目视频,并且性能优于使用估计3D数据的方法。

下载地址

搜集汇总
数据集介绍
Real-World Video Motion Dataset 数据集图片
构建方式
该数据集由丰田工业大学团队构建,旨在为运动语言模型提供真实的单目视频运动数据。构建过程中,研究人员从HumanML3D测试集中随机采样运动片段,邀请10名不同性别和年龄段的参与者(20-50岁)在单目RGB摄像头(iPhone SE第二代)前模仿这些动作,同时变换相对视角。每个视频序列均配对了基于ViTPose估计的2D关键点、基于TRACE和WHAM估计的3D运动数据,以及原始HumanML3D动作描述文本。所有参与者均签署知情同意书,数据经3名标注者人工验证,其中86.4%的视频-描述对在语义上保持一致,确保了数据质量。最终数据集包含132个视频,总计14,878帧,时长743.9秒。
特点
该数据集的核心特点在于填补了真实单目视频运动与现有运动语言模型之间的鸿沟。与传统仅依赖于合成或3D动捕数据不同,该数据集提供了真实的单目视频运动,并同时包含估计的2D和3D姿态序列,支持对2D运动接口的全面评估。其独特之处在于,数据集中每个视频均与语义一致的文本描述配对,且经过人工验证,为运动到文本生成任务提供了可靠基准。此外,数据集与预训练的2D运动编码器和适配器协同设计,使得基于2D输入的运动语言模型在真实视频上表现优于使用估计3D输入的模型,同时计算成本大幅降低(ViTPose仅需17.2 GFLOPs/帧,而WHAM需250.2 GFLOPs/帧)。这一特性凸显了该数据集在推动低成本、高精度运动理解方面的潜力。
使用方法
该数据集的使用方法简洁高效,支持即插即用。用户可按照GitHub仓库中的安装指南配置相应环境,并下载预训练模型和数据集。通过运行`evaluate_with_realworld.py`脚本,用户可直接在真实世界视频上评估2D运动接口的性能,该脚本支持有无适配器两种模式的对比。此外,`demo.py`脚本提供了完整的视频推理流程,包括ViTPose姿态估计、运动标注生成和结果可视化,用户只需提供任意单目视频即可生成对应的动作描述。数据集结构清晰,分为HumanML3D预处理数据、真实世界视频数据(包含2D/3D姿态和文本描述)以及用于适配器训练的伪真实数据,便于研究人员复现实验或扩展新任务。
背景与挑战
背景概述
该数据集由丰田工业大学的研究人员于2026年发布,旨在解决运动语言模型(MoLM)在真实世界单目视频中应用的关键瓶颈。传统MoLM依赖3D动作捕捉数据,而真实场景中获取精确3D姿态既昂贵又易受噪声干扰。为此,研究团队构建了首个结合2D姿态估计与MoLM的即插即用接口,并配套发布了包含132段真实单目视频的数据集,涵盖10名受试者、总计14,878帧(约743.9秒)的多样化动作。每段视频均配有人工验证的语义描述,验证一致性高达86.4%,为评估2D运动接口在真实场景下的鲁棒性提供了坚实基准。该数据集不仅填补了真实世界运动理解数据的空白,还显著降低了计算成本(2D姿态估计仅需17.2 GFLOPs/帧,远低于3D方法的250.2 GFLOPs),推动了运动语言模型向实际应用的迈进。
当前挑战
数据集构建与应用面临多重挑战。首要挑战源于真实单目视频的固有复杂性:视角变化、遮挡、光照波动及姿态估计噪声导致2D关键点存在显著不确定性,难以直接适配基于3D运动训练的MoLM。其次,构建过程中需克服缺乏真实3D标注的困境,研究团队采用‘伪真实对’策略,从AMASS渲染随机视角视频并提取ViTPose 2D姿态,以训练适配器弥合域差距。此外,不同MoLM架构(如TM2T、MotionGPT、MG-MotionLLM)的输入编码差异,要求数据集同时兼容多种基线,并在统一基准下验证2D输入的通用性。最后,注释质量保障亦是难点,虽然86.4%的视频-文本对通过人工验证,但仍需处理语义歧义与细微动作描述不一致,确保数据集的可信度与实用价值。
常用场景
经典使用场景
该数据集的核心应用场景在于为运动语言模型(MoLM)提供无需三维姿态估计的二维运动接口,通过单目RGB视频直接驱动动作描述生成。其经典使用模式为:输入真实世界单目视频,经由ViTPose提取二维关键点序列,再通过轻量级适配器(A_real)与二维编码器(E_2D)映射至预训练MoLM的潜空间,完成从动作到文本的自动化语义转换。此流程摒弃了计算昂贵的三维重建环节,使得在消费级摄像头条件下实现实时、低功耗的运动理解成为可能。
解决学术问题
该数据集解决了运动语言模型在真实场景中因依赖三维运动捕捉数据而受限的学术难题。传统方法需借助多视角或深度传感器获取精确三维骨骼序列,成本高昂且难以泛化至非受控环境。此数据集通过提供大规模真实单目视频与人工验证的语义标注对,首次系统验证了二维关键点与三维运动在潜空间和离散token空间的高度对齐性(top-1匹配率达44.8%),显著缩小了二维输入与三维基准的性能差距(平均下降从-25.8%收窄至-0.2%),为低成本运动理解研究奠定了数据基石。
衍生相关工作
该数据集催生了一系列前沿研究方向。首先,二维-三维运动表征对齐研究成为热点,多个工作探索了在潜空间或token级实现跨模态映射的轻量化方法。其次,基于伪真实数据训练适配器的范式被推广至其他姿态估计算法(如TRACE、WHAM)的鲁棒性增强。此外,零样本运动描述生成任务受益于此数据集,研究者开始利用预训练语言模型直接解析二维骨架序列,开辟了无需任何三维监督的运动理解新路径。最后,该数据集的评估协议(Avg Drop指标)被多篇后续论文采纳,成为衡量二维运动输入质量的标准基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务