遇见数据集

Cartwheel Human Motion Dataset

收藏
github2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

世界上最大的高质量人体运动数据集,包含约12,000小时(5.56百万个片段)的运动数据,经过严格的筛选和质量控制流程构建而成,用于训练和验证人体运动生成模型的缩放定律。

The largest high-quality human motion dataset in the world contains approximately 12,000 hours (5.56 million clips) of motion data. It was constructed through rigorous screening and quality control processes, and is designed for training and validating the scaling laws of human motion generation models.

创建时间:
2026-08-25
原始信息汇总

Compute-Optimal Scaling Laws for Human Motion Generation 数据集详情

数据集简介

该数据集由 Cartwheel 团队构建,是当前世界最大规模的高质量人体运动数据集,旨在证明人体运动生成可以像语言模型一样遵循可预测的缩放定律(scaling laws),从而摆脱数据约束的限制。

数据集规模与构成

  • 最终语料库:11,969 小时,包含 556 万个片段(clips)
  • 构建历程:约 423,000 小时的原始视频目录 → 预筛选后约 91,000 小时 → 视觉门控通过 24,300 小时 → 经过 Comic 重建与物理质量检查后保留 12,100 小时 → 安全筛查后得到最终 11,969 小时
  • 规模对比:约为此前唯一运动缩放定律研究的 40 倍,是次大运动语料库的 4 倍
  • 总体缩减:从原始数据到最终语料库约经过 35 倍缩减

研究方法与关键发现

1. 计算最优缩放定律

  • 首次在自回归(autoregressive)和流匹配(flow matching)两种框架中独立拟合人体运动生成的计算最优缩放定律
  • 两种框架的指数均接近 C^1/2,表明运动数据的缩放规律与语言模型同样可预测,且与框架选择无关
  • 拟合结果包含不确定性估计,覆盖 Chinchilla 的三种估计器及其分析选择

2. 数据质量门控机制

  • 数据集的核心构建理念是“质量门控而非爬取”,通过多阶段筛选(视觉门控、物理 QA、安全筛查)确保数据质量

3. 外推验证

  • 通过保留部分预算数据验证缩放定律的预测能力,证明该定律可有效指导预算规划与模型选择

4. 数据重复容忍度

  • 在匹配的模型规模(49.2M)和计算量(约 10^18 FLOPs)下,自回归模型在约 16 个 epoch 处越过 +2% 损失阈值,而流匹配在约 498 个 epoch 处才越过
  • 流匹配对同一数据的重复利用率约为自回归的 30 倍,框架选择决定了固定语料库的有效使用时长

数据构建方法论

数据集采用文档化的策展方法,将原始视频转化为最大规模的运动语料库,表明数据约束型模态的数据是通过构建而非简单爬取获得的。

搜集汇总
数据集介绍
Cartwheel Human Motion Dataset 数据集图片
构建方式
该数据集由Cartwheel团队构建,旨在解决人类运动生成领域数据稀缺的问题。构建过程遵循一套严谨的策展方法论,从约42.3万小时的原始视频目录出发,经过预筛选保留约9.1万小时,随后通过视觉质量门控筛选出2.43万小时,再经由Comic重建与物理质量检查,并结合动作捕捉及公共语料,最终通过安全审查,得到11,969小时的高质量运动数据,涵盖约556万个片段。整个流程实现了约35倍的缩减,凸显了数据质量门控在语料库构建中的核心作用。
特点
该数据集具有显著的特点。其规模远超以往研究,约为先前运动缩放定律研究语料库的40倍,是次大运动语料库的4倍,为训练大规模模型提供了坚实基础。数据集在构建中强调了质量优先,通过多级视觉与物理检查确保数据可靠。此外,研究揭示了运动生成遵循计算最优缩放定律,其指数接近C^(1/2),与语言模型中的Chinchilla缩放行为相似,表明运动数据的扩展具有可预测性。同时,数据重复容忍度在不同生成框架下差异显著,自回归模型约16个周期即达性能墙,而流匹配模型可容忍约498个周期,为框架选择提供了重要参考。
使用方法
该数据集可用于训练和评估人类运动生成模型。研究者可基于此语料库,在自回归或流匹配框架下,进行缩放定律的拟合与验证,以预测不同计算预算下的模型最优损失与规模。数据集支持控制式实验设计,如通过固定计算量缩放模型参数量,或固定模型大小调整训练周期,从而研究数据重复的影响。此外,该语料库的构建方法论可作为数据稀缺模态下数据集建设的范例,其质量门控流程与安全审查机制可为其他领域的数据收集提供借鉴。用户需遵循数据集许可协议,确保合规使用。
背景与挑战
背景概述
Cartwheel Human Motion Dataset诞生于2024年,由Cartwheel团队携手多位研究者构建,旨在解决人体运动生成领域长期受数据匮乏制约的瓶颈。该数据集通过严格的质量筛选流程,从庞大的原始视频中提取出约12,000小时的高质量运动数据,其规模是先前最大数据集的四倍,极大丰富了运动表征的学习资源。研究团队基于此语料库,系统验证了人体运动生成遵循与语言模型类似的Chinchilla缩放定律,揭示了计算资源与模型性能间的可预测关系,为运动生成技术的规模化发展和物理与数字智能的融合奠定了坚实基础。
当前挑战
该数据集面临的挑战主要体现在领域问题和构建过程两个方面。领域层面,人体运动生成长期受限于数据稀缺,现有数据集规模小且质量参差不齐,难以支撑大规模模型的高效训练,成为技术走向实际应用的主要障碍。构建过程中,团队需从约42.3万小时的原始视频中,通过预过滤、视觉筛选、Comic重建及物理QA、安全审查等多层质量关卡,最终仅保留约2.8%的数据,整个过程涉及复杂的自动化筛选与人工审核,每个环节都需严格控制数据质量,避免引入噪声偏差,确保语料库的纯净度和代表性,其工程复杂度与资源消耗均构成显著挑战。
常用场景
经典使用场景
Cartwheel Human Motion Dataset作为当前规模最大、质量最高的人类运动数据集,其经典使用场景聚焦于训练和评估人类运动生成模型。该数据集包含约12,000小时的精细标注运动数据,涵盖多样化动作类别,为自回归模型和流匹配模型等生成框架提供了大规模的语料基础。研究者利用该数据集探索运动生成的缩放规律,通过调整模型参数量与训练数据规模,系统性地度量不同计算预算下的性能边界,从而建立运动生成领域的计算最优缩放定律,类似于自然语言处理中的Chinchilla定律。这种场景强调数据规模与模型容量的协同优化,推动了运动生成从经验性设计向可预测性工程的转变。
解决学术问题
该数据集解决了人类运动生成领域长期面临的数据稀缺与不可扩展性问题。此前,运动生成模型受限于高质量数据不足,难以验证规模提升对性能的实际增益。通过构建约423k小时原始视频筛选至11,969小时的高质量运动语料,该数据集证明了运动生成并非数据受限,而是遵循与语言模型相似的计算最优缩放规律(C^1/2)。这一发现解决了两个关键学术问题:其一,量化了数据规模对模型性能的边际效应,为资源分配提供了理论依据;其二,比较了自回归与流匹配两种框架下的数据重复容忍度,发现流匹配可重复利用数据约30倍之多,为生成目标的设计和数据增强策略提供了全新视角。这些结论不仅深化了运动生成的理论基础,也为后续研究提供了可复现的基准。
衍生相关工作
该数据集衍生了一系列经典工作,推动了运动生成领域的蓬勃发展。最直接的是其自身建立的计算最优缩放定律研究,首次将语言模型中的Chinchilla方法类比至运动模态,实现了跨领域的理论迁移。在此基础上,研究者进一步探索了数据重复对模型泛化能力的影响,揭示了自回归与流匹配框架间约30倍的重复容忍度差异,催生了针对不同生成目标的训练策略优化研究。此外,该数据集公开的详细数据整理方法论,包括视觉质量门控、物理验证和安全筛查流程,为其他数据受限模态(如手部运动、面部表情)构建大规模语料库提供了范式参考。后续工作还扩展了缩放定律的适用范围,如多模态运动生成与条件生成,进一步验证了数据的核心驱动作用,并为运动生成的可扩展性奠定了坚实的实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务