遇见数据集

awesome-text-to-motion

收藏
github2026-05-27 更新2026-06-04 收录
官方服务:

资源简介:

这是一个关于文本驱动人体运动生成的数据集资源集合,专注于单人场景且不涉及人-物/场景交互。该合集收录了该领域相关的多个数据集,并提供了数据集的统计图表和交互式可视化,旨在为研究人员和开发者提供全面的数据集索引和整理。

This is a collection of dataset resources focused on text-driven human motion generation, targeting single-person scenarios with no human-object or scene interactions involved. This compilation includes multiple datasets relevant to the field, alongside statistical charts and interactive visualizations for each dataset, with the goal of providing researchers and developers with comprehensive dataset indexing and organization.

创建时间:
2025-08-15
原始信息汇总

awesome-text-to-motion 数据集详情

项目概述

这是一个专注于文本驱动的人体运动生成(Text-driven Human Motion Generation)的资源集合,涵盖综述、数据集和模型,聚焦于单人场景(不涉及人与物体或场景的交互)。项目提供了交互式可视化图表和统计数据的在线页面。

综述(Surveys)

共收录 4 篇综述论文:

论文标题 发表信息 链接
Motion Generation: A Survey of Generative Approaches and Benchmarks arXiv(2025) https://arxiv.org/abs/2507.05419
Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation arXiv(2025) https://arxiv.org/abs/2506.03191
Text-driven Motion Generation: Overview, Challenges and Directions arXiv(2025) https://arxiv.org/abs/2505.09379
Human Motion Generation: A Survey TPAMI(2023) https://arxiv.org/abs/2307.10894

数据集(Datasets)

共收录 26 个数据集:

2025年发布

  • UniMo4D (arXiv 2025): X-MoGen: Unified Motion Generation across Humans and Animals
  • FineMotion (arXiv 2025): 细粒度时空注释的数据集和基准,用于细粒度运动生成和编辑
  • SnapMoGen (arXiv 2025): 从表达性文本生成人体运动
  • MotionMillion (ICCV 2025): 百万级数据驱动的零样本运动生成
  • HumanAttr (arXiv 2025): 生成属性感知的人体运动
  • GBC-100K (arXiv 2025): 从运动到行为的分层建模
  • STANCE (CVPR 2025): 动态运动融合用于多功能运动编辑
  • PerMo (CVPR 2025): 个性化文本到运动生成
  • TMD (arXiv 2025): 任意到运动生成
  • Motion-X++ (arXiv 2025): 大规模多模态3D全身人体运动数据集

2024年发布

  • MotionFix (SIGGRAPH Asia 2024): 文本驱动的3D人体运动编辑
  • HumanML3D-Extend (arXiv 2024): 长文本指令驱动的无限运动生成
  • MotionPercept (ICLR 2025): 对齐人体运动生成与人类感知
  • PaM (arXiv 2024): 通过AI反馈驱动的直接偏好优化
  • HumanML3D++ (ICCV 2025): 任意文本到运动生成
  • MotionVerse (arXiv 2024): 统一多模态运动生成的大运动模型
  • RICH-CAT (arXiv 2024): 接触感知的文本描述人体运动生成
  • FineHumanML3D (LREC-COLING 2024): 从细粒度文本描述生成运动
  • BlindWays (NeurIPS 2024): 文本到盲人运动
  • LaViMo (ECCV 2024): 开放词汇描述的双向3D人体运动生成
  • Inter-MT2 (ICCV 2025): 人类交互中运动推理与生成的统一框架
  • MotionLib (ICML 2025): 百万级人体运动的大运动模型扩展
  • HumanML3D-synthesis (MM 2024): 文本驱动人体运动生成的性能评估库
  • Limb-ET2M (MM 2024): 通过LLM引导的肢体级情感操控实现情感增强的文本到运动生成

2023年及之前

  • Motion-X (NeurIPS 2023): 大规模3D表达性全身人体运动数据集
  • HumanLong3D (AAAI 2024): 自回归运动扩散
  • HuMMan-MoGen (NeurIPS 2023): 细粒度时空运动生成与编辑
  • HumanML3D (CVPR 2022): 从文本生成多样且自然的3D人体运动
  • KIT (Big Data 2016): KIT运动语言数据集

模型(Models)

共收录 52 个模型,涵盖多种技术路线:

代表性模型类别

模型名称 发表信息 关键技术
X-MoGen arXiv 2025 跨人类与动物的统一运动生成
ReMoMask arXiv 2025 检索增强的掩码运动生成
SASI SIGGRAPH 2025 语义一致的文本到运动与无监督风格
MoMask++ arXiv 2025 表达性文本的运动生成
GotoZero ICCV 2025 零样本运动生成
MotionGPT3 arXiv 2025 人体运动作为第二模态
Motion-R1 arXiv 2025 思维链推理与强化学习
MOGO arXiv 2025 残差量化分层因果Transformer
FlowMotion arXiv 2025 目标预测条件流匹配
MixerMDM CVPR 2025 可学习的运动扩散模型组合
SALAD CVPR 2025 骨架感知的潜扩散模型
MotionLab ICCV 2025 统一运动生成与编辑
PackDiT arXiv 2025 联合人体运动和文本生成

其他模型(按时间排序)

ACMDM、MoMADiff、ReAlign、GENMO、DSDFM、UniPhys、Shape-Move、MG-MotionLLM、ReMoGPT、UniTMGE、MotionReFit、LoRA-MDM、HMU、SimMotionEdit、MotionStreamer、GenM³、Kinesis、sMDM、PMG、PersonaBooth、MotionAnything、BioVAE、MoMug、Fg-T2M++、CASIM、SPORT、MotionPCM、Free-T2M、FlexMotion、MMDM、EgoLM、MoGenTS 等。

技术特点

  • 聚焦范围: 单一人体运动生成,不涉及人-物体或人-场景交互
  • 核心任务: 文本到运动生成(Text-to-Motion Generation)
  • 主流技术: 扩散模型、自回归模型、检索增强、强化学习、大语言模型
  • 研究方向: 零样本生成、细粒度控制、个性化生成、情感增强、物理一致性等
搜集汇总
数据集介绍
awesome-text-to-motion 数据集图片
构建方式
该数据集并非传统意义上的单一数据集合,而是一个精心策划的资源索引库,旨在系统性地收录文本驱动人体运动生成领域的综述、数据集与模型。其构建方式采用社区驱动的众包模式,通过GitHub平台开放贡献渠道。贡献者需遵循详尽的指南,通过修改‘data/arxiv.csv’或‘data/without-arxiv.json’文件,以结构化格式添加包含arXiv ID、论文类型(综述/模型/数据集)、缩写、会议信息及标签等元数据的条目。所有提交通过Pull Request审查后合并,确保了资源库的持续更新与质量把控。此外,项目主页提供了交互式可视化与统计图表,优化了浏览体验。
特点
该资源库的核心特点在于其高度的系统性与专业性,专注于单人场景且排除人-物或人-场景交互的文本驱动人体运动生成任务。它并非简单罗列,而是对资源进行了精细分类,划分为综述、数据集与模型三大板块,每个条目均附有详细的元数据标签,如骨干网络(Transformer、Diffusion)与方法论标签(Physical、Editing),便于研究者进行定向检索与对比分析。其动态更新机制依托于社区贡献与自动化工作流,确保了信息的时效性。同时,项目主页集成的交互式图表,使得数据集的规模、时间分布等统计特性一目了然,为领域全景提供了直观的鸟瞰视角。
使用方法
该资源库的使用方法直观便捷。研究人员可直接访问其GitHub仓库或项目主页,通过清晰的目录结构浏览三大分类下的资源列表。每个条目均提供论文链接、项目主页及代码仓库(如可用),方便直接获取原始资料。对于希望贡献的研究者,可通过Fork仓库、创建分支、按照指定格式在CSV或JSON文件中添加新论文信息,并提交Pull Request来完成。自动化工作流会验证提交的合法性,确保数据一致性。此外,项目页面提供的交互式可视化工具允许用户通过统计图表探索资源分布,从而高效定位特定年份、会议或技术路线的相关工作。
背景与挑战
背景概述
文本驱动的人体运动生成是计算机视觉与图形学交叉领域的前沿研究方向,旨在根据自然语言描述自动合成逼真且多样化的三维人体动画。这一领域自2016年KIT运动语言数据集问世以来逐步兴起,尤其在2022年HumanML3D数据集的发布后迎来了蓬勃发展。该数据集由Eric Guo等人于CVPR 2022提出,开创性地将大规模文本-运动对引入研究视野,成为后续工作的基准基石。随后,以Motion-X、MotionMillion、FineMotion等为代表的数十个数据集不断涌现,逐步拓展了运动生成的语义丰富度、时空精细度与跨模态泛化能力。该研究方向的核心问题在于弥合自然语言与人体运动之间的语义鸿沟,实现从抽象描述到具身动作的高保真映射。近年来,随着扩散模型、大语言模型与强化学习等技术的深度融合,该领域已从简单的动作生成演进至涵盖编辑、风格迁移、长序列控制与个性化生成等复杂任务,对虚拟现实、人机交互与数字内容创作等领域产生了深远影响。
当前挑战
当前文本驱动运动生成领域面临多重挑战。其一,语义对齐的细粒度不足:现有数据集多依赖粗粒度文本描述,难以精确刻画动作的时序细节、肢体局部运动及属性特征,导致生成结果在空间定位与时间节奏上存在偏差。其二,数据稀缺与多样性局限:尽管HumanML3D、Motion-X等数据集已提供数万级样本,但相较于自然语言的无限表达,运动数据的覆盖范围仍显不足,尤其在罕见动作、情感表达与复杂交互场景中表现乏力。其三,构建过程中的标注歧义与噪声:文本-运动对的人工标注成本高昂,且不同标注者对同一动作的语言描述存在主观差异,引入语义噪声。其四,长序列与零样本泛化瓶颈:现有模型在生成超过数十秒的连续动作或处理未见过的文本描述时,常出现运动退化为静态或语义断裂的问题,亟需更鲁棒的时序建模与泛化策略。
常用场景
经典使用场景
在文本驱动的三维人体运动生成领域,该数据集集合了从早期KIT Motion-Language Dataset到大规模HumanML3D及其衍生版本(如HumanML3D++、FineHumanML3D)的丰富资源,为研究者提供了标准化的训练与评估基准。其经典使用场景聚焦于将自然语言描述转化为连贯、多样且符合语义的三维人体动画序列,例如通过“一个人挥手打招呼”或“跑步时跳跃”等文本指令,驱动生成对应的精细运动轨迹。这一过程涉及文本与运动模态的对齐、时空一致性建模以及运动多样性控制,是计算机视觉与图形学交叉领域的前沿研究方向。
衍生相关工作
基于该数据集,学术界衍生出一系列具有里程碑意义的工作。在模型架构方面,T2M(CVPR 2022)首次提出基于VAE和Transformer的文本-运动生成框架,成为后续研究的基石;MoMask(NeurIPS 2023)引入掩码建模策略,显著提升了运动生成的多样性与质量。在细粒度控制上,FineMoGen(NeurIPS 2023)实现了时空维度的精细运动编辑,而MotionFix(SIGGRAPH Asia 2024)则聚焦于文本驱动的运动修正。此外,大规模预训练模型如MotionGPT3和Being-M0将语言模型与运动生成统一,推动了多模态理解与生成的一体化发展,充分彰显了该数据集作为核心孵化平台的价值。
数据集最近研究
最新研究方向
文本驱动的人体运动生成领域正经历从单一动作合成向多模态、细粒度与物理可解释性融合的范式跃迁。当前研究前沿聚焦于三个方面:其一,大规模数据集与零样本泛化能力的深度耦合,如MotionMillion以百万级数据驱动零样本运动生成,突破传统标注瓶颈;其二,细粒度时空语义对齐成为新热点,FineMotion通过时空双维度标注实现精准运动编辑,而SnapMoGen则探索从丰富文本描述到生动动作的映射机制;其三,跨物种与通用运动模型的兴起,UniMo4D首次统一人与动物的运动生成框架,标志着该领域从单一场景向通用智能体行为的跨越。这些进展不仅回应了元宇宙与数字人产业对高保真运动生成的迫切需求,更通过强化学习与扩散模型的深度融合,推动了物理合理性约束下的可控运动生成,为具身智能与虚拟现实交互提供了关键基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务