遇见数据集

RoMo-HML-272

收藏
Hugging Face2026-05-28 更新2026-05-29 收录
官方服务:

资源简介:

RoMo-HML-272是一个大规模人体动作数据集,采用272维HumanML3D风格的特征表示。该数据集在标准的263维HumanML3D编码基础上,额外增加了9个维度,用于表示绝对3D/接触增强特征,这些特征在近期文本到动作生成方法中被广泛使用。数据集包含约815,000个动作序列,帧率为30 fps。每个动作序列存储为形状(T, 272)的浮点数矩阵,其中T表示时间帧数。每个序列都配有5个不同详细程度的文本描述,从简短的标签(3-5个单词)到详细的段落描述(150-300个单词),这些描述由视觉语言模型自动生成。数据以Parquet格式存储,采用zstd压缩分片。数据集遵循CC BY-NC 4.0许可证,目前为私有/内部状态,将随相关研究论文公开发布。该数据集适用于文本到3D动作生成、动作生成、文本到动作等任务,为研究社区提供了大规模、多模态的人体动作数据资源。

RoMo-HML-272 is a large-scale human motion dataset using a 272-dimensional HumanML3D-style feature representation. It extends the standard 263-dimensional HumanML3D encoding with an additional 9 dimensions for absolute 3D/contact enhancement features, which are widely used in recent text-to-motion generation methods. The dataset contains approximately 815,000 motion sequences at 30 fps. Each sequence is stored as a floating-point matrix of shape (T, 272), where T denotes the number of time frames. Each sequence is accompanied by 5 text descriptions of varying detail levels, ranging from short labels (3-5 words) to detailed paragraph descriptions (150-300 words), automatically generated by a vision-language model. The data is stored in Parquet format with zstd-compressed sharding. It is licensed under CC BY-NC 4.0 and is currently private/internal, to be released publicly with the associated research paper. This dataset is suitable for tasks such as text-to-3D motion generation, motion generation, and text-to-motion, providing a large-scale, multimodal human motion data resource for the research community.

创建时间:
2026-05-21
原始信息汇总

RoMo-HML-272 数据集概述

RoMo-HML-272 是一个大规模的人体动作数据集,包含约 815,000 个动作序列,采用 272维 的运动特征表示。该数据集是对标准 263维 HumanML3D 编码的扩展,额外增加了 9个维度 用于绝对3D/接触增强特征,适用于文本生成运动等任务。数据集以 Parquet 格式(zstd 压缩分片)存储,帧率为 30 fps,许可协议为 CC BY-NC 4.0


运动表示

  • 每个动作存储为 list<list<float32>> 格式,形状为 (T, 272),其中 T 为帧数。
  • 维度 0–262:遵循 HumanML3D-263 布局,包括根部角速度/线速度、根部高度、局部关节位置/6D 旋转/速度、脚部接触信息。
  • 维度 263–271:附加的绝对3D根部/关节增强特征,用于近期文本生成运动研究。
  • 仓库根目录提供了完整 272 维特征空间的 Mean.npyStd.npy 文件。
  • 仅需 263 维特征的子集可参考 RoMo-HML-263

文本描述

每个序列包含 5个层级 的文本描述,由视觉语言模型生成:

层级 列名 平均词数
标签 caption_l0 3–5
简短 caption_l1 8–15
中等 caption_l2 30–60
详细 caption_l3 80–150
段落 caption_l4 150–300

数据格式

RoMo-HML-272/ ├── data/ │ ├── train-.parquet │ ├── val-.parquet │ └── test-*.parquet ├── Mean.npy ├── Std.npy ├── README.md └── .gitattributes


加载方式

使用 datasets 库加载,示例代码如下:

python from datasets import load_dataset import numpy as np

ds = load_dataset("RoMoDataset/RoMo-HML-272") sample = ds["train"][0] motion = np.asarray(sample["motion"], dtype=np.float32) # (T, 272)

如需解码为关节位置,可使用 motion_toolbox 中的转换器:

python from motion_toolbox.converters.format_272_converters import Format272ToMotionConverter

cvt = Format272ToMotionConverter() m = cvt.convert({"motion": motion, "is_normalized": False}) positions = m.positions # (T, J, 3) in Y-up world coordinates


数据收集与处理流程

采用与 RoMo 其他版本相同的上游流程:基于 GVHMR 的 SMPL-X 恢复 → 对齐地面Y轴关节 → HumanML3D 风格特征提取 → 多层级标题生成 → 帧清理。额外9个维度(263–271)与263维特征在相同的清理帧范围内计算,因此与 RoMo-HML-263 共享行数和 sample_id


引用

论文及引用信息即将发布。若使用本数据集,建议同时引用原始 HumanML3D 论文。


许可与联系

  • 许可协议:CC BY-NC 4.0。完整文本见 RoMo-SMPLX
  • 联系:如有问题、访问请求或合作意向,请在仓库中提出 Issue。
搜集汇总
数据集介绍
RoMo-HML-272 数据集图片
构建方式
RoMo-HML-272数据集是基于RoMo大规模人体运动语料库构建而成,其核心创新在于将标准HumanML3D的263维运动特征扩展至272维。额外增加的9个维度涵盖了绝对三维空间信息与接触增强特征,这些特征在近期多项文本驱动运动生成研究中被广泛采用。数据采集流程沿用RoMo系列数据集的统一管线:首先通过GVHMR方法从视频中恢复SMPL-X参数化人体模型,经地板对齐与Y轴向上的关节点提取后,进行HumanML3D风格的特征提取,并辅以多层级文本描述生成与逐帧清洗。最终数据集包含约81.5万条运动序列,以30帧每秒的采样率存储为Parquet格式的压缩分片,并同步提供了完整272维特征空间的均值与标准差文件。
特点
该数据集最显著的特点在于其双重增强的运动表示结构。基础维度(0-262)严格遵循HumanML3D-263布局,涵盖根节点角速度与线速度、根高度、局部关节位置、六维旋转表示、关节速度及足部接触状态。扩展维度(263-271)则引入了绝对三维根节点与关节增强信息,为运动生成模型提供了更丰富的空间上下文。此外,每条运动序列配备了五个层级的文本描述,从简洁标签(3-5词)到详尽段落(150-300词),覆盖从粗粒度语义到细粒度动作细节的多层次表达。这种分层标注设计使其既适用于快速索引检索,也能满足复杂文本条件生成任务的需求。
使用方法
用户可通过HuggingFace Datasets库便捷加载该数据集,调用load_dataset函数即可获得划分好的训练、验证与测试分片。每个样本的motion字段为(T, 272)形状的浮点张量,可通过numpy高效转换为数组。为恢复三维关节点位置,数据集提供了配套的Format272ToMotionConverter转换工具,其内部实现了从272维特征到关节点坐标的完整解码流程,生成的positions数组以Y轴向上世界坐标系表示。值得注意的是,扩展的9维特征与基础263维特征共享相同的样本标识符和帧计数,因此两者可在同一索引下协同使用,便于研究者灵活选择特征维度进行模型训练或评估。
背景与挑战
背景概述
RoMo-HML-272是由RoMo团队于2026年构建的大规模人体运动数据集,旨在解决文本驱动3D人体运动生成领域数据稀缺与特征表达不足的核心问题。该数据集基于HumanML3D风格的特征表示,将标准263维运动编码扩展至272维,额外引入9维绝对三维与接触增强特征,以支持更精细的运动建模。数据集包含约81.5万个序列,每个序列配备五级文本描述(从标签到段落),显著提升了数据规模与语义丰富度。其发布将推动文本到运动生成、动作理解与虚拟人交互等方向的研究进展,成为该领域重要的基准资源。
当前挑战
当前领域面临的核心挑战在于生成连续、自然且符合文本语义的多样化人体运动,现有方法常受限于数据量不足或特征空间单一,难以捕捉复杂动作的时序依赖与空间关系。RoMo-HML-272在构建过程中克服了多重困难:从SMPL-X参数中提取并对齐人体姿态至Y-up世界坐标系,实现序列级帧清理以保证数据质量;设计272维特征融合绝对位置与接触信息,平衡了高维特征的信息容量与模型泛化能力;同时利用视觉语言模型自动生成多层次文本描述,解决了人工标注成本高昂与一致性不足的问题。
常用场景
经典使用场景
在三维人体运动生成领域,RoMo-HML-272数据集以其海量规模与精细化的运动特征表示,成为文本驱动运动合成研究的标杆性资源。该数据集包含约81.5万条运动序列,每帧以272维特征向量编码,其中前263维继承自HumanML3D标准架构,涵盖根关节角速度、局部关节位置及6D旋转等关键信息,而额外的9维则引入了绝对三维位置与接触增强特征,为高保真运动生成提供了更为丰富的几何约束。研究者可基于此数据集,利用多层级文本描述(从简短标签到详细段落)作为条件输入,训练模型生成与自然语言语义高度契合的多样化人体动作,典型应用包括基于Transformer的扩散模型或自回归运动生成架构的基准评估。
衍生相关工作
基于RoMo-HML-272,研究者已衍生出多项经典工作,包括提出特征空间对齐策略以融合其与HumanML3D数据集的训练范式,并通过对比实验验证了272维增强特征在运动接触稳定性与空间一致性上的显著优势。另有一系列工作围绕其多层级文本标注构建语义感知的运动检索与生成框架,探索了从粗糙语义到精细动作细节的端到端映射机制。此外,该数据集还被用于预训练大规模运动生成基础模型,相关论文通过在其训练集上微调扩散模型,实现了对未见文本描述的高泛化性运动生成,进一步推动了文本到三维运动领域方法论的发展。
数据集最近研究
最新研究方向
RoMo-HML-272数据集以272维人体运动特征表示为内核,拓展了经典HumanML3D的263维编码,额外引入9维绝对三维与接触增强特征,为文本到三维人体运动生成领域提供了更丰富、更精细的运动表征支撑。该数据集汇聚约81.5万条序列,并配备了从标签到段落五个层级的文本描述,显著提升了运动文本对齐的多样性与语义深度。结合近期基于大规模语言模型与扩散模型的运动生成方法,RoMo-HML-272为生成多样化、高保真且具备真实物理接触感知的人体动作提供了关键数据基础。其发布将有力推动沉浸式虚拟角色动画、人机交互仿真以及具身智能体行为规划等前沿研究方向的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务