遇见数据集

RoMoDataset/RoMo-HML-263

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

RoMo-HML-263 是 RoMo 身体语料库的 263 维 HumanML3D 运动特征表示,配有丰富的多级文本描述。它是用于训练和评估基于 HumanML3D 特征集模型的直接配套数据集。该版本包含 810,281 个剪辑,这些剪辑是 RoMo 论文分发的官方 HumanML3D-263 向量(new_joint_vecs)。数据集采用 Parquet 格式(zstd 压缩分片),包含训练、验证和测试分割(分别为 689,147、80,729 和 40,405 个序列)。每个序列以 30 fps 的帧率存储,特征维度为 263,并具有 5 个级别的文本描述(从标签到段落)。

RoMo-HML-263 is the RoMo body corpus in the 263-dimensional HumanML3D motion-feature representation, paired with rich multi-level text descriptions. It is the drop-in companion for training and evaluating models built around the HumanML3D feature set. This release contains the 810,281 clips for which the RoMo paper distributed official HumanML3D-263 vectors (new_joint_vecs). The dataset is in Parquet format (zstd-compressed shards) with train, validation, and test splits (689,147, 80,729, and 40,405 sequences respectively). Each sequence is stored at 30 fps, has a feature dimension of 263, and includes 5 levels of text descriptions (from tag to paragraph).

提供机构:
RoMoDataset
搜集汇总
数据集介绍
RoMoDataset/RoMo-HML-263 数据集图片
构建方式
RoMo-HML-263数据集基于RoMo人体运动语料库构建而成。其构建过程首先从GVHMR导出的SMPL-X运动序列出发,采用HumanML3D-263标准特征提取流程,计算根节点角速度与线速度、6D关节旋转、局部关节位置、关节速度及足地接触等263维特征,并将结果对齐至Y轴向上的世界坐标系。随后通过帧级清洗,剔除包含NaN、Inf或绝对值大于1e3的帧,保留最长连续有效片段,并仅保留帧数不少于40的样本。最终结合视觉语言模型为每段运动生成从标签到段落五个层级的文字描述,形成约81.4万条高质量运动-文本对。
使用方法
使用者可通过HuggingFace Datasets库直接加载数据集,利用load_dataset('RoMoDataset/RoMo-HML-263')获取各分片数据。每一样本的运动数据以(T, 263)的浮点型数组形式存储,配合仓库根目录下的Mean.npy与Std.npy文件,可执行标准化操作。为还原三维关节位置,建议使用motion_toolbox中的HumanML3DDirectToMotionConverter工具,传入运动序列及非归一化标识即可得到Y轴坐标系下的22个关节点位置序列。数据集适用于文本到运动生成、运动检索及多模态运动理解等任务的训练与评估。
背景与挑战
背景概述
RoMo-HML-263 数据集由 RoMo 团队于 2026 年创建,旨在为文本驱动的人体运动生成研究提供大规模、标准化且语义丰富的训练资源。其核心研究问题在于如何基于 HumanML3D 的 263 维运动特征表示,结合多层级文本描述,提升模型对人体动作的生成质量与多样性。该数据集包含约 81.4 万个运动片段,每个样本配备从标签到段落共五个层次的文本注释,显著拓展了现有基准的规模与语义粒度。通过采用与 HumanML3D 一致的特征空间,RoMo-HML-263 可直接兼容现有评估体系,有望推动 text-to-motion 领域的性能边界突破,并为跨模型比较提供更公平的试验平台。
当前挑战
该数据集所解决的领域问题主要在于现有运动数据集规模有限、文本描述单一,难以支撑模型在高细粒度与多样性场景下的泛化能力。RoMo-HML-263 通过构建大规模、多级文本注释的基准,试图攻克这一瓶颈。在构建过程中,团队面临多项技术挑战:首先,从 SMPL-X 参数中提取稳定、一致的 HumanML3D 特征需严格的运动清洗流程,包括过滤包含 NaN 或无穷值的帧,保留最长连续干净序列,并丢弃帧数少于 40 的片段;其次,确保在约 81.4 万个样本中七个子集因参数缺陷被排除,反映了大规模特征重计算中的数值稳定性问题;最后,多级文本描述的自动生成依赖于视觉-语言模型的质量与控制,需平衡语义覆盖与描述精度,避免噪声引入。
常用场景
经典使用场景
RoMo-HML-263数据集在文本到三维人体运动生成任务中发挥着基石般的作用。研究者可借助该数据集中统一的263维HumanML3D运动特征表示与丰富多级文本描述,训练能够将自然语言精准映射为连贯人体动作的模型。该数据集包含约81万条高质量运动序列,每段运动配有从简短标签到详细段落共五个层级的文本说明,为模型学习文本与动作间的语义关联提供了充足且多样化的训练样本,是当前该领域最具规模与系统性的资源之一。
解决学术问题
该数据集有效解决了现有运动生成研究中数据规模有限、文本描述单一、运动表示不统一等关键瓶颈问题。通过提供大规模、标准化且经严格清洗的运动特征数据,RoMo-HML-263使得学术研究能够更深入地探索文本与运动之间的细粒度语义映射关系,推动对动作多样性、自然度以及时空一致性的建模研究。其在结构上沿用了HumanML3D特征体系,降低了特征工程门槛,使研究者得以专注于核心算法创新,从而显著加速了文本驱动人体运动生成领域的理论进展与方法迭代。
实际应用
在实际应用中,RoMo-HML-263数据集为虚拟数字人、游戏角色动画、影视特效预可视化以及人机交互系统等提供了坚实的数据基础。基于该数据集训练的文本到运动生成模型,能够高效地将用户输入的描述性语言转化为自然流畅的三维人体动作,大幅降低动画制作中人工关键帧设定的成本。同时,该数据集兼顾了多层级文本描述,可支持从简单指令到复杂剧情叙述的不同应用场景,赋能开发者打造更具表现力与个性化的互动体验,推动数字内容创作向智能化、自动化方向演进。
数据集最近研究
最新研究方向
随着文本到3D人体运动生成领域的蓬勃发展,RoMo-HML-263数据集应运而生,它以前沿的HumanML3D-263特征表征为基石,整合了超过81万段精细的体态运动片段,并搭配了从关键词到段落描述的五级文本标注体系。该数据集不仅延续了经典HumanML3D的数据规范,更通过大规模、多层次的结构化描述,为多模态运动理解与生成模型提供了深度训练资源。当前,研究者正借助该数据集探索更具泛化能力的文本驱动运动合成框架,推动虚拟角色动画、人机交互及动作理解等热点应用的技术突破,其发布有望显著提升运动生成的语义对齐精度与动作多样性,成为该领域标准评估与跨任务迁移学习的重要支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务