遇见数据集

RoMo-SMPL

收藏
Hugging Face2026-05-28 更新2026-05-29 收录
官方服务:

资源简介:

RoMo-SMPL是一个大规模、组织丰富的人体运动生成数据集,以SMPL身体参数空间表示,是RoMo论文的核心发布。该数据集旨在为文本到3D运动生成任务提供高质量、语义丰富的训练和评估资源。数据集包含813,938个运动序列(核心集),按固定比例划分为训练集(691,989)、验证集(81,271)和测试集(40,678)。每个序列以30帧每秒的速率提供,身体运动数据通过GVHMR方法从原始视频中恢复,表示为SMPL模型参数,包括全局方向(smpl_global_orient,形状为(T, 3))、身体关节姿态(smpl_body_pose,形状为(T, 63))、形状参数(smpl_betas)和根平移(smpl_transl,形状为(T, 3))。每个运动片段附带有五个不同详细程度的文本描述(caption_l0到caption_l4),从标签式到段落式,以及一个三级语义分类体系:顶层分类(taxonomy_category)、中层分类(taxonomy_subcategory)和细粒度原子动作标签(taxonomy_atomic_action)。数据集以Parquet格式存储,采用zstd压缩分片,遵循CC BY-NC 4.0许可协议。注意,该版本仅包含身体运动数据,不包含手部姿态或手部描述。RoMo-SMPL适用于文本到3D运动生成、运动理解、运动分类等任务,并可与同系列的其他表示形式数据集(如RoMo-HML-263、RoMo-HML-272、RoMo-SOMA-77)结合使用。

RoMo-SMPL is a large-scale and well-organized human motion generation dataset represented in the SMPL body parameter space, serving as a core release of the RoMo paper. This dataset aims to provide high-quality, semantically rich training and evaluation resources for text-to-3D motion generation tasks. It contains 813,938 motion sequences (core set), divided into fixed proportions for training (691,989), validation (81,271), and test sets (40,678). Each sequence is provided at 30 frames per second, with body motion data recovered from raw videos using the GVHMR method and represented as SMPL model parameters, including global orientation (smpl_global_orient, shape (T, 3)), body joint poses (smpl_body_pose, shape (T, 63)), shape parameters (smpl_betas), and root translation (smpl_transl, shape (T, 3)). Each motion clip is accompanied by five text descriptions of varying detail levels (caption_l0 to caption_l4), ranging from label-style to paragraph-style, and a three-level semantic classification system: top-level category (taxonomy_category), middle-level subcategory (taxonomy_subcategory), and fine-grained atomic action labels (taxonomy_atomic_action). The dataset is stored in Parquet format with zstd compression sharding, following the CC BY-NC 4.0 license. Note that this version only includes body motion data, excluding hand poses or hand descriptions. RoMo-SMPL is suitable for tasks such as text-to-3D motion generation, motion understanding, and motion classification, and can be used in conjunction with other representation datasets in the same series (e.g., RoMo-HML-263, RoMo-HML-272, RoMo-SOMA-77).

创建时间:
2026-05-28
原始信息汇总

数据集概述:RoMo-SMPL

RoMo-SMPL 是 RoMo 论文中对应的人体运动语料库,使用 SMPL 人体参数空间(包括全局朝向、21个关节的人体姿态、形状和位移)表示。每个运动片段包含 5个文本描述三级语义分类(类别、子类别、原子动作),并带有固定的训练/验证/测试集划分。


数据集属性

属性 数值
总序列数 813,938 (论文核心集)
训练集 / 验证集 / 测试集 691,989 / 81,271 / 40,678
帧率 30 fps
人体模型 SMPL (通过 GVHMR 恢复)
姿态来源 GVHMR
描述层级 5 级 (caption_l0caption_l4)
语义分类 category / subcategory / atomic_action
数据格式 Parquet (zstd 分片,位于 data/ 目录下)
数据规模 100K < n < 1M
任务类型 text-to-3d, text-generation
语言 英文

注意:该版本仅包含身体运动,不包含手部姿态及手部描述。


数据模式 (Schema)

列名 类型 描述
sample_id string 规范的 RoMo 片段 ID
split string 数据集划分:train, val, test
fps int64 固定值 30
smpl_global_orient list<list<float32>> 全局朝向 (轴角表示),维度 (T, 3)
smpl_body_pose list<list<float32>> 身体关节点轴角,维度 (T, 63)
smpl_betas list<list<float32>> 体型参数 (逐帧或广播)
smpl_transl list<list<float32>> 位移 (根节点),维度 (T, 3)
caption_l0caption_l4 string 从标签到段落的5级文本描述
taxonomy_category string 顶层分类领域
taxonomy_subcategory string 中层分类
taxonomy_atomic_action string 细粒度动作标签

数据加载

使用 datasets 库直接加载:

python from datasets import load_dataset

ds = load_dataset("RoMoDataset/RoMo-SMPL") sample = ds["train"][0] print(sample["caption_l0"], sample["taxonomy_category"])


相关数据集

数据集 表示形式
RoMo-HML-263 HumanML3D 263维特征
RoMo-HML-272 HumanML3D 272维特征
RoMo-SOMA-77 Kimodo SOMA-77 933维特征

引用

bibtex @article{zhang2026romo, title={RoMo: A Large-Scale, Richly Organized Dataset and Semantic Taxonomy for Human Motion Generation}, author={Zhang, Jiahao and others}, journal={arXiv preprint arXiv:2605.26241}, year={2026} }

搜集汇总
数据集介绍
RoMo-SMPL 数据集图片
构建方式
RoMo-SMPL数据集的构建以SMPL人体参数模型为核心,从大规模自然场景视频中通过GVHMR方法精确恢复人体姿态与形状参数,涵盖全局方向、21个关节点三维旋转、体型参数及空间平移信息。每条运动片段均配备五条语义层级由粗到细的文本描述,并基于三级分类体系(类别、子类别、原子动作)进行系统化组织。数据集遵循固定的训练、验证与测试划分,采用高效的Parquet格式存储,并通过zstd压缩分片,确保大规模数据的高效读写与可复现性。
特点
该数据集的核心特色在于其超大规模与严谨的结构化语义体系。包含超过81万段SMPL参数化人体运动序列,覆盖丰富多样的自然场景行为。每段运动附带从标签级(caption_l0)到段落级(caption_l4)的五层次文本描述,并与三级分类学标签紧密关联,实现了文本与运动空间的精细对齐。数据来源完全基于自然场景,具有极佳的生态效度。此外,固定划分的数据分割方式为模型训练、验证与测试提供了标准化基准,促进了研究结果的可比性。
使用方法
研究者可通过HuggingFace Datasets库便捷加载RoMo-SMPL数据集,只需调用`load_dataset("RoMoDataset/RoMo-SMPL")`即可获取完整的训练集、验证集与测试集。每条数据样本以字典形式返回,包含SMPL运动参数、多层级文本描述及分类学标签。用户可根据研究目标自由选择不同文本粒度的描述(caption_l0至caption_l4)进行文本到运动生成模型的训练与评估,或利用三级分类标签开展细粒度动作分析与语义理解任务。
背景与挑战
背景概述
RoMo-SMPL数据集由张佳豪等研究人员于2026年提出,依托arXiv预印本平台发布,旨在填补大规模、语义结构清晰的人体运动生成数据集的空白。该数据集隶属于RoMo项目核心,采用SMPL人体参数化模型,包含813,938段野外场景下的身体运动序列,每段配有多达五级文本标注与三层语义分类体系。研究人员利用GVHMR方法从视频中恢复SMPL参数,确保了数据在全局方位、关节点姿态、体型与位移等方面的精确性。通过提供固定训练/验证/测试划分,该数据集为文本到三维运动生成等前沿任务提供了标准化评估基准,对推动人体运动理解与合成领域的研究具有重要影响力。
当前挑战
RoMo-SMPL所应对的领域核心挑战在于实现从自然语言描述到细粒度三维人体运动的精准生成,这一过程亟需大规模、多层次语义标注的真实运动数据作为支撑。现有数据集往往规模有限、语义标签单一,难以支撑复杂运动生成模型的训练。构建过程中,该团队面临从嘈杂视频中稳定恢复高质量SMPL参数的难题,尤其需要处理遮挡、复杂背景与多视角偏差等野外场景因素。此外,为每段序列生成五级文本注释并建立兼顾类别、子类别与原子动作的层次化语义分类系统,亦耗费了大量人力与标注校正努力。同时,数据以Parquet格式分片存储的设计,兼顾了海量数据的可扩展性与高效的加载解析效率。
常用场景
经典使用场景
RoMo-SMPL数据集是面向文本驱动的人体运动生成任务而构建的经典资源,其核心用途在于将自然语言描述与三维人体运动序列进行对齐。研究者可利用该数据集训练模型,依据给定的文本标签或句子级描述,生成对应的人体全局朝向、关节姿态及根节点平移等SMPL参数。得益于其包含的81万余条运动序列及五级语义标注(从粗粒度类别到细粒度原子动作),该数据集成为评估运动生成模型在多样性、保真度和语义契合性上表现的重要基准。
实际应用
在日常应用中,RoMo-SMPL所支持的运动生成技术可广泛服务于数字人内容创作、虚拟现实交互、游戏动画自动生产及影视预可视化等场景。例如,用户仅需输入一段描述性文本,即可快速获得符合语义的三维人物动画,极大降低手工动作捕捉或逐帧动画制作的成本。同时,该数据集训练的模型还可为智能健身指导、康复训练仿真、以及社交机器人动作规划等实际系统提供生动逼真且语义可控的虚拟体态生成能力。
衍生相关工作
围绕RoMo-SMPL数据集,衍生出了一系列经典工作。例如,基于其两级以上语义标签的设计理念,研究者提出了分层式运动生成模型,以增强对动作类别的零样本泛化能力。此外,该数据集还催生了多模态运动检索、文本到运动扩散模型、以及结合时空注意力机制的结构化运动合成方法等代表性成果。这些工作不仅在学术上验证了RoMo-SMPL数据的价值,也促进了运动理解与生成社区中互评基准的建立与迭代。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务