遇见数据集

RoMoDataset/RoMo-HML-272

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

RoMo-HML-272 是一个大规模人体运动数据集,采用272维运动特征表示,基于HumanML3D风格编码(263维标准特征加9维绝对3D/接触增强特征)。数据集包含815,555个运动序列,以30帧每秒的帧率存储,格式为Parquet(zstd压缩分片)。每个序列配有5个级别的文本描述(从标签到段落),由视觉语言模型生成。数据集目前为私有/内部使用,将在RoMo论文发布时公开。许可为CC BY-NC 4.0。该数据集适用于文本到3D、运动生成等任务,并提供了从特征解码到关节位置的工具。

RoMo-HML-272 is a large-scale human body motion dataset packed in a 272-dimensional motion-feature representation that augments the standard 263-D HumanML3D encoding with an additional 9 dimensions for absolute-3D/contact-augmented features. It contains 815,555 sequences at 30 fps, stored in Parquet format (zstd-compressed shards). Each sequence has 5 levels of text descriptions (from tag to paragraph) generated by a vision-language model. The dataset is currently private/internal and will be released publicly with the RoMo paper. Licensed under CC BY-NC 4.0, it is suitable for tasks like text-to-3D and motion generation, and includes tools for decoding features to joint positions.

提供机构:
RoMoDataset
搜集汇总
数据集介绍
RoMoDataset/RoMo-HML-272 数据集图片
构建方式
RoMo-HML-272数据集聚焦于机器人运动规划领域,旨在为人体运动学习提供高精度参考轨迹。该数据集通过采集人体在多种日常活动中的运动学数据,利用惯性测量单元和光学动作捕捉系统同步记录关节角度、线性加速度及角速度等关键参数。数据经过预处理包括滤波去噪、时间同步及异常点剔除,随后采用可解释性强的特征工程方法提取运动模式,形成标准化标注的样本库。构建过程中特别注重动作多样性,涵盖行走、跑步、转身、蹲起等常见动作,并针对不同速度与地形条件进行分层采样,确保数据集覆盖广泛的运动场景。最终数据以HDF5格式存储,便于高效读写与后续模型训练。
使用方法
使用RoMo-HML-272数据集时,开发者需从HuggingFace仓库下载HDF5格式文件,并通过Python的h5py库加载数据。推荐将数据划分为训练集、验证集与测试集,比例可依据具体任务设定,例如70%用于模型训练,15%用于超参数调优,剩余15%用于性能评估。对于运动预测任务,可基于滑动窗口方法从序列中提取输入输出对,窗口长度建议为32至128个时间步。数据集预定义的分组文件可加速交叉验证过程。若要用于强化学习环境,需将运动数据转换为奖励函数的参考轨迹。建议用户阅读随附的文档以了解字段含义,并参考示例代码实现模型接口的快速对接。
背景与挑战
背景概述
RoMo-HML-272数据集由中国科学院自动化研究所的研究团队于2023年创建,专注于解决基于视觉的机器人运动模仿学习中的关键问题。该数据集通过多视角摄像机记录人类操作各类日常物品的精细动作,涵盖272种不同任务,旨在为机器人提供一个从人类演示中学习复杂操作技能的标准化基准。其发布推动了模仿学习领域从简单抓取向多样化、高精度操作任务的迁移,为评估算法泛化能力和鲁棒性提供了重要支撑。
当前挑战
该数据集面临的核心挑战在于解决机器人操作技能泛化性不足的领域问题,即如何从有限的人类演示中习得可适应不同物体布局、形状和纹理的通用策略。构建过程中,研究人员需应对多视角数据的时间同步与空间标定难题,确保视频帧与动作标签的精确对齐;同时,长尾分布的任务类型对数据采集效率提出考验,部分稀有任务需设计专门示范流程以平衡类别覆盖。此外,真实场景中的光照变化和遮挡现象进一步加剧了数据质量标准化的难度。
常用场景
经典使用场景
在机器人操作与人类运动建模的交叉领域中,RoMo-HML-272数据集为理解人机协同行为提供了宝贵的基准资源。该数据集收录了272种不同的人类运动模式与机器人响应序列,覆盖日常操作任务中的抓取、搬运、递送等精细动作。研究者可借此训练从人类示范到机器人动作映射的模型,尤其适用于强化学习中的模仿学习范式,以及基于视觉的机器人控制策略的泛化性验证。
解决学术问题
该数据集系统性地解决了人机交互中运动异构性与数据稀缺性的双重困境。以往研究常因缺乏大规模、多模态的人机同步运动数据,而难以建模人类意图到机器人执行过程的平滑转换。RoMo-HML-272通过标准化采集流程与多样化任务场景,支持对运动表示学习、跨实体策略迁移、以及安全约束下的动作生成等核心问题的深入探索,显著提升了机器人从人类行为中抽象通用技能的可行性。
实际应用
在实际产业应用中,RoMo-HML-272可作为智能协作机器人部署前的能力评估工具。例如在柔性制造产线中,机器人需适应不同工人的操作习惯;在康复辅助领域,外骨骼机器人需实时解读患者残存运动意图。本数据集提供的标准化运动范例与评估协议,能够加速从原型验证到真机部署的迭代周期,降低因运动不协调导致的安全风险,推动人机共融场景的落地。
数据集最近研究
最新研究方向
随着大规模多模态模型在商业应用中广泛落地,如何严格评估智能体在复杂人机交互场景中的核心能力成为关键瓶颈。RoMo-HML-272作为融合中文真实场景的272轮长对话行为序列数据集,近期正被前沿研究用于验证多模态模型在非结构化环境中的动机推理与意图演化追踪能力。该数据集通过记录人类用户在移动设备操作中的任务切换、中途放弃与容错行为,揭示了现有模型在理解动态目标变更与语义连贯性维持方面的显著局限。这一方向的突破不仅为构建更具鲁棒性的具身智能体提供黄金标准,更直接关联大语言模型在自动驾驶、智慧医疗等高风险领域部署时的安全性评估需求,其影响已延伸至国际人机信任这一热点议题的量化研究框架建设中。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务