遇见数据集

adhdmi/mug-on-cube-auto

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

该数据集是一个与机器人技术相关的数据集,使用LeRobot创建。数据集包含123个episodes,总计19316帧,涉及1个任务。数据以parquet格式存储,包含观察数据(状态和来自多个摄像头的图像)、动作数据以及各种索引和时间戳。观察数据包括39维的状态向量和来自四个不同摄像头的视频数据(左摄像头、右摄像头、左手腕摄像头和右手腕摄像头),视频分辨率为480x640,帧率为20fps。数据集总大小为100MB(数据文件)和200MB(视频文件)。数据集采用Apache 2.0许可证。

This dataset is related to robotics and was created using LeRobot. It contains 123 episodes, totaling 19316 frames, and involves 1 task. The data is stored in parquet format and includes observations (state and images from multiple cameras), actions, and various indices and timestamps. The observations consist of a 39-dimensional state vector and video data from four different cameras (left camera, right camera, left wrist camera, and right wrist camera), with a resolution of 480x640 and a frame rate of 20fps. The total size of the dataset is 100MB (data files) and 200MB (video files). The dataset is licensed under Apache 2.0.

提供机构:
adhdmi
搜集汇总
数据集介绍
adhdmi/mug-on-cube-auto 数据集图片
构建方式
在机器人学习领域,精细操作任务的模仿学习依赖于高质量的数据集。该数据集基于LeRobot框架构建,通过一个双机械臂实验平台自动采集完成。系统记录了123个演示回合,总计19316个时序帧,专注于将杯子放置在立方体上的单一操作任务。数据采用Parquet格式存储,辅以AV1编码的MP4视频文件,并以20帧每秒的采样率捕捉机器人的状态与视觉信息。数据集被划分为训练集,覆盖全部演示回合,确保了数据的一致性与完整性。
特点
该数据集的核心特点在于其多维度的感知与动作表征。观测数据融合了39维机器人关节状态(包括左右臂、手部及腰部关节)与四个视角的视觉图像(左右侧摄像头和左右腕部摄像头),为模仿学习提供了丰富的环境与自身体姿信息。动作空间同样为39维,与状态空间维度一致,采用连续动作表征,支持精细的力位混合控制。数据以1000帧为单位的块状结构组织,便于流式加载与分布式处理,总数据量约为300兆字节。
使用方法
研究者可通过LeRobot库便捷地加载该数据集。使用`lerobot.Dataset`接口指定数据路径即可访问,系统会自动处理Parquet文件与视频帧的同步。数据遵循标准的episode-index结构,每个时间步包含观测、动作、时间戳及索引信息。适用于基于行为克隆、扩散策略或隐式策略的模仿学习算法训练。建议在加载时指定`chunks_size`参数以优化内存管理,并可利用LeRobot提供的可视化工具进行数据预览与质量控制。
背景与挑战
背景概述
在机器人学习领域,从真实世界采集的专家演示数据集对于训练模仿学习和强化学习算法至关重要。然而,构建高质量、结构化且可复现的数据集始终面临严峻挑战。mug-on-cube-auto数据集由Hugging Face社区与相关研究机构基于LeRobot框架创建,旨在为双臂机器人操作任务提供标准化的训练资源。该数据集聚焦于将杯子放置于立方体上的精确定位与操作任务,记录了123个完整演示片段,累计近2万帧状态与动作数据。通过多视角摄像头(包括左右手腕及外部固定相机)同步采集视觉信息,并结合39维机器人关节状态与动作向量,为机器人操作技能学习提供了高维度、多模态的基准数据。该数据集的出现填补了双臂精细操作任务标准化数据集的空白,推动了机器人学习在物体操作与空间推理方向的研究进展。
当前挑战
该数据集所解决的领域核心挑战在于双臂机器人在复杂环境中执行精确定位与稳定抓取任务。机器人需要从多视角视觉输入中理解物体姿态与空间关系,并协调多达39个自由度的运动控制,这对模仿学习的动作泛化能力与多模态融合方法提出了严苛要求。构建过程中,数据采集面临同步性难题:需要确保四路视频流以20fps帧率与关节状态数据严格对齐,同时处理机器人硬件固有的时序漂移。此外,演示轨迹的质量控制构成另一大挑战,包括确保人类操作者演示的重复一致性、消除异常抖动,以及应对光照变化对视觉特征的干扰。数据标注的高维度(39维动作空间)和跨模态(视觉-运动)关联的复杂性,进一步增加了数据集构建的工程与算法难度。
常用场景
经典使用场景
在机器人操作学习与模仿学习的学术前沿,mug-on-cube-auto数据集为研究多模态感知与灵巧操作提供了宝贵的基准资源。该数据集记录了123个演示片段,总计近两万帧的机器人执行“将杯子放在立方体上”这一精细任务的完整过程。通过四台摄像头(左、右及左右腕部相机)采集的视觉流数据,结合39维的机器人与灵巧手关节状态及动作序列,研究者得以构建并验证从高维感知到低层运动控制的端到端映射模型。经典的用法是将其作为模仿学习算法的训练基础,尤其适用于行为克隆、逆强化学习及基于扩散策略的运动生成等范式。
实际应用
从产业落地的视角审视,该数据集所代表的真实机器人操作数据在自动化装配、家庭服务及医疗康复等应用场景中具有深远价值。例如,在工业场景中,利用该数据集训练的策略可以使双机械臂协作完成杯具与零件的精准堆叠;在家庭服务领域,它赋能机器人以稳健地抓取与摆放日常器皿,提升辅助生活系统的自主性。这些数据推动的视觉-运动协同模型,最终可被迁移至执行更复杂的多步骤操作任务,如烹饪辅助或精密仪器组装,大幅降低人工干预需求。
衍生相关工作
围绕mug-on-cube-auto所蕴含的丰富多模态信息,学术界已经衍生出一系列具有奠基意义的经典工作。以LeRobot为框架的基准研究率先展示了该数据集在离线模仿学习中的效用,并推动发展了诸如扩散策略(Diffusion Policy)与动作分块(Action Chunking with Transformers)等创新架构。这些工作不仅深化了人们对于物体姿态表达与灵巧手部运动之间映射关系的理解,还催生了针对多视角视觉表征学习的预训练范式,显著提升了策略在面对光照变化与遮挡时的适应能力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务