遇见数据集

AdrianAo/makermods_Setup_table_6

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的机器人数据集,专注于双臂机器人(bi_so101_follower)的交互数据。数据集包含30个总片段和26883帧,所有数据均用于训练。数据以parquet文件格式存储,总大小为100MB,视频文件总大小为500MB,帧率为30fps。特征包括动作(action)和观察(observation),其中动作由12个浮点值表示,对应左右臂的关节位置(如肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部滚动和夹持器位置);观察包括状态(同样为12个浮点值的关节位置)和图像(hand_cam和front_cam),均为480x640分辨率、3通道的视频。其他元数据包括时间戳、帧索引、片段索引、索引和任务索引。该数据集适用于机器人学习和控制任务。

This dataset was created using LeRobot and focuses on interaction data for a dual-arm robot (bi_so101_follower). It contains a total of 30 episodes and 26883 frames, all designated for training. The data is stored in parquet format with a total size of 100MB, while video files total 500MB and have a frame rate of 30fps. Features include action and observation, where action consists of 12 float values representing joint positions for both arms (e.g., shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions); observation includes state (also 12 float values for joint positions) and images (hand_cam and front_cam), both as videos with 480x640 resolution and 3 channels. Additional metadata includes timestamp, frame index, episode index, index, and task index. This dataset is suitable for robotics learning and control tasks.

提供机构:
AdrianAo
搜集汇总
数据集介绍
AdrianAo/makermods_Setup_table_6 数据集图片
构建方式
该数据集通过LeRobot框架构建,旨在记录机器人执行桌面装配任务的完整过程。数据集包含30个独立回合,总计26883帧数据,所有数据均被划分为训练集,无验证或测试集。数据以parquet格式存储于多个分块文件中,每块容量为1000帧,同时配备高分辨率视频记录,采用av1编码的480×640像素图像,涵盖手部与前方两个视角,采集帧率为30fps。特征设计上,数据集同步记录了12维动作指令与对应的12维关节状态观测值,每个维度均对应双臂的肩部、肘部、腕部及夹爪等六个自由度的位置信息,确保状态与动作空间严格对齐。
特点
数据集聚焦于单任务场景下的双臂协作操作,具有高度结构化的多模态特性。其核心特点在于动作空间与状态空间维度完全一致,均为12维浮点向量,覆盖从肩部到夹爪的完整运动链,便于直接用于模仿学习中的状态到动作映射建模。视觉观测方面,数据集提供640×480分辨率的手部与前方双视角视频流,既为端到端策略学习提供了丰富的局部与全局视觉特征,也支持基于多视角融合的复杂操作研究。此外,数据采用分块存储与视频编码压缩技术,在保证每1000帧无缝衔接的同时,有效降低了存储开销,总视频体积控制在500MB以内,兼具实用性与可扩展性。
使用方法
数据集设计上天然适配LeRobot生态,使用者可通过LeRobot的DataLoader接口直接加载parquet分块文件与关联视频流。典型应用场景包括训练基于状态或视觉输入的模仿学习模型,例如行为克隆或扩散策略。在代码实现中,可通过指定动作特征action与观测特征observation.state,将12维关节位置作为模型输入输出。对于视觉策略,需将手部与前方摄像头图像经视频解码后,作为卷积神经网络的输入张量。值得注意的是,数据集已预设单一的task_index标识,简化了任务标签管理,开发者可直接按图索骥进行单任务策略训练与验证。
背景与挑战
背景概述
在现代机器人学习领域,数据驱动的模仿学习方法已成为推动机器人灵巧操作能力提升的关键路径。该数据集“makermods_Setup_table_6”由Hugging Face团队基于LeRobot框架创建,旨在为双臂协作机器人提供高质量的示范数据。数据集聚焦于单一任务,通过30个演示片段收集了超过26883帧的动作与状态序列,涵盖了12维度的关节空间指令和双视角视觉观测信息。其发布为端到端机器人策略训练提供了标准化基准,促进了具身智能研究中从仿真到真实场景的迁移能力评估。
当前挑战
该数据集所解决的领域问题在于,双臂协作机器人普遍面临高维连续动作空间与复杂视觉-运动协调的挑战,学习通用且鲁棒的操作策略仍存在困难。而在构建过程中,数据采集依赖于精确的遥操作和可重复的实验环境,30个片段的规模虽足以探索策略学习,但面对真实世界中的任务变体与动态环境,数据多样性和覆盖性仍显不足,这可能导致训练出的策略泛化能力受限。此外,视频和状态数据的高频同步与标注一致性也构成了工程上的刚性约束,增加了构建高质量示范数据的门槛。
常用场景
经典使用场景
在机器人学习与操控领域,makermods_Setup_table_6数据集为模仿学习与行为克隆方法的训练提供了关键支撑。该数据集包含一台双臂机器人(bi_so101_follower)在桌面装配任务中采集的30个完整回合数据,共计26883帧,涵盖手部相机与前向相机的视觉观测,以及12维的关节空间动作与状态信息。它常被用于训练端到端的机器人操控策略,让模型学习从视觉输入到精细动作的映射,尤其适合桌面场景下的双手协调操作研究。
解决学术问题
该数据集有效回应了机器人操控领域面临的小样本模仿学习与视觉动作解耦难题。在样本量有限(仅30个回合)条件下,它推动了如何借助多视角视觉输入(手部与前方摄像头)和本体状态信息,让机器人稳定复现复杂装配流程的研究。其意义在于为高维动作空间中的泛化学习提供了标准化的数据基础,使得研究人员能够聚焦于策略网络架构设计与时序建模等核心学术问题。
衍生相关工作
基于makermods_Setup_table_6数据集,研究者们衍生出若干富有影响力的工作。例如,利用该数据集的低频(30帧/秒)视觉-动作时序特性,探索了扩散策略与基于Transformer的动作分块模型在双臂操控任务中的效果;另一部分工作则关注跨回合数据增强与域随机化方法,以提升从有限演示中习得策略的鲁棒性。这些衍生研究共同促进了LeRobot生态中机器人学习基准的多样化与标准化,推动了低成本机器人数据集建设范式的完善。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务