遇见数据集

DAVIAN-Robotics/0528_bk_config1_open_drawer

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人学习数据集,使用LeRobot工具创建,专门针对机器人控制任务。数据集基于Franka机器人平台,包含40个episodes和9147帧数据,覆盖2个不同任务。数据以parquet文件格式存储,每个chunk大小为1000帧,总数据文件大小为100MB,视频文件大小为200MB,帧率为20fps。数据集包含多个特征:观察状态(如关节位置q_0到q_6、关节速度qdot_0到qdot_6、末端执行器位置x、y、z、姿态四元数qx、qy、qz、qw、线速度和角速度vx、vy、vz、wx、wy、wz、夹爪位置和抓取状态)、动作(包括位置x、y、z、姿态四元数qx、qy、qz、qw和夹爪控制)、来自三个视角的图像视频(wrist、left_back、right_back,每个视频为3通道RGB图像,分辨率480x640,编码为av1),以及时间戳、帧索引、episode索引、索引和任务索引。数据集仅用于训练,splits为train:0:40。

This dataset is a robotics learning dataset created using the LeRobot tool, specifically designed for robot control tasks. It is based on the Franka robot platform, containing 40 episodes and 9147 frames, covering 2 distinct tasks. The data is stored in parquet file format, with each chunk size of 1000 frames, total data file size of 100MB, video file size of 200MB, and a frame rate of 20fps. The dataset includes multiple features: observation state (such as joint positions q_0 to q_6, joint velocities qdot_0 to qdot_6, end-effector position x, y, z, orientation quaternions qx, qy, qz, qw, linear and angular velocities vx, vy, vz, wx, wy, wz, gripper position, and grasp state), action (including position x, y, z, orientation quaternions qx, qy, qz, qw, and gripper control), image videos from three perspectives (wrist, left_back, right_back, each video is 3-channel RGB with 480x640 resolution, encoded in av1), as well as timestamp, frame index, episode index, index, and task index. The dataset is intended for training only, with splits as train:0:40.

提供机构:
DAVIAN-Robotics
搜集汇总
数据集介绍
构建方式
本数据集依托LeRobot框架构建,专为机器人操作任务设计。数据采集采用Franka机器人平台,在特定配置下执行打开抽屉动作,共收录40个完整操作回合(episode),总计9147帧时序数据。数据集以parquet格式高效存储结构化信息,并同步记录多视角视频流(腕部、左后方、右后方),视频文件采用AV1编码压缩,分辨率统一为480×640像素,帧率设定为20 FPS。全部数据被划分为训练集,未设置验证与测试分区。
特点
数据集特色在于其多维度的感知与动作信息融合:每个时间步均包含29维机器人状态观测(涵盖关节位置、速度、末端执行器位姿与夹爪状态)、8维连续动作指令(涉及三维平移、四元数旋转及夹爪控制),以及三个独立视角的RGB视觉图像。数据集涵盖了两种不同任务变体(total_tasks: 2),并采用chunk分块存储机制(每块1000帧),便于大规模分布式读取与流式加载。
使用方法
使用者可通过LeRobot库的官方API便捷调用,利用`lerobot.Dataset`接口加载数据集,支持按episode索引或时间帧随机采样。由于未划分验证集,建议用户自行从40个回合中拆分20%(约8个回合)作为评估数据。视觉观测数据通过Hugging Face Datasets库的`decode`机制自动解码视频张量,而状态与动作数据则直接以NumPy数组形式提供,便于与PyTorch或TensorFlow训练管线无缝衔接。
背景与挑战
背景概述
在机器人学习领域,基于示教学习的操作技能获取是近年来的研究热点,其核心在于利用高质量的专家演示数据使机器人掌握复杂任务。该数据集由DAVIAN-Robotics团队创建,采用Franka Panda机器人平台,聚焦于‘打开抽屉’这一典型家具操作任务。数据集创建于2024年,共包含40个演示回合,总计9147帧时序数据,采样频率为20赫兹。通过融合腕部及多角度的视觉输入与29维机器人状态信息,该数据集为研究精细操作中的感知-运动耦合提供了标准化基准。其开源共享特性对推动机器人操作技能的可复现研究与算法泛化能力评估具有重要参考价值。
当前挑战
数据集所应对的领域挑战在于:开放式抽屉任务要求机器人准确感知抽屉把手的位置与姿态,同步协调手臂运动与夹爪控制,同时处理视觉遮挡与物体个体差异带来的不确定性。构建过程中的挑战包括:确保多相机视角下视觉信息与运动数据的高精度时间同步;设计重复执行时避免抽屉机械特性变化的干扰;在有限演示回合数(40次)内覆盖足够的状态空间以支持泛化学习。此外,数据采集依赖精密遥操作设备,操作人员的示范一致性也可能影响数据质量,增加了构建可靠基准数据的难度。
常用场景
经典使用场景
在机器人操作领域,开抽屉任务作为一项基础且具挑战性的操作技能,常被用于验证具身智能算法的泛化能力。0528_bk_config1_open_drawer数据集由Franka机械臂在真实物理环境中执行获取,包含40个演示回合、超过9000帧的时序数据,涵盖多视角视觉信息与关节状态、末端执行器位姿等29维观测变量。该数据集最经典的用途在于训练基于模仿学习的行为克隆模型,尤其是利用LeRobot框架实现的端到端策略学习。通过将观测状态和动作序列作为监督信号,研究者可构建将高维视觉输入直接映射为机器人动作的神经网络,为后续复杂操作任务的迁移学习奠定数据基础。
衍生相关工作
围绕该数据集衍生的经典工作主要集中于模仿学习与数据高效策略方面。基于LeRobot框架,研究者以此为蓝本开发了多种行为克隆的改进变体,包括引入注意力机制的Transformer策略、结合对比学习的表征预训练方法等。这些衍生工作探索了如何从少量演示中提取可迁移的运动基元,从而应对抽屉打开角度、握持点变化等分布外场景。值得注意的是,该数据集还催生了关于人机协同演示数据增强的研究,通过增量式更新策略库来缓解灾难性遗忘问题,进一步扩展了机器人学习在非结构化环境中的适应边界。
数据集最近研究
最新研究方向
该数据集聚焦于机器人操作任务中的精细互动行为——开抽屉。在具身智能领域,数据驱动方法已成为研究热点,而高质量、可复现的操作演示数据尤为稀缺。此数据集基于Franka机械臂采集,包含40个演示片段、近万帧状态与动作记录,并提供了多视角视觉输入(腕部、左后、右后),为模仿学习、行为克隆以及视觉-运动协调策略的建模提供了理想基准。当前前沿方向围绕如何在有限演示下提升策略泛化能力,该数据的多模态特征与结构化状态空间(29维状态、8维动作)有力支撑了端到端学习与因果推理模型的开发。其公开性亦顺应了开放科学浪潮,推动机器人社区从黑盒模型向可解释、可迁移的操作智能演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务