遇见数据集

DAVIAN-Robotics/0528_bk_config2

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人操作数据集,使用LeRobot框架创建。数据集包含30个训练片段(episodes),总计7942帧,覆盖9个不同的任务。数据以parquet文件和视频文件形式存储,总数据量约为100MB,视频文件约为200MB。数据集采集自Franka机器人,帧率为20 fps。观测特征包括:29维的机器人状态向量(包含7个关节位置、7个关节速度、末端执行器的3D位置、四元数朝向、线速度、角速度、夹爪位置和抓取状态);三个相机视角的图像观测(手腕、左后、右后),每个均为480x640分辨率的RGB视频;以及时间戳、帧索引、片段索引等元数据。动作空间为8维向量,表示末端执行器的目标位置、朝向和夹爪控制。数据集适用于机器人学习任务,如模仿学习或强化学习。

This dataset is a robotic manipulation dataset developed using the LeRobot framework. It consists of 30 training episodes, totaling 7942 frames, spanning 9 distinct tasks. The data is stored in both parquet files and video files, with a total volume of approximately 100MB for non-video data and ~200MB for video files. The dataset was collected using a Franka robot, with a capture frame rate of 20 fps. Observation features include: a 29-dimensional robot state vector, which encompasses 7 joint positions, 7 joint velocities, the 3D position and quaternion orientation of the end effector, linear velocity, angular velocity, gripper position and grasp status; image observations from three camera perspectives (wrist, left rear, right rear), all of which are RGB videos with a resolution of 480×640; as well as metadata such as timestamps, frame indices, and episode indices. The action space is an 8-dimensional vector that represents the target position, orientation of the end effector, and gripper control commands. This dataset is applicable to robotic learning tasks such as imitation learning and reinforcement learning.

提供机构:
DAVIAN-Robotics
搜集汇总
数据集介绍
构建方式
该数据集依托于LeRobot框架构建,以Franka机器人为数据采集平台,通过遥操作或自动演示方式记录了30个episode、共计7942帧的机器人操作数据。数据按chunk分块存储,每个chunk容量为1000帧,采用Parquet格式存储状态与动作数值,同时将多视角视频(腕部、左后、右后)以AV1编码的MP4文件独立保存,视频分辨率为480×640,帧率与数值数据同步为20fps。元数据信息统一记录于info.json文件中,包含机器人类型、任务总数(9类)及数据分割方案,所有训练样本均未划分验证集。
特点
数据集的核心特点在于其多模态融合设计,将29维机器人状态(包括关节位置、速度、末端执行器位姿及夹爪状态)与8维动作指令(位置、姿态四元数及夹爪控制)紧密结合。三路摄像头提供了丰富的环境观察视角,其中腕部相机聚焦操作细节,侧后方相机兼顾全局场景。视频流采用高压缩比AV1编码,在保持视觉质量的同时控制存储体积,图像与数值数据的时间戳严格对齐,确保状态-动作-观测的时空一致性。所有特征以规范化张量形式存储,便于直接输入深度学习模型。
使用方法
数据加载宜通过LeRobot库的API实现,调用`load_dataset`函数可直接读取Parquet时间序列与关联视频文件。用户可按episode或frame索引随机访问,利用`observation.state`获取机器人实时状态,结合`observation.images`字典提取多视角图像序列。动作数据可直接用于模仿学习中的行为克隆训练,或作为强化学习的专家轨迹。建议将30个episode按任务类型分组,用于多任务策略学习。若需自定义数据流水线,可参考info.json中的特征结构与chunk路径规则,自行构建高效的数据迭代器。
背景与挑战
背景概述
在机器人学习领域,模仿学习与强化学习对高质量、标准化数据集的依赖日益凸显。0528_bk_config2数据集由DAVIAN-Robotics团队基于LeRobot框架创建,采用Apache-2.0开源许可,旨在为Franka机械臂的操控任务提供结构化训练资源。该数据集采集于2023年5月28日,包含30个示范回合、总计7942帧数据,覆盖9种不同操作任务,每帧记录29维机械臂状态与8维动作指令,并配以三视角视频流(腕部、左后方、右后方),帧率为20 FPS。其发布填补了开源社区在高保真机器人操控数据集方面的空白,为多任务模仿学习、行为克隆及多模态融合研究提供了基准平台。
当前挑战
该数据集的核心挑战体现在两个层面。在领域问题层面,它致力于解决机器人精细操控中的多任务泛化与视觉-运动耦合难题,要求算法从高维视觉与运动状态中学习鲁棒的动作策略。在构建过程中,数据采集面临多视角同步、机械臂轨迹精确标注及不同任务间动作空间一致性等工程挑战;同时,数据集规模(100MB数据文件与200MB视频文件)与有限回合数(30个)限制了模型对复杂环境的适应能力,如何在少量示范下实现高效迁移学习成为关键技术瓶颈。
常用场景
经典使用场景
在机器人学习领域,该数据集通常被用于训练和评估基于视觉的运动策略模型。其包含的Franka机器人操作数据,融合了多视角视觉观测(腕部、左后方、右后方摄像头)与关节状态、末端执行器位姿及夹爪状态等29维状态信息,为模仿学习提供了丰富的状态-动作对样本。研究者可借助此类数据,构建从高维视觉输入到低维动作输出的端到端映射,实现机器人对精细操作任务的习得。
解决学术问题
该数据集有助于解决机器人学习中的核心学术难题,如小样本模仿学习中的泛化能力不足、多模态感知融合的效率低下,以及复杂接触任务中动作序列的鲁棒性控制问题。通过提供30个完整演示片段、涵盖9种不同操作任务的标准化数据,它推动了行为克隆、逆强化学习及离线策略优化等方法在现实场景中的验证与改进,为理解机器人如何从有限演示中抽象出通用操作规律奠定了基础。
衍生相关工作
基于该数据集衍生的经典工作包括多任务模仿学习统一框架、基于扩散策略的动作生成模型,以及视觉-语言-动作联合预训练范式。研究者常常将其作为基准,对比不同网络架构(如Transformer或扩散模型)在少样本场景下的策略迁移效果。同时,该数据集也催生了关于数据增强技术的研究,例如通过视角合成或噪声注入提升策略的泛化鲁棒性,进一步丰富了机器人学的数据驱动方法论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务