遇见数据集

DAVIAN-Robotics/0528_bk_config3

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集由LeRobot创建,是一个机器人领域的数据集,专门用于机器人学习和控制任务。数据集包含60个完整 episodes,总计13747帧,覆盖11个不同任务。数据采集自Franka机器人,包含多模态特征:机器人状态(如关节位置、速度、末端执行器位姿和抓取状态)、动作指令(位置和抓握控制),以及三个摄像头视频流(手腕、左后、右后视角),视频分辨率为480x640,帧率为20fps。数据以parquet格式存储,适用于机器人模仿学习、强化学习等研究。

This dataset was created by LeRobot. It is a robotics-specific dataset dedicated to robot learning and control tasks. The dataset includes 60 complete episodes, totaling 13,747 frames, covering 11 distinct tasks. All data is collected from a Franka robot and contains multimodal features: robot states such as joint positions, velocities, end-effector poses and grasp status, action commands for position and grasp control, and three camera video streams from the wrist, left rear and right rear perspectives. The videos have a resolution of 480x640 and a frame rate of 20 fps. The dataset is stored in Parquet format and is applicable to research in robotic imitation learning, reinforcement learning and other relevant fields.

提供机构:
DAVIAN-Robotics
搜集汇总
数据集介绍
构建方式
该数据集依托于LeRobot库构建,旨在服务于机器人操作任务的模仿学习与行为克隆研究。数据源自Franka机器人平台,通过精心设计的11种不同任务场景,录制了总计60个示范轨迹,涵盖13747帧有效行为记录。数据以Parquet格式高效存储,并辅以多视角同步视频流(腕部、左后方、右后方),视频采用AV1编码,分辨率为640x480,帧率为20fps。数据集结构遵循v3.0规范,将轨迹按1000帧为单元切分为数据块与视频块,便于分布式加载与流式处理。所有训练数据未做分割,统一归入训练集。
特点
本数据集的核心特色在于其多模态、高维度的观测空间与精细化的动作表征。观测状态囊括29维度的机器人关节角度、角速度、末端执行器位姿、速度及夹爪状态,为模型提供了丰富的环境感知信息。动作空间则为8维连续向量,涵盖末端平移、四元数旋转与夹爪开合指令,直接映射至底层控制。三路摄像头以独立视频流形式记录,保留了完整的时间序列上下文,有利于视觉-运动策略的学习。此外,数据集明确记录了时间戳、帧索引、任务标签与示范片段索引,支持对序列依赖关系的建模与跨任务泛化能力的评估。
使用方法
推荐使用LeRobot框架(https://github.com/huggingface/lerobot)进行数据集的加载与预处理。开发者可通过HuggingFace Spaces提供的可视化工具(链接见README)直接预览轨迹与图像序列。在代码中,可利用LeRobot的DataModule接口按需读取Parquet数据与压缩视频,自动完成批量重组与时间对齐。由于数据已按标准格式组织,可无缝对接常见的模仿学习算法(如Diffusion Policy、ACT)的训练管道。建议将action向量作为监督信号,observation.state与observation.images作为模型输入,进行端到端的行为克隆。数据集采用Apache-2.0许可,允许自由使用与修改。
背景与挑战
背景概述
该数据集由DAVIAN-Robotics研究机构于近期创建,旨在推动机器人操作领域的模仿学习与行为克隆研究。依托于Hugging Face的LeRobot框架,数据集针对Franka机器人平台采集了60个示范轨迹,涵盖11种操作任务,共计13747帧的高频(20fps)多模态数据。通过融合29维机器人状态信息(包括关节角度、速度、末端执行器位姿及抓取状态)与8维动作指令,以及三视角视觉输入(腕部、左后侧、右后侧摄像头),为机器人从示范中学习精细操作技能提供了高质量的训练资源。该数据集的发布为机器人操作中的策略泛化与迁移学习研究奠定了重要基础。
当前挑战
在领域问题层面,该数据集聚焦于机器人操作中的模仿学习挑战,即如何从有限的示范数据中高效提取操作策略并实现跨场景泛化。多视角视觉信息的整合以及高维状态-动作空间的建模显著增加了学习任务的复杂度。在构建过程中,数据采集面临挑战:利用Franka机器人进行精细操作时需确保示范轨迹的准确性与一致性,同时保持20fps的实时同步记录;此外,如何设计涵盖11种任务的多样化场景以增强数据代表性,并在有限的60回合内捕捉足够的操作变化,是构建该数据集的核心难点。
常用场景
经典使用场景
在机器人学习领域,0528_bk_config3数据集凭借其精细化的多模态感知与动作记录,成为模仿学习与离线强化学习研究的理想基准。该数据集利用Franka机械臂,在11个不同任务中收集了60个演示片段,总计近14000帧,并同步提供了29维的机器人状态信息(包括关节角度、角速度、末端执行器位姿及夹爪状态)、8维的动作指令以及来自三台相机(腕部、左后、右后)的高清视频流。这些丰富的传感器数据使得研究者能够训练出能够从视觉输入直接映射到精确动作的深度神经网络模型,从而在无需手工设计特征的情况下,让机器人学习复杂的操作技能。
解决学术问题
在学术领域,本数据集直击机器人技能学习中数据稀缺与泛化能力不足的痛点。通过提供统一格式的多任务演示,它使得研究者能够系统性地探索多任务学习、元学习以及跨任务迁移方法,解决如何让单一模型掌握多种精细操作(如抓取、放置、装配)的核心难题。此外,数据集中包含的长时间序列与高帧率信息,为研究长时域依赖建模和时序预测提供了宝贵资源,进而推动机器人从简单的示教复现向具有环境适应性的智能行为进化,其影响已辐射至自动化控制与认知科学的交叉方向。
衍生相关工作
围绕该数据集,学术界与工业界已衍生出多项具有影响力的研究工作。一方面,基于LeRobot框架,研究者利用其标准化的数据格式开发了多种行为克隆算法,如基于Transformer的决策模型和扩散策略,显著提升了从多模态观测中生成平滑动作序列的效果。另一方面,该数据集促进了仿真到现实迁移技术的发展,例如通过域随机化技术将数据中的视觉特征转化为适用于不同光照与背景条件的鲁棒策略。此外,有多项工作探索了利用该数据进行表征学习,将高维视觉与低维状态融合为紧凑的隐空间,从而推动机器人基础模型的构建与泛化能力的突破。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务