遇见数据集

jellyho/droid_move_banana

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,是一个机器人学习数据集,专门用于Franka机器人执行任务。数据集包含21个训练片段,总计1465帧,帧率为10fps,涉及一个任务。数据特征丰富,包括机器人的状态观测(如关节位置、关节速度、笛卡尔位置、夹爪位置)、动作、奖励、完成标志、成功标志,以及来自两个摄像头的视频观测(左侧手腕摄像头和左侧侧视摄像头1),视频分辨率为720x1280,编码为AV1。数据集结构以Parquet文件格式存储,总数据文件大小为100MB,视频文件大小为200MB。

This dataset is a robotics learning dataset developed using the LeRobot framework, specifically tailored for tasks executed by Franka robots. It contains 21 training episodes, with a total of 1465 frames at a frame rate of 10 fps, corresponding to one single task. The dataset includes rich data modalities: robot state observations such as joint positions, joint velocities, Cartesian positions, and gripper positions, actions, rewards, completion flags, success flags, as well as visual observations captured by two cameras, namely the left wrist camera and the left side-view camera 1. The video observations have a resolution of 720×1280 and are encoded using the AV1 codec. The dataset is stored in Parquet file format, with a total data file size of 100 MB and a total video file size of 200 MB.

提供机构:
jellyho
搜集汇总
数据集介绍
jellyho/droid_move_banana 数据集图片
构建方式
该数据集基于LeRobot框架构建,属于机器人操作学习领域的典型数据资源。构建过程依托Franka机械臂平台,通过遥操作或程序化控制执行单一任务,采集21个回合共1465帧的传感器数据。数据以10fps的频率记录,涵盖关节位置、关节速度、笛卡尔位置及夹爪位置等多维状态信息,同时包含动作序列、奖励、完成标志与成功标志。视觉数据通过腕部左视和侧视左视两个摄像头以1280×720分辨率同步采集,并编码为AV1格式视频。所有记录以Parquet和MP4文件分块存储,遵循LeRobot v3.0规范,形成结构化的机器人学习数据集。
使用方法
使用该数据集时,可借助LeRobot官方工具或Hugging Face数据集接口加载Parquet与视频文件。通过解析meta/info.json获取特征名称、维度及文件路径模板,研究者能够按需提取状态、动作及视觉流。数据适用于训练端到端的机器人操作策略,例如基于行为克隆或离线强化学习的算法。用户可利用可视化空间在线浏览数据集内容,快速验证任务场景。在模型训练中,常将观测状态与图像输入策略网络,动作作为监督信号或优化目标。数据集遵循Apache-2.0许可,允许自由使用与修改,但需注意引用规范并遵守相关伦理准则。
背景与挑战
背景概述
在机器人学习领域,高质量的真实操作数据集对于推动算法泛化与技能迁移具有关键意义。droid_move_banana数据集依托LeRobot框架构建,采用Franka机械臂平台,包含21个演示回合、1465帧,以10Hz频率记录了关节位置、速度、笛卡尔位姿、夹爪状态及双视角视频,任务聚焦于移动香蕉这一基础操作。该数据集为视觉-动作策略学习、模仿学习与强化学习研究提供了标准化的真实世界操作基准,尤其适用于评估多模态感知与精细操控算法的鲁棒性。
当前挑战
该数据集所对应的领域问题——基于视觉引导的机械臂精细抓取与移动操作——面临操作对象位姿多样、遮挡与光照变化、接触动力学复杂等固有挑战,要求策略具备强泛化能力。构建过程中,需精确同步Franka机械臂的24维状态观测与双路720p视频流,保证时间对齐与数据完整性,同时控制演示质量以涵盖任务成功与失败模式;此外,单任务、有限回合的规模也限制了策略在多变场景下的迁移能力,对数据采集协议与标注一致性提出更高要求。
常用场景
经典使用场景
在机器人学习领域,基于示教数据的模仿学习与视觉-运动策略建模长期占据核心地位。droid_move_banana数据集依托LeRobot框架构建,涵盖21条Franka机械臂操作轨迹,总计1465帧、10Hz采样,同步记录关节位置与速度、笛卡尔位姿、夹爪开合及双路RGB视频观测。其最经典的使用场景在于训练端到端的视觉-运动策略,使机械臂能够从多模态观测中习得将香蕉移至目标位置的连续控制指令,从而为模仿学习算法提供标准化、可复现的基准测试环境。
解决学术问题
该数据集直面机器人模仿学习研究中长期存在的若干难题:真实机器人演示数据获取成本高昂、多模态观测(本体感知与视觉)时空对齐困难、以及策略泛化能力验证缺乏统一平台。通过提供细粒度动作标签与高分辨率视觉流,它使得研究者能够系统探究状态表征学习、动作分块预测与视觉编码器预训练等关键问题。其意义在于降低了真实机器人实验门槛,为模仿学习算法的可比性评估与可重复研究奠定了数据基础。
实际应用
在实际工业与服务机器人场景中,droid_move_banana数据集可用于验证抓取-放置任务的可迁移性策略。例如,在物流分拣、食品处理或实验室自动化环节,机械臂需依据视觉反馈精准操控柔性或易损物体,该数据集提供的演示轨迹能够支撑策略预训练与仿真到现实的微调。借助LeRobot可视化工具,开发者可高效调试策略行为,缩短从算法原型到真机部署的迭代周期,为轻量级操作任务的自动化提供数据支撑。
数据集最近研究
最新研究方向
在具身智能与机器人操作学习领域,droid_move_banana数据集为基于Franka机械臂的抓取与移动任务提供了高维视觉-运动-力觉多模态示范数据,涵盖关节位置、速度、笛卡尔位姿、夹爪状态及双视角视频流,共计21条轨迹与1465帧。当前前沿研究聚焦于利用此类富含时空信息的数据驱动模仿学习与视觉-语言-动作模型,探索跨场景泛化、精细操作策略迁移以及从人类演示中提取可解释控制表征。该数据集亦呼应了社区对标准化机器人数据格式LeRobot的推广需求,为构建可复现的基准评测与促进开源协作生态提供了关键支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务