遇见数据集

DAVIAN-Robotics/0528_bk_config1_pick_and_place

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,属于机器人领域,专注于Franka机器人的拾取和放置任务。数据集包含15个episodes、4197帧和6个任务,数据以parquet格式存储,视频以mp4格式存储,帧率为20fps。特征包括观察状态(如关节位置、速度、末端执行器位姿和夹爪状态)、动作(末端执行器位姿和夹爪控制)、以及来自手腕、左后和右后摄像头的视频图像(每个为3通道480x640分辨率)。数据集用于机器人学习和控制研究。

This dataset was created using LeRobot and belongs to the robotics domain, focusing on pick-and-place tasks with a Franka robot. It contains 15 episodes, 4197 frames, and 6 tasks, with data stored in parquet format and videos in mp4 format at 20fps. Features include observation states (such as joint positions, velocities, end-effector poses, and gripper state), actions (end-effector poses and gripper control), and video images from wrist, left back, and right back cameras (each with 3 channels and 480x640 resolution). The dataset is intended for robot learning and control research.

提供机构:
DAVIAN-Robotics
搜集汇总
数据集介绍
DAVIAN-Robotics/0528_bk_config1_pick_and_place 数据集图片
构建方式
在机器人操作领域中,数据集的构建是推动模仿学习发展的关键环节。该数据集依托LeRobot框架,通过Franka机器人平台采集了6类拾取与放置任务的15个演示回合,总计包含4197帧时序数据。每帧数据以20帧/秒的频率记录,涵盖机器人关节位置与速度、末端执行器位姿、夹爪状态及抓取状态等29维观测状态,同时配套8维动作指令。数据以Parquet格式分块存储,并配有来自腕部及两个背向视角的640×480分辨率深度视频流,所有数据统一划分为训练集,无测试集预留。
特点
该数据集的核心价值在于其多模态融合特性与精细化标注。观测空间中融合了29维机器人本体状态与三路视觉信号,其中视觉数据采用高效AV1编码,在保证质量的同时压缩存储空间。动作空间涵盖7自由度位姿与夹爪控制,完整覆盖了操作任务的运动学维度。6种任务类型的划分与数据分块存储策略(每块1000帧)便于模型按需加载,而经过标准化的特征命名体系(如关节角q_0至q_6、四元数位姿等)则显著提升了数据在模仿学习流水线中的易用性。
使用方法
作为LeRobot生态的标准数据集,使用者可通过该框架的DataModule接口直接加载,利用提供的可视化工具(链接至HuggingFace Space)进行数据预览。训练时宜采用时序建模范式,将观测状态与动作序列按20帧/秒的时序对齐,通过滑动窗口或回合级批处理构建训练样本。视频数据可通过帧采样或光流提取生成视觉特征,与本体状态在特征维度融合。需注意数据集仅含单一训练划分,建议采用交叉验证或留出法进行模型评估,且Parquet与MP4的混合存储格式要求设计专用的异步数据加载管线以优化训练吞吐量。
背景与挑战
背景概述
该数据集由DAVIAN-Robotics团队于近期创建,依托LeRobot框架构建,聚焦于机器人抓取与放置(pick-and-place)这一基础操作任务。作为机器人学领域的关键研究课题,抓取与放置任务要求机械臂在动态环境中对目标物体进行精准识别、抓取与转移,是工业自动化、仓储物流及服务机器人应用中的核心能力。数据集采用Franka机器人平台,记录了包含6类任务、15个完整操作片段的视觉与状态数据,总帧数达4197帧。其通过多视角相机(腕部、左后方、右后方)及29维状态空间(包含关节角度、末端执行器位姿、夹爪状态等)的精细标注,为模仿学习与示教学习提供了高质量的训练样本,对推动机器人精细操作技能的学习与泛化研究具有重要参考价值。
当前挑战
该数据集所解决的领域问题在于抓取与放置任务中操作技能的可迁移性与鲁棒性挑战。传统方法依赖手工设计的控制规则,难以适应物体形状、材质与位姿的多样性;而基于数据驱动的学习方法又面临数据稀缺与标注成本高昂的困境。构建过程中,数据集面临的挑战包括:1)确保多视角视觉数据与机器人状态数据的时空同步精度,以支持模仿学习中的动作映射;2)在有限样本量(15个片段)下平衡任务覆盖度与数据质量,避免过拟合;3)处理夹爪抓取状态(grasp_state)的准确标注,尤其针对细长或易滑落物体;4)应对真实环境中光照变化与背景干扰对视觉特征稳定性的影响,这些挑战共同制约着模型从示范到泛化的能力边界。
常用场景
经典使用场景
在机器人操作领域,0528_bk_config1_pick_and_place数据集凭借其精细的抓取与放置任务配置,成为模仿学习与行为克隆研究的经典样本。该数据集利用Franka机器人采集了15个完整回合、4197帧的时序数据,涵盖6种不同任务场景,整合了29维关节状态与末端执行器信息,以及多视角视觉观测。研究者常以此作为训练机器人从视觉输入映射到连续动作的基准,探索端到端策略在精密操纵中的泛化能力。
实际应用
在实际应用层面,该数据集为智能仓储、精密装配及家庭服务等领域的机器人部署提供了可落地的训练资源。基于其抓取与放置数据训练的模型,能够引导机器人适应不同物体形状与摆放位置,实现从仿真环境到真实工厂产线的策略迁移。例如,利用其多视角图像可开发鲁棒的视觉伺服系统,或在个性化服务场景中快速适配新物体的操作指令,显著降低了编程成本与调试周期。
衍生相关工作
基于该数据集,衍生出若干具有影响力的研究工作,包括利用扩散策略(Diffusion Policy)进行轨迹合成的创新方法,以及结合Transformer架构的多模态动作预测模型。同时,它还促进了跨机器人平台的领域自适应算法开发,例如通过对抗训练减小不同关节构型间的状态分布差异。此外,部分工作以此为基础探索了基于语言指令的零样本操作生成,拓展了机器人从演示中理解语义的边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务