遇见数据集

jae0311/serving_with_palm

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot工具创建的机器人学数据集,主要用于机器人控制任务。数据集包含267个完整的情节(episodes),总计153,662帧数据,以30帧/秒的速率采集。数据以Parquet文件格式存储,总数据文件大小约为100MB,视频文件大小约为200MB。数据集的核心特征包括:机器人动作(action),包含6个关节位置(肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转、夹爪位置);观察状态(observation.state),同样包含6个关节位置;以及两个视觉观察源:顶部摄像头图像(observation.images.top)和腕部摄像头图像(observation.images.wrist),均为480x640分辨率的三通道彩色视频。此外,数据集还包含时间戳、帧索引、情节索引、索引和任务索引等元数据。数据集的机器人类型为omx_follower,并定义了6个具体的机器人操作任务,例如向左递送杯子、向右递送杯子、将盘子放置在中心、返回初始位置以及两个组合任务。数据集按照训练集划分,包含所有267个情节。

This dataset is a robotics dataset created using the LeRobot tool, primarily intended for robot control tasks. It contains 267 complete episodes with a total of 153,662 frames, captured at 30 frames per second. The data is stored in Parquet file format, with a total data file size of approximately 100MB and video file size of about 200MB. Key features of the dataset include: robot actions (action) comprising 6 joint positions (shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, gripper position); observation states (observation.state) also containing 6 joint positions; and two visual observation sources: top camera images (observation.images.top) and wrist camera images (observation.images.wrist), both being 480x640 resolution three-channel color videos. Additionally, the dataset includes metadata such as timestamps, frame index, episode index, index, and task index. The robot type is omx_follower, and the dataset defines 6 specific robot manipulation tasks, e.g., serve cup to the left, serve cup to the right, place plate at center, return to home, and two combined tasks. The dataset is split for training, encompassing all 267 episodes.

提供机构:
jae0311
搜集汇总
数据集介绍
jae0311/serving_with_palm 数据集图片
构建方式
该数据集依托于LeRobot框架构建,旨在为机器人操控任务提供高质量的训练数据。数据采集过程中,研究者利用Omx Follower机器人执行一系列餐桌服务动作,通过顶部与腕部双视角摄像头以30帧/秒的速率同步录制视觉信息,同时记录6维关节空间的状态与动作指令(包括肩部、肘部、腕部及夹爪位置)。数据以Parquet格式存储结构化信息,视频则采用AV1编码压缩,整体包含267个episode、逾15万帧画面,覆盖从单步服务到复合操作的多类任务。
特点
数据集的显著特色在于其多模态异构数据的有机融合,既包含高精度运动学参数(如关节角度的浮点型序列),又提供480×640分辨率的双路视觉流,为模仿学习与强化学习研究提供了丰富的输入维度。此外,数据集精心设计了6种递进式任务标签(如向左/向右递送杯子、放置餐盘及归位),支持从简单到复杂策略的逐步训练,且所有数据已按267:0的比例划分为训练与验证集,便于直接调用。
使用方法
使用者可通过HuggingFace的datasets库直接加载该数据集,或借助LeRobot的API高效访问结构化数据与视频文件。推荐的实践路径包括:首先利用`observation.state`与`action`字段构建状态-动作对,以训练行为克隆模型;其次可将`observation.images.top`及`observation.images.wrist`输入视觉编码器,实现端到端的视觉运动策略学习。数据集的元信息(如帧索引、任务编号)已规范化,便于按episode或任务类型进行切片与预处理。
背景与挑战
背景概述
在机器人学习领域,模仿学习旨在通过人类示范数据使机器人学会复杂的操作技能,但高质量、多模态的示范数据集长期匮乏,制约了模型泛化性与鲁棒性的提升。"serving_with_palm"数据集由Hugging Face LeRobot团队创建,发布时间为2024年,其核心研究问题聚焦于利用多视角视觉与关节状态信息,实现桌面级服务机器人的精细操作。该数据集包含267个示范片段、超过15万帧数据,覆盖了6种倒水与摆盘等复合任务,并分别通过顶部与腕部相机记录视觉信息。作为LeRobot生态的核心示例之一,它为基于Transformer的模仿学习算法提供了标准化训练基准,显著推动了机器人感知与动作耦合研究的发展。
当前挑战
该数据集当前面临的主要挑战包括:领域问题层面,如何从单一任务数据集泛化到未知场景下的多种服务操作,例如应对不同杯具形状、桌面布局或光照条件的变化,仍是模仿学习在机器人服务应用中的关键瓶颈。构建过程中,数据采集采用遥控操作范式,要求操作者以30Hz频率同步记录6维关节轨迹与两个视角的视频流,这不仅增加了人为误差与生理疲劳,还引入了时间戳对齐精度不足的潜在风险。此外,267个示范的规模对学习复杂动作的多样性来说仍显不足,且全部数据仅来自单一机器人本体,限制了跨形态迁移的能力。
常用场景
经典使用场景
在机器人学习与操作领域,经典场景是学习基于视觉的精细操作策略。该数据集记录了机械臂完成倒水、放置餐具等服务的完整动作序列,包含高自由度关节角度与双视角视频,常用于训练模仿学习模型,使机器人从人类示教中泛化抓取、放置与交互技能。
实际应用
实际应用中,该数据集可赋能餐饮服务机器人在动态环境中完成送餐、摆盘等复杂操作,也可用于家庭辅助机器人学习端杯、递物等日常任务。其多视角视频与精确动作记录为开发远程操作与自主导航混合系统提供训练基础。
衍生相关工作
基于该数据集的衍生工作包括:使用扩散策略实现机器人细粒度动作生成、联合视觉语言模型进行任务级规划、以及通过离线强化学习提升策略鲁棒性。这些研究共同推动了从演示到自主操作的闭环系统进化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务