遇见数据集

kunhsiang/eval_exp9_sc1var_grasp_the_box_outside_the_plate_20260528-190338

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,专注于机器人学任务,具体涉及一个名为so_follower的机器人。数据集包含1个episode、2568帧和1个任务,数据以parquet文件格式存储,视频文件以mp4格式存储。特征包括动作(6自由度关节位置,如肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)、观测状态(6自由度关节位置)、以及三个视角的图像观测(前视、顶视和夹爪视角,均为480x640分辨率、3通道、30fps的视频)。此外,还包含时间戳、帧索引、episode索引、索引和任务索引等元数据。数据集用于机器人控制和感知研究,支持训练和评估机器人模型。

This dataset was created using LeRobot and focuses on robotics tasks, specifically involving a robot named so_follower. It contains 1 episode, 2568 frames, and 1 task, with data stored in parquet files and video files in mp4 format. Features include actions (6-degree-of-freedom joint positions, such as shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions), observation states (6-degree-of-freedom joint positions), and image observations from three perspectives (front, top, and gripper, all as videos with 480x640 resolution, 3 channels, and 30fps). Additionally, it includes metadata such as timestamps, frame index, episode index, index, and task index. The dataset is intended for robotics control and perception research, supporting the training and evaluation of robot models.

提供机构:
kunhsiang
搜集汇总
数据集介绍
kunhsiang/eval_exp9_sc1var_grasp_the_box_outside_the_plate_20260528-190338 数据集图片
构建方式
该数据集依托于LeRobot开源框架构建,专注于机器人操作任务的精细数据采集。数据源自单次实验(exp9)中,机械臂(so_follower)执行将盒子抓取至盘子外的具体操作(sc1var_grasp_the_box_outside_the_plate)。整个数据流程通过多视角视觉传感器与关节状态记录同步进行,共包含1个完整情节(episode),持续2568帧,采样频率为30帧/秒。数据以分块形式存储,其中动作与状态信息保存于Parquet格式文件中,而来自前视、顶视及夹爪三个角度的视觉观测则编码为AV1格式的视频,分别存放于对应的视频目录下。这种结构化的存储方式确保了数据的高效访问与长期复用。
特点
数据集在维度与模态上呈现显著特征。动作与观测状态均以6维浮点向量呈现,涵盖肩部旋转、腰部俯仰、肘部弯曲、腕部俯仰与回转以及夹爪开合等关键关节变量,精准反映了机械臂的完整运动学状态。视觉观测方面,三路摄像头提供480×640像素的彩色图像,形成覆盖操作区域的多角度视野,极大丰富了环境感知的层次。此外,每条记录均附有时间戳、帧索引及任务编号,便于时间序列分析与跨任务对比。单任务、单情节的聚焦设计,使该数据集非常适合用于验证特定操作技能的泛化能力与精细运动控制算法的有效性。
使用方法
用户可通过LeRobot库便捷加载与使用该数据集。推荐利用Hugging Face Spaces提供的可视化界面直接预览数据内容,交互式浏览各帧图像与对应的关节状态。在本地环境中,可使用LeRobot的API指定数据集路径与配置,自动读取Parquet文件中的动作、状态及元数据,并同步关联三路视频流。由于数据采用标准分块存储格式(chunk-xxx/file-xxx.parquet与视频文件),开发者可定制数据加载器进行批量处理或流式训练。该数据集遵循Apache-2.0许可协议,支持灵活的科研与工程应用场景,如图像到动作的端到端学习、状态预测或模仿学习算法的评估。
背景与挑战
背景概述
该数据集由研究者 Kunhsiang 于2026年5月创建,基于 LeRobot 框架构建,专注于机器人操作任务中的精细抓取问题。具体而言,数据集围绕“抓取盘子外的盒子”这一具体场景展开,属于机器人仿真或真实环境下的灵巧操作范畴。此类任务对机器人感知与动作的协调性要求极高,是机器人学习领域的重要基础性课题。数据集虽仅包含单一任务和一条轨迹,但提供了2568帧高分辨率图像(480x640)及多视角视频流(前视、顶视、夹爪),结合6自由度动作与状态信息,为模仿学习或强化学习方法提供了标准化的数据基准。其影响力体现在推动机器人操作中的泛化能力研究,并为后续多场景、多变量实验提供了对比基线。
当前挑战
数据集面对的挑战可分为领域问题与构建过程两个层面。在领域层面上,核心挑战在于解决机器人从感知到动作的端到端映射问题,尤其是在非结构化环境下,如何使机器人精确理解“抓取盘子外物体”这一指令,并应对物体位置、姿态与尺寸的变动。此外,单一轨迹与有限视角限制了模型的泛化性,难以应对噪声、遮挡或光照变化。构建过程中,挑战包括数据获取成本高昂:需人工遥操作或示教方式记录单次长达2568帧的演示,且需确保多摄像头同步与视频编码(如AV1)的高效存储;同时,数据集仅1条轨迹,统计代表性不足,难以支撑复杂模型的训练,需进一步扩展场景变量与专家演示数量以提升鲁棒性。
常用场景
经典使用场景
在机器人操作与模仿学习领域,精确抓取是衡量灵巧操作能力的关键任务。该数据集聚焦于“在盘子外部抓取盒子”这一特定场景,通过配置SO Follower机械臂,采集了包含6维关节空间状态(肩部、肘部、腕部等位置)与对应动作序列的高质量样本。典型应用是训练基于视觉-运动耦合的策略网络,利用前视、顶部和夹爪三视角的同步视频数据(30 FPS,640×480分辨率),结合状态信息,使机器人学会从杂乱环境中自主定位并稳定抓取目标物体。单条轨迹长达2568帧的连续记录,为研究长时序动作依赖与轨迹平滑性提供了理想基准。
解决学术问题
该数据集直接回应了机器人学中两个经典难题:如何从高维视觉观测中提取鲁棒的抓取表示,以及如何解决任务级泛化中的“分布偏移”问题。通过标准化单任务场景(grasp_the_box_outside_the_plate),研究人员得以隔离变量,量化评估模仿学习算法在具身环境中的性能边界。其公开的7-DOF动作空间与多视角视觉流,为验证行为克隆、逆强化学习等方法的样本效率与可迁移性提供了可复现的测试平台。该数据集的发布推动了从“专用技能”向“可泛化操作基元”的学术范式转变,尤其在评估跨场景零样本适应能力方面具有重要参考价值。
衍生相关工作
作为基于LeRobot生态构建的精细操作数据集,它衍生出多个研究方向。在算法层面,有工作利用其关节空间连续性设计“动作分块”(Action Chunking)模块,提升任务成功率;在表征学习方面,研究人员基于其多视角视频预训练视觉编码器(如VideoMAE),再在下游抓取任务微调,显著减少真实世界交互数据需求。另一支经典应用是将其作为“逆向动力学预测”的测试床,通过对比原始动作与反推动作误差来评估闭环控制稳定性。该数据集还常与Libero、Meta-World等基准联合使用,构建多任务迁移学习的评估协议,推动通用操作智能体的研发进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务