遇见数据集

kunhsiang/eval_exp9_sc1var_grasp_the_big_box_20260528-184426

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的机器人数据集,专门用于机器人任务,涉及一个名为so_follower的机器人类型。数据集包含1个episode,总计2566帧,以30帧每秒的速率采集。数据特征包括动作(6个关节位置:肩部旋转、肩部提升、肘部弯曲、手腕弯曲、手腕滚动和夹爪位置)、观测状态(同样为6个关节位置),以及三个视角的图像观测:前视、顶部和夹爪视角,每个图像分辨率为480x640像素,3个通道,采用AV1编解码器。此外,数据集还包括时间戳、帧索引、episode索引、索引和任务索引等元数据。数据以parquet文件格式存储,视频以mp4格式存储,总数据文件大小为100MB,视频文件大小为200MB。

This dataset was created using LeRobot and is designed for robotics tasks, involving a robot type named so_follower. It contains 1 episode with a total of 2566 frames, captured at 30 frames per second. The features include actions (6 joint positions: shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions), observation states (also 6 joint positions), and image observations from three perspectives: front, top, and gripper, each with a resolution of 480x640 pixels, 3 channels, using the AV1 codec. Additionally, the dataset includes metadata such as timestamp, frame index, episode index, index, and task index. Data is stored in parquet files, with videos in mp4 format, totaling 100MB for data files and 200MB for video files.

提供机构:
kunhsiang
搜集汇总
数据集介绍
kunhsiang/eval_exp9_sc1var_grasp_the_big_box_20260528-184426 数据集图片
构建方式
该数据集基于LeRobot框架构建,专为机器人模仿学习任务设计。整个数据集仅包含一个评估回合(episode),共计2566帧,由名为“so_follower”的机器人采集完成。任务聚焦于抓取大型箱子这一单一动作,机器人通过其6自由度关节(肩部、肘部、腕部及夹爪)执行操作。数据以Parquet格式存储动作序列及状态信息,同时采用AV1编码的视频文件记录来自前视、顶视和夹爪视角的视觉观测,数据帧率为30帧/秒,确保时间分辨率与空间细节的平衡。
特点
该数据集的显著特点在于其高度专业化与稀疏性:仅包含一个回合、一个任务,适用于评估特定抓取动作的泛化能力。特征空间包含6维连续动作与状态向量,对应机器人关节位置与夹爪开合度;视觉观测部分则通过三个独立摄像头(前视、顶视、夹爪视角)提供480x640分辨率的RGB图像,形成多模态感知数据。此外,数据集附带时间戳与索引信息,便于时序分析与片段提取,整体设计契合LeRobot生态系统的规范化标准。
使用方法
数据集可通过LeRobot库直接加载使用。用户需先安装LeRobot环境,随后利用`load_dataset`函数指定数据集路径与配置名称(default),即可获取包含动作、状态、图像及元数据的字典结构。训练时,可将观察量(observation.state与observation.images)作为输入,动作(action)作为监督信号,用于训练策略网络。推荐利用数据集提供的可视化界面(Hugging Face Space)进行预览与验证,以评估数据质量与任务覆盖范围。
背景与挑战
背景概述
该数据集由Hugging Face LeRobot框架生成,由研究者Kunhsiang于2026年5月28日创建,聚焦于机器人抓取任务中的精细操作能力。其核心研究问题在于探索在单一变量变化的场景下(如目标物体位置或姿态微调),机器人如何通过模仿学习实现对大型箱体的稳健抓取。数据集仅包含单条轨迹(共2566帧),记录了SO Follower机器人从6维关节角度和3个视角(前视、顶视、夹爪视)的视觉输入,完整复现了“抓取大箱子”这一具体行为。作为LeRobot生态中的评估用例,该数据集为验证在受限条件下(如单一场景变量)的机器人学习泛化能力提供了基准,其开源特性(Apache-2.0许可)有望加速机器人灵巧操作领域的可复现研究。
当前挑战
领域问题层面,该数据集致力于应对机器人操作中从仿真到真实环境的迁移鸿沟,尤其是大尺寸、不规则物体抓取时存在的视觉遮挡、动力学不稳定及末端执行器规划纠错难题。构建过程中,挑战体现为数据规模极受限(仅1条轨迹),难以涵盖光照变化、表面纹理差异或物体初始位姿的多样组合;同时,6维动作空间与高帧率视频(30 FPS)使得数据同步标注和长时序依赖建模尤为复杂。此外,使用单一机器人平台(SO Follower)和特定传感器配置,导致模型对硬件差异和视角变化的鲁棒性不足,进一步放大了在真实部署时因环境偏移而引发的抓取失败风险。
常用场景
经典使用场景
在机器人操作领域,该数据集聚焦于单一变量场景下的抓取任务,即机器人须精准抓取一个大型箱体。数据集以高帧率(30 FPS)记录了一组完整的示教轨迹,涵盖肩部、肘部、腕部及夹爪的六维关节动作,同时提供前向、顶部和夹爪三视角的同步视频。这一结构使其成为模仿学习与行为克隆研究的经典训练素材,常用于验证模型从视觉-状态观测到连续动作映射的学习能力,尤其适合评估算法在固定任务、有限样本条件下的泛化性能。
解决学术问题
该数据集核心解决了机器人领域样本效率低下的学术难题。传统强化学习方法往往需要海量试错,而该数据集通过提供一份高质量、多模态的专家演示,使得研究人员能够探索如何从少量示范中高效提取操作策略。它推动了模仿学习中隐式策略、扩散策略等前沿方法的发展,并帮助量化不同视角融合、状态表示与噪声鲁棒性对抓取成功率的影响,为少样本学习在具身智能中的理论突破提供了标准化的验证平台。
衍生相关工作
基于该数据集,衍生出一系列经典工作。例如,利用LeRobot框架与扩散策略(Diffusion Policy)相结合,模型能够从单条轨迹中学习多峰动作分布,显著提升抓取成功率;此外,基于Vision Transformer(ViT)的视觉运动策略也被提出,利用三视角图像序列提取空间-时间特征。部分研究还引入隐式行为克隆(Implicit Behavior Cloning),通过能量函数建模动作分布,在抓取任务上展现出强大的泛化能力。这些工作共同推动了机器人技能学习的范式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务