遇见数据集

kunhsiang/eval_exp9_sc1var_grasp_the_small_box_20260529-113738

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人学数据集,使用LeRobot创建。数据集包含一个名为so_follower的机器人类型,总共有1个任务、1个情节和2524帧。数据以30帧每秒(fps)的速率采集,包含训练集(train)划分。数据集的特征包括动作(action)、观察状态(observation.state)以及来自三个不同视角(front、top、gripper)的图像观察(observation.images),图像分辨率为480x640像素,3通道。数据格式为Parquet文件,视频格式为MP4。数据集总数据文件大小为100MB,视频文件大小为200MB。

This dataset is a robotics dataset created using LeRobot. It includes a robot type named so_follower, with a total of 1 task, 1 episode, and 2524 frames. Data is collected at 30 frames per second (fps) and includes a training split. The dataset features actions, observation states, and image observations from three different perspectives (front, top, gripper), with image resolution of 480x640 pixels and 3 channels. Data is stored in Parquet files, and videos are in MP4 format. The total data file size is 100MB, and video files size is 200MB.

提供机构:
kunhsiang
搜集汇总
数据集介绍
kunhsiang/eval_exp9_sc1var_grasp_the_small_box_20260529-113738 数据集图片
构建方式
该数据集基于LeRobot框架构建,旨在捕获单场景单变量条件下机器人抓取小箱子的操作过程。数据采集自so_follower机器人平台,共计1个完整episode,包含2524帧时序数据。每条记录以30帧/秒的频率同步存储机器人六自由度关节状态(肩部旋转、肩部升降、肘部弯曲、腕部弯曲、腕部旋转及夹爪开合)及其对应的动作指令。此外,数据集集成了来自前视、顶视和夹爪视角的三路同步视频流,分辨率均为640×480像素,采用AV1编码压缩以平衡画质与存储效率。所有数据被分块存储为Parquet格式的表格文件和MP4视频文件,通过元数据文件统一管理索引、时间戳与任务信息。
特点
本数据集的核心特点在于其高度聚焦的单一任务设计——仅包含一个抓取小箱子的操作轨迹,但通过多模态传感融合提供了丰富的学习信号。机器人本体状态与动作空间维度一致(均为6维连续值),便于探索模仿学习中的状态-动作对齐机制。三路视觉观测覆盖了全局与局部视野,其中夹爪视角尤其有助于细粒度操作分析。数据量虽小(约300MB),但2524帧的密集采样确保了动作序列的流畅性,适合用于小样本学习或运动基元提取。所有数据采用Apache 2.0许可协议发布,支持自由研究应用。
使用方法
推荐使用LeRobot库加载该数据集,通过`dataset = load_dataset('kunhsiang/eval_exp9_sc1var_grasp_the_small_box_20260529-113738', split='train')`直接获取单episode数据。用户可利用`features`字段中的键名(如`action`、`observation.state`、`observation.images.front`)分别访问机器人动作、状态与视觉帧。视频数据以时间序列形式呈现,适合作为行为克隆或逆强化学习模型的输入。由于仅含一个episode,建议将其作为验证集或与同类数据集配合进行迁移学习;也可通过Hugging Face Spaces可视化界面直接浏览视频和状态轨迹。
背景与挑战
背景概述
在机器人学习领域,模仿学习与示教数据集的构建是推动技能迁移与泛化能力提升的核心驱动力。该数据集由kunhsiang于2026年5月29日基于LeRobot框架创建,聚焦于单变量场景下的精确抓取任务——抓取一个小型盒子。作为一个面向机器人操作的数据集,它记录了单条示范轨迹,包含2524帧的高频观测数据(30 FPS),覆盖来自前视、顶视及夹爪视角的多模态视觉信息与6维关节动作状态,为细粒度操作行为的复现与分析提供了基础。尽管规模有限,该数据集在机器人技能复现与评估流程中具有示范性价值,尤其适用于验证单任务模仿学习算法的性能,以及对末端执行器在受限空间中完成精确抓取的能力进行量化测试,体现了数据集在特定操作约束下对机器人行为建模的支撑作用。
当前挑战
该数据集所解决的领域问题聚焦于机器人精确抓取任务中行为建模的挑战:在变化极小的单一场景下,抓取小型物体要求末端执行器具备高度精准的位姿调控与力控制能力,而传统基于规则的方法难以适应物体形状与摆放状态的细微差异。构建过程中亦面临多重技术挑战:首先,高质量示教数据的采集依赖昂贵且精密的遥操作设备,单条轨迹的采集成本高且可复现性受操作人员熟练度影响;其次,多视角视频(AV1编码)与高维动作空间(6自由度关节位置)的同步记录对存储与处理效率提出较高要求;此外,单条轨迹的有限样本量限制了模型的泛化能力,需借助数据增强或迁移学习策略来缓解小样本下的过拟合问题,从而提升技能迁移的鲁棒性。
常用场景
经典使用场景
在机器人操作研究领域,精准抓取小型目标物体始终是一项极具挑战性的任务,尤其是在非结构化环境中。该数据集聚焦于单一变体场景下抓取小型盒子的操作任务,通过LeRobot框架采集了包含2524帧的高频时序数据(30fps),涵盖6维关节动作指令、状态信息以及来自前视、顶部和夹爪三个视角的同步视频流。其经典使用场景在于为模仿学习算法提供细粒度的专家演示,例如训练基于行为克隆或扩散策略的模型,使机器人学会从视觉输入到关节动作的端到端映射,从而复现稳定的抓取轨迹。
实际应用
在真实工业与物流场景中,该数据集所代表的精准抓取能力具有直接的转化价值。例如,它可用于开发自动化分拣系统中的轻量级夹爪控制器,使机械臂能够从传送带上稳定拾取易碎或尺寸不一的小型包装盒。结合LeRobot提供的可视化与验证工具链,工程师可快速部署基于此数据集训练的模型至实际产线,减少人工示教成本,同时提升批量作业中的位姿适应能力与操作一致性。
衍生相关工作
围绕该数据集的结构化特性,学术界已衍生出若干代表性工作。一方面,研究者利用其多视角视频流提出了跨视角特征对齐的预训练策略,显著提升了零样本迁移至新物体的成功率;另一方面,基于其关节空间与动作空间的低维表示,诞生了融合阻抗控制的残差学习框架。此外,该数据集的稀疏拍摄模式(单集演示)还催生了面向数据高效模仿学习的噪声注入与轨迹增强方法,为极端稀缺演示场景下的机器人技能获取开辟了新路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务