遇见数据集

kunhsiang/eval_exp9_sc2var_grasp_the_small_box_20260527-170521

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是通过LeRobot平台创建的机器人学数据集,专注于一个具体的任务:抓取小盒子。数据集包含1个完整的episode,总计2384帧数据,帧率为30fps。数据以parquet文件格式存储,并包含对应的mp4格式视频文件。数据集的特征包括:动作(action),为6维浮点数组,对应机器人肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转和夹爪的位置;状态观测(observation.state),同样为6维浮点数组,反映机器人各关节的实时位置;图像观测(observation.images),提供来自三个摄像头视角的视频数据,包括前视角(front)、顶视角(top)和夹爪视角(gripper),每个视频的分辨率为480x640,3通道彩色,编码格式为av1。此外,数据集还包含时间戳(timestamp)、帧索引(frame_index)、episode索引(episode_index)、数据索引(index)和任务索引(task_index)等元数据。数据集适用于机器人控制、模仿学习或强化学习的研究与应用。

This dataset is a robotics dataset created using the LeRobot platform, focusing on a specific task: grasping a small box. It contains 1 complete episode with a total of 2384 frames at a frame rate of 30fps. The data is stored in parquet format and includes corresponding video files in mp4 format. The dataset features include: action, a 6-dimensional float32 array corresponding to the positions of shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper; state observation (observation.state), also a 6-dimensional float32 array reflecting the real-time joint positions of the robot; image observations (observation.images), providing video data from three camera perspectives: front, top, and gripper, each with a resolution of 480x640, 3 color channels, and encoded in av1 format. Additionally, the dataset includes metadata such as timestamp, frame_index, episode_index, index, and task_index. This dataset is suitable for research and applications in robot control, imitation learning, or reinforcement learning.

提供机构:
kunhsiang
搜集汇总
数据集介绍
kunhsiang/eval_exp9_sc2var_grasp_the_small_box_20260527-170521 数据集图片
构建方式
该数据集依托LeRobot框架构建,采集自so_follower机器人平台,通过遥操作或自主策略执行“抓取小盒子”任务。全流程以30帧每秒的频率同步记录六维关节位置(包括肩部旋转、肩部升降、肘部弯曲、腕部弯曲、腕部旋转及夹爪位置)与三路视觉观测,涵盖前视、俯视及夹爪视角,分辨率均为480×640。数据经编码为AV1格式视频并以Parquet列式存储,最终以单回合、2384帧的规模封装,形成面向机器人操作学习的标准化示范数据。
特点
数据集聚焦于精细抓取操作,具有多模态同步观测的显著特征。其动作与状态空间均采用六自由度关节位置表示,与机器人本体构型严格对应;视觉模态则从三个互补视角提供环境感知,有助于学习空间几何关系。单回合的连续示范保留了完整的时间动态,视频与状态流以30Hz精确对齐,为模仿学习或强化学习提供了高保真的时序信号。数据以Apache-2.0许可开放,结构清晰,便于直接加载与复现。
使用方法
使用者可借助LeRobot工具链便捷读取该数据集。在HuggingFace平台,可通过内置可视化空间在线浏览视频与状态曲线;本地使用时,依据meta/info.json中定义的数据路径模板加载Parquet文件及对应MP4视频,解析动作、状态及图像特征。典型应用包括训练视觉运动策略、评估模仿学习算法或进行多模态表征学习。训练中可将三路视频与六维状态作为输入,关节位置作为预测目标,从而驱动机器人完成类似抓取任务。
背景与挑战
背景概述
机器人操作技能的通用化习得长期以来受制于高质量真实演示数据的稀缺,LeRobot项目应运而生。该数据集由LeRobot框架生成,收录了SO-100系列机械臂执行抓取小盒任务的单次完整演示,涵盖肩部、肘部、腕部及夹爪六自由度关节状态与动作序列,并同步采集前视、顶视及夹爪三路视觉信号,总帧数达2384帧,采样率30帧每秒。作为具身智能领域的一项开源实践,其以Apache-2.0许可证发布,为视觉-动作映射、模仿学习及策略泛化研究提供了可复用的底层数据基础,折射出社区对低成本、标准化机器人演示数据的迫切需求。
当前挑战
该数据集所面对的领域难题在于,真实环境中抓取微小盒状物体对感知精度与末端执行器控制均提出严苛要求,小目标在视觉上占比有限,易受遮挡与光照变化干扰,而接触阶段的力位混合控制稍有偏差便会导致滑脱或碰撞。构建过程中的具体挑战包括:单次演示所蕴含的样本多样性极为有限,难以支撑策略网络在多变初始位姿与物体外观下保持鲁棒;六自由度关节轨迹与多视角视频帧之间的时序对齐需保证帧级同步;抓取过程中夹爪接近阶段的细微运动特征可能因视频编码压缩而损失,从而削弱数据对精细操作的学习价值。
常用场景
经典使用场景
在机器人学习与具身智能研究领域,双臂协作与视觉伺服抓取长期占据核心地位。该数据集以SO follower机械臂为平台,依托LeRobot框架采集了包含前视、顶视与夹爪三路视觉观测以及六维关节位置与动作序列的完整示范数据,共涵盖三十帧每秒、两千余帧的连续时序信息。其最经典的使用场景在于模仿学习与视觉-动作策略的端到端训练,研究者可借助行为克隆或扩散策略等方法,从示范轨迹中习得将小型盒状物体从初始位姿稳健抓取的感知-动作映射,从而在仿真或真机环境中复现高精度抓取行为。
解决学术问题
该数据集有效回应了机器人抓取研究中若干关键学术难题:其一,多视角视觉观测与本体感知的融合如何提升抓取策略在遮挡与光照变化下的鲁棒性;其二,动作空间的连续性与时序依赖如何通过序列建模方法得到准确刻画;其三,真实机器人示范数据稀缺条件下的策略泛化与迁移。通过提供标准化的数据格式与明确的特征命名,该数据集为验证不同模仿学习算法的样本效率与泛化边界提供了可复现的基准,其意义在于推动从仿真到现实的策略迁移研究,并为具身智能中的数据驱动方法积累可比较的实证基础。
衍生相关工作
以该数据集为代表的LeRobot格式抓取示范数据,催生了一系列围绕模仿学习与机器人基础模型的衍生工作。典型方向包括基于扩散策略的轨迹生成、视觉-语言-动作模型在抓取任务上的微调、以及多视角表征学习与动作分块策略的融合。相关研究常将其作为评估基准之一,用于比较不同策略架构在真实机械臂上的成功率与泛化表现,并进一步衍生出数据增强、跨本体迁移与在线自适应等扩展性工作,逐步形成了以标准化数据集为纽带的开放研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务