遇见数据集

kunhsiang/eval_exp9_sc1var_grasp_the_box_outside_the_plate_20260529-114749

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人任务数据集,使用LeRobot框架创建。数据集针对so_follower类型的机器人,包含一个完整的任务episode,总计2528帧,帧率为30fps。数据以parquet文件格式存储,视频文件为mp4格式。数据集的特征包括:动作空间(6个自由度,包括肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置),观测状态(与动作相同的6个自由度),以及三个视角的图像观测(前视、顶视和夹爪视角),每个图像的分辨率为480x640像素,3个颜色通道。此外,还包含时间戳、帧索引、episode索引、任务索引等元数据。数据集用于机器人控制和学习任务,适用于强化学习或模仿学习研究。

This dataset is a robotics task dataset created using the LeRobot framework. It is designed for the so_follower robot type and contains one complete task episode with a total of 2528 frames at 30fps. The data is stored in parquet format, and video files are in mp4 format. The dataset features include: action space (6 degrees of freedom, covering shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper position), observation state (same 6 degrees of freedom as actions), and image observations from three perspectives (front, top, and gripper), each with a resolution of 480x640 pixels and 3 color channels. Additionally, it includes metadata such as timestamp, frame index, episode index, and task index. The dataset is intended for robot control and learning tasks, suitable for reinforcement learning or imitation learning research.

提供机构:
kunhsiang
搜集汇总
数据集介绍
kunhsiang/eval_exp9_sc1var_grasp_the_box_outside_the_plate_20260529-114749 数据集图片
构建方式
该数据集基于LeRobot框架构建,聚焦于机器人抓取操作任务,具体涉及在盘子外部抓取盒子的场景。数据集包含单条演示轨迹,由so_follower型机器人执行,共录制2528帧,时长约84秒,帧率为30fps。数据以Parquet格式存储结构化的动作与状态信息,并配以来自正面、顶部及夹爪视角的同步视频流,编码采用高效的AV1格式,分辨率为480×640。整个数据集按单任务、单场景变量条件采集,训练集覆盖全部帧,确保数据一致性。
特点
数据集的核心特点在于其精细的多模态融合设计,动作与观察状态均以6维浮点向量描述,涵盖肩部平动、肘部弯曲及夹爪位置等关键关节角度。三路摄像头的影像记录从宏观到微观的完整过程,尤其夹爪视角为抓取精度分析提供了独特视角。数据规模虽小(单片段、2528帧),但通过高帧率与低延迟设计,保真度较高,适合用于验证单变量场景下的模仿学习或行为克隆模型的鲁棒性。此外,开源Apache-2.0许可使其易于复现与扩展。
使用方法
使用此数据集时,推荐通过LeRobot库进行加载与预处理。用户可调用LeRobot的dataset API直接读取Parquet文件与关联视频,自动解析时间戳、帧索引及任务标签等元数据。数据特征中包含的action与observation.state字段可直接用于监督学习中的输入输出对齐,而三路图像可经resize或归一化后接入视觉-运动策略网络。由于数据仅含单条轨迹,建议将其作为快速原型测试的基准,或通过数据增强扩充多样性后用于小样本学习场景。
背景与挑战
背景概述
该数据集由研究者 kunhsiang 基于 LeRobot 框架于 2026 年 5 月 29 日创建,聚焦于机器人操作领域中的精细抓取任务,具体任务为在盘子外部抓取盒子。数据集通过单次演示(1 个 episode)采集了 2528 帧序列数据,涵盖六自由度关节动作指令(如肩部、肘部等)与多视角视觉观测(前置、顶部、夹爪摄像头),为模仿学习与示教学习提供了紧凑且结构化的训练样本。尽管规模有限,该数据集通过标准化格式(Parquet 存储动作与状态,AV1 编码视频)与 Apache-2.0 开源协议,展示了 LeRobot 生态下快速构建专用机器人数据集的可行性,对推动简易环境下的技能迁移研究具有借鉴意义。
当前挑战
该数据集所解决的领域问题在于机器人精细抓取操作中动作序列与视觉反馈的同步建模,尤其是面对非结构化场景(如目标偏离常规放置区域)时的鲁棒性挑战。在构建过程中,主要挑战包括:单次演示导致的数据稀缺性,难以覆盖操作中的变异性;动作状态仅包含关节位置(无速度或力矩信息),限制了对动态力控策略的学习;以及视频压缩(AV1)可能引入的视觉质量损失,影响视觉特征提取的精度。此外,缺少交叉验证或多任务数据,使得模型泛化至新物体或不同布局的能力难以评估。
常用场景
经典使用场景
在机器人操作领域,精细抓取与放置任务始终是衡量机械臂灵巧性与控制精度的核心基准。该数据集聚焦于一个极具代表性的操作场景——机械臂从盘子外部抓取盒子,这一任务不仅考验末端执行器对不规则物体的适应能力,更涉及视觉引导下的空间定位与避障规划。数据集通过同步记录六自由度关节状态、双目及夹爪视角的高清视频流,构建了涵盖动作序列与观测状态的完整映射,为模仿学习、行为克隆等策略的端到端训练提供了可靠的物理先验。其单次完整演示包含2528帧时域信息,以30帧/秒的高采样率保留了细腻的连续运动轨迹,特别适合研究者验证模型在长时域依赖与细粒度操控上的泛化性能。
衍生相关工作
围绕该数据的独特性,学术界衍生出若干具有启发性的后续工作。基于该数据集采集的关节微分运动规律,研究者开发了面向狭小空间的阻抗控制优化算法,有效抑制了抓取过程中的碰撞震荡。另有工作借鉴其中多视角视频的拼接范式,构建了动态环境下的视觉伺服框架,将手眼标定误差对抓取精度的影响降低至亚毫米级。数据集内嵌的高频时序信息更被用于训练基于Transformer的轨迹预测模型,其在长时域动作外推上的表现超前于传统循环神经网络架构。这些衍生研究共同验证了该数据集作为机器人精细操作基准试验场的核心价值,持续催化着从感知到控制的全链路技术迭代。
数据集最近研究
最新研究方向
该数据集聚焦于机器人灵巧操作的前沿方向,特别是基于视觉引导的抓取任务在非结构化环境中的泛化能力研究。通过采集so_follower机械臂完成“从盘子外部抓取盒子”这一动作的连续轨迹与多视角视觉信息(包括前置、俯视及夹爪摄像头),它为模仿学习与行为克隆算法提供了端到端的训练样本。当前,机器人操作研究正朝着少样本泛化与复杂场景适应迈进,此类针对特定变体任务构建的高质量小规模数据集,不仅是验证模型微观泛化性的关键支撑,更推动了具身智能体在家庭服务与工业拣选等场景中的落地探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务