遇见数据集

kunhsiang/eval_exp9_sc1var_grasp_the_red_box_20260528-165157

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的机器人数据集,专门用于机器人技术研究。数据集包含一个名为so_follower的机器人执行任务时的数据,总共有1个回合和2370帧,帧率为30fps。数据以parquet文件格式存储,视频以mp4格式存储。数据集特征包括:动作(包含6个关节位置:肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)、观测状态(与动作相同的6个关节位置)、来自三个摄像头视角的图像观测(前视、顶视和夹爪视,每个图像分辨率为480x640,3通道,视频编码为av1),以及时间戳、帧索引、回合索引、索引和任务索引。数据集主要用于训练和评估机器人控制算法,特别是涉及视觉和动作数据的任务。

This dataset is a robotics dataset created using LeRobot, designed for robotics research. It contains data from a robot named so_follower performing a task, with a total of 1 episode and 2370 frames at 30fps. The data is stored in parquet files, and videos are in mp4 format. The dataset features include: action (with 6 joint positions: shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper position), observation state (same 6 joint positions as action), image observations from three camera views (front, top, and gripper, each with a resolution of 480x640, 3 channels, video codec av1), as well as timestamp, frame index, episode index, index, and task index. The dataset is primarily used for training and evaluating robot control algorithms, especially tasks involving vision and action data.

提供机构:
kunhsiang
搜集汇总
数据集介绍
kunhsiang/eval_exp9_sc1var_grasp_the_red_box_20260528-165157 数据集图片
构建方式
该数据集专为机器人操控任务设计,聚焦于抓取特定红色盒子的场景,由LeRobot框架构建而成。数据采集依托so_follower型机器人平台,通过遥操作或预设程序驱动,以30帧/秒的采样率同步记录6自由度的关节位姿指令与多视角视觉信息。数据组织方式采用分块存储策略,将2370帧完整演示分割为若干大小为1000帧的块,并分别以Parquet格式保存结构化数值数据、以AV1编码的MP4视频保留相机原始画面,确保大规模序列数据的高效存取与回放。
特点
数据集呈现出少样本、高信息密度的独特结构,仅包含单个任务与单条完整演示片段,却覆盖了2370帧连续序列,适合用于行为克隆等算法的快速原型验证。其观测空间由三路独立摄像头——前置、俯视与夹爪视角——构成,每帧均提供480×640分辨率的彩色图像,使模型能同时获取全局场景与局部操作细节。动作与状态空间均精确对应六维关节变量(含夹爪位置),且时间戳与帧索引字段完整保留,支持时序对齐与离线强化学习训练。
使用方法
使用者可借助LeRobot库提供的统一API加载数据集,通过指定配置名称'default'读取分布在data目录下的Parquet文件与各视角的视频流。在训练阶段,模型可提取'observation.state'作为输入特征,以'action'为目标进行端到端的策略学习;视觉策略则可直接引用'observation.images'字段中的三路视频帧,经编码器处理后输出关节控制指令。数据集内置的'chunks_size'参数与分块结构特别适配流式训练范式,允许按块载入内存以突破显存限制,同时'fps'属性为时域平滑后处理提供了标准化基准。
背景与挑战
背景概述
该数据集创建于2026年5月28日,由研究者kunhsiang基于LeRobot框架构建,聚焦于机器人抓取操作任务,具体为抓取红色盒子的单一场景变体(sc1var)。数据集包含一个完整操作轨迹,共计2370帧、30帧/秒的高频采样,记录了从肩部、肘部至腕部和夹爪的六自由度关节状态及前视、顶视和夹爪视角的多模态视频信息。作为面向机器人模仿学习与示教学习的小规模示例数据集,其公开在HuggingFace平台上,遵循Apache-2.0许可,旨在为机器人精细操控研究提供可复现的基准数据。尽管规模有限,该数据集体现了从仿真或真实机器人采集环境到标准化数据格式的转化流程,对推动低成本、易部署的机器人学习研究具有启发意义。
当前挑战
该数据集所解决的领域问题是机器人精细抓取操作中的模仿学习与行为克隆,尤其在单一物体、单一抓取策略的约束下,验证从状态-动作对到策略映射的可行性。当前挑战体现在两方面:首先,在领域问题层面,仅包含1个轨迹、1个任务的数据规模无法泛化至多物体、多姿态或多光照条件下的可靠抓取,对动态环境干扰的鲁棒性不足;其次,数据集构建过程中,需精准同步多视角视频与关节状态时间戳,确保动作标签与视觉观察严格对齐,同时避免硬件噪声(如夹爪滑动、关节抖动)对数据质量的污染。此外,仅依赖单一场景会导致策略过拟合,亟需引入任务变体与数据增强。
常用场景
经典使用场景
在机器人操作领域,从人类演示中学习复杂技能一直是模仿学习的核心挑战。该数据集专为单一变量场景下的精准抓取任务设计,记录了SO Follower机械臂在固定实验环境中抓取红色盒子的完整轨迹,包含2370帧高频(30 FPS)动作序列与多视角视觉观测。经典使用场景聚焦于端到端的行为克隆训练,研究者可利用前、顶部和夹爪三个视角的RGB视频流,结合6维关节空间状态与动作标签,构建从视觉输入到运动输出的映射模型。数据集的单任务、长序列特性使其特别适用于评估算法在目标明确、变化可控条件下的泛化能力。
实际应用
在产业自动化场景中,该数据集直接服务于精密装配、物流分拣及危险环境操作等任务。例如,电子元件抓取需要毫米级的末端执行器定位精度,而该数据集包含的关节位置反馈与高分辨率视觉信息,可迁移至类似几何结构的物体操作。此外,多视角视频数据对训练具有强鲁棒性的视觉伺服系统至关重要,能帮助机器人适应光照变化或部分遮挡。其轻量化结构(仅100MB数据文件)也便于嵌入式设备部署,加速了从实验室到工厂的算法落地进程。
衍生相关工作
基于此类细粒度操控数据,研究者已衍生出多项经典工作。在架构创新上,多头注意力机制被引入以融合多视角视觉特征与动作序列,形成了空间-时间Transformer模型。在数据增强方向,通过域随机化(如改变盒子颜色或背景纹理)合成虚拟训练集,显著提升了策略的跨场景迁移能力。此外,逆动力学模型的提出实现了从视觉特征到关节力矩的直接映射,省略了中间运动规划步骤。这些工作共同推动了轻量级机器人学习算法的标准化,并为LeRobot生态系统的评估体系提供了关键验证基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务