遇见数据集

pick_cube_test_137eps_p1fix

收藏
Hugging Face2026-08-04 更新2026-08-05 收录
官方服务:

资源简介:

该数据集是基于 LeRobot 框架创建的机器人操作数据集,适用于机器人模仿学习等任务。数据集包含一个名为“pick_cube”(抓取立方体)的任务,共 138 个 episode,总计 67390 帧。数据特征包括:6 维动作(shoulder_pan.pos, shoulder_lift.pos, elbow_flex.pos, wrist_flex.pos, wrist_roll.pos, gripper.pos)、6 维观测状态(与动作相同)、侧视摄像头图像(480×640×3,AV1 编码视频,30fps)、腕部摄像头图像(480×640×3,AV1 编码视频,30fps)、时间戳、帧索引、回合索引、全局索引和任务索引。机器人类型为 so_follower。数据存储格式为 Parquet(动作、状态等)和 MP4(视频)。数据集按训练集划分(0:138 episode)。许可证为 Apache-2.0。

This robot manipulation dataset is developed based on the LeRobot framework, suitable for tasks such as robot imitation learning. The dataset contains a task named "pick_cube" (cube grasping), with a total of 138 episodes and 67390 frames overall. The data features include: 6-dimensional actions (shoulder_pan.pos, shoulder_lift.pos, elbow_flex.pos, wrist_flex.pos, wrist_roll.pos, gripper.pos), 6-dimensional observation states (same as the actions), side-view camera images (480×640×3, AV1-encoded videos at 30fps), wrist camera images (480×640×3, AV1-encoded videos at 30fps), timestamps, frame indices, episode indices, global indices, and task indices. The robot type is so_follower. The dataset is stored in Parquet format (for actions, states and other related data) and MP4 format (for videos). The dataset is split into a training set (0:138 episodes). The license is Apache-2.0.

创建时间:
2026-08-04
原始信息汇总

数据集概述:pick_cube_test_137eps_p1fix

基本信息

  • 任务类型:机器人(Robotics)
  • 许可证:Apache-2.0
  • 创建工具:LeRobot (https://github.com/huggingface/lerobot)
  • 数据集大小:数据文件约100 MB,视频文件约200 MB
  • 机器人类型:so_follower

数据规模

  • 总片段数(Episodes):138
  • 总帧数(Frames):67,390
  • 总任务数(Tasks):1
  • 帧率:30 FPS
  • 数据集划分:训练集(train)包含全部138个片段

数据结构

动作与状态特征

  • 动作(action)

    • 数据类型:float32
    • 维度:6维
    • 包含:shoulder_pan.pos, shoulder_lift.pos, elbow_flex.pos, wrist_flex.pos, wrist_roll.pos, gripper.pos
  • 机器人状态(observation.state)

    • 数据类型:float32
    • 维度:6维
    • 包含:与动作相同的6个关节位置信息

视觉观测

  • 侧视角相机图像(observation.images.side)

    • 类型:视频
    • 分辨率:480×640×3(高×宽×通道)
    • 编码:AV1,像素格式yuv420p,帧率30 FPS,无音频
  • 腕部相机图像(observation.images.wrist)

    • 类型:视频
    • 分辨率:480×640×3(高×宽×通道)
    • 编码:AV1,像素格式yuv420p,帧率30 FPS,无音频

其他特征

  • timestamp:时间戳(float32,1维)
  • frame_index:帧索引(int64,1维)
  • episode_index:片段索引(int64,1维)
  • index:全局索引(int64,1维)
  • task_index:任务索引(int64,1维)

数据存储格式

  • 数据文件:Parquet格式,路径为 data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频文件:MP4格式,路径为 videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
  • 分块大小:1000帧/块

引用信息

  • 暂无BibTeX引用信息(标注为[More Information Needed])

可视化工具

可通过LeRobot可视化空间在线浏览该数据集:https://huggingface.co/spaces/lerobot/visualize_dataset?path=mwhnh10/pick_cube_test_137eps_p1fix

搜集汇总
数据集介绍
pick_cube_test_137eps_p1fix 数据集图片
构建方式
该数据集基于LeRobot框架构建,专为机器人操作任务设计,聚焦于'抓取立方体'这一单一操作场景。数据采集过程中,利用双视角视觉感知系统,同步记录侧面与手腕处的RGB图像,并以30帧每秒的采样率捕获动作序列。每个样本包含6维关节角度控制指令及对应观测状态,涵盖肩部、肘部、腕部等关键自由度,数据以Parquet格式存储,配套视频文件采用AV1编码压缩,确保了数据的高效存储与快速读取。
使用方法
该数据集适用于机器人模仿学习领域的算法研发与验证。使用者可借助LeRobot库内置的数据加载与预处理流程,便捷地访问视频帧与状态-动作对,构建端到端的行为克隆或视觉运动策略模型。数据已预设为单一训练集,可在此基础上自行划分验证集与测试集,以评估模型在抓取任务上的泛化能力与鲁棒性,亦可在仿真环境中迁移测试,推动真实世界下的机器人智能化进程。
背景与挑战
背景概述
该数据集由研究者利用HuggingFace的LeRobot框架于近期创建,旨在支撑机器人操作任务的模仿学习研究。其核心聚焦于‘抓取立方体’这一基础但关键的机器人操作技能,通过采集138个演示片段,记录了SO-100系列机械臂在侧视与手腕视角下的视觉观测、关节状态及动作序列。该数据集以Apache-2.0许可发布,其结构与LeRobot生态紧密集成,为多模态机器人学习提供了标准化示例。在机器人学习领域,此类任务特定数据集对于发展稳健的视觉运动策略至关重要,有望推动机器人从感知到行动的端到端学习,并促进可复现研究。
当前挑战
构建该数据集所面临的挑战多维且严峻。领域层面,抓取操作因其对空间精度、时序协调及视觉反馈的苛刻要求,是机器人学中的经典难题,尤其需应对物体姿态多变、遮挡与光照干扰等复杂情况。构建过程中,数据采集需保证演示质量与任务一致性,涵盖精确的动作标注、多视角高帧率视频同步记录及系统状态准确追踪。此外,数据规模有限(138个片段)对策略泛化构成瓶颈,如何基于小样本实现高效学习是后续研究的关键障碍。该数据集的发布,旨在为攻克上述挑战提供基准性的数据支撑。
常用场景
经典使用场景
该数据集为机器人操作领域的模仿学习研究提供了宝贵资源,其核心使用场景聚焦于基于视觉的灵巧抓取任务。数据集中包含了从多视角(侧面与手腕)采集的高分辨率视频流,以及精确的关节状态与动作指令,使得研究者能够训练端到端的视觉运动策略。借助LeRobot框架,数据集结构清晰地划分了训练集,便于直接用于行为克隆、逆强化学习等主流算法的验证与比较,是评估机器人学习模型在精细操作任务上性能的标准基准之一。
解决学术问题
在学术研究中,该数据集针对机器人精确抓取未知物体的泛化性问题提供了系统性解决方案。通过记录大量真实的操作轨迹,它使得探索高维状态-动作空间中的映射关系成为可能,助力解决小样本学习下的策略迁移困境。同时,多模态数据(图像与本体感觉)的融合为研究多传感器信息整合机制提供了实验平台,推动了对机器人操作中感知-决策闭环的理解,为构建鲁棒的视觉伺服控制策略奠定了数据基础。
实际应用
在实际应用方面,该数据集的价值体现在加速工业自动化和服务机器人的部署进程。其采集的抓取动作数据可直接用于训练机械臂在非结构化环境中进行物体分拣、装配等任务,减少人工编程成本。此外,借助该数据集训练的模型能够适应轻量级、低成本的仿人机器人平台,促进家庭助理机器人的智能升级,使其在动态场景下实现安全、高效的物体交互,展现出从实验室研究向现实生产力转化的巨大潜力。
数据集最近研究
最新研究方向
该数据集基于LeRobot框架采集,聚焦于六自由度机械臂的抓取任务,包含138个演示回合、67,390帧的侧视与腕部视觉观测数据,用于研究机器人操作中的模仿学习与行为克隆。当前前沿研究方向包括利用此类高维视觉-运动数据训练端到端的神经策略,结合扩散策略或变换器架构以提升抓取操作的泛化性与鲁棒性。同时,该数据集也支持多模态融合、视觉-语言模型引导的操作规划研究,以及人机协同中的技能迁移与示教学习。其标准化格式与开源许可促进了可复现研究,对推动具身智能和家庭服务机器人的实际应用具有重要意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务