datagen-stack-v1-joint-5cam
收藏资源简介:
datagen-stack-v1-joint-5cam是一个自动生成的监督微调(SFT)数据集,专为stack_retrieve任务家族设计。该数据集基于cuRobo规划,并经过物理和线性时序逻辑(LTL)安全检查,已转换为LeRobot v2.1格式。它源自IDEAS-Lab-Northwestern/ManiGuard-Bench基准,包含28个基础任务,每个任务提供40个成功且LTL安全的轨迹,总计1120个episodes。数据集涵盖2,652,083帧图像,8个唯一语言任务,使用FrankaPanda机器人进行绝对关节控制。帧率为30 FPS,分辨率为256×256,图像格式为LeRobot v2.1。任务涉及机器人操作三个堆叠在目标对象上的相同对象,逐个卸载到旁边的重新堆叠堆中,以暴露底部目标对象,然后将其检索到目标区域。数据模式包括状态(8维:7个关节位置和1个夹爪状态)、动作(8维:下一个达到的关节位置和夹爪命令)和命令动作(8维:cuRobo目标关节位置和夹爪命令),并保留5个摄像头视角(opposite、left、right、left_shoulder和wrist)。数据集在CC BY 4.0许可下发布,生成的艺术品(如关节状态/动作轨迹、渲染演示视频和语言提示)归IDEAS Lab, Northwestern University所有,而底层场景和对象资产来自BEHAVIOR-1K,受其许可约束。
datagen-stack-v1-joint-5cam is an automatically generated supervised fine-tuning (SFT) dataset designed for the stack_retrieve task family. It is based on cuRobo planning, with physical and linear temporal logic (LTL) safety checks, and converted to LeRobot v2.1 format. The dataset originates from the IDEAS-Lab-Northwestern/ManiGuard-Bench benchmark, containing 28 base tasks, each providing 40 successful and LTL-safe trajectories, totaling 1,120 episodes. It includes 2,652,083 frames, 8 unique language tasks, using a FrankaPanda robot for absolute joint control. The frame rate is 30 FPS, resolution is 256×256, and image format is LeRobot v2.1. The task involves the robot manipulating three identical objects stacked on a target object, unloading them one by one into a restacking pile next to it to expose the bottom target object, then retrieving it to a target area. Data modalities include state (8-dimensional: 7 joint positions and 1 gripper state), action (8-dimensional: next achieved joint position and gripper command), and commanded action (8-dimensional: cuRobo target joint position and gripper command), with 5 camera views retained (opposite, left, right, left_shoulder, and wrist). The dataset is released under CC BY 4.0 license, with generated artifacts (e.g., joint state/action trajectories, rendered demonstration videos, and language prompts) owned by IDEAS Lab, Northwestern University, while underlying scene and object assets are from BEHAVIOR-1K, subject to its license constraints.
数据集概述
数据集名称: datagen-stack-v1-joint-5cam
许可证: CC BY 4.0
数据集标签: LeRobot, 机器人操作, 模仿学习
任务类别: 机器人
数据规模: 1000 到 10000 条样本
数据集来源与生成
- 创建者: yypeng666 (IDEAS-Lab-Northwestern)
- 源数据集: IDEAS-Lab-Northwestern/ManiGuard-Bench —— 包含全部 28 个
stack_retrieve基任务。 - 生成方式: 每个基任务包含 40 条成功且符合线性时序逻辑(LTL)安全约束的轨迹,共计 1120 个片段。
- 转换格式: LeRobot v2.1
任务描述
任务为 stack_retrieve:桌面上三个相同物体叠放在一个目标物体之上。机器人需要依次将三个顶部物体逐一取下并堆放到旁边的重堆区域(流程:抬升到安全转移高度 → 平移 → 下降 → 夹取 → 抬升 → 搬运至目标堆 → 放置),从而暴露底部的目标物体,然后抓取该目标物体(保持夹持)并将其放入目标区域。
- 每个片段的提示(prompt)来自基任务诊断文件(
meta/tasks.jsonl)。 - 演示必须到达目标状态且保持 LTL 安全(即没有掉落或倾倒已重堆的物体,目标物体保持直立);失败或不安全的尝试已被剔除。
数据组成
| 项目 | 数值 |
|---|---|
| 片段数(Episodes) | 1120(28 基任务 × 40) |
| 帧数(Frames) | 2,652,083 |
| 独特语言任务数 | 8 |
| 机器人 / 控制方式 | Franka Panda / 绝对关节控制 |
| 帧率 / 分辨率 / 格式 | 30 FPS / 256×256 / LeRobot v2.1 |
数据模式(Schema)
- 状态(
state):8 维,[arm_q(7), gripper(1)] - 动作(
actions):8 维,[arm_q[t+1](7), gripper_cmd(1)]—— 默认的 SFT 目标,表示下一步实现的动作。 - 指令动作(
actions_commanded):8 维,[curobo_target_q(7), gripper_cmd(1)]—— cuRobo 指令,作为额外字段。 - 控制方式:绝对关节控制(训练时可转换为 delta 模式)。
摄像机(共 5 个,全部保留):
- 第三方视角:
image_opposite,image_left,image_right,image_left_shoulder - 腕部视角:
wrist_image
注意事项
- 摄像机子集选择以及机械臂关节 delta 转换是训练时的选择;该数据集提供所有 5 个摄像机流和绝对关节控制数据。
- MimicGen 模拟状态重放转储未包含在此数据集中(保留在原始归档中,SFT 不需要)。
许可信息
- 数据集采用 CC BY 4.0 许可(见
LICENSE文件)。 - 生成的工件(关节状态/动作轨迹、渲染的演示视频和语言提示)版权归 2026 年 IDEAS Lab, Northwestern University 所有。
- 渲染视频中的底层场景和物体资产来自 BEHAVIOR-1K,并受其许可证约束;本数据集不重新分发这些资产。



