遇见数据集

directional_pick_place_simpledesk_diverse_targets_tested40_200demos_20260716_molmobot

收藏
Hugging Face2026-07-20 更新2026-07-21 收录
官方服务:

资源简介:

Directional SimpleDesk Pick-and-Place Diverse Targets (MolmoBot) 是一个机器人模仿学习数据集,专注于桌面物体方向性拾放任务。该数据集包含200个由脚本策略生成的成功演示轨迹,这些轨迹从原始的MolmoSpaces输出转换为MolmoBot/Synthmanip训练格式。核心任务是根据自然语言指令(例如“拿起木杯并将其放在蓝色纸巾盒的左侧”)拾取一个桌面物体,然后从机器人视角将其放置到第二个物体的左侧或右侧。数据集在方向指令上保持平衡:包含100个“左侧”指令演示和100个“右侧”指令演示。这些演示来源于40个固定的初始场景布局(每个方向20个),每个布局提供5个成功演示。拾取物体和参考物体的角色独立变化。数据集包含5类拾取物体(杯、马克杯、纸巾盒、土豆、喷雾瓶)和15类参考物体,确保了目标物体的多样性。每个场景包含拾取物体、参考物体以及另外两个桌面物体,所有场景均使用相同的SimpleDesk环境(编号1088),但物体的身份、角色和位姿各不相同。数据以HDF5轨迹文件和MP4视频文件的形式提供,包含两个摄像头的流数据(腕部摄像头和肩部摄像头)。数据集已划分为训练集(36个布局,180个轨迹,360个视频)和验证集(4个布局,20个轨迹,40个视频),划分基于场景布局以确保独立性。数据已针对MolmoBot的`SynthmanipDataset`加载器进行预处理,并提供了基于训练集计算的归一化统计信息(动作使用分位数归一化,机器人状态使用最小-最大归一化)。该数据集适用于机器人模仿学习、视觉运动策略学习等方向的研究和开发。需要注意的是,数据集规模较小,仅包含成功轨迹,且所有演示共享40个初始布局,因此不能代表任务的全部失败分布或广泛的泛化能力。

Directional SimpleDesk Pick-and-Place Diverse Targets (MolmoBot) is a robot imitation learning dataset focusing on directional pick-and-place tasks for desktop objects. It contains 200 successful demonstration trajectories generated by scripted policies, converted from the original MolmoSpaces output to the MolmoBot/Synthmanip training format. The core task is to pick up a desktop object based on natural language instructions (e.g., Pick up the wooden cup and place it to the left of the blue tissue box) and then place it to the left or right of a second object from the robots perspective. The dataset is balanced in directional instructions: it includes 100 left instruction demonstrations and 100 right instruction demonstrations. These demonstrations originate from 40 fixed initial scene layouts (20 per direction), each providing 5 successful demonstrations. The roles of the pick-up object and reference object vary independently. The dataset includes 5 categories of pick-up objects (cup, mug, tissue box, potato, spray bottle) and 15 categories of reference objects, ensuring diversity in target objects. Each scene contains a pick-up object, a reference object, and two additional desktop objects. All scenes use the same SimpleDesk environment (ID 1088), but the identities, roles, and poses of objects differ. Data is provided in HDF5 trajectory files and MP4 video files, including stream data from two cameras (wrist camera and shoulder camera). The dataset is divided into a training set (36 layouts, 180 trajectories, 360 videos) and a validation set (4 layouts, 20 trajectories, 40 videos), with the division based on scene layouts to ensure independence. The data has been preprocessed for MolmoBots `SynthmanipDataset` loader, and normalization statistics computed from the training set are provided (action uses quantile normalization, robot state uses min-max normalization). This dataset is suitable for research and development in robot imitation learning, visuomotor policy learning, and related areas. It should be noted that the dataset is small in scale, contains only successful trajectories, and all demonstrations share 40 initial layouts, so it does not represent the full distribution of failures or broad generalization capabilities.

创建时间:
2026-07-17
原始信息汇总

数据集概述:Directional SimpleDesk Pick-and-Place Diverse Targets (MolmoBot)

基本信息

  • 数据集名称:Directional SimpleDesk Pick-and-Place Diverse Targets
  • 机器人平台:Franka(通过MolmoBot/Synthmanip训练格式)
  • 任务类型:桌面拾取与放置(Pick-and-Place)
  • 指令形式:例如“Pick up the wooden cup and place it to the left of the blue tissue box”
  • 方向平衡:100条“left”演示 + 100条“right”演示

数据集规模与划分

划分 Benchmark配置 HDF5轨迹 MP4视频
train 36 180 360
val 4 20 40
总计 40 200 400
  • 验证集划分按场景安全隔离:最后4个场景(10%)保留为验证集,同一场景的所有演示不跨划分。
  • 每个场景包含5条成功轨迹,存储在house_*目录下。
  • 每个轨迹包含两个摄像头视角的视频文件:wrist_camera_zed_minidroid_shoulder_light_randomization

任务成功标准

严格成功(strict_success) 需同时满足:

  1. 拾取物体与参考物体之间的XY轴对齐表面间隙在0到0.06米之间(配置最大0.05米,容差0.01米)。
  2. 两个物体由同一表面支撑。
  3. 参考物体从初始位姿移动不超过0.15米,旋转不超过60度。
  4. 拾取物体位于请求的左或右90度角扇区(以机器人参考桌面坐标系为准)。

宽松成功(lax_success) 仅需满足条件1-3,不要求方向条件。所有200条保留轨迹均以严格成功结束。

物体多样性

  • 拾取物体类别(5类):Cup(11)、Mug(10)、TissueBox(7)、Potato(6)、SprayBottle(6)
  • 参考物体类别(15类):Bowl、Box、Calculator、Candle、Cup、DishSponge、Egg、Mug、PaperTowel、Potato、RemoteControl、SoapBottle、SprayBottle、TissueBox、Tomato
  • 每个场景包含拾取物体、参考物体以及两个额外的桌面物体。
  • 所有场景使用同一个SimpleDesk房屋(1088),但物体身份、角色和位姿各异。

数据采集

  • 来源基准筛选:使用脚本化策略pick_and_place_relative_next_to_search进行筛选,每个场景在5次尝试中至少获得1次严格成功。
  • 数据采集:每个场景要求5次严格成功,共200次成功轨迹(来自210次尝试,使用500步步长)。

数据格式与布局

dataset_manifest.json directional_pick_place_simpledesk_diverse_targets_tested40_200demos_20260716_norm_stats.yaml train/ house_/ valid_trajectory_index.json val/ house_/ valid_trajectory_index.json

  • 数据已转换为MolmoBot SynthmanipDataset 加载器兼容格式。
  • 归一化:使用franka_joint动作预设和franka_droid摄像头预设,动作采用分位数归一化,状态采用最小-最大归一化。
  • 数据维度:动作和机器人状态均为8维;动作块形状为[16, 8],每样本包含4张图像(每个摄像头2个观测帧)。

验证与完整性

  • MolmoSpaces原生验证:零无效轨迹。
  • 转换后验证:所有400个引用的摄像头视频文件均已解析并复制,无缺失文件。
  • 训练集和验证集均通过了真实的SynthmanipDataset加载测试。
  • 最终发布包含200个HDF5文件和400个MP4文件。

来源与可复现性

  • 源基准路径:MolmoSpaces仓库中FrankaPickAndPlaceRelativeNextToSimpleDeskDiverseTargetsTested40Bench
  • 哈希值
    • benchmark.json SHA-256: 23511589a1c58c7d3ce27d841a93900ac502a71c68daeca91682ffc6a44e12b9
    • 完整leaf基准 SHA-256: 83544065ae11b2c3f46f7463614c6052676621e4334bbb9bc8639d35647fc199
  • 转换与上传:通过MolmoBot脚本convert_molmospaces_to_molmobot.py完成,命令与选项详见源运行记录。

限制与注意事项

  • 数据集规模较小,来自40个固定场景,仅使用一个SimpleDesk房屋,不具备广泛家庭场景泛化能力。
  • 每个场景有5个共享初始排列的演示,不应将200个轨迹误认为200个独立布局。
  • 仅包含成功的脚本化演示,不反映任务或规划器的完整失败分布。
  • 物体覆盖多样但不均匀,行为受脚本化规划器抓取和运动偏好影响。
  • 仅包含“left”和“right”方向,缺少“in front of”和“behind”。
  • 未声明独立许可证,场景依赖MolmoSpaces、ProcTHOR、Objaverse及其关联资产,用户需自行遵守相关软件和资产使用条款。
搜集汇总
数据集介绍
directional_pick_place_simpledesk_diverse_targets_tested40_200demos_20260716_molmobot 数据集图片
构建方式
本数据集源自MolmoSpaces原生格式的自动化脚本演示,经由MolmoBot/Synthmanip训练布局转换而成。任务设定为从机器人视角抓取桌面物体,并将其放置于另一参考物体的左侧或右侧。数据集共包含200条成功轨迹,按方向均衡划分:100条对应“left”指令,100条对应“right”指令。覆盖40种固定的初始空间排布,每种排布采集5次成功演示,抓取物与参考物的角色独立变化,碗并非固定目标。数据采集前,通过脚本化策略对每种排布进行筛选,确保至少一次严格成功后才纳入正式收集。最终从210次尝试中获取200次严格成功的轨迹,每次尝试的步长上限为500步。
特点
该数据集在任务成功判定上采用严苛的多维标准:不仅要求抓取物与参考物在XY平面上的表面间隙位于0至0.06米之间,且两物体需由同一表面支撑,参考物的位移与旋转需在限定范围内,更关键的是抓取物必须落在以机器人桌面坐标系为参照的指定90度扇形区域内(左或右)。宽松成功信号仅记录前三项条件,因此轨迹可能满足邻近放置却不符方向指令。数据集中所有保留轨迹均以严格成功为结局,保障了方向性指令的纯正性。物体类别覆盖广泛,抓取物包含5类,参考物涵盖15类,但场景仅基于单一SimpleDesk房屋,排布数量有限。
使用方法
数据集已适配MolmoBot的SynthmanipDataset加载器,提供dataset_manifest.json和归一化统计文件。用户可通过Hugging Face CLI下载至本地目录,训练时指向根目录并采用转换时使用的franka_joint动作预设与franka_droid相机预设。HDF5文件存储了关节与末端执行器动作、机器人观测、相机标定、物体与机器人状态、严格与宽松成功信号及MuJoCo完整状态信息。每个排布目录下包含5个HDF5文件和10个MP4视频(每轨迹两视角各一个)。训练集含36种排布共180条轨迹,验证集含4种排布20条轨迹。数据分割按排布整体划分,确保同排布的尝试不跨集,验证集为最后10%的排布。验证环节确认零无效轨迹,所有视频文件完整可解析。
背景与挑战
背景概述
在机器人学习领域,模仿学习作为一种从人类或脚本演示中获取技能的有效范式,近年来在精细操作任务中取得了显著进展。然而,模型对空间关系指令的理解与执行仍是核心挑战之一,尤其是在以物体相对位置为条件的拾放任务中。由ccwatson团队于2026年7月创建的directional_pick_place_simpledesk_diverse_targets_tested40_200demos_20260716_molmobot数据集,专注于解决机器人从自身视角出发,依据“向左”或“向右”的方向性语言指令,将拾取物体放置于参考物体指定侧的任务。该数据集基于MolmoSpaces和MolmoBot框架,包含200条从Franka机器人脚本策略转化的成功轨迹,覆盖40种初始布局,物体种类涵盖杯子、马克杯、纸巾盒等,确保了场景的多样性。该数据集通过严格的方向性成功条件定义,为评估和提升机器人对空间语言指令的泛化能力提供了标准化基准,推动了具身智能在语义化操作任务中的研究。
当前挑战
该数据集所应对的领域核心挑战在于,机器人需准确理解并执行基于物体相对空间关系的方向性指令,而非简单的“邻近”放置——这要求模型能够区分左右语义并精确控制末端执行器的放置区域。数据集构建过程中面临多重挑战:首先,需设计40种不同物体身份与角色的初始布局,确保场景多样性,同时通过脚本策略在至多500步内筛选出严格满足方向性成功条件的轨迹。其次,构建过程需平衡轨迹数量与布局独立性,避免因共享初始布局导致的数据伪重复。此外,还需处理物体姿态偏移、多视角相机融合、以及严格与宽松成功信号的记录,以保证数据质量。最终,通过原子化保存的MuJoCo状态,数据集支持重放与再渲染,为后续算法在方向性操作中的泛化与鲁棒性研究奠定了数据基础。
常用场景
经典使用场景
在机器人模仿学习领域,该数据集为训练机械臂执行空间关系导向的抓取与放置任务提供了精细化基准。其核心设计在于引导机器人根据自然语言指令,如‘将木质杯子放置在蓝色纸巾盒左侧’,完成基于物体相对位置的定向操作。数据集包含200条由脚本化策略生成的成功演示轨迹,涵盖40种不同的初始场景布局,每种布局对应五种不同的抓取与参考物体角色组合,并均衡覆盖‘左侧’与‘右侧’两种方向指令。这一结构使得研究者能够系统性地评估模型对空间语义理解的泛化能力。
衍生相关工作
该数据集衍生了一系列聚焦于空间关系理解与模仿学习融合的经典工作。研究者基于其方向性标注与多样化物体组合,开发了联合语言-视觉-动作的Transformer模型,用于解析相对方位指令并生成机器人操作序列。此外,数据集的双成功指标机制催生了对比学习框架,用于区分‘非定向接近’与‘定向放置’行为;其基准任务也被扩展至多方向(如前/后)设置,推动了从单一方向偏好向全方位空间推理的学术探索。这些工作共同强化了机器人通过少量示范泛化至新场景与物体类别的能力。
数据集最近研究
最新研究方向
该数据集聚焦于机器人灵巧操作中的空间语义理解与模仿学习前沿,通过200条成功演示,系统收集了Franka机械臂在桌面场景中根据自然语言指令(如“将木杯放到蓝色纸巾盒左侧”)完成定向拾放任务的轨迹数据。研究突破了传统“放置到旁边”的非方向性基准,首次引入了基于机器人视角的左右定向约束,并严格定义了成功条件(包括方位角切片、物体位移与旋转容差)。该工作与MolmoBot、Synthmanip等具身智能框架深度集成,采用双视角视觉(腕部ZED Mini与肩部Droid相机)和8维动作空间,为大规模模仿学习提供了高质量的标准化训练与验证集。其意义在于推动了机器人理解空间关系方向性指令的能力,为家庭服务机器人从简单抓取迈向精细操作铺平了道路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务