遇见数据集

visual_masked_distracting_metaworld_sam

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

该数据集是 Visual Masked Distracting Meta-World 的变体,包含由专家策略生成的 Meta-World 操作轨迹,并渲染了动态视频背景干扰。每个时间步提供 128×128 的 RGB 图像(无干扰帧和带有 DAVIS 视频背景的干扰帧)、ground-truth 代理和操作对象分割掩码(二值图,0/255)、以及由 Segment Anything Model (SAM) 预测的对应掩码。此外,还包含操作对象的世界坐标系姿态(7维:位置+四元数)、完整环境状态向量(39维)、专家动作(4维:dx, dy, dz, gripper)、奖励值以及终止/截断标志。数据集被组织为 6 个 Meta-World 任务配置:push-v3、sweep-into-v3、door-open-v3、handle-pull-v3、pick-place-v3、peg-insert-side-v3。每个任务提供 1,000,000 步训练集和 100,000 步测试集。该数据集旨在支持机器人操作中的对象感知学习,特别是在视觉干扰下,通过掩码区分代理、操作对象和背景,可用于训练和评估世界模型、潜在动作模型(如 IM-LAM 和 Foreground-MaskLAM),以及研究分割质量对模型鲁棒性的影响。数据集的 ground-truth 掩码来自 MuJoCo 模拟器分割渲染,预测掩码来自 SAM,背景帧来自 DAVIS 数据集。数据集采用 CC BY 4.0 许可证,但干扰帧部分受 DAVIS 研究使用限制。

This dataset is a variant of Visual Masked Distracting Meta-World, containing Meta-World manipulation trajectories generated by expert policies with dynamic video background distractions. Each timestep provides 128×128 RGB images (both non-distracting frames and distracting frames with DAVIS video backgrounds), ground-truth segmentation masks for the agent and manipulated objects (binary images with values 0/255), and corresponding masks predicted by the Segment Anything Model (SAM). Additionally, it includes the 7-DoF world-coordinate pose (position + quaternion) of the manipulated object, the full 39-dimensional environment state vector, 4-dimensional expert actions (dx, dy, dz, gripper), reward values, and termination/truncation flags. The dataset is organized into 6 Meta-World task configurations: push-v3, sweep-into-v3, door-open-v3, handle-pull-v3, pick-place-v3, and peg-insert-side-v3. Each task provides 1,000,000 steps for training and 100,000 steps for testing. The dataset is designed to support object-aware learning in robotic manipulation, especially under visual distractions, where masks help distinguish the agent, manipulated objects, and background. It can be used for training and evaluating world models, latent action models (e.g., IM-LAM and Foreground-MaskLAM), and studying the impact of segmentation quality on model robustness. The ground-truth masks are rendered via MuJoCos segmentation rendering, predicted masks come from SAM, and background frames are from the DAVIS dataset. The dataset is licensed under CC BY 4.0, with the distracting frames subject to DAVIS research use restrictions.

创建时间:
2026-08-29
原始信息汇总

数据集概述

Visual Masked Distracting Meta-World (ground-truth + SAM masks) 是一个用于机器人操作研究的视觉数据集,由 Georgios Tsakoumakis 制作,相关论文为 Interaction-Masked Latent Action Models for Object-Aware Manipulation under Visual Distractors(伦敦帝国理工学院硕士论文)。数据集旨在为模仿学习、潜在动作模型和世界模型研究提供带有动态视频背景干扰的专家操作轨迹,并同时提供仿真器的精确分割掩码和 SAM 模型预测的分割掩码。


核心特点

  • 动态干扰背景:场景背景为 DAVIS 视频片段,可模拟任务无关的动态视觉干扰。
  • 双重掩码来源:每个时间步同时提供 ground-truth(仿真器精确分割)SAM 预测分割,便于分析模型对分割质量的鲁棒性。
  • 对象级信息:包含被操作对象的位姿(位置 + 四元数方向)。
  • 规范化格式:数据遵循 (o_t, a_t, r_t, term_t, trunc_t) 标准时间步结构,便于时序建模。

数据字段说明

每个示例为单时间步(t),字段详情如下:

字段 类型 形状/数据类型 描述
observation 图像 128x128 RGB 无干扰背景的原始帧。
observation_distracted 图像 128x128 RGB 叠加 DAVIS 视频背景的帧,用于干扰变体训练。
mask 图像 128x128 L (0/255) Ground-truth 智能体(机器人)分割掩码(255=机器人)。
object_mask 图像 128x128 L (0/255) Ground-truth 被操作对象分割掩码(255=对象)。
pred_mask 图像 128x128 L (0/255) SAM 预测的智能体分割掩码。
pred_object_mask 图像 128x128 L (0/255) SAM 预测的被操作对象分割掩码。
object_state list[float] 7 被操作对象在世界坐标系中的位姿 [x, y, z, qw, qx, qy, qz]
state list[float] 39 完整环境/本体感知状态向量。
action list[float] 4 专家动作 [dx, dy, dz, gripper]
reward float 标量 时间步 t 的奖励值。
terminated bool 标量 时间步 t 是否终止。
truncated bool 标量 时间步 t 是否截断。

任务配置(Configurations)

数据集按 Meta-World 任务划分为多个 HuggingFace builder 配置。加载时需使用下述配置名称(不加前缀)。可用任务如下:

  • push-v3
  • sweep-into-v3
  • door-open-v3
  • handle-pull-v3
  • pick-place-v3
  • peg-insert-side-v3

数据划分(Splits)

每个任务配置均提供以下划分:

划分 时间步数
train 1,000,000
test 100,000

掩码的生成方式

  • Ground-truth 掩码mask, object_mask):源自 MuJoCo 分段渲染,以与 RGB 帧相同的相机位姿按几何体 ID 生成二值掩码。
  • SAM 预测掩码pred_mask, pred_object_mask):在帧上运行 Segment Anything Model 并提取智能体及被操作对象区域。可能含有分割误差,用于研究对不完美掩码的鲁棒性。

使用与实现

标准加载方式见下方 Python 代码示例。该数据集支持仅加载部分列以节省内存。用户可据实验需求选择:

  • 使用 ground-truth 掩码:["observation_distracted", "mask", "object_mask", ...]
  • 使用 SAM 预测掩码:["observation_distracted", "pred_mask", "pred_object_mask", ...]

python from datasets import load_dataset

ds = load_dataset( "tsakman23/visual_masked_distracting_metaworld_sam", name="handle-pull-v3", # 任务配置名 split="train", )

ex = ds[0] ex["observation_distracted"] # PIL.Image, 128x128 RGB(带干扰帧) ex["mask"] # PIL.Image, 128x128 L, ground-truth 智能体掩码 = 255 ex["object_mask"] # PIL.Image, 128x128 L, ground-truth 对象掩码 = 255 ex["pred_mask"] # PIL.Image, 128x128 L, SAM 预测智能体掩码 ex["pred_object_mask"] # PIL.Image, 128x128 L, SAM 预测对象掩码 ex["object_state"] # [x, y, z, qw, qx, qy, qz] ex["state"] # 39 维状态向量 ex["action"] # [dx, dy, dz, gripper]

训练时通常使用 observation_distracted 作为观测量,并移除纯净的 observation 字段。


许可与引用

  • 许可证:CC BY 4.0,但其中 observation_distracted 帧包含 DAVIS 视频内容,该部分受 DAVIS 研究用途许可限制,商业使用或再分发需审阅 DAVIS 许可。
  • 归属
    • Meta-World(MIT License)
    • DAVIS 视频背景(非商业研究使用)
    • Segment Anything Model(SAM)
  • 引用格式

bibtex @mastersthesis{tsakoumakis2026imlam, title = {Interaction-Masked Latent Action Models for Object-Aware Manipulation under Visual Distractors}, author = {Tsakoumakis, Georgios}, school = {Imperial College London}, year = {2026}, type = {{MSc} thesis} }

搜集汇总
数据集介绍
visual_masked_distracting_metaworld_sam 数据集图片
构建方式
该数据集源于对Meta-World仿真环境中专家操作轨迹的深度加工,旨在为视觉干扰条件下的机器人操作研究提供支撑。其构建过程融合了多模态信息采集与处理技术:首先,通过MuJoCo物理引擎渲染获取无干扰的原始观察图像与真值分割掩码,涵盖智能体与操作对象;随后,将DAVIS视频片段动态合成至场景背景,生成带有视觉干扰的观察图像;进一步,运用Segment Anything Model对干扰帧进行实例分割,产出预测掩码。此外,数据集同步记录了操作对象的位姿、完整状态向量、动作指令等细粒度数据,并以时间步为单位存储,形成结构化的轨迹数据流。
特点
该数据集的一个显著特征在于其同时提供精确仿真掩码与SAM预测掩码的双重标注体系,为研究分割质量对模型性能的影响提供了独特条件。每个样本包含128x128分辨率的多样化视觉信息,涵盖原始帧、干扰帧及四类掩码图像,丰富了数据维度。数据覆盖六个典型操作任务,每个任务均配有百万级训练样本与十万级测试样本,规模宏大。更值得注意的是,其动态视频背景干扰设计精准模拟了现实世界中复杂多变的视觉环境,为评估模型在干扰下的泛化能力提供了严苛基准。
使用方法
数据集通过HuggingFace datasets库以多配置形式分发,使用者可按需加载特定任务子集,如'push-v3'。其接口设计考量了易用性与灵活性,既能便捷地选取训练或测试划分,也支持通过columns参数筛选所需字段,以优化内存占用。在模型训练中,研究者可依据研究目标自由组合真值掩码或预测掩码作为监督信号,并以干扰帧作为主要观察输入,从而检验不同输入设定下模型的学习效果。该数据集同时兼容模仿学习、世界模型等多种机器人学习范式,尤其适用于潜动作模型与对象感知操作相关的研究方向。
背景与挑战
背景概述
在机器人学习领域,视觉干扰下的对象操作稳健性一直是研究热点,而精确的感知分割对于学习对象级动态模型至关重要。该数据集由帝国理工学院的Georgios Tsakoumakis在其硕士论文《Interaction-Masked Latent Action Models for Object-Aware Manipulation under Visual Distractors》中构建,旨在解决动态视频背景下操作任务中对象感知与干扰分离的难题。数据集基于Meta-World基准,采集了六种操作任务的专家轨迹,每个时间步包含原始观测、动态干扰背景、真值分割掩码以及由Segment Anything Model(SAM)预测的掩码,并整合了对象姿态与状态信息。该数据集不仅为潜在动作模型(如IM-LAM和Foreground-MaskLAM)提供了训练与评估的基准,还支持研究分割质量对模型鲁棒性的影响。其规模宏大,每任务含百万级训练样本,为机器人操作领域提供了宝贵的数据资源,对推动视觉干扰下的对象级操作学习具有重要影响力。
当前挑战
该数据集面临的挑战涵盖多个层面。从领域问题看,视觉干扰下的对象操作要求模型能从高维像素中提取与任务相关的对象信息,而动态视频背景的融入使得像素级重建难以隔离可控内容,这加剧了对象感知与干扰分离的难度。不完美的预测分割(如SAM产生的误差)进一步考验模型的鲁棒性。从数据集构建角度,生成真值掩码需精确同步MuJoCo分割渲染与相机位姿,确保掩码与RGB帧逐像素对齐;同时,大规模数据的存储与处理需优化以管理超过48GB的字节量,且每个时间步都包含多种图像字段,增加了数据管理的复杂度。此外,许可与合规问题也不容忽视,因为干扰背景嵌入DAVIS视频内容,其非商业研究用途对本数据集的潜在商业应用构成了限制。
常用场景
经典使用场景
在机器人操作与模仿学习的研究浪潮中,视觉干扰下的控制问题始终是通往现实世界部署的关键障碍。该数据集以Meta-World的六类经典操作任务为基底,通过动态视频背景合成干扰帧,并同时提供模拟器精确分割掩码与Segment Anything Model预测掩码,为构建鲁棒的视觉表示提供了理想试验场。研究者可借此训练基于掩码的潜动作模型,将智能体与操作对象从杂驳背景中剥离,亦可系统比较真实掩码与预测掩码对模型性能的扰动,探索分割误差传播规律。其单步存储结构支持时间堆叠,便于构造序列决策样本,广泛应用于世界模型预训练、视觉预训练表征学习及干扰抑制策略评估等经典研究范式。
衍生相关工作
该数据集源于Imperial College London的硕士论文,其衍生的经典工作深刻反映了对象中心学习的前沿脉络。最具代表性的当属IM-LAM模型——一种从智能体到对象的掩码引导正向动力学模型,将预测聚焦于交互对象,显著提升干扰下的行为预测精度。另一重要贡献为Foreground-MaskLAM,通过掩码联合门控重建损失,强制解码器精细重构操作对象而非机械臂,增强了世界模型对任务相关动态的建模能力。这些工作共同推动了‘交互掩码’概念的发展,在视觉干扰控制领域开辟了新范式。该数据集亦成为后续研究分割误差鲁棒性、无监督对象发现及多任务泛化的原型载体,其CC BY 4.0许可与详尽文档促进了学术社区对对象感知操作问题的持续探索。
数据集最近研究
最新研究方向
该数据集聚焦于机器人操作领域中的视觉干扰鲁棒性研究,特别是通过引入动态视频背景干扰来模拟真实世界的复杂场景。其前沿方向是结合大规模分割模型(如SAM)与潜在动作模型,探索在干扰背景下基于目标中心的操作学习。当前热点包括利用掩码信息分离操作对象与干扰物,以提升世界模型对关键状态的预测精度,并研究精确掩码与预测掩码对模型性能的影响。该数据集的发布为评估视觉干扰下操作策略的泛化能力提供了基准,推动了面向实际部署的鲁棒机器人学习研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务