遇见数据集

SP_Referential_Disambiguation_200

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

该数据集是一个用于机器人学习任务的多模态时序数据集,使用LeRobot框架创建。它包含180个episodes(总计88,939帧),涵盖4个不同任务。每个数据样本包括机器人的动作指令和来自多个传感器的观测信息:动作部分是一个6维浮点向量,对应机器人肩部平移、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转和夹爪的位置控制;观测部分包括一个同维度的浮点状态观测向量(反映关节位置),以及来自五个固定视角(腕部、中部、上方、右侧、左侧)的RGB视频流,视频分辨率为640x480,帧率为30 fps,采用AV1编码。此外,每个样本还附带有时间戳、帧索引、episode索引、任务索引等元数据。数据集采用Apache-2.0许可证,所有数据均标记为训练集,适用于机器人模仿学习、视觉运动策略学习、多视角感知与控制等研究领域。

This dataset is a multimodal time-series dataset for robot learning tasks, created using the LeRobot framework. It contains 180 episodes (totaling 88,939 frames) covering 4 different tasks. Each data sample includes robot action commands and observations from multiple sensors: the action part is a 6-dimensional floating-point vector corresponding to position control for robot shoulder translation, shoulder lift, elbow bend, wrist bend, wrist rotation, and gripper; the observation part includes a floating-point state observation vector of the same dimension (reflecting joint positions), and RGB video streams from five fixed perspectives (wrist, middle, top, right, left), with each video having a resolution of 640x480, a frame rate of 30 fps, and AV1 encoding. Additionally, each sample comes with metadata such as timestamps, frame indices, episode indices, and task indices. The dataset uses the Apache-2.0 license, all data is labeled as training set, and it is suitable for research areas like robot imitation learning, visual-motor policy learning, and multi-view perception and control.

创建时间:
2026-07-23
原始信息汇总

数据集概况

  • 名称: SP_Referential_Disambiguation_200
  • 许可证: Apache-2.0
  • 任务类别: 机器人学 (Robotics)
  • 标签: LeRobot
  • 创建工具: 基于 LeRobot 创建

数据集结构

  • 数据格式: Parquet 文件,位于 data/*/*.parquet
  • 视频编码: AV1,分辨率 480×640,帧率 30 FPS
  • 帧率 (FPS): 30

特征 (Features)

特征名称 数据类型 形状 描述
action float32 [6] 机器人关节动作:shoulder_pan.pos, shoulder_lift.pos, elbow_flex.pos, wrist_flex.pos, wrist_roll.pos, gripper.pos
observation.state float32 [6] 机器人关节状态(同上)
observation.images.wrist video [480, 640, 3] 腕部摄像头图像
observation.images.middle video [480, 640, 3] 中间摄像头图像
observation.images.above video [480, 640, 3] 上方摄像头图像
observation.images.right video [480, 640, 3] 右侧摄像头图像
observation.images.left video [480, 640, 3] 左侧摄像头图像
timestamp float32 [1] 时间戳
frame_index int64 [1] 帧索引
episode_index int64 [1] 回合索引
index int64 [1] 全局索引
task_index int64 [1] 任务索引

数据集规模

  • 总回合数: 180
  • 总帧数: 88,939
  • 总任务数: 4
  • 数据文件大小: 约 100 MB
  • 视频文件大小: 约 200 MB

划分

  • 训练集: 0 至 179 回合(共 180 回合)

机器人类型

  • 机器人型号: so_follower

引用

  • 论文: 暂无信息
  • 引用格式: 暂缺 BibTeX 条目
搜集汇总
数据集介绍
SP_Referential_Disambiguation_200 数据集图片
构建方式
SP_Referential_Disambiguation_200数据集基于LeRobot框架构建,专注于机器人操作中的指代消歧任务。数据通过操控so_follower型机器人采集,包含180个完整片段,总计88939帧,涵盖4种不同任务。每个片段记录了6维连续动作指令(如关节位置、夹爪开合)与状态观测,并同步采集了五个视角(手腕、中间、上方、右侧、左侧)的高清视频流(640×480分辨率,30帧/秒)。数据以Parquet格式存储结构化信息,视频采用AV1编码压缩,整体规模约300MB(含视频)。数据集按单一训练集划分,无验证或测试集,便于端到端模仿学习研究。
特点
该数据集的核心特色在于多模态融合与指代消歧的复杂性。它提供了动作、状态与多视角视觉观测的同步记录,支持从视觉输入直接映射到低层控制信号。五个固定摄像头从不同空间方位捕捉环境,为机器人理解物体指代关系提供了丰富上下文。数据涵盖了4种不同任务场景,有助于评估模型在变化情境下的泛化能力。此外,所有数据按1000帧分块存储,便于分布式加载,且视频与结构化数据分离管理,兼顾了读取效率与存储灵活性。
使用方法
该数据集可通过HuggingFace的LeRobot库便捷加载。用户需安装lerobot库,并调用`load_dataset`函数指定数据集名称,即可获取多模态数据流。加载后,数据以字典形式呈现,包含`action`、`observation.state`及各视角的`observation.images`字段,每帧附带时间戳与片段索引。推荐用于模仿学习或离线强化学习训练,通过LeRobot的`push_to_hub`接口可进一步扩展或上传自定义模型。数据已预处理为统一格式,无需额外清洗,直接支持PyTorch或TensorFlow流水线。
背景与挑战
背景概述
在机器人学习领域,如何使机械臂在复杂环境中精准理解并执行基于自然语言或视觉的指代消解任务,是迈向通用智能操作的关键瓶颈。SP_Referential_Disambiguation_200数据集由研究者justintiensmith基于LeRobot框架构建,发布于开源社区,旨在解决机器人操作中的指代歧义问题。该数据集以Sawyer机器人平台上的柔顺跟随(so_follower)模式,采集了180个示范片段,涵盖4种不同任务,总帧数达88939帧。通过多视角视觉观测(包括腕部、中部、上方、左右共5个摄像头)与6维关节状态数据的协同记录,为研究机器人从多模态信息中正确识别目标物体与操作意图提供了标准化的训练与评估基准,对推动具身智能中语义理解与动作规划的融合具有重要参考价值。
当前挑战
该数据集所解决的领域核心问题在于机器人指代消歧——即在多目标、多视角的物理环境中,机器人需从连续的高维视觉与状态数据流中,精确辨别当前操作指令所指向的实体。这一任务面临双重挑战:一方面,真实场景中物体外观相似、背景杂乱、视角变化剧烈,使得视觉特征与语言描述的映射存在严重歧义;另一方面,构建过程中需同步采集5路高清视频(480×640分辨率)与6维关节动作序列,数据同步精度要求严苛,且180个片段仅包含4类任务,样本多样性有限。此外,多模态数据的高频采样(30 FPS)与编码存储(AV1格式)对计算资源与存储开销提出了显著要求,扩大了数据高效利用的难度。
常用场景
经典使用场景
SP_Referential_Disambiguation_200数据集专为机器人操作中的指代消歧任务而设计,经典用途在于训练机械臂在多视角视觉输入下,精准理解语言指令所指代的目标物体或空间位置。该数据集通过同步采集手腕、中部、上方、左右共五路摄像头的高清视频流,结合机器人关节状态与动作序列,为模仿学习与行为克隆范式提供了丰富的多模态训练素材。研究人员通常利用此数据集来验证模型在复杂视觉场景中解析歧义性指令的能力,从而推动人机交互中自然语言理解与物理操作的无缝衔接。
实际应用
在实际应用中,该数据集可用于开发具备强健指代理解能力的家庭服务机器人或工业协作机械臂。例如,在家庭场景中,机器人可基于该数据训练模型,当用户说“把那个红色杯子递给我”时,即使桌面上存在多个杯子,也能通过摄像头融合观察与历史经验正确定位目标。在精密装配线上,机器人能够依据模糊指令(如“拧紧右侧的螺丝”)自主辨识操作对象,减少人工示教成本。此外,该数据还可用于增强远程操控系统的辅助决策模块,提升操作员与机器人之间交互的自然度与效率。
衍生相关工作
此数据集衍生了多项具有影响力的研究工作,包括基于视觉-语言预训练的指代消歧模型、多视角特征融合的模仿学习框架以及时空注意力机制的物体跟踪方法。研究者以其为基准,开发了如‘ReferTron’这类专门处理机器人场景下不明确语言指令的神经网络架构。同时,该数据集促进了‘LeRobot’生态中数据标准化与评估协议的发展,后续出现的‘MultiView-Policy’和‘Disambig-Net’等模型均直接引用该数据集作为核心训练与评估来源,极大地推进了机器人指代理解领域从实验室环境向真实世界的迁移能力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务