遇见数据集

move_clutter_camera_goal

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

该数据集基于LeRobot框架创建,专为机器人操控学习任务设计。数据包含机器人执行多任务(共5个任务)的演示数据,涵盖631个episode,总计481915帧。数据形式包括12维动作指令(如目标夹爪相机位置、锚点位置、腕部偏移、手指速度等)、20维机器人状态观测(如速度、位置、夹爪压力、激光测距仪、目标力、障碍物方位等),以及三路224x224彩色视频流(夹爪相机、锚点相机0、锚点相机1),视频编码为AV1,帧率30fps。此外,还包含时间戳、帧索引、episode索引、任务索引以及锚点姿态(12维旋转和平移)。数据文件以Parquet格式存储,视频文件以MP4格式存储。机器人类型为stringman。数据集适用于模仿学习、强化学习等机器人操控任务,如移动杂乱物体、到达目标等场景。

This dataset is created based on the LeRobot framework and is specifically designed for robot manipulation learning tasks. The data contains demonstration data of a robot performing multiple tasks (5 tasks in total), covering 631 episodes with a total of 481,915 frames. The data format includes 12-dimensional action commands (e.g., target gripper camera position, anchor position, wrist offset, finger velocity, etc.), 20-dimensional robot state observations (e.g., velocity, position, gripper pressure, laser rangefinder, target force, obstacle orientation, etc.), and three 224x224 color video streams (gripper camera, anchor camera 0, anchor camera 1) encoded in AV1 at 30fps. Additionally, it includes timestamps, frame indices, episode indices, task indices, and anchor poses (12-dimensional rotation and translation). The data files are stored in Parquet format, and video files are stored in MP4 format. The robot type is stringman. The dataset is suitable for robot manipulation tasks such as imitation learning and reinforcement learning, including moving cluttered objects, reaching targets, and other scenarios.

创建时间:
2026-08-04
原始信息汇总

数据集概述:naavox/move_clutter_camera_goal

基本信息

  • 许可证:Apache-2.0
  • 任务类别:机器人学(Robotics)
  • 创建工具:基于 LeRobot 框架(https://github.com/huggingface/lerobot)创建
  • 机器人类型:stringman
  • 数据集规模:总计 631 个片段(episodes),481,915 帧,5 个任务
  • 数据划分:训练集包含全部 631 个片段(0:631)

数据格式

  • 帧率:30 FPS
  • 数据文件:Parquet 格式,存储于 data/*/*.parquet
  • 视频文件:MP4 格式,使用 AV1 编码,分辨率 224x224,RGB 三通道
  • 文件大小:数据文件约 100MB,视频文件约 200MB

特征结构

动作(Action)

12 维浮点数组,包含:

  • 目标夹爪相机坐标(goal_gripper_cam_x/y/z)
  • 两个锚点目标坐标(goal_anchor_0_x/y/z, goal_anchor_1_x/y/z)
  • 腕部偏移(wrist_offset)、手指速度(finger_speed)及片段结束标志(episode_end)

观测状态(Observation State)

20 维浮点数组,包含:

  • 速度信息(vel_x/y/z、wrist_speed、finger_speed)
  • 夹爪位姿(gripper_pos_x/y/z、spin、finger_angle)
  • 传感器数据(激光测距仪、手指压力、腕部角度、目标力)
  • 环境目标方位(hamper_bearing/distance、toybox_bearing/distance、trashcan_bearing/distance)

观测图像(Observation Images)

三个同步视频流,均为 224x224x3:

  • gripper_camera(夹爪相机)
  • anchor_camera_0(锚点相机 0)
  • anchor_camera_1(锚点相机 1)

辅助信息

  • anchor_poses:12 维浮点数组,表示两个锚点的位姿(旋转和平移)
  • 时间戳:timestamp(float32)
  • 索引字段:frame_index、episode_index、index、task_index(均为 int64)

引用信息

该数据集的 BibTeX 引用信息暂未提供(标记为 [More Information Needed])。

搜集汇总
数据集介绍
move_clutter_camera_goal 数据集图片
构建方式
该数据集基于LeRobot框架构建,由机器人执行特定任务时采集的多模态传感数据构成。数据以parquet格式存储,并遵循统一的元数据规范,记录了机器人动作指令、观测状态及多视角视觉信息。在数据采集过程中,机器人通过夹爪相机和双锚点相机同步捕获224x224像素的RGB图像,同时以30Hz频率记录包含速度、位置、角度、力传感在内的20维状态向量。动作空间定义为12维向量,涵盖目标位置、锚点坐标、腕部偏移、手指速度等关键控制参数。数据集共包含631个完整回合,累计帧数达481,915帧,任务类型达5种,并按训练集与测试集进行了划分。
特点
数据集的核心特征在于其多维异构数据的深度融合与精细标注。每一帧数据均整合了高分辨率视觉流、低延迟状态传感及精确的动作指令,为模仿学习与强化学习提供了丰富的监督信号。特别地,双锚点相机与夹爪相机的多视角设计增强了空间感知能力,而包含力反馈、激光测距等在内的状态向量则捕捉了操作过程中的物理交互细节。此外,数据以30Hz高频率采集,确保了时间连续性,且所有样本均经过episode索引与时间戳对齐,便于时序建模。这种结构设计赋予了数据集在机器人操作任务中高度的可复现性与泛化潜力。
使用方法
使用此数据集时,研究者可依托LeRobot库加载与解析数据,并借助内置可视化工具直观查看样本内容。数据组织上,动作与观测数据以parquet文件分块存储,视频流以mp4编码独立存放,通过元数据中的路径索引实现关联。建议采用标准的数据加载API,将图像序列与状态向量对齐生成训练批次。该数据集适用于训练基于视觉的运动策略,例如通过行为克隆或逆强化学习方法,使机器人掌握在复杂环境中移动杂物并达成相机目标的任务。测试时可利用预留的评估序列验证模型泛化性能。
背景与挑战
背景概述
该数据集由LeRobot框架于近期创建,聚焦于机器人操控领域中的目标导向任务,旨在通过多摄像头视觉与状态观测数据训练机器人完成物体整理与移动操作。数据集包含631个演示回合、近48万帧视频及多模态传感器数据,涵盖了夹爪相机与双锚点相机视图,以及关节速度、位置、力反馈等20维状态信息。其核心研究问题在于探索如何利用大规模真实机器人演示数据,提升机器人在非结构化环境中执行精细操控任务的泛化能力。作为开源数据集,其采用Apache-2.0许可,为机器人学习社区提供了标准化的基准资源,推动了基于视觉的机器人操作策略的研究进展。
当前挑战
该数据集面临的挑战首先体现在任务复杂性上,即机器人需在动态且杂乱的环境中,依据多视角视觉输入精准规划并执行物体搬运与归位动作,这对感知的鲁棒性及动作的精准性提出了极高要求。其次,构建过程中面临着多传感器数据同步与校准的难题,包括不同相机视角间的空间一致性、状态与视觉信息的时间对齐,以及高帧率视频与传感器数据的庞大存储与高效处理。此外,数据集仅包含5类任务,其规模与多样性有限,可能限制模型对未见场景的泛化能力,同时,标注动作空间维度高达12维,增加了策略学习的难度,对算法的样本效率与泛化性能构成显著挑战。
常用场景
经典使用场景
该数据集作为机器人学习领域的仿真与真实世界交互数据集,核心用途在于训练和评估基于视觉的操纵策略,特别是针对杂乱环境下的目标导向抓取与放置任务。数据采集自‘stringman’机器人,包含多视角相机(夹爪相机与两个锚点相机)的高清视频流,以及高维度的状态与动作序列。研究者利用该数据集进行模仿学习、强化学习以及离线强化学习算法的基准测试,通过其丰富的多模态特征(如力觉、距离传感)和精细的动作控制信号,推动策略模型在动态、非结构化场景中的泛化能力研究。
实际应用
在实际应用中,该数据集可直接赋能服务机器人、工业分拣系统及家庭辅助设备等场景。具体而言,它可用于开发机器人对家居杂物、仓储物品的自主整理与归类能力,通过学习目标导向的移动与抓取策略,提升在动态、遮挡环境下的操作效率。数据集中包含的夹爪相机与锚点相机视角,为构建基于视觉的闭环反馈系统提供了真实范例,有助于实现机器人对目标物体空间位姿的精确追踪与调整,从而在物流、清洁及辅助照料等垂直领域实现高性价比的部署方案。
衍生相关工作
该数据集已衍生出一系列具有影响力的研究工作。基于LeRobot框架,研究者围绕该数据开发了多种视觉运动策略模型,如基于Transformer的动作分块(Action Chunking with Transformers)和扩散策略(Diffusion Policy),并探索了条件模仿学习在复杂机械臂控制中的应用。此外,该数据集推动了多传感器融合算法的创新,例如将激光测距与视觉图像结合以增强环境感知。同时,其数据格式和评估标准已作为机器人学习社区的参考基准,促进了跨环境数据集的统一与比较,催生了关于数据增强、回放缓冲策略及离线强化学习的新一批方法论成果。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务