遇见数据集

place_box

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

该数据集由LeRobot项目创建,专注于机器人操作任务,适用于机器人控制、模仿学习或强化学习的研究与应用。它包含52个完整回合(episodes),总计28,949帧数据,覆盖单一任务。数据以结构化格式存储,包括动作、状态观测和多视角图像观测:动作和状态观测均为6维浮点向量,对应机器人关节位置(如肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置);图像观测提供腕部摄像头和顶部摄像头的视频流,分辨率均为480x640,帧率30 FPS,采用AV1编码。此外,数据集还包含时间戳、帧索引、回合索引和任务索引等元数据。数据以Parquet文件形式组织,视频文件以MP4格式存储,总数据量约300 MB(其中结构化数据100 MB,视频数据200 MB)。机器人类型为so_follower。数据集遵循Apache 2.0许可。

This dataset is created by the LeRobot project and focuses on robot manipulation tasks, suitable for research and applications in robot control, imitation learning, or reinforcement learning. It contains 52 complete episodes, totaling 28,949 frames of data, covering a single task. The data is stored in a structured format, including actions, state observations, and multi-view image observations: both actions and state observations are 6-dimensional floating-point vectors corresponding to robot joint positions (such as shoulder translation, shoulder elevation, elbow flexion, wrist flexion, wrist rotation, and gripper position); image observations provide video streams from a wrist camera and a top camera, both with a resolution of 480x640, a frame rate of 30 FPS, and AV1 encoding. Additionally, the dataset includes metadata such as timestamps, frame indices, episode indices, and task indices. The data is organized in Parquet files, with video files stored in MP4 format, totaling approximately 300 MB (with structured data at 100 MB and video data at 200 MB). The robot type is so_follower. The dataset follows the Apache 2.0 license.

创建时间:
2026-07-17
原始信息汇总

数据集概述

  • 数据集名称: place_box
  • 许可协议: Apache-2.0
  • 任务类别: 机器人学 (Robotics)
  • 标签: LeRobot
  • 创建工具: LeRobot
  • 总片段数: 52
  • 总帧数: 28949
  • 总任务数: 1
  • 帧率: 30 FPS
  • 机器人类型: so_follower

数据特征

数据集包含以下特征:

  • action: 动作数据,形状为 [6],数据类型为 float32,包含 shoulder_pan.pos, shoulder_lift.pos, elbow_flex.pos, wrist_flex.pos, wrist_roll.pos, gripper.pos
  • observation.state: 观测状态数据,形状为 [6],数据类型为 float32,包含与 action 相同的6个关节位置。
  • observation.images.wrist: 腕部摄像头图像,视频格式,分辨率为 480x640,3通道,编码为 AV1,帧率 30 FPS。
  • observation.images.top: 顶部摄像头图像,视频格式,分辨率为 480x640,3通道,编码为 AV1,帧率 30 FPS。
  • timestamp: 时间戳,形状为 [1],数据类型为 float32
  • frame_index: 帧索引,形状为 [1],数据类型为 int64
  • episode_index: 片段索引,形状为 [1],数据类型为 int64
  • index: 总索引,形状为 [1],数据类型为 int64
  • task_index: 任务索引,形状为 [1],数据类型为 int64

数据拆分

  • 训练集: 包含索引 0 至 51 的全部 52 个片段。

数据文件

  • 数据路径: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频路径: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
  • 数据文件大小: 100 MB
  • 视频文件大小: 200 MB
  • 代码库版本: v3.0
搜集汇总
数据集介绍
place_box 数据集图片
构建方式
place_box数据集基于LeRobot框架构建,旨在为机器人操作任务提供高质量的演示数据。该数据集通过远程操控so_follower机器人执行放置箱子任务进行采集,共计包含52个完整演示片段(episode),总帧数达到28949帧。每个演示片段记录了机器人从初始状态到任务完成的完整轨迹,数据以30帧每秒的采样频率进行存储。数据采用Parquet格式组织,分为多个chunk文件,同时对应的视频数据以AV1编码的MP4文件独立存储,确保高效的数据加载与处理。
使用方法
使用place_box数据集时,推荐采用LeRobot库进行数据加载与预处理。用户可通过HuggingFace提供的可视化工具在线预览数据集内容。在模型训练中,可将action字段作为监督信号用于模仿学习,observation.state与observation.images作为输入特征。数据已预划分为训练集(全部52个episode),研究者可直接利用其进行行为克隆、强化学习等算法的开发与评估。由于数据采用标准化的Parquet与视频格式,也便于集成到PyTorch、TensorFlow等主流深度学习框架中。
背景与挑战
背景概述
在机器人操作领域,学习从高维感知输入中执行精细操控任务一直是研究的前沿难题。place_box数据集由adrfm机构于近期创建,依托Hugging Face的LeRobot框架进行标准化采集与发布,核心研究问题聚焦于如何利用视觉和状态信息驱动机械臂完成精准的放置任务。该数据集包含52个演示片段,总计28949帧,记录了一台so_follower型号机器人通过手腕与顶部双视角摄像头(640x480分辨率)执行6自由度动作的数据,涵盖关节位置与夹爪开合等关键状态变量。作为机器人模仿学习领域的重要资源,place_box为验证从观测到动作的端到端映射算法提供了高保真度的基准,尤其推动了使用视频与状态融合策略的视觉运动策略发展。
当前挑战
当前数据集面临的核心挑战在于解决精细操控中多模态感知与动作的高效对齐问题。具体而言,6维动作空间与高分辨率视觉输入的时序同步要求模型具备强健的帧间关联能力,而30FPS的采集频率加剧了运动模糊与光流骤变的风险。构建过程中,双视角视频的编码(AV1格式)与parquet结构化数据的整合需克服存储与解码延迟的权衡,同时52个片段仅覆盖单一任务(放置箱子),暴露出对复杂光照、物体形状变异及环境干扰的泛化局限性。此外,so_follower机械臂的柔性关节特性引入非刚体动力学噪声,使得观测状态与真实物理交互间的建模偏差成为阻碍策略迁移的深层难题。
常用场景
经典使用场景
在机器人操作与模仿学习的前沿领域中,place_box数据集承载着从人类演示中习得灵巧操作能力的核心使命。该数据集记录了机械臂执行“放置盒子”这一精细任务的完整轨迹,包含52个演示片段,共计近3万帧高保真数据。其经典用法聚焦于通过行为克隆或离线强化学习范式,让机器人模型学习从视觉观测到关节动作的直接映射,尤其适用于端到端策略的预训练与微调。研究者可借助该数据集训练机器人自主完成容器内物体的精准放置,从而在结构化环境中复现人类般的操作流畅性。
解决学术问题
place_box数据集精准回应了机器人操作领域中的数据稀缺与可重复性难题。传统机器人实验常因硬件差异与环境复杂性导致结果难以复现,而该数据集以标准化格式提供了包含6自由度关节状态与多视角视觉信息的高质量闭环演示。它使学术界能够系统研究模仿学习中视觉-运动耦合的泛化边界,尤其为探索动作捕捉噪声对策略鲁棒性的影响、评估不同网络架构(如扩散策略与Transformer)在固定操作任务上的效能提供了基准平台。其开放授权也大大降低了机器人学习研究的门槛。
实际应用
place_box数据集的实际应用场景广泛渗透于智能制造与家庭服务机器人领域。在工业装配线上,基于该数据集训练的放置技能可直接迁移至零件分拣与物料码垛环节,缓解传统编程式控制的僵硬性。在家庭环境中,机器人可借助习得的泛化能力完成物品归位、餐具整理等日常任务。此外,该数据集与LeRobot框架的深度集成,为开发者在虚拟仿真与实体机器人间搭建了无缝迁移的桥梁,使得从数据采集到策略部署的闭环实验周期显著缩短。
数据集最近研究
最新研究方向
在机器人操作领域,基于视觉与运动控制的精细操作任务正成为前沿研究焦点。place_box数据集借助LeRobot框架构建,记录了SO-Follower机械臂执行放置任务的52个完整回合,涵盖关节空间6维动作指令与腕部、顶部双视角视觉观测信息。该数据集的出现为模仿学习与行为克隆算法的验证提供了标准化基准,其高帧率(30 FPS)的AV1压缩视频与Parquet结构化存储方式,预示着大规模机器人操作数据集向高效、可复现方向演进。当前,结合多模态感知与强化学习的机器人泛化能力研究持续升温,place_box所代表的任务驱动型数据集正推动该领域从简单抓取迈向复杂空间推理与装配操作的智能化跨越。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务