遇见数据集

zonglin11/stack_and_move

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人控制数据集,由LeRobot创建,使用Apache 2.0许可证。数据集包含100个episodes,总计55906帧,涉及2个任务,数据以parquet文件格式存储,视频以mp4格式存储。数据集的特征包括:动作(包含6个关节位置:肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转、夹爪位置)、观测状态(与动作相同的6个关节位置)、观测图像(前视和侧视摄像头视频,分辨率480x640,30fps,RGB三通道),以及时间戳、帧索引、episode索引、索引和任务索引等元数据。数据集专用于机器人学习和控制任务。

This is a robotics control dataset developed by LeRobot and licensed under the Apache 2.0 license. The dataset contains 100 episodes with a total of 55,906 frames, covering 2 tasks. The data is stored in Parquet file format, while the accompanying videos are saved in MP4 format. The dataset includes the following features: actions comprising 6 joint positions: shoulder translation, shoulder lift, elbow flexion, wrist flexion, wrist rotation, and gripper position; observation states with the same 6 joint positions as the actions; observation images, which are videos captured by front-view and side-view cameras with a resolution of 480×640, 30 frames per second (fps), and 3-channel RGB; and metadata including timestamps, frame index, episode index, sample index, and task index. This dataset is specifically tailored for robotics learning and control tasks.

提供机构:
zonglin11
搜集汇总
数据集介绍
zonglin11/stack_and_move 数据集图片
构建方式
该数据集基于LeRobot框架构建,旨在为机器人操作任务提供高质量的演示数据。数据通过操控so_follower机械臂采集而来,包含两种操作任务,共100个演示片段,总计55906帧图像与动作记录。数据以Parquet格式存储动作与状态序列,同时以AV1编码的视频文件保存双视角视觉观测(前视和侧视),每个片段均包含丰富的时序信息,如时间戳、帧索引与任务标签。
特点
数据集的核心特点在于其结构化与多模态特性。动作与状态空间均为6维连续值,涵盖机械臂肩部、肘部、腕部及夹爪等多个关节位置,提供了细粒度的操控指令。视觉观测由两个640×480分辨率的摄像头以30帧/秒捕捉,覆盖不同视角,增强了环境感知的完整性。此外,数据集明确划分了训练集与元信息,便于后续模型训练与评估,总数据量约为300MB,展示了良好的可扩展性与实用性。
使用方法
数据集的使用主要依托LeRobot库进行加载与预处理。用户可通过lerobot API直接读取Parquet文件中的动作、状态与视频数据,并按需提取特定片段或任务。默认配置下,所有片段均可用于训练,支持模仿学习与强化学习任务的开发。建议结合可视化工具(如Hugging Face Spaces上的数据集预览界面)直观检查数据质量,并根据具体需求调整数据切分方式,以适应机器人学习算法的不同输入规范。
背景与挑战
背景概述
随着具身智能与机器人学习领域的蓬勃发展,高质量、标准化的机器人操作数据集成为推动算法进步的关键基石。Stack_and_move 数据集由研究团队利用 LeRobot 框架构建,旨在为机器人精细操作任务提供训练与评估基准。该数据集创建于 2024 年前后,核心研究问题是多步骤物体操作中的策略泛化与鲁棒性,例如堆叠和移动等复合技能的学习。通过记录 100 个演示片段、共计约 55906 帧的机器人动作序列,研究者得以深入探索从视觉观测到连续动作映射的端到端学习范式。其发布促进了机器人社区在模仿学习、离线强化学习等方向的实证比较,尤其凸显了低成本、可复现数据采集流程对缩小仿真与真实世界鸿沟的贡献。
当前挑战
数据集所应对的领域问题集中于机器人精细操作中的多任务泛化与演示效率挑战。一方面,堆叠与移动任务要求模型理解物体间的物理交互关系与空间位姿变化,这使得单纯依赖静态图像分类的方法难以奏效,而需结合时序动作预测与状态估计。另一方面,构建过程中面临数据采集一致性难题:仅依靠 100 个演示片段需确保不同场景下的动作紧凑性,且多视角视频(480×640 分辨率,30 FPS)的同步编码与低延迟压缩(AV1 编解码)在保持高保真度的同时增加了系统复杂度。此外,动作空间包含 6 自由度控制,从肩部到夹爪的连续关节指令(浮点型)对数据标注精度提出严苛要求,如何避免轴间耦合误差并保障长序列的帧间平滑性,仍是后续研究需突破的瓶颈。
常用场景
经典使用场景
在机器人操作领域,stack_and_move数据集为模仿学习与行为克隆提供了高质量的示范数据。该数据集通过So-Follower机械臂在真实环境中执行100个完整轨迹,涵盖堆叠与移动两种操作任务,并同步录制来自前向与侧向摄像头的视觉信息,以及六维关节角度与夹爪状态。研究者可利用这些数据训练端到端的策略网络,使机器人从状态-动作映射中学习复杂的操作技能,亦可作为基线测试不同算法在有限样本下的泛化能力。
衍生相关工作
围绕stack_and_move已衍生出多项代表性工作。基于该数据集的行为克隆策略可直接应用于LeRobot框架下的训练流水线,作为对比IMITATE与ACT等更先进算法效果的基线。其多视角视频流也启发了研究者探索视觉先验辅助的强化学习预训练,例如利用该数据构造逆动力学模型或进行因果推理的解耦。此外,该数据集与官方发表的ROS-Bridge配合,催生了元学习与跨任务领域泛化的验证标准,推动了实用示范学习系统的迭代进化。
数据集最近研究
最新研究方向
在机器人操作领域,stack_and_move数据集为模仿学习与多任务泛化提供了关键支撑,其前沿研究聚焦于少样本的灵巧操作策略,例如通过少量的演示轨迹学习堆叠与移动物体的复杂动作序列。结合LeRobot开源框架,该数据集加速了具身智能体在非结构化环境中的迁移学习,尤其在双臂协作和视觉-运动协调方面取得突破。随着大规模机器人数据收集的普及,stack_and_move正助力推动自动驾驶、工业自动化等场景中的精准控制与自适应决策,成为连接仿真训练与真实世界部署的桥梁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务