遇见数据集

yywang122/DL_project_box_ok

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,属于机器人领域,专门针对so_follower机器人类型。数据集包含60个episodes,总计48973帧,帧率为30fps。数据以parquet文件和视频文件形式存储,总数据文件大小为100MB,视频文件大小为200MB。特征包括动作(如关节位置)、观测状态(包括关节位置和来自handeye和side摄像头的图像,分辨率为360x640)、时间戳、帧索引、episode索引等。数据集仅用于训练,分割为train集(0:60)。

This dataset was created using LeRobot and belongs to the robotics domain, specifically for the so_follower robot type. It contains 60 episodes with a total of 48,973 frames at a frame rate of 30fps. The data is stored in parquet and video files, with a total data file size of 100MB and video file size of 200MB. Features include actions (e.g., joint positions), observation states (including joint positions and images from handeye and side cameras with a resolution of 360x640), timestamps, frame indices, episode indices, etc. The dataset is intended for training only, with splits defined as train (0:60).

提供机构:
yywang122
搜集汇总
数据集介绍
yywang122/DL_project_box_ok 数据集图片
构建方式
该数据集基于LeRobot框架构建,专注于机器人操作任务。数据集包含60个episode,共计48973帧数据,由so_follower型机器人采集而成。数据以parquet格式存储,分为动作(action)、观测状态(observation.state)和多视角图像观测(observation.images.handeye与observation.images.side)等特征。动作及状态均为6维浮点型向量,对应机器人各关节位置;图像分辨率为360×640,采用AV1编码的视频格式。数据整理为1000帧大小的分块,便于分布式加载与处理。
特点
数据集具有多模态融合的显著特点,同步提供了高精度关节状态与双视角视觉信息,为模仿学习等机器人控制算法提供了丰富的输入通道。所有episode均对应同一任务,保证了数据的一致性。数据集中包含完整的时间戳、帧索引与episode索引,便于时序建模与序列化处理。总数据量约为100MB,视频数据约占200MB,规模适中,适合快速迭代实验。数据集遵循Apache-2.0开源许可协议,鼓励学术界与工业界自由使用。
使用方法
数据集可通过Hugging Face的datasets库结合LeRobot工具进行加载。用户可调用指定配置的default配置,利用parquet文件路径读取结构化数据。对于视觉信息,需使用支持视频解码的加载器处理AV1编码的.mp4文件。数据已预先划分为训练集(0至59号episode),可直接用于训练。使用时需注意将动作(action)作为监督信号,观测状态与图像作为模型输入,适用于训练基于视觉的机器人操控策略,例如行为克隆或强化学习算法。
背景与挑战
背景概述
在机器人操作任务中,模仿学习依赖于高质量、时序对齐的演示数据,但现有数据集往往规模小、场景单一,且难以统一格式,限制了方法的泛化与迁移。DL_project_box_ok数据集由Hugging Face的LeRobot社区创建,面向机器人灵巧操作场景,基于so_follower机械臂采集了60个回合共近5万帧的高频观测与动作数据。该数据集以Apache-2.0协议开源,提供6维关节空间的状态与动作序列,并包含手眼与侧方双视角视频,旨在为低样本、多模态的机器人模仿学习研究提供标准化的基准。数据集的出现填补了开源社区中面向精细抓取操作的紧凑型高质量资源的空白,推动了机器人学习领域从仿真到真实场景的数据标准化进程。
当前挑战
在领域问题层面,该数据集致力于克服真实机器人操作中数据获取成本高、任务泛化能力弱的挑战,通过提供结构化的夹爪运动与视觉观测数据,为基于行为克隆和离线强化学习的方法提供可复现的测试平台。在构建过程中,挑战体现在多源异构数据的同步与标注:如何确保30帧每秒的高频视频与机器人状态轨迹在毫秒级精度上对齐,以及如何统一不同传感器(如关节编码器与摄像头)的坐标系。此外,仅包含单一任务、60个回合的小规模样本量,使得模型在面对扰动或场景变化时容易过拟合,如何从有限演示中提取鲁棒的操作策略仍是数据使用的主要瓶颈。
常用场景
经典使用场景
在机器人学习与操控领域,DL_project_box_ok数据集为模仿学习与行为克隆研究提供了标准化基准。该数据集包含60条由so_follower机器人采集的示范轨迹,涵盖肩部、肘部、腕部及夹爪的六维关节空间动作序列,并同步录制了手眼相机与侧方相机的第一人称视角视频。研究人员可利用该数据训练机器人从视觉观测直接映射到关节动作的端到端策略模型,尤其适合验证基于扩散策略或变换器架构的模仿学习算法在精细操作任务中的泛化能力。
解决学术问题
该数据集核心解决了机器人学中长期存在的少样本技能获取难题。传统强化学习需要大量试错交互才能学习简单操作,而DL_project_box_ok通过提供预先采集的专家示范数据,使得在无需定义奖励函数的情况下,即可利用行为克隆方法实现从示教到自主执行的快速迁移。其标准化格式(包含关节状态、动作指令与多视角视频)还降低了不同算法在6自由度连续控制任务上的对比门槛,推动了视觉-运动联合表征学习、跨视角泛化等学术问题的研究进展。
衍生相关工作
围绕DL_project_box_ok数据集,研究社区已衍生出若干探索性工作。作为LeRobot生态的统一数据格式范例,它常被用于验证联合动作空间与任务嵌入的通用性策略预训练方法;基于其60条短轨迹的规模特征,涌现了面向小样本场景的数据增强与守恒量学习技术。此外,该数据集的手眼相机与侧方相机同步记录特性,启发了跨视角一致性约束下的策略鲁棒性提升方案,以及结合可微分渲染实现从2D到3D动作空间映射的神经隐式表达方法,为工业级低样本模仿学习链路提供了可复现的验证基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务