遇见数据集

PhilippEngelmann/rollout_smolvla_blau335oben_v1_20260527_171930

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的机器人控制数据集,专门用于机器人技术任务。数据集包含一个完整的episode,总共有2803帧数据,涉及1个任务。数据特征包括动作(action)和观测(observation),其中动作由6个关节位置(如肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)组成,观测包括状态(同样为6个关节位置)和三个视角的图像视频数据:顶部视角、腕部视角和侧面视角,每个视频的分辨率为480x640,帧率为30fps,使用AV1编解码器。数据集还包含时间戳、帧索引、episode索引、任务索引等信息。机器人类型为so_follower,数据以Parquet格式存储,视频以MP4格式存储。数据集总大小为300MB(数据文件100MB,视频文件200MB),许可证为Apache 2.0。

This dataset is a robotics control dataset created using LeRobot, designed for robotics tasks. It contains one complete episode with a total of 2803 frames and involves 1 task. The dataset features include action and observation, where action consists of 6 joint positions (e.g., shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions), and observation includes state (also 6 joint positions) and image video data from three perspectives: top, wrist, and side. Each video has a resolution of 480x640, a frame rate of 30fps, and uses the AV1 codec. The dataset also includes timestamps, frame indices, episode indices, task indices, and other metadata. The robot type is so_follower, with data stored in Parquet format and videos in MP4 format. The total dataset size is 300MB (100MB for data files and 200MB for video files), licensed under Apache 2.0.

提供机构:
PhilippEngelmann
搜集汇总
数据集介绍
PhilippEngelmann/rollout_smolvla_blau335oben_v1_20260527_171930 数据集图片
构建方式
该数据集依托于LeRobot框架构建,通过真实机器人rollout流程采集而成。数据集中包含一个机器人操作回合,共计2803帧,涵盖动作、状态与多视角视觉信息。动作与状态数据均为6维浮点向量,对应机械臂各关节位置与夹爪开合度。视觉观测来自顶部、腕部及侧面三个摄像头,均以30帧每秒的AV1编码视频形式存储,分辨率为480×640。数据按照parquet格式分块存储,视频则独立保存为MP4文件,便于高效读取与索引。
使用方法
该数据集可通过LeRobot库直接加载与可视化。用户可使用其提供的API读取parquet文件中的动作、状态序列,并关联对应的视频帧。数据集已预划分训练集,便于直接用于模仿学习或行为克隆模型的训练。由于数据格式规范,也可配合PyTorch或TensorFlow等框架自定义数据加载器,适用于机器人策略学习、多视角视觉表征预训练等场景。
背景与挑战
背景概述
该数据集由研究人员PhilippEngelmann于2026年5月创建,依托Hugging Face社区广泛使用的LeRobot框架构建,专注于机器人操作领域中的模仿学习与行为克隆研究。其核心研究问题在于如何通过多视角视觉观测与高精度动作序列,驱动从动机械臂(so_follower)完成复杂操作任务。数据集包含单条完整episode,共计2803帧,记录了6自由度关节位置指令与对应状态,并同步采集了顶部、腕部和侧方三个视角的30fps高清视频,为多模态机器人学习提供了丰富的训练样本。该数据集的出现填补了在轻量级、开源机器人数据采集与共享方面的空白,借助LeRobot生态,有望加速机器人学习算法的复现与标准化比较,对推动具身智能研究具有重要参考价值。
当前挑战
在领域问题层面,该数据集主要解决机器人操作中数据稀缺与低泛化性的挑战。传统机器人学习依赖昂贵的手工编程或示教,而该数据集通过低成本、标准化的采集流程,为从原始视觉到低维关节动作的端到端学习提供了数据基础,但单episode的样本量(仅1条episode)极难支撑模型对复杂环境变异的鲁棒泛化,过拟合风险显著。在构建过程中,挑战体现在多源异构数据的对齐与存储:需同时确保6维动作向量与三个视频流在30fps下的精确时序同步,并采用AV1压缩编码在保持视觉细节的同时控制存储开销(视频文件达200MB)。此外,任务索引与episode元数据的结构化设计虽便于检索,但当前仅有一个任务类型,限制了数据集在任务多样化场景下的直接复用性。
常用场景
经典使用场景
在机器人学习领域中,rollout_smolvla_blau335oben_v1_20260527_171930数据集为模仿学习与行为克隆研究提供了宝贵的实物数据支撑。该数据集包含单条完整机器人物体操作轨迹,以30帧每秒的速度记录了从顶部、腕部和侧面三个视角的高清视觉信息,并同步采集了六维关节空间动作序列与状态观测。这种多模态数据组织形式,使得研究者能够针对机械臂的精细操控任务,开展端到端的行为克隆训练。经典使用场景聚焦于通过监督学习方式,直接从专家演示中提取决策策略,从而让机器人复现拾取、放置、推拉等动作技能。数据集简洁的轨迹结构和标准化的LeRobot格式,极大降低了初学者与资深研究者验证算法可行性的门槛。
解决学术问题
该数据集主要解决了机器人操作领域长期面临的专家演示数据稀缺与复现困难问题。在学术研究中,通用的仿真环境虽多,却难以完全模拟真实世界的物理特性与接触力学,导致学到的策略迁移至实体机器人时性能急剧下降。本数据集提供了真实的物理传感器数据和视觉观测,为研究从仿真到现实的迁移学习提供了基准参考。同时,它支持研究者深入探索小样本模仿学习、视觉运动策略泛化以及多视角融合的感知机制。数据集中蕴含的时序依赖关系和状态动作耦合,也为解决因果推断与闭环控制中的长时域依赖问题提供了切入口,推动了机器人学术界在复杂操作技能获得与泛化方面的理论进展。
实际应用
在实际工程应用中,该数据集能够作为机器人技能预训练与快速部署的基石。依托于机器人操作原始数据,企业开发人员可在拾取与装配、仓储分拣、精密装配等工业场景中,训练出具备通用操作能力的机器人系统。多视角图像记录为机器人提供了空间理解基础,使其能在动态环境中识别目标位置并调整抓取姿态。此外,该数据集与LeRobot开源库的深度集成,直接支持了机器人策略的快速仿真测试与实际硬件部署,显著缩短了从算法研发到产线落地的周期。对于服务机器人领域,数据集也可用于开发家庭助手机械臂的日常操控能力,如端水杯、开关门等任务,从而提升机器人的实用性与人机协作的流畅度。
数据集最近研究
最新研究方向
该数据集聚焦于机器人模仿学习领域的前沿探索,通过采集六自由度关节动作、多视角视觉观测(顶部、腕部、侧面)及时间序列数据,为训练具备泛化能力的视觉-运动策略提供了高保真资源。其基于LeRobot框架的设计与AV1视频编码技术,契合了当前机器人学习研究中强调数据效率与多模态融合的趋势。随着具身智能与大规模机器人数据集的交叉深化,此类精细化的操控数据正推动从仿真环境向真实世界部署的跨越,为复杂任务如灵巧抓取与装配提供了可复现的基准,同时促进了开源社区对长期行为序列建模与因果推理的探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务