遇见数据集

PhilippEngelmann/rollout_smolvla_blau335oben_v1_20260527_171709

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,是一个机器人领域的数据集,主要用于机器人控制和视觉任务。数据集包含机器人的动作数据(如肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)和观测数据(包括机器人的状态信息和来自顶部、腕部及侧面摄像头的视频数据)。视频数据以AV1编码格式存储,分辨率为480x640,帧率为30fps。数据集总共有1个任务、1个episode和2624帧,数据以parquet和mp4格式分块存储,总数据量约为300MB。数据集适用于训练和评估机器人学习模型。

This dataset was created using LeRobot and is a robotics dataset designed for robot control and visual tasks. It includes robot action data (such as shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions) and observation data (including robot state information and video data from top, wrist, and side cameras). The video data is stored in AV1 codec format with a resolution of 480x640 and a frame rate of 30fps. The dataset contains 1 task, 1 episode, and 2624 frames in total, with data stored in chunked parquet and mp4 files, totaling approximately 300MB. It is suitable for training and evaluating robot learning models.

提供机构:
PhilippEngelmann
搜集汇总
数据集介绍
PhilippEngelmann/rollout_smolvla_blau335oben_v1_20260527_171709 数据集图片
构建方式
在机器人学习领域,高质量的数据集是推动技能泛化与迁移的关键。rollout_smolvla_blau335oben_v1_20260527_171709数据集基于LeRobot框架构建,专注于记录机器人操作任务的完整轨迹。其构建过程以so_follower机器人本体为实验平台,通过预设策略执行单次rollout,采集了包含动作指令、本体状态及多视角视觉观测在内的时序数据。数据集以30帧每秒的采样频率,记录了2624帧连续运动信息,并按照Parquet格式压缩存储于分块文件中,而高分辨率视觉图像则采用AV1编码视频格式独立保存,实现了高效的数据组织与低存储冗余。
特点
该数据集的核心特色在于其多模态融合的感知架构与精细化的运动参数化描述。数据集合了动作向量与状态向量的六自由度关节位置信息,覆盖了肩部、肘部、腕部及夹爪的完整运动链。视觉部分则提供顶部、腕部与侧方三个角度的彩色图像流,分辨率统一为480×640像素,为场景理解与灵巧操作提供了丰富的空间线索。此外,数据集中嵌入了时间戳、帧索引与任务索引等元信息,便于时间序列分析与任务级训练,同时支持LeRobot生态下的可视化与标准化预处理。
使用方法
使用者可借助LeRobot库轻松加载与解析该数据集。通过指定数据集路径即可访问包含动作、状态、图像及元数据的结构化样本,其中图像数据以视频帧形式按需解码。数据集预定义训练集划分,适用于模仿学习中的行为克隆或强化学习的离线策略优化。典型应用流程包括:利用LeRobot的DataLoader迭代轨迹片段,提取多视角图像与关节状态作为模型输入,以动作为监督信号进行策略网络训练。研究者亦可调整chunks_size参数或自定义数据增强,以适应不同算法架构与计算资源约束。
背景与挑战
背景概述
该数据集名为rollout_smolvla_blau335oben_v1_20260527_171709,由PhilippEngelmann基于LeRobot框架创建于2026年5月27日,属于机器人学习领域,旨在为模仿学习与机器人操控提供多模态训练数据。数据集聚焦于机器人末端执行器的精细动作控制,通过采集6自由度关节位置以及顶部、腕部和侧方三个视角的高清视频流,构建了2624帧的紧凑演示轨迹。其核心贡献在于提供一种标准化的数据采集与存储范式,利用Apache-2.0许可推动机器人策略学习的可复现性与开源协作,对基于视觉的运动规划与机器人远程操控研究具有重要参考价值。
当前挑战
数据集所解决的领域问题在于,机器人操控任务中缺乏高采样率、多视角对齐且结构化的真实演示数据,限制了从观察空间到动作空间的端到端学习迁移。构建过程中面临的关键挑战包括:1)多摄像头同步与视频压缩编码(AV1格式)的实时处理,需在30fps帧率下维持低延迟与高保真度;2)单任务单轨迹样本量(仅1个episode)引发的数据稀疏性,对策略泛化能力构成显著制约;3)机器人关节空间与图像空间异质性特征的统一编码,需要设计兼容parquet与视频帧序列的混合存储架构。
常用场景
经典使用场景
在机器人学习与模仿学习领域,该数据集为训练基于视觉的运动策略提供了弥足珍贵的资源。其收录了单一机械臂(so_follower)在执行特定任务时的完整轨迹,包含高保真的关节状态(六自由度动作与状态)以及多视角视觉输入(顶部、腕部、侧面)。研究者可借助这些数据,以端到端的方式学习从原始像素到精细操作的映射,例如训练扩散策略(Diffusion Policy)或基于Transformer的决策模型,从而完成诸如“blau335oben”所指代的精密抓取或放置任务。
解决学术问题
该数据集直面机器人领域长期存在的“数据稀缺”与“模拟到现实迁移困难”这两大核心挑战。通过提供真实环境中采集的低延迟、高频率(30 FPS)的专家演示,它使得在复杂物理交互下的策略泛化性研究成为可能。学者们能够借此探究多模态感知融合(视觉与本体感受)对行为克隆性能的增益效果,并验证不同网络架构在细粒度操作任务中的鲁棒性,为构建通用机器人操作基座模型提供了实验基石。
衍生相关工作
基于该数据集,研究者已衍生出一系列经典工作:在算法层面,有学者借助其多摄像头视频流提出了层级模仿学习框架,先利用视觉扩散模型生成动作草图,再通过逆运动学求解器实现精调。在系统层面,该数据集被纳入LeRobot基准测试套件,支撑了关于实时在线策略蒸馏与行为离线强化学习相结合的探索。此外,其标准化存储结构(parquet + mp4)催生了可复现研究工具链,如基于此数据格式扩展出跨本体(Cross-Embodiment)的动作预测模型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务