遇见数据集

PhilippEngelmann/rollout_smolvla_blau335oben_v1_20260527_171453

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

这是一个由LeRobot创建的机器人学数据集,用于机器人控制或任务学习。数据集包含动作(action)和观测状态(observation.state),其中动作和状态均涉及6个关节位置(如肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)。观测部分包括三个视角的图像:顶部(top)、腕部(wrist)和侧面(side),每个图像的分辨率为480x640像素,3个通道,以30帧/秒的视频格式(AV1编码)存储。此外,数据集还包含时间戳、帧索引、任务索引和episode索引等元数据。数据集总计1个episode、881帧、1个任务,数据以parquet文件和视频文件形式组织,总大小约为300MB(数据文件100MB,视频文件200MB)。数据集使用Apache 2.0许可证,适用于机器人训练或评估任务。

This is a robotics dataset created using LeRobot, designed for robot control or task learning. It includes actions (action) and observation states (observation.state), with both involving six joint positions (e.g., shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions). Observations consist of images from three perspectives: top, wrist, and side, each with a resolution of 480x640 pixels and 3 channels, stored as video files at 30 frames per second (AV1 codec). Additionally, the dataset contains metadata such as timestamps, frame indices, task indices, and episode indices. It totals 1 episode, 881 frames, and 1 task, organized in parquet and video files, with an approximate total size of 300MB (100MB for data files and 200MB for video files). The dataset is licensed under Apache 2.0 and is suitable for robot training or evaluation tasks.

提供机构:
PhilippEngelmann
搜集汇总
数据集介绍
PhilippEngelmann/rollout_smolvla_blau335oben_v1_20260527_171453 数据集图片
构建方式
该数据集基于LeRobot框架构建,源于对机器人操控任务的真实环境 rollout 采集。数据来源于一台so_follower型机器人,在30帧每秒的采样频率下,记录了包含6维关节空间动作与状态序列的完整操控轨迹。每个数据样本同步采集来自顶部、腕部和侧方三个视角的640×480分辨率视频流,并经AV1编码压缩存储。数据集结构遵循LeRobot v3.0规范,所有数据以Parquet文件存储,视频则独立保存为MP4文件,并由元数据文件统一索引和管理。
特点
数据集涵盖单次完整任务执行历程,共包含881帧时序数据。其核心特色在于多模态感知信息的整合:机器人的关节位置、执行的动作指令,以及三路同步摄像头的视觉观测被精确对齐至同一时间轴。所有视觉数据采用高压缩比的高效视频编码格式,在保证画质的同时显著降低存储开销。数据集将训练数据划分为单一分片(train: 0:1),支持直接用于模仿学习或行为克隆算法的训练与验证。
使用方法
研究者可通过LeRobot库直接加载该数据集,利用其提供的标准API完成数据读取与预处理。在训练过程中,可将观测状态与视觉图像作为模型输入,对应的动作序列作为监督信号,构建端到端策略网络。数据集支持32位浮点精度的动作与状态数据,适应多种深度学习框架。视频数据通过PyAV后端进行解码,可灵活调整帧速率或进行图像增强。建议结合HuggingFace Spaces提供的可视化工具对数据进行预览与质量评估。
背景与挑战
背景概述
该数据集由PhilippEngelmann于2026年5月创建,基于LeRobot框架构建,聚焦于机器人操作领域的模仿学习研究。核心研究问题在于利用多视角视觉观测(顶部、腕部、侧面摄像头)与六自由度关节状态数据,实现机器人精确的抓取与放置动作复现。数据集包含单条演示轨迹,涵盖881帧动作序列及对应的高清视频流,为从示范中学习机器人控制策略提供了基础资源。其影响力体现在推动低成本、可复现的机器人数据采集流程标准化,尤其为So_Follower型机械臂的离线策略训练提供了验证基准。
当前挑战
当前挑战集中于解决机器人模仿学习中的领域泛化问题:如何从单条轨迹的有限示范中提炼出鲁棒的策略,以应对环境扰动与物体位姿变化。构建过程中面临的主要难点包括:多摄像头视频与关节状态的时序同步校准,确保动作标签与视觉观测的精确对齐;以及在仅包含一条演示数据的条件下,克服数据稀疏性对策略泛化能力的限制,同时避免过拟合至特定初始条件或背景噪声。
常用场景
经典使用场景
在机器人学习与智能控制领域,rollout_smolvla_blau335oben_v1_20260527_171453数据集为模仿学习与行为克隆提供了高质量的多模态训练资源。该数据集记录了单次机器人操作任务的完整轨迹,包含6维关节动作与状态信息,以及顶部、腕部、侧方三个视角的同步视频流,采样频率为30帧每秒。研究者可将该数据集用于训练端到端的视觉运动策略模型,通过匹配观测图像与动作序列,使机器人掌握在特定场景下的操作技能,如抓取与放置等精细任务。
解决学术问题
该数据集有效解决了机器人操作研究中数据获取成本高昂与可复现性不足的瓶颈问题。通过提供标准化的、包含多种传感器模态的演示数据,研究者能够系统性地探索不同视觉输入对策略学习效果的影响,验证多视角融合在提升模型鲁棒性方面的作用。此外,该数据集为迁移学习与域适应研究提供了基准,助力学术社区深入理解从仿真到真实环境的知识迁移机制,推动通用操作智能的理论发展。
衍生相关工作
该数据集的衍生工作体现在多个前沿研究方向上。基于此类数据,研究者发展了隐式行为克隆与扩散策略等先进算法,通过概率建模提升动作生成的多样性。同时,数据集中记录的轨迹信息被用于构建逆强化学习框架,从演示中挖掘潜在奖励函数。此外,多视角视频数据促进了视觉预训练与跨模态表征学习的融合,催生了以视觉语言模型驱动机器人操作的新范式,显著拓展了数据驱动的操作智能边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务