遇见数据集

aaawangge/rollout_smolvla-pen-transfer

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人学习数据集,使用LeRobot工具创建。它包含机器人执行任务时的动作和观测数据:动作数据包括6个关节位置(如肩部平移、肩部升降、肘部弯曲等),观测数据包括机器人状态(同样为6个关节位置)以及三个视角(顶部、前部、右侧)的图像观测,图像分辨率为480x640,帧率为30fps。数据集总共有20个episodes、12000帧,涉及一个任务,机器人类型为so_follower。数据以parquet和mp4格式存储,适用于机器人控制和研究。

This dataset is a robotics learning dataset created using the LeRobot tool. It includes action and observation data from robot task execution: actions consist of 6 joint positions (e.g., shoulder pan, shoulder lift, elbow flex), observations include robot state (also 6 joint positions) and image observations from three views (top, front, right) with a resolution of 480x640 and a frame rate of 30fps. The dataset contains 20 episodes, 12000 frames, and involves one task, with a robot type of so_follower. Data is stored in parquet and mp4 formats, suitable for robot control and research.

提供机构:
aaawangge
搜集汇总
数据集介绍
aaawangge/rollout_smolvla-pen-transfer 数据集图片
构建方式
在机器人学习领域,数据集的质量与构建方式直接决定了模型的泛化能力与策略的鲁棒性。rollout_smolvla-pen-transfer 数据集依托于先进的 LeRobot 框架精心构建,通过模拟环境中的策略部署与数据收集流程,捕捉了机械臂在笔类物体转移任务中的完整交互轨迹。该数据集共计包含20个独立片段(episodes),总计12000帧观测样本,所有数据均以30帧/秒的固定频率记录。每一片段详尽记录了机械臂各关节的位置与夹爪状态,同时通过顶部、前方及右侧三个视角的视觉传感器同步采集640×480分辨率的彩色图像,为多模态学习提供了丰富且对齐的信号源泉。
特点
该数据集最显著的特点在于其多模态融合的设计与高度结构化的数据组织形式。除了涵盖六自由度关节位置与夹爪动作的连续状态空间外,数据集特别引入了多角度视觉观测,包括高帧率压缩的AV1编码视频流,有效平衡了存储效率与视觉保真度。所有数据均以Parquet列式存储格式打包分块,并配以清晰的元数据索引,便于大规模分布式训练与高效随机访问。数据集专注于单一任务(笔类物体转移),但通过20个完整片段与超过三千个控制步长的细节记录,为模仿学习与行为克隆等算法提供了既具针对性又不失多样性的训练素材。
使用方法
使用该数据集时,研究者可以通过LeRobot提供的可视化平台快速预览数据质量与任务执行细节,从而评估其与自身研究方向的契合度。在编程层面,数据集遵循标准化的特征字典定义,用户可直接调用LeRobot的数据加载器按帧或按片段索引进行读取,并利用分块文件机制实现高效流式处理。针对机器人策略训练,建议首先利用多视角图像与状态信息进行表征学习,随后将6维动作向量作为目标输出,构建端到端的控制模型。所有数据均在Apache-2.0许可下开放,支持灵活的研究与商业应用扩展。
背景与挑战
背景概述
该数据集由用户aaawangge于2026年5月27日创建,依托于Hugging Face LeRobot开源框架,聚焦于机器人操作技能的模仿学习研究。核心研究问题在于如何通过少样本示教数据,使机器人掌握精细的物体转移任务(如笔的传递与操作)。数据集采用so_follower型机器人,以30帧/秒的速度录制了20个片段,共计12000帧图像与状态动作序列,具备多视角视觉输入(顶部、前方、右侧)及六维关节动作空间。作为LeRobot生态中的典型推演示例,该数据集为验证行为克隆与视觉运动策略在真实机器人场景中的泛化能力提供了标准化测试平台,对推动低成本机器人学习范式发展具有重要参考价值。
当前挑战
该数据集面临的领域挑战在于:机器人精细操作任务中,视觉感知与动作执行之间的跨模态映射存在高度非线性,且笔的刚性接触与滑动行为易受物体形状、摩擦力等物理参数干扰,传统模型难以从有限示教中泛化至未见过初始构型。构建过程中的挑战则体现在:数据采集需同步校准三个摄像头与6自由度机械臂的时空对齐,确保视频流与关节状态的时间戳误差小于33毫秒;同时,20个演示片段的规模较小,对数据增强与抗过拟合策略提出了严苛要求,而Av1视频编码的压缩误差可能引入感知歧义,进一步加剧模仿学习的不稳定性。
常用场景
经典使用场景
在机器人操作与模仿学习领域,rollout_smolvla-pen-transfer数据集被精心设计为评估和训练视觉运动策略的核心资源。该数据集记录了机械臂执行精细物体转移任务的完整轨迹,尤其聚焦于笔这类小型日常物品的抓取与传递操作。每一帧都包含了来自顶部、前方和右侧三个视角的高清图像,以及机器人关节空间的状态与动作序列,为研究多模态感知与运动控制的耦合提供了不可或缺的素材。其经典的用途在于训练基于视觉的策略模型,如扩散策略或条件变分自编码器,通过观测图像与状态信息预测下一刻的关节动作,从而实现在复杂背景与光照条件下的精确物体操控。
衍生相关工作
该数据集的发布催生了一系列相关的研究工作,围绕其精细操作数据形成了如行为克隆的改进版本、基于能量函数的学习框架以及利用语言条件进行任务分割的新方法。一些工作基于该数据探索了如何利用对比学习从多视角图像中提取更紧凑的视觉特征,另一些则将经典的运动规划算法与数据驱动的预测相融合,生成了更具鲁棒性的混合策略。这些衍生工作不仅深化了对机器人技能习得机制的理解,也推动了如LeRobot这样的开源工具链的标准化进程,使得后续研究者能更加便捷地进行数据收集、策略训练与跨平台部署,形成了良性发展的科研生态。
数据集最近研究
最新研究方向
基于LeRobot框架构建的rollout_smolvla-pen-transfer数据集,聚焦于机器人精细操作技能的学习与迁移,尤其在笔类物体转移任务中展现出前沿价值。该数据集通过同步采集6自由度关节状态与多视角(顶部、前部、右侧)640×480分辨率视觉信息,以30Hz频率记录20个回合、12000帧示范数据,为模仿学习与行为克隆提供了高质量的多模态训练素材。结合近年具身智能的热潮,该数据集可服务于小样本机器人操作技能的泛化研究,推动视觉-运动策略在非结构化环境下的适应性提升,对加速机器人从仿真到真实世界的技能迁移研究具有重要示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务