遇见数据集

aaawangge/rollout_smolvla_precision-pen-placement_20260529_183213

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人控制数据集,使用LeRobot创建,专注于机械臂操作任务。数据集包含20个episodes,总共12000帧数据,以30帧每秒(fps)录制。数据特征包括动作(action)和观测(observation),其中动作包括机械臂的6个关节位置(如肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置),观测包括机械臂的6个关节状态以及从顶部、前部和右侧视角采集的图像视频(每帧分辨率为480x640,3通道RGB)。此外,数据集还包含时间戳、帧索引、episode索引、任务索引等元数据。数据以parquet格式存储,视频以mp4格式存储,总数据文件大小为100MB,视频文件大小为200MB。机器人类型为so_follower,适用于训练和评估机器人控制模型。

This dataset is a robotics control dataset created using LeRobot, focusing on robotic arm manipulation tasks. It contains 20 episodes with a total of 12,000 frames recorded at 30 frames per second (fps). The features include actions and observations: actions consist of 6 joint positions of the robotic arm (e.g., shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper position), while observations include the 6 joint states and image videos captured from top, front, and right perspectives (each frame with a resolution of 480x640 and 3 RGB channels). Additionally, the dataset includes metadata such as timestamps, frame indices, episode indices, and task indices. The data is stored in parquet format, with videos in mp4 format; the total data file size is 100MB, and the video file size is 200MB. The robot type is so_follower, suitable for training and evaluating robotic control models.

提供机构:
aaawangge
搜集汇总
数据集介绍
aaawangge/rollout_smolvla_precision-pen-placement_20260529_183213 数据集图片
构建方式
该数据集基于LeRobot框架构建,专注于精密笔放置任务的机器人操作轨迹记录。通过以30帧每秒的频率采集so_follower型机械臂在执行任务时的状态数据与视觉信息,构建了包含20个演示回合、共计12,000帧的多模态数据集。每个回合记录了机械臂6个关节(包括肩关节、肘关节、腕关节及夹爪)的位置动作指令以及对应的本体感知状态,同时利用顶部、正面和右侧三个视角的RGB摄像头以640×480分辨率捕获环境视觉变化。所有数据以Parquet格式存储元数据,而视频流则采用AV1编码压缩为MP4格式,实现了高效的结构化存储。
特点
数据集在标准化与多模态融合方面表现出显著优势。其动作与观测状态空间维度完全对齐(均为6维),便于构建端到端的模仿学习模型。视觉模块包含三个同步视角的640×480高清视频流,为算法提供了丰富的空间上下文信息。采用AV1编解码器在保证画质的前提下将视频存储量控制在约200MB,配合Parquet元数据的高效压缩(约100MB),整体资源占用紧凑。所有数据均以30帧每秒的均一帧率录制,且每个样本包含精确时间戳与帧索引,便于时序建模。数据集中所有回合均隶属于单一任务类型,形成高度专注的专业基准集。
使用方法
用户可借助LeRobot库直接加载该数据集进行机器人学习研究。通过指定数据集路径并调用LeRobot的dataset类,即可自动获取对齐后的视觉-状态-动作三元组。典型应用包括训练基于行为克隆的模仿学习模型或构建视觉-运动策略。数据以标准化的episode结构组织,支持按回合或帧索引进行随机采样。视觉数据以视频帧序列形式呈现,可通过提供的元数据获取每个视角的编码参数。由于所有动作和状态使用相同的关节命名体系,用户能够迅速建立状态到动作的映射关系。此外,数据集采用Apache-2.0许可证,支持学术与商业场景下的自由使用与二次开发。
背景与挑战
背景概述
该数据集由aaawangge创建,依托LeRobot框架于2026年5月29日采集,专注于精密笔放置任务在机器人操作领域的研究。核心研究问题在于利用视觉与状态信息驱动机械臂实现高精度操作,以推动模仿学习在精细装配场景中的应用。数据集包含20个episode、共12000帧,通过顶部、前方和右侧三视角相机(分辨率480×640)捕捉视觉信息,并记录六维关节状态(肩部、肘部、腕部及夹爪位置)和对应动作。其Apache-2.0许可协议降低了科研门槛,为机器人学习社区提供了标准化的基准数据,尤其在触觉反馈缺失的纯视觉控制范式下具有探索价值。
当前挑战
该数据集聚焦于精密笔放置任务,核心挑战在于解决高自由度机械臂在厘米级精度下的视觉运动耦合问题,涉及物体微小偏移、夹爪滑动等非理想操作环境的鲁棒性。构建过程中面临多视角视频同步与高频状态记录的时序对齐困难(采样率30Hz),以及六自由度动作空间在狭小操作域内的欠约束性。此外,因采用AV1编码压缩视频,解码质量与数据规模的平衡成为数据复用的技术壁垒;单任务场景(20个episode)也限制了模型泛化能力的验证,亟需更大规模多样化数据采集来克服过拟合风险。
常用场景
经典使用场景
在机器人操作研究领域,该数据集聚焦于精密笔类放置任务,通过Franka Emika机器人平台采集包含多视角视觉观测(顶部、前方、右侧)与六维关节状态的动作序列。其经典使用场景集中于模仿学习与离线强化学习范式,研究人员可利用20个episode、12000帧的示教数据,训练视觉-运动策略模型,使机器人精准复现放置笔的精细操作轨迹,尤其适用于验证行为克隆、扩散策略等算法的少样本泛化能力。
实际应用
实际应用中,该数据集可作为工业流水线中精密装配(如电子元件插装)的自动化训练蓝本。基于其数据特征,可开发实时视觉伺服系统,使机械臂在无结构化场景下自主完成笔具归位等任务。同时结合LeRobot框架,该数据集能快速适配于机器人教学平台,降低非专家用户部署技能学习算法的门槛,助力智能仓储与医疗手术辅助等场景的柔性产线建设。
衍生相关工作
该数据集催生了多项延伸性研究,包括基于扩散模型的精细动作生成方法,其性能在该数据集上首次验证了多帧联合噪声预测对操控精度的提升。此外,跨本体迁移学习工作利用该数据集中的通用关节定义(如shoulder_pan.pose),证明预训练策略可在不同机械臂构型间零样本复用。近期还涌现出融合大语言模型的任务推理工作,通过该数据集示范如何将自然语言指令与底层运动轨迹对齐,突破传统端到端学习的语义鸿沟。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务