遇见数据集

utkarshsheel/so101_pick_sharpenr_v3_20260530_095754

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集由LeRobot创建,专注于机器人技术任务,具体涉及拾取和锐化操作。数据集包含35个episodes,总计20964帧,以30fps的帧率采集。数据特征包括机器人的动作(如肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)、观测状态(关节位置)、来自顶部和腕部摄像头的图像观测(分辨率为480x640,3通道),以及时间戳、帧索引、episode索引、任务索引等元数据。机器人类型为so_follower,数据以parquet格式存储,总数据文件大小为100MB,视频文件大小为200MB。数据集适用于机器人控制、视觉导航和强化学习等应用。

This dataset was developed by LeRobot, focusing on robotics tasks, specifically pickup and sharpening operations. It contains 35 episodes, totaling 20964 frames collected at 30 fps. The dataset includes robot action data (e.g., shoulder translation, shoulder elevation, elbow flexion, wrist flexion, wrist rotation, and gripper position), observation states (joint positions), image observations from the top-view and wrist-mounted cameras (resolution: 480×640, 3-channel), as well as metadata such as timestamps, frame indices, episode indices, and task indices. The robot platform used is so_follower. The data is stored in Parquet format, with a total data file size of 100 MB and video file size of 200 MB. This dataset is suitable for applications including robot control, visual navigation, and reinforcement learning.

提供机构:
utkarshsheel
搜集汇总
数据集介绍
utkarshsheel/so101_pick_sharpenr_v3_20260530_095754 数据集图片
构建方式
so101_pick_sharpenr_v3_20260530_095754数据集基于LeRobot框架构建,专注于机器人操作任务的记录与复现。数据采集过程中,通过一台so_follower型机器人执行拾取与锐化动作,以30帧/秒的采样频率同步记录机器人关节状态与视觉信息。数据集包含60个完整任务回合,共35919帧数据,其中每个回合的关节动作序列和对应的观测状态被精确捕捉。视觉信息由顶部和腕部两台摄像头以640×480分辨率、AV1编码格式采集,形成多视角视频流。所有数据按分块方式存储,其中结构数据以Parquet格式保存于data目录,视频数据则以MP4格式独立存放,确保了数据组织的高效性与扩展性。
特点
该数据集的核心特点在于其精细的机器人操作记录结构。每个样本包含6维关节动作指令(涵盖肩部、肘部、腕部及夹爪的位姿控制)以及对等的6维观测状态,为模仿学习算法提供了直接的输入-输出对齐。多模态视觉信息通过两台摄像机同时捕获,顶部视角提供全局场景,腕部视角聚焦局部操作细节,形成了对操作环境的立体感知。数据集以任务为中心进行组织,所有60个回合均归属于同一任务,且全部划分为训练集,便于进行一致性实验。此外,视频编码采用了AV1压缩格式,在保证画质的同时有效降低了存储开销,总数据量约300MB,兼顾了实用性与可复现性。
使用方法
使用该数据集时,研究者可借助LeRobot框架的标准化接口进行加载与处理。数据集的元信息文件info.json详细描述了特征名称、数据类型、形状及编码参数,支持直接解析。视觉数据可通过pyav后端解码为张量,并与关节状态、动作序列按时间索引对齐。由于所有数据被划分为大小为1000帧的块,用户可按chunk_index和file_index灵活读取。数据集在Hugging Face平台上还提供了可视化工具,可直接在浏览器中预览任务回放,便于快速理解操作流程。对于机器人模仿学习任务,可将action字段作为策略网络输出目标,observation.state和images作为模型输入,开启端到端的训练范式。
背景与挑战
背景概述
在机器人操控领域,灵巧抓取与精细操作任务一直是研究的难点,尤其对于非结构化环境中的小型物体而言。so101_pick_sharpenr_v3_20260530_095754数据集由Hugging Face上的贡献者utkarshsheel创建,依托于LeRobot开源框架,旨在为机器人学习提供标准化、高质量的演示数据。该数据集于2026年5月生成,包含60个演示片段、共计约35,919帧图像与状态-动作序列,聚焦于单一任务——拾取并放置削笔器。其构建采用so_follower型机器人,通过双视角(顶部与腕部)摄像头以30帧/秒采集视觉信息,并记录六轴关节角度及夹爪状态。该数据集作为LeRobot生态中的典型实例,推动了模仿学习与行为克隆在真实机器人操作任务中的发展,为机器人领域研究者提供了可复现的基准数据。
当前挑战
该数据集所解决的领域问题在于实现机器人在精细操作任务中的精准放行与泛化。拾取削笔器这类小型、形状不规则物体,要求机器人具备高精度的视觉定位与抓取规划能力,同时克服机械臂运动学约束与夹爪力控制难题。在数据构建过程中,挑战体现在数据一致性维持上:人工远程操作产生的50段演示需严格对齐任务目标,确保动作轨迹的可训练性;此外,视频编码采用AV1格式以平衡存储与质量,但需在200 MB的视频文件中保持清晰度与帧率稳定。双视角图像(480×640分辨率)采集需同步消除时间戳偏差,而360°环境光照变化则增加了视觉鲁棒性的构建难度。最终,数据集仅包含单一任务和训练分割,缺乏验证与测试划分,限制了模型评估的完备性。
常用场景
经典使用场景
在机器人学习与操控领域,该数据集为模仿学习与行为克隆提供了高质量的示范数据。其核心价值在于记录了SO系列机械臂执行“拾取与放置”任务时完整的关节状态与视觉观测,包括6维动作空间(肩部、肘部、腕部及夹爪)及顶部与腕部双视角RGB视频流。经典使用场景涵盖端到端策略训练,例如利用行为克隆或逆强化学习方法,从专家示范中直接学习将物体从工作台面抓取并转移至指定位置的操控策略。该数据集以30Hz采样频率确保时序细节丰富,且包含60个完整回合的轨迹,为研究动作序列的平滑性与任务泛化性提供了坚实基础。
实际应用
在实际工业场景中,该数据集可用于训练具有基础泛化能力的机器人操作技能模型。例如,在电子产品装配线上,基于该数据训练的模型可学习从料盘吸取精密元件并置入特定治具的标准化动作。由于数据包含了顶部视角与腕部视角的双目图像,模型能够自适应应对工件位置偏移与光照变化,从而在非结构化环境中保持稳定性。此类系统若成功部署,将显著降低产线重复性劳动的人力依赖,并通过减少程序化示教时间,提升小批量多品种制造的灵活性与经济性。
衍生相关工作
该数据集衍生出的经典工作主要集中于基于视觉的机器人模仿学习算法改进。早期研究常以该数据集作为基线,验证如扩散策略(Diffusion Policy)在复杂动作轨迹建模上的有效性,或利用其多视角视觉特征训练基于Transformer的视觉语言动作模型。后续工作进一步探索了数据增强技术(如在线随机化背景与光照)对策略泛化能力的增益,以及如何通过阶段化回放实现复杂长序列任务的分层学习。这些衍生工作共同推动了从单一数据集到跨任务、跨形态迁移学习的通用机器人基础模型发展趋势。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务