遇见数据集

HyeonseokE/SO101-cap_place_spoon_between_bread_and_cereal_60epi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集由LeRobot创建,用于机器人任务。数据集包含60个episodes,总计20328帧,数据以parquet格式存储。特征包括:机器人状态观测(6维关节位置:肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转、夹爪位置)、动作(6维关节位置,与状态观测相同维度)、图像观测(顶部摄像头和左腕摄像头视频,分辨率480x640,3通道,10fps,H.264编码)、末端执行器位置(6维XYZRPY坐标)、二值化夹爪状态、自然语言技能描述、技能验证问题、技能类型、技能进度、技能目标位置(关节空间6维和笛卡尔空间6维)、子任务自然语言描述、对象名称、目标位置(3维XYZ)、时间戳、帧索引、episode索引、任务索引等。数据集仅包含训练集,涵盖60个episodes。

This dataset was created using LeRobot for robotics tasks. It contains 60 episodes with a total of 20,328 frames, stored in parquet format. Features include: observation.state (6-dimensional joint positions: shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, gripper), action (6-dimensional joint positions, same as observation.state), observation.images.top and observation.images.left_wrist (video data with resolution 480x640, 3 channels, 10fps, H.264 codec), observation.ee_pos.robot_xyzrpy (6-dimensional XYZRPY coordinates), observation.gripper_binary (binary gripper state), skill.natural_language (natural language skill description), skill.verification_question, skill.type, skill.progress, skill.goal_position.joint and skill.goal_position.robot_xyzrpy (goal positions in joint and Cartesian space), subtask.natural_language, subtask.object_name, subtask.target_position (3D XYZ), timestamp, frame_index, episode_index, task_index, etc. The dataset includes only a training split with 60 episodes.

提供机构:
HyeonseokE
搜集汇总
数据集介绍
HyeonseokE/SO101-cap_place_spoon_between_bread_and_cereal_60epi 数据集图片
构建方式
该数据集基于LeRobot框架构建,专注于机器人操作技能的模仿学习。数据采集依托SO101型跟随机器人,在模拟环境中执行放置勺子于面包与麦片之间的精细操作任务。共计60个完整演示回合,以10帧/秒的频率记录,累计采集20328帧观测数据。原始数据以Parquet格式存储于分块文件中,并辅以H.264编码的高清视频流(顶部与左手腕视角),确保状态信息与视觉信息的同步捕获。数据集已预设训练集与完整数据对齐,无需额外拆分。
特点
数据集的核心特色在于其结构化、多模态的观测体系。它不仅包含6维关节位置与末端执行器位姿等机器人本体状态,还融入了技能层面的自然语言描述、验证问题与进度指示,以及子任务的细粒度目标信息(如目标物体名与三维空间坐标)。视频数据分辨率达480×640像素,提供双重视觉输入,极大丰富了学习场景的感知维度。整体数据量约300MB,覆盖单一任务,为行为克隆与策略评估提供了精准且完备的基准。
使用方法
使用者可通过LeRobot库便捷加载与可视化该数据集。推荐在Python环境中调用LeRobot的数据加载接口,指定数据集名并选择所需特征字段,如`observation.state`用于状态输入,`action`作为预测目标。视频数据可结合OpenCV等视觉库进行解码与在线预览。对于模仿学习任务,应依据`frame_index`与`episode_index`组织序列数据,形成完整的回合样本。数据集内含的`skill.goal_position`字段可直接用于评估模型对目标姿态的逼近精度。
背景与挑战
背景概述
在机器人学习领域,从人类示教数据中学习精细操作技能是迈向通用具身智能的关键路径。SO101-cap_place_spoon_between_bread_and_cereal_60epi数据集由HyeonseokE等人基于LeRobot框架创建,专注于解决一项高精度、多步骤的桌面操作任务:将勺子放置于面包与麦片之间。该数据集包含60个演示片段,总计超过2万帧,通过SO101型从动臂机器人记录,融合了6维关节状态、末端执行器位姿及顶部与左手腕的双视角视频信息,特别引入自然语言指令、子目标位置与验证问题等结构化标注,为学习复杂任务的分层推理与视觉-运动控制提供了宝贵资源。该数据集的诞生弥补了现有公开数据集在细粒度、语言引导的接触式操作场景中的空白,有望推动多模态模仿学习与任务泛化研究的发展。
当前挑战
该数据集旨在解决机器人精细操作中的两大挑战。其一是领域问题:在细微接触与空间约束并存的操作中,机器人需同时理解密集的视觉反馈、联合姿态的动态变化以及语言指令的语义映射,这超越了传统拾取与放置任务,要求模型具备对物体间相对位置关系(如‘之间’)的精准感知与鲁棒执行能力。其二是构建挑战:采集过程中需确保示教动作的自然性与可重复性,为此数据集采用了结构化任务分解,将宏观技能拆分为带有进度标识与验证问题的子步骤,并记录多模态数据的高频同步(10 FPS),对硬件标定、视频压缩(H.264编码)与parquet格式的存储效率均提出了严苛要求,同时需要平衡数据规模与质量,使得60个片段足以覆盖任务内的变异性又不失代表性。
常用场景
经典使用场景
在机器人学习与操作领域,SO101-cap_place_spoon_between_bread_and_cereal_60epi数据集为模仿学习与行为克隆提供了精细化的训练素材。该数据集记录了60回合机械臂将勺子放置于面包与谷物之间的操作演示,包含机械臂六关节角度状态、末端执行器位姿、夹爪状态以及顶部与左腕摄像头捕捉的视觉信息。研究者可借助这些高保真观测与动作序列,训练机器人精准执行餐具摆放等精细操作任务,尤其适用于多模态感知与动作策略的联合建模。
解决学术问题
该数据集核心解决了机器人操作中长时域精细操控的学术挑战,尤其是涉及视觉引导的抓取-放置任务在非结构化环境中的泛化问题。通过提供包含自然语言指令、子任务分解及进度标注的丰富元数据,它推动了分层任务规划与技能学习的研究进展。其贡献在于为可复现的基准评估提供标准化数据,使学者得以系统对比不同算法在闭环控制、多步操作中的表现,进而探索视觉-运动耦合的深层机制。
衍生相关工作
依托此数据集,衍生出若干突破性研究工作,包括基于扩散策略的视觉运动Transformer、利用对比学习增强子任务表征的分层模仿学习框架,以及融合语言指令与触觉反馈的多模态操作模型。此外,该数据激发了对数据高效元学习算法的探索,旨在从有限演示中快速泛化至相似任务。这些工作共同推动了LeRobot社区在机器人技能获取与迁移学习前沿的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务