遇见数据集

jewoo97/green_block_in_cup_20260530_140450

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集由LeRobot创建,是一个机器人学数据集,包含90个episodes,总计41910帧数据。数据以parquet格式存储,视频以mp4格式存储。数据集包含以下特征:动作(6个关节位置:肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部旋转、夹爪位置)、观察状态(与动作相同的6个关节位置)、来自前部和腕部摄像头的图像观察(分辨率480x640,30fps,彩色图像),以及时间戳、帧索引、episode索引、索引和任务索引等元数据。机器人类型为“so_follower”。数据集用于训练和评估机器人控制模型,支持视觉和状态观察。

This dataset was created by LeRobot. It is a robotics dataset containing 90 episodes and a total of 41,910 frames. The dataset's data is stored in Parquet format, while the corresponding videos are stored in MP4 format. It includes the following features: actions (6 joint positions: shoulder translation, shoulder lift, elbow flexion, wrist flexion, wrist rotation, gripper position), observation states (the same 6 joint positions as the actions), image observations from the front and wrist cameras (with a resolution of 480×640, 30 frames per second (fps), and color images), as well as metadata such as timestamps, frame indices, episode indices, sample indices, and task indices. The robot type is designated as "so_follower". This dataset is used for training and evaluating robot control models, and supports both visual and state observations.

提供机构:
jewoo97
搜集汇总
数据集介绍
jewoo97/green_block_in_cup_20260530_140450 数据集图片
构建方式
该数据集依托于LeRobot框架构建,专注于机器人操控任务。数据通过部署在实体机器人上的传感器与执行器采集获得,涵盖了90个完整演示回合,共计41,910帧时序数据。在构建过程中,机器人关节状态(包括6个自由度位置信息)与动作指令被同步记录,同时借助前向及腕部摄像头捕获分辨率为480×640的视觉流,并以视频格式进行压缩存储。数据以Parquet格式序列化,图像则编码为AV1视频文件,整体数据集大小约为300MB,确保了高效的存储与访问。
特点
该数据集的核心特点在于其多模态融合特性与高保真采集标准。每一帧数据同时包含机器人各关节的精确位姿信息(如肩部、肘部、腕部及夹爪位置)、对应的动作指令以及两个视角的高清RGB图像,这为模仿学习与行为克隆提供了丰富的输入维度。此外,数据集按固定帧率(30 FPS)采集,并附带时间戳、帧索引与回合索引,形成了结构化的时序序列。90个独立回合均针对单一任务,但演示中蕴含的多样性为算法鲁棒性训练奠定了坚实基础。
使用方法
该数据集兼容LeRobot生态系统,可直接用于训练机器人操控策略。使用时,研究人员可通过加载Parquet文件获取关节状态与动作序列,并同时解压对应的视频流以提取视觉观测。推荐将数据集按索引划分为训练集(前90回合全部用于训练)进行模型拟合,或利用内置的流水线进行数据增强与批次采样。结合计算框架(如PyTorch),用户可构建端到端的神经网络,输入多视角图像与当前状态,预测执行动作,从而驱动真实机器人复现抓取与放置操作。
背景与挑战
背景概述
该数据集由名为jewoo97的研究人员基于LeRobot框架于2025年6月30日创建,隶属于机器人操作学习领域,聚焦于将绿色方块精确放入杯中的精细操作任务。数据集共包含90个演示回合、41910帧时序数据,通过前视与腕部双视角摄像头以30帧每秒的帧率采集高清视觉信息,并同步记录六自由度机械臂关节动作与夹爪状态。作为开源数据集(遵循Apache-2.0协议),其结构化的状态-动作配对数据为模仿学习与行为克隆算法提供了标准化的训练素材,对推动具身智能中细粒度操作技能学习具有基础性价值。
当前挑战
该数据集的核心挑战在于解决机器人操作学习领域中的技能泛化与数据高效性问题。具体而言,1)领域问题方面,绿色方块放杯任务虽看似简单,却暴露了精细操作中视觉感知与运动控制的耦合难题——方块初始位置、光照变化及杯口微小偏移均可能导致策略失稳,而单一任务(仅1种指令)限制了模型对多形态物体的泛化能力;2)构建过程方面,90回合的演示数据规模(约100MB结构化数据与200MB视频)在模仿学习中易陷入过拟合,且依赖人工遥操作收集高质量示教增加了数据获取成本,同时未提供任务分割信息(全部划入训练集)使得模型评估缺乏严谨的验证集设计。
常用场景
经典使用场景
在机器人学习与操控领域,green_block_in_cup_20260530_140450数据集作为一项基于LeRobot框架构建的精细操作任务资源,其核心场景集中于模仿学习算法的训练与验证。该数据集包含90个演示片段,涵盖从6自由度机械臂关节状态到高分辨率视觉观测的完整传感信息,特别适用于研究机器人如何通过学习人类示教轨迹完成“将绿色方块放入杯子”这一典型装配动作。研究者可借助其中30帧每秒的同步图像与机器人状态序列,构建从感知到动作的端到端映射模型,推动灵巧操作技能在结构化环境中的泛化能力提升。
衍生相关工作
该数据集衍生出的经典工作主要集中于视觉—动作策略的预训练与微调范式。依托LeRobot社区的开源基础设施,研究者已基于此数据训练出多种行为克隆变体与隐式模仿学习模型,例如通过对比学习融合多视角图像特征来增强策略对视觉混乱背景的鲁棒性。此外,部分工作探索了将时序卷积网络与Transformer架构结合,利用该数据集中连续30秒以上的演示序列进行时间因果建模,促使了机器人领域从单步映射向长时程任务规划的跃迁。更前沿的尝试还包括利用扩散策略在该数据上生成平滑且多样的机器人运动轨迹,为柔性操作提供新范式。
数据集最近研究
最新研究方向
在机器人操作与模仿学习的前沿疆域,精细操作任务正成为衡量算法泛化能力与精确性的试金石。green_block_in_cup_20260530_140450数据集聚焦于“方体入杯”这一典型装配作业,通过90个示范片段、逾4万帧高频动作序列,系统收录了6自由度机械臂(so_follower)在相机与腕部视觉双重引导下的操控轨迹。该数据集为端到端模仿学习、行为克隆及扩散策略等范式提供了标准化训练基底,其多视角视频与关节状态对齐的结构,尤为契合当前热门的视觉-语言-动作联合建模研究。在具身智能与灵巧操作交汇的热点事件中,此类数据集不仅推动了少样本泛化与闭环控制算法的迭代,更为机器人在非结构化环境中实现精准拾取、放置等类人操作奠定了关键的实证基础,对工业自动化与家庭服务场景的部署具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务