遇见数据集

Metric-AI/so_101_chocolate_merged_dedup

收藏
Hugging Face2026-06-19 更新2026-06-21 收录
官方服务:

资源简介:

该数据集是一个机器人数据集,使用LeRobot工具创建,专门用于机器人任务。数据集包含70个总剧集和18849个总帧数,数据以parquet文件格式存储,总数据文件大小为100MB,视频文件大小为200MB。特征包括动作数据(如机器人关节位置:肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部滚动和夹爪位置)、观察状态(与动作相同的关节位置)、观察图像(包括固定摄像头和手眼摄像头的视频数据,分辨率为480x640,3通道,帧率为30fps,使用av1编解码器),以及时间戳、帧索引、剧集索引、索引和任务索引等元数据。机器人类型为“so_follower”,任务类别为robotics,适用于训练和评估机器人控制模型。数据集结构支持分块处理,块大小为1000,并包含训练分割(剧集0到70)。

This is a robotics dataset developed using the LeRobot toolkit, tailored specifically for robotics tasks. It comprises a total of 70 episodes and 18849 frames, stored in Parquet file format. The total size of the data files is 100 MB, while the total size of the video files is 200 MB. The dataset includes the following core features: 1. Action data: Robot joint position commands including shoulder translation, shoulder lift, elbow flexion, wrist flexion, wrist roll, and gripper position 2. Observation states: Identical joint position measurements as those in the action data 3. Observation images: Video streams captured by both fixed cameras and eye-in-hand cameras, with a resolution of 480×640, 3 RGB channels, a frame rate of 30 fps, and encoded with the AV1 codec 4. Metadata: Timestamps, frame indices, episode indices, sample indices, and task indices The target robot type for this dataset is "so_follower", with the task category classified as robotics. It is suitable for training and evaluating robot control models. The dataset structure supports chunked processing with a chunk size of 1000, and includes the training split covering episodes 0 to 70.

提供机构:
Metric-AI
搜集汇总
数据集介绍
Metric-AI/so_101_chocolate_merged_dedup 数据集图片
构建方式
在机器人学习领域,高质量数据集的构建是推动具身智能发展的关键基石。so_101_chocolate_merged_dedup数据集基于LeRobot框架精心打造,专为机器人操作任务设计。该数据集通过合并与去重流程,整合了70个机器人演示片段,共计18849帧图像与动作序列。数据采集频率为30帧每秒,涵盖机器人从肩部到夹爪的六维关节空间状态,并辅以固定视角与手眼视角的640×480像素视频记录。所有数据以Parquet格式存储,经AV1视频编码压缩,确保高效存取与低存储开销。其结构清晰定义于meta/info.json文件中,支持分块读取与多模态特征对齐。
特点
该数据集拥有鲜明的技术特性,显著区别于传统机器人数据集。首先,多模态信息深度融合,同时提供关节状态向量与双视角视觉流(固定视角与手眼视角),为学习视觉-运动耦合策略提供了丰富输入。其次,数据集聚焦于单一操作任务,总计70个完整情节,动作与状态特征维度均为6,对应机器人真实物理关节空间,可直接用于模仿学习与强化学习算法。值得注意的是,视频数据采用AV1编码,在保持高质量的同时大幅压缩体积,视频与数据文件合计约300MB,兼具学术研究可用性与工程部署效率。
使用方法
研究人员可通过LeRobot库便捷地加载与使用该数据集。首先,利用HuggingFace Datasets库的load_dataset函数导入so_101_chocolate_merged_dedup,指定数据集分割(如'train')后即可获取数据迭代器。默认配置为70个情节全部用于训练,每个情节包含时间戳、帧索引、动作指令、六维关节状态以及来自两个摄像头的视频帧。视频帧可通过预设的'video'类型字段直接解码为张量,便于与PyTorch等深度学习框架无缝集成。此外,开发者可借助HuggingFace Spaces提供的可视化界面直观浏览数据内容,加速数据集理解与算法调试流程。
背景与挑战
背景概述
在机器人操作领域,如何通过模仿学习让机器人掌握精细的物体操作技能一直是一项核心挑战。so_101_chocolate_merged_dedup数据集由Metric AI团队于近期构建,基于LeRobot框架开发,专注于通过遥操作数据训练机器人完成巧克力相关操作任务。该数据集包含70个片段、约18849帧图像数据,使用SO-100系列机械臂(型号so_follower)以30帧/秒的频率采集,记录了肩部、肘部、腕部及夹爪的6维关节动作状态,并配备固定视角与手眼视角的双目视觉输入(480×640像素)。数据集采用Apache-2.0开源许可发布,旨在为机器人精细操作研究提供标准化的多模态训练基准,其结构化格式与LeRobot生态的兼容性使其在机器人行为克隆与策略学习领域具有重要参考价值。
当前挑战
该数据集所解决的领域核心问题在于机器人对易损或柔性物体(如巧克力)的精准操作,这要求模型同时理解视觉反馈与关节力矩约束,避免因抓取力度不当或位姿偏差造成物体损坏。在构建过程中,挑战包括:1) 需通过遥操作设备精确记录人类演示轨迹,确保动作序列在6维关节空间中的平滑性与一致性;2) 多视角视频(固定相机与手眼相机)的同步采集与压缩编码(AV1格式)需在保证画质的同时控制存储开销(视频文件约200MB);3) 数据清洗与去重(如数据集名称中的“dedup”所示)以剔除冗余或失败的演示片段,维持训练样本的高效覆盖。
常用场景
经典使用场景
在机器人学习与操控领域,so_101_chocolate_merged_dedup数据集为模仿学习与行为克隆提供了理想的实验平台。该数据集记录了6自由度机械臂(SO-101系列)在拆解巧克力包装任务中的完整操作轨迹,包含70个专家演示片段,总计近1.9万帧高保真数据。每一帧都精确记录了关节角度、末端执行器位姿及夹爪开合状态,并同步提供了固定视角与手眼相机的第一人称视频流。研究者可通过这些多模态观测-动作对,训练从视觉输入到运动指令的端到端策略网络,尤其适用于处理细粒度、高精度的灵巧操作场景。
解决学术问题
该数据集有效破解了机器人操作领域中长期存在的两大难题:精密力反馈与视觉引导的协同学习。传统数据集往往缺乏连续、一致的关节运动记录,导致模型在推广至未见环境时鲁棒性不佳。通过提供标准化、去冗余的演示数据,研究人员得以深入探究基于视觉的机器人拆解策略,并量化轨迹空间中的多模态表示学习效果。此外,该数据集为评估不同模仿学习算法(如逆强化学习、生成式动作建模)提供了基准,推动了操作技能从示教到自主泛化的理论发展。
衍生相关工作
该数据集的发布催生了一系列富有启发性的衍生研究。基于所记录的关节位姿与力矩信息,研究者构建了可泛化的力控操作基元库,并以此为基石发展了面向脆弱物体操作的阻抗控制框架。同时,两路视觉流的同步记录使得多视角注意力机制与视角不变特征学习成为可能,进而诞生了融合时空图卷积的姿态预测模型。在算法层面,围绕该数据集的策略蒸馏实验验证了从融合视觉预测到纯状态观测的知识转移可行性,为边缘端机器人的轻量化部署提供了理论支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务