遇见数据集

KS325/open-lower-drawer-r2-occ-train

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人控制数据集,使用LeRobot创建,专门针对so_follower机器人类型。它包含14个episodes,总计10290帧数据,用于训练单一任务。数据特征包括6维动作(如肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)和状态观测(同样为6维),以及来自两个摄像头(camera1和camera2)的图像观测,每个图像分辨率为480x640像素,3通道,帧率为30fps。数据集以parquet文件格式存储,视频以mp4格式存储,总数据文件大小为100MB,视频文件大小为200MB。数据按chunks组织,每个chunk大小为1000帧。该数据集适用于机器人学习和控制研究,特别是涉及视觉反馈和动作执行的任务。

许可证: apache-2.0 任务类别: - 机器人学 标签: - LeRobot 配置项: - 配置名称: 默认 数据文件: data/*/*.parquet --- 本数据集基于[LeRobot(LeRobot)](https://github.com/huggingface/lerobot)开发构建。 <a class="flex" href="https://huggingface.co/spaces/lerobot/visualize_dataset?path=KS325/open-lower-drawer-r2-occ-train-expand_first"> <img class="block dark:hidden" src="https://huggingface.co/datasets/huggingface/badges/resolve/main/visualize-this-dataset-xl.svg"/> <img class="hidden dark:block" src="https://huggingface.co/datasets/huggingface/badges/resolve/main/visualize-this-dataset-xl-dark.svg"/> </a> ## 数据集描述 - **主页:** [更多信息待补充] - **论文:** [更多信息待补充] - **许可证:** apache-2.0 ## 数据集结构 [meta/info.json]: json { "代码库版本": "v3.0", "机器人类型": "so_follower", "总回合数": 14, "总帧数": 10290, "总任务数": 1, "分块大小": 1000, "数据文件总大小(MB)": 100, "视频文件总大小(MB)": 200, "帧率": 30, "数据划分": { "训练集": "0:14" }, "数据路径格式": "data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet", "视频路径格式": "videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4", "数据特征": { "动作": { "数据类型": "float32", "字段名称": [ "肩摆关节位置", "肩俯仰关节位置", "肘关节屈曲位置", "腕关节屈曲位置", "腕关节横滚位置", "夹爪位置" ], "形状": [ 6 ] }, "观测.状态": { "数据类型": "float32", "字段名称": [ "肩摆关节位置", "肩俯仰关节位置", "肘关节屈曲位置", "腕关节屈曲位置", "腕关节横滚位置", "夹爪位置" ], "形状": [ 6 ] }, "观测.图像.相机1": { "数据类型": "video", "形状": [ 480, 640, 3 ], "字段名称": [ "高度", "宽度", "通道数" ], "详细信息": { "视频.高度": 480, "视频.宽度": 640, "视频.编码格式": "av1", "视频.像素格式": "yuv420p", "是否为深度图": false, "视频.帧率": 30, "视频.通道数": 3, "是否包含音频": false } }, "观测.图像.相机2": { "数据类型": "video", "形状": [ 480, 640, 3 ], "字段名称": [ "高度", "宽度", "通道数" ], "详细信息": { "视频.高度": 480, "视频.宽度": 640, "视频.编码格式": "av1", "视频.像素格式": "yuv420p", "是否为深度图": false, "视频.帧率": 30, "视频.通道数": 3, "是否包含音频": false } }, "时间戳": { "数据类型": "float32", "形状": [ 1 ], "字段名称": null }, "帧索引": { "数据类型": "int64", "形状": [ 1 ], "字段名称": null }, "回合索引": { "数据类型": "int64", "形状": [ 1 ], "字段名称": null }, "全局索引": { "数据类型": "int64", "形状": [ 1 ], "字段名称": null }, "任务索引": { "数据类型": "int64", "形状": [ 1 ], "字段名称": null } } } ## 引用 **BibTeX:** bibtex [More Information Needed]

提供机构:
KS325
搜集汇总
数据集介绍
KS325/open-lower-drawer-r2-occ-train 数据集图片
构建方式
在机器人操作技能学习的研究中,高质量示范数据的采集往往依赖标准化的硬件平台与流程化记录机制。该数据集依托LeRobot框架构建,以so_follower机械臂为采集载体,针对“打开下层抽屉”这一单一操作任务,完成了14条完整演示轨迹的记录。数据采集频率为30帧/秒,累计获得10290帧有效样本,同步保存六维关节位置动作指令与对应状态观测,并借助双路摄像头以480×640分辨率捕获视觉信息,最终以Parquet列式存储格式分块归档,形成结构清晰、可直接加载的训练集。
特点
数据集围绕单一抽屉开启任务展开,任务边界明确,避免了多任务混杂带来的学习干扰。其显著特征在于多模态同步性:动作向量与关节状态均为六维浮点数组,时间戳、帧索引、情节索引等元信息完整对齐,为时序建模提供了精确的监督信号。两路视频流以AV1编码存储,在保持图像质量的同时控制了文件体积,帧率与动作序列严格一致,使得视觉观测与本体感知之间形成可靠映射。整体数据规模适中,适合快速验证模仿学习与视觉运动策略。
使用方法
研究者可借助LeRobot工具链直接加载该数据集,通过元信息文件解析数据分块路径,按需读取Parquet文件中的动作、状态与时间序列字段,并同步解码对应视频帧。利用情节索引与帧索引可灵活划分训练与验证片段,开展行为克隆、视觉-动作联合建模等实验。可视化空间提供了在线浏览数据集轨迹的入口,便于在训练前直观检查示范质量与任务一致性,为策略网络的设计与调参提供依据。
背景与挑战
背景概述
在具身智能与机器人学习领域,利用真实世界交互数据训练通用操作策略已成为突破传统编程范式的关键路径。open-lower-drawer-r2-occ-train数据集由KS325团队依托LeRobot框架构建,于2025年发布,面向SO-100/SO-101系列低成本机械臂的精细操作任务。该数据集聚焦于单一任务——开启低位抽屉,包含14个训练回合、10290帧、双视角同步视频及六自由度关节位置与动作标注,其核心研究问题在于以有限演示样本驱动视觉-运动策略在真实环境中的可泛化学习。作为LeRobot生态中面向特定操作场景的开源资源,该数据集为社区探索小样本模仿学习与多模态表征提供了基准平台,对推动低成本机器人操作研究具有切实的参考价值。
当前挑战
该数据集所应对的核心挑战源于真实机器人操作任务的复杂性与数据构建的固有局限。在领域问题层面,低位抽屉开启任务需协调机械臂的精细力控与视觉伺服,机械臂需在遮挡、光照变化及目标位姿不确定条件下完成精准抓取与持续拉动,对策略的鲁棒性和泛化能力构成显著考验。构建过程中,数据采集依赖遥操作或动觉示教,受限于SO-100系列机械臂的硬件精度与操作空间,轨迹一致性难以保证;同时,仅14个回合的有限演示导致状态-动作空间覆盖不足,难以充分表征任务中的多模态分布,给模仿学习算法的过拟合风险与泛化边界带来结构性制约,双视角视频同步与存储亦对数据管线的稳定性提出较高要求。
常用场景
经典使用场景
在机器人学习领域,操作技能的数据驱动习得已成为核心范式,其中桌面级精细操作任务因涉及多关节协调与视觉伺服而备受关注。该数据集旨在支撑单一任务——打开下层抽屉——的模仿学习与策略评估,其经典使用场景涵盖基于视觉的端到端策略训练、状态-动作序列建模以及开环与闭环控制性能的对比研究。研究者常利用其多视角视频流与六自由度关节位置信息,构建条件变分自编码器、扩散策略或行为克隆等模型,在仿真与真实机器人平台上验证操作策略的泛化性与鲁棒性。
解决学术问题
该数据集直面机器人操作学习中长期存在的若干学术难题,诸如高维视觉观测与低维动作空间之间的映射学习、小样本条件下的策略泛化以及多阶段任务中的时序信用分配。通过提供统一的物理机器人轨迹与同步多摄像头视频,它缓解了真实世界操作数据稀缺且难以标准化的困境,为模仿学习算法的可复现比较提供了基准。其意义在于推动从仿真到现实的迁移研究,并促进对接触丰富型操作任务中视觉表征学习与动作序列建模的深入理解。
衍生相关工作
围绕该数据集,已有研究衍生出若干经典工作,包括基于扩散模型的机器人策略(Diffusion Policy)在抽屉开启任务上的适配与评估、视觉-语言-动作模型在低层操作中的指令接地实验,以及面向LeRobot框架的数据增强与策略蒸馏方法。这些工作不仅拓展了数据集在跨本体迁移与多任务学习中的应用边界,还促进了开源机器人学习社区在基准构建、算法比较与可重复研究方面的协同进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务