遇见数据集

RonLiao/lerobot-so101-elevator-6btn-dual-cam

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,包含600个episodes,共144,494帧,覆盖3个任务。数据以parquet格式存储,总大小为100MB,视频文件大小为500MB,帧率为30fps。数据集包含动作和观察特征,动作包括6个关节位置(如肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部滚动、夹爪位置),观察特征包括状态(相同关节位置)和两个图像(前置摄像头和腕部摄像头),图像分辨率为480x640,3通道,视频编码为av1。数据集仅用于训练分割。

This dataset was created using LeRobot, containing 600 episodes with a total of 144,494 frames and covering 3 tasks. The data is stored in parquet format with a total size of 100MB, video files size of 500MB, and a frame rate of 30fps. The dataset includes action and observation features: actions consist of 6 joint positions (e.g., shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, gripper position), observations include state (same joint positions) and two images (front camera and wrist camera) with a resolution of 480x640, 3 channels, and video codec av1. The dataset is only for training split.

提供机构:
RonLiao
搜集汇总
数据集介绍
RonLiao/lerobot-so101-elevator-6btn-dual-cam 数据集图片
构建方式
该数据集基于LeRobot框架构建,旨在为机器人操作任务提供标准化的训练数据。数据集源自so101型机械臂在六按钮电梯面板操作场景下的实际运行记录,采用前后双摄像头(正面与腕部)进行多角度视觉信息采集。数据以Parquet格式存储结构化信息,视频则编码为AV1格式的MP4文件,确保高效压缩与视觉保真度。共收集600个完整操作轨迹,包含约14.5万帧数据,覆盖三种不同任务类别。每个轨迹均标注了机械臂六个关节的实时位置与夹爪状态,时间戳与帧索引精确对齐,便于时序建模与策略学习。
特点
数据集具备高密度、多模态与结构化特性。视觉部分提供480×640分辨率的双路视频流,帧率为30FPS,兼顾细节与流畅性;动作与状态空间均为六维连续值,包含肩部、肘部、腕部及夹爪的位置信息,维度完整且物理含义明确。数据按1000帧为一个Chunk进行分块存储,便于分布式加载与流式处理。训练集覆盖全部600个轨迹,无需额外划分,简化使用流程。总数据量约600MB,其中视频文件占500MB,适合中等规模计算环境下的模仿学习与策略优化实验。
使用方法
数据集可通过LeRobot库加载,兼容Hugging Face Datasets与PyTorch生态。用户只需调用预置接口即可自动解析Parquet表格与视频文件,获得结构化的动作、观测状态及图像序列。典型应用场景包括行为克隆、逆强化学习或端到端机器人策略训练。数据已按标准格式组织,支持随机采样、批次生成与时序对齐。建议在训练前对六维动作向量进行归一化处理,并利用双摄像头视角进行视角融合或注意力机制建模,以提升策略在真实电梯操作环境中的泛化能力。
背景与挑战
背景概述
在机器人学习领域,数据驱动的模仿学习与强化学习方法日益受到关注,而高质量、多视角的遥操作数据集是推动该领域发展的关键。lerobot-so101-elevator-6btn-dual-cam数据集由LeRobot社区构建,并于近期发布,旨在为机器人操作任务提供标准化的训练与评估资源。该数据集以so101_follower机械臂为载体,聚焦于电梯场景下的六按钮操作任务,共采集600个演示片段,总计超过14万帧,并整合了前置与腕部双摄像头视觉信息。数据集采用Apache-2.0许可协议开放,其结构与LeRobot框架深度契合,为机器人技能学习提供了多模态、多任务的研究基准,对提升机器人泛化能力与操作精度具有重要推动作用。
当前挑战
该数据集所解决的领域问题核心在于复杂环境下的机器人精细操作与多任务迁移学习。在电梯场景中,机械臂需识别不同按钮布局、适应光照变化并执行精准按压,这要求模型具备视觉-动作联合推理能力,而传统数据集常缺乏此类场景覆盖。构建过程中,挑战主要体现在三方面:首先,高保真度的双视角视频采集需同步控制与标准化标定,以消除视差和延时影响;其次,600个演示片段的动作序列与状态信息须经过严格对齐与异常检测,确保时序一致性;最后,多任务标签的划分与元信息管理(如6轴关节角度映射)需在有限硬件资源下完成,以避免数据冗余与噪声干扰。
常用场景
经典使用场景
在机器人学习与操控领域,lerobot-so101-elevator-6btn-dual-cam数据集为模仿学习与行为克隆研究提供了高质量的多模态训练资源。该数据集包含600个完整轨迹,涵盖3种电梯按钮操作任务,由六自由度机械臂通过双手腕和前置摄像头记录执行的原始动作序列,以及对应的关节状态信息。其最经典的使用场景是作为端到端策略训练的标准基准,研究者可以基于该数据集训练从视觉观测到关节动作的直接映射模型,探索基于视觉的运动规划与精细操控能力的自动化习得路径。
实际应用
在实际应用层面,该数据集赋能了服务型机器人自主作业能力的落地,尤其在楼宇自动化与无障碍设施辅助场景中展现出巨大潜力。基于此数据集训练的控制系统能够赋予机器人识别并精准操作电梯控制面板的能力,这直接服务于仓储物流机器人跨楼层物资流转、医疗运输机器人自主转运病患等现实需求。此外,数据集录制的双手腕与前置立体视觉配置兼容主流商业机械臂的传感器布局,使得研究成果能够无缝迁移至工厂产线的柔性装配单元或商用清洁机器人的人机协作接口中,显著降低了真实环境部署的技术壁垒。
衍生相关工作
该数据集衍生出的经典工作主要集中在下游策略网络架构创新与域自适应学习两个方向。研究者基于其构建出首个公开的电梯操控专用行为克隆基线,推动了Viper、ACT等端到端动作生成模型的实物验证;亦有团队利用其中的多视角视觉输入,提出了基于跨模态注意力机制的融合框架,显著提升了不同光照与遮挡条件下的按键识别容错率。在基准层面,该数据集被引入LeRobot训练管线后,催生了面向复杂人机交互场景的评测套件,与RT-1、Octo等大模型形成了方法论的对照,成为验证机器人底层运动生成模型可迁移性的关键标尺。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务