遇见数据集

HarikrishnaVydana/pick-place-redcube-3-cmaeras-complex-2-train

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人学数据集,使用LeRobot创建,专注于机器人的拾取和放置任务(具体为pick-place-redcube-3-cameras-complex-2-train场景)。数据集包含丰富的多模态数据:动作数据为6维浮点向量,表示机器人关节位置(包括肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置);观察数据包括相同的6维状态向量和三个摄像头视角的视频(侧视、上视和腕部视角),每个视频分辨率为480x640,3通道,帧率为30fps,使用AV1编解码器。此外,数据集还包含时间戳、帧索引、episode索引、任务索引等元数据。数据集总共有126个episodes,93863帧,数据以parquet文件格式存储,视频以mp4格式存储,适用于机器人控制、强化学习或计算机视觉任务的研究和开发。

This dataset is a robotics dataset created using LeRobot, focusing on pick-and-place tasks (specifically the pick-place-redcube-3-cameras-complex-2-train scenario). It contains rich multimodal data: action data as a 6-dimensional float vector representing robot joint positions (including shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions); observation data includes the same 6-dimensional state vector and video from three camera perspectives (side, up, and wrist views), each with a resolution of 480x640, 3 channels, 30fps frame rate, using the AV1 codec. Additionally, the dataset includes metadata such as timestamps, frame indices, episode indices, and task indices. It comprises 126 episodes and 93,863 frames, stored in parquet format for data and mp4 format for videos, suitable for research and development in robot control, reinforcement learning, or computer vision tasks.

提供机构:
HarikrishnaVydana
搜集汇总
数据集介绍
HarikrishnaVydana/pick-place-redcube-3-cmaeras-complex-2-train 数据集图片
构建方式
该数据集是依托LeRobot框架精心构建的机器人操作学习资源,专为训练机器人在复杂环境中执行拾取与放置红色立方体的任务而设计。数据采集环节整合了三个摄像头视角,包括侧视、俯视及腕部视角,每个视角均以30帧每秒的速率录制640x480分辨率的RGB视频,全面捕捉操作过程中的空间与细节信息。同时,数据集记录了六自由度机械臂关节位置和夹爪状态作为观测值与动作指令,形成完整的状态-动作对。整个数据集包含126个演示回合,总计93863帧,数据以Parquet格式存储,视频以AV1编码压缩,确保了存储效率与数据完整性,为模仿学习策略的训练提供了高质量的示范样本。
特点
该数据集的一大特色在于其多模态融合的特性,巧妙地将高分辨率视觉观测与低维关节状态相结合,为机器人提供了丰富的环境感知与操作反馈。其设计精心考虑了实际操作的复杂性,通过三视角设置并选取红色立方体作为操作目标,增强了模型对物体位置与姿态变化的辨识能力。采用的AV1视频编解码技术,在保证画质的同时有效降低了存储开销。此外,数据集明确划分了训练集,包含统一的机器人类型‘so_follower’,且具备标准化的元数据结构,如时间戳、帧索引等,便于研究者直接应用于模仿学习、行为克隆等算法的训练与评估,在机器人学习领域具有极高的实用价值。
使用方法
使用该数据集时,研究者可借力LeRobot库进行高效加载与解析。其包含的action与observation.state字段直接对应机器人控制指令与本体状态,而observation.images下的三个子字段则提供了不同视角的视觉输入,可构建端到端的视觉运动策略模型。数据集中每个episode均附有episode_index与task_index标记,便于按问答模式或任务进行数据划分与调用。通过官方可视化工具,可以直观浏览数据样例,辅助数据质量审核。此外,为适配复杂任务需求,可将此训练集与同一场景下的验证集相结合,借助标准的监督学习或强化学习流程对策略模型进行微调,从而在仿真或实体机器人上实现精准的拾放操作。
背景与挑战
背景概述
该数据集由Harikrishna Vydana创建,基于Hugging Face的LeRobot框架,于近期发布,聚焦于机器人操作中的抓取与放置任务。其核心研究问题在于,通过多摄像头(侧面、上方、手腕)的视觉输入,结合六维关节动作,实现复杂环境下的精准物体拾取与放置。数据集包含126个训练片段,共93863帧,以30Hz的频率记录,涵盖了完整的机器人控制信号与同步图像流,为模仿学习及强化学习算法提供了丰富的训练样本。作为开源数据集,其采用Apache 2.0许可,促进了机器人学习社区的协作与复现,对推动视觉-动作联合建模领域的发展具有重要意义。
当前挑战
该数据集旨在应对机器人精细操作中的三大挑战:其一,多视角视觉融合问题,即如何有效整合侧视、俯视及腕部摄像头的异构视觉信息,以增强对物体空间位置和姿态的感知鲁棒性;其二,复杂场景下的任务泛化能力,要求算法在光照变化、遮挡及背景干扰下仍能稳定执行拾放操作;其三,构建过程中,需精确同步三路视频流与机器人动作数据,并处理高数据量(视频200MB)与高帧率(30fps)带来的存储与标注挑战,确保数据质量与一致性,为后续模型训练奠定可靠基础。
常用场景
经典使用场景
在机器人学习与操作领域,该数据集致力于捕捉机械臂执行拾取与放置任务的细腻动作序列,通过三视角(侧视、俯视、腕部)高分辨率摄像头与关节状态记录,为模仿学习提供丰富的高维观测样本。其经典使用场景聚焦于训练视觉运动策略,使机器人能从多模态感官输入中学习精准的抓取与释放动作,并适应复杂环境下的空间变化。研究者可借此数据集进行端到端神经网络的训练与验证,探索从像素到动作的直接映射,推动机器人从固定程序控制向数据驱动自主决策的范式转变。
衍生相关工作
该数据集的发布可衍生出一系列前沿研究工作,包括基于Transformer架构的视觉运动策略模型,其利用多视角注意力机制提升操作的空间认知能力;亦催生了多模态融合算法的创新,通过联合编码视觉流与关节状态实现更稳健的控制信号预测。在此基础上,研究者可探索离线元学习框架,利用该数据集预训练通用操作先验,并快速适应新物体或任务布局。此外,数据集中隐含的时序动作模式还可为世界模型研究提供素材,用于预测操作动作的动态演变,促进可预测、可规划的下一代机器人学习系统的发展。
数据集最近研究
最新研究方向
该数据集聚焦于多视角融合的机器人操作技能学习,其核心方向在于利用三相机(侧视、俯视、腕部)同步采集的高频视觉流与六维关节控制信号,驱动模仿学习与强化学习范式下的复杂精细操作研究。结合LeRobot开源框架,数据集为具身智能体提供了丰富的训练素材,支撑端到端控制策略的泛化性探索,并为大规模机器人数据标准化、多任务协同学习以及仿真到现实迁移等前沿课题提供了关键基准,在推动开源机器人学习生态发展与实际工业应用落地方面具有重要示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务