遇见数据集

maysmile/icra_0522_can_sub

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的机器人学数据集,专注于双机械臂控制任务。数据集包含动作数据(右臂7个关节、左臂7个关节、右夹爪和左夹爪共16个维度)、状态观测数据(与动作相同的16维关节状态)、以及来自三个视角(前、右、左)的视频观测数据(前视角分辨率为480x640,右和左视角为640x480,均为RGB视频)。数据以parquet格式组织,总共有207个episodes,47619帧,帧率为15fps。数据集还包含时间戳、帧索引、episode索引、任务索引等元数据,适用于机器人模仿学习或强化学习研究。

This dataset is a robotics dataset developed using LeRobot, focusing on dual-arm robotic control tasks. It includes action data with 16 total dimensions: 7 joints for the right arm, 7 joints for the left arm, plus the right and left grippers. It also contains state observation data, which consists of 16-dimensional joint states consistent with the action dimensions. Additionally, the dataset provides video observation data from three perspectives: front, right, and left. The front-view camera has a resolution of 480×640, while the right and left-view cameras have a resolution of 640×480, with all videos being in RGB format. The data is organized in Parquet format, with a total of 207 episodes, 47619 frames, and a frame rate of 15 fps. Metadata such as timestamps, frame indices, episode indices, and task indices is also included in the dataset. This dataset is suitable for research in robotic imitation learning or reinforcement learning.

提供机构:
maysmile
搜集汇总
数据集介绍
maysmile/icra_0522_can_sub 数据集图片
构建方式
该数据集基于LeRobot框架构建,收录了机器人操作任务中采集的示教数据。数据来源于双机械臂平台RBY1的遥操作记录,包含207个完整回合(episode),共计47,619帧时序样本。每个回合以15帧/秒的采样率同步记录16维动作指令、关节状态观测以及三视角视觉影像(前置、左侧、右侧),视觉数据采用AV1编码的640×480或480×640分辨率视频流形式存储,兼顾数据保真度与压缩效率。数据集以parquet格式存储结构化数据,视频文件独立存放于MP4容器中,并通过元信息文件(info.json)统一描述特征维度、编码参数与分割方式,所有样本均归入训练集,无显式验证或测试划分。
特点
数据集核心特性在于深度融合了多模态感知信息与精准的动作指令空间。状态与动作空间均为16维连续浮点向量,分别对应左右双臂各7个关节角度及2个夹爪开合度,实现了对机器人运动学状态的完整刻画。视觉观测部分通过三路独立视频流提供立体环境感知能力,覆盖机器人操作的前方及双侧视野,其最高15帧/秒的时序分辨率足以捕捉动态操作细节。数据质量方面,采用AV1编码在保持视觉信息丰富度的同时将全部视频文件压缩至约200 MB,而结构化数据仅占100 MB,整体规模精炼,适合快速迭代训练。
使用方法
本数据集适用于基于模仿学习或强化学习的机器人技能获取任务。开发者可依据LeRobot库的标准接口加载样本,访问`observation.state`与`observation.images`字段获取状态与图像观测,并利用`action`字段作为策略网络的目标输出。数据按回合索引组织,训练时支持随机采样或按序遍历完整时序序列。由于全部207个回合均标记为训练集,用户可自行划分验证子集以评估泛化能力。建议在预处理阶段将视频帧解码为标准化尺寸的RGB张量,并结合时间对齐技术同步多视角图像与状态序列,从而构建端到端策略模型的训练管线。
背景与挑战
背景概述
该数据集由研究团队基于LeRobot框架创建,聚焦于双机械臂协同操作任务中的机器人学习。其核心研究问题在于如何通过模仿学习使机器人掌握精细且协调的操作技能,例如在复杂环境中进行物体抓取与投放。icra_0522_can_sub数据集以RBY1型机器人为载体,记录了207个完整序列、总计47619帧的演示数据,覆盖了双臂关节轨迹、夹爪状态以及多视角视觉观测(前、左、右三个摄像头),为多模态融合和行为克隆提供了高质量的训练样本。作为面向灵巧操作任务的公开基准,该数据集推动了机器人领域从单臂控制向双臂协同的范式演进,为后续研究提供了可复现的数据基础。
当前挑战
该数据集旨在解决双臂协同操作中高维动作空间与精准时空耦合的领域难题,关键在于克服双臂运动协调、抓取稳定性及环境适应性等核心挑战。构建过程中,团队面临多源异构数据(16维关节动作、多路视频流)的同步与标定困难,需确保15帧/秒采样频率下视觉与状态信息的时间戳一致。此外,数据高效压缩(AV1编码、30倍恒定质量因子)与存储规模(视频数据达200MB)之间的平衡,以及单任务场景下207个演示片段的任务同质性与多样性矛盾,均构成了技术实现上的主要障碍。
常用场景
经典使用场景
在机器人学习与操控领域,icra_0522_can_sub数据集凭借其丰富的双臂协同操作任务数据,成为模仿学习与强化学习研究的理想基石。该数据集以15帧/秒的频率记录来自前、左、右三个视角的高清视觉图像,同时捕捉包含16维关节与夹爪动作在内的完整状态信息,为训练机器人从人类示范中学习精细操作技能提供了多模态、高保真的数据支撑。研究者可借助此数据集构建端到端的策略网络,实现双臂机器人在复杂环境下的精准物体抓取与协同动作生成。
实际应用
在产业落地层面,icra_0522_can_sub数据集为双臂协作机器人在物流分拣、精密装配及医疗辅助等领域的应用提供了关键的技术验证平台。例如,基于该数据集训练的策略可直接迁移至对柔顺性要求极高的电路板插件任务中,或用于指导机器人完成瓶罐类物品的稳定抓取与传递。依托LeRobot生态系统的标准化接口,开发者能够便捷地部署预训练模型,加速人机协同场景下的自动化解决方案从原型到产品的迭代过程。
衍生相关工作
该数据集激发了多项具有影响力的衍生研究,包括基于扩散策略的动作生成模型、跨状态空间域迁移的自适应算法,以及融合多视角注意力机制的视觉-运动解耦框架。相关学者已利用此数据集验证了数据增强策略在提升动作预测精度的有效性,并在ICRA等顶级机器人会议中发表了围绕双臂协调、操作灵巧性的突破性成果。此外,它还被纳入多个开源机器人学习基准测试平台,成为评估新一代策略网络鲁棒性与多任务泛化性能的标准参考集。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务