遇见数据集

CoRL2026-CSI/UR7e_phase1_Chocopie_10fps

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,涉及UR7e机器人,包含20个episodes、8401帧、1个任务,数据以parquet格式存储,视频以mp4格式存储,帧率为10fps。特征包括机器人关节状态(7个关节位置)、动作(7个关节位置)、两个视角的图像(顶部和手腕,分辨率480x640,3通道,10fps)、技能类型、技能进度、目标位置(关节、世界坐标、机器人坐标)、自然语言指令、末端执行器位置、夹爪状态、时间戳、帧索引、episode索引、索引和任务索引。数据集用于机器人学习任务,如技能模仿和强化学习。

This dataset was created using LeRobot, involving a UR7e robot. It contains 20 episodes, 8401 frames, and 1 task, with data stored in parquet format and videos in mp4 format at 10fps. Features include robot joint states (7 joint positions), actions (7 joint positions), images from two perspectives (top and wrist, resolution 480x640, 3 channels, 10fps), skill type, skill progress, goal positions (joint, world coordinates, robot coordinates), natural language instructions, end-effector position, gripper state, timestamp, frame index, episode index, index, and task index. The dataset is intended for robotics learning tasks such as skill imitation and reinforcement learning.

提供机构:
CoRL2026-CSI
搜集汇总
数据集介绍
CoRL2026-CSI/UR7e_phase1_Chocopie_10fps 数据集图片
构建方式
该数据集依托LeRobot框架构建,专注于UR7e机械臂在嵌入式任务中的学习场景。数据采集以10帧每秒的频率进行,共包含20个演示片段,累计8401帧图像与状态信息。每个片段均由操作员远程操控机械臂完成“Chocopie”这一特定任务,并通过双RealSense摄像头(俯视与腕部视角)同步记录视觉信息,同时采集关节角度、末端执行器位姿及夹爪状态等多模态数据。数据以Parquet格式存储结构化特征,并辅以H.264编码的视频文件,确保高效存取与后续分析。
使用方法
研究者在利用该数据集时,可通过LeRobot库直接加载Parquet文件与视频流。推荐采用官方可视化界面进行数据预览与校验。数据默认按20个完整片段作为训练集,无需额外划分。用户可根据tasks索引、natural_language字段或episode_index来筛选特定技能或片段。对于模仿学习任务,可直接将observation.state与observation.images作为模型输入,以action序列作为预测目标;若探索技能拆解,则可利用skill.type与goal_position系列特征进行条件化行为克隆,从而实现多任务泛化与细粒度操作指令跟踪。
背景与挑战
背景概述
该数据集由CoRL2026-CSI团队基于LeRobot框架创建,聚焦于UR7e机械臂在“Chocopie”任务中的操作学习。作为机器人领域中的示范学习数据集,它记录了机械臂执行特定操作时的状态、动作与视觉观测信息,包含20个episode、8401帧数据,并以10fps的帧率采集多视角图像与关节状态。该数据集的构建旨在推动机器人从示范中学习精细操作技能的研究,为后续的模仿学习与泛化算法提供基准。其发布对机器人学习社区具有重要参考价值,尤其在高精度操作任务中,能够有效支持策略学习与行为克隆方法的评估与改进。
当前挑战
该数据集所解决的领域核心挑战在于机器人精细操作技能的自动化获取,特别是在单一任务场景下,如何从有限的示范中提取鲁棒的动作策略。具体挑战包括:1) 示范数据的多样性与覆盖性不足,20个episode可能无法充分表征任务中的全部状态与扰动,导致策略泛化能力受限;2) 构建过程中,多传感器同步与高精度标注的困难,尤其是相机视角、关节位姿与动作指令之间的时序对齐,要求严格的标定与数据质量控制;3) 数据规模与计算效率的平衡,尽管仅包含单一任务,但40MB的parquet与200MB的视频数据在高效存储与训练时仍需优化,以支持后续算法的快速迭代与验证。
常用场景
经典使用场景
在机器人操作领域,UR7e_phase1_Chocopie_10fps数据集为模仿学习与行为克隆等算法提供了经典的训练与验证平台。该数据集记录了UR7e机械臂执行“巧克力派”抓取与放置任务的完整演示,包含20个演示片段,总帧数达8401帧。数据以10Hz频率采样,同步采集了7维关节状态与动作指令、两路640×480的RGB视频流(分别来自顶部与腕部RealSense相机),以及丰富的技能标签信息,如技能类型、进度、目标位姿和自然语言描述。研究者常利用这些多模态信息训练端到端的视觉-运动策略,实现从高维感知到低层控制的直接映射,是验证策略泛化能力与操作精度的理想基准。
解决学术问题
在机器人学习研究中,该数据集有力地推动了从原始感知到精细操作动作的端到端学习这一核心难题的解决。传统的机器人控制方法依赖精确的动力学模型与手工设计的特征,而该数据集提供了高保真的状态-动作对,使研究者能聚焦于探索如何利用神经网络从多视角视觉输入中提取关键语义,并与连续动作空间建立可靠的映射关系。数据集的结构化标注,如目标位姿与技能进度,为研究分层控制、子任务分解以及自然语言引导的操作策略提供了宝贵资源。其意义在于为对比不同模仿学习算法的效率与鲁棒性提供了标准化评估基准,深刻影响了机器人操作中技能获取与泛化能力的研究范式。
实际应用
在实际工业与生活场景中,该数据集的应用潜力颇为广泛。基于此类数据训练的策略,可直接部署于仓库物流的物件分拣、电子元器件的精密装配以及厨房操作中的物品抓取等任务。数据集中的顶部与腕部双视角视觉信息,使得机器人能够适应光照变化和遮挡环境,提升在真实动态场景中的操作可靠性。结合自然语言标注,该数据集还能服务于开发可由人类自然语言指令驱动的协作机器人,实现“听懂指令并精确操作物体”的智能化服务,在智能制造、医疗辅助和养老陪护等前沿领域展现出重要的应用前景。
数据集最近研究
最新研究方向
该数据集聚焦于UR7e机械臂在精细操作任务中的模仿学习研究,特别是面向“巧克力派”这类柔性物品的抓取与操控。其以10帧/秒采集的多模态数据——包括7维关节状态、腕部和俯瞰视角的视觉流以及技能语言标签——为机器人从人类演示中理解复杂操作序列提供了关键训练素材。当前,基于LeRobot框架的此类数据集正推动具身智能从简单抓取向精细化、语义化任务演进,与工业柔性装配、餐饮服务等场景的自动化需求紧密呼应。该数据集的发布不仅有助于提升机器人在非结构化环境中的泛化能力,还通过标准化格式(Apache-2.0许可)促进了跨研究团队的算法复现与对比,为下一步融合自然语言指令与视觉-运动联合建模的研究奠定了基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务