遇见数据集

trytoycon/dish_pick_phaseB50_20260526_235523

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是通过LeRobot项目创建的,属于机器人学领域,主要用于机器人任务的数据收集。数据集包含30个episodes,总计17308帧,数据以parquet格式存储,视频以mp4格式存储。特征包括机器人的动作(如肩部、肘部、腕部和夹爪的位置)、状态观察(与动作相同的关节位置)、来自前部和腕部摄像头的图像观察(分辨率480x640,3通道,30fps),以及时间戳、帧索引、episode索引、索引和任务索引等元数据。机器人类型为so_follower。数据集适用于训练或评估机器人控制模型,特别是涉及视觉和动作反馈的任务。

This dataset was created using the LeRobot project and falls under the robotics domain, primarily for data collection in robot tasks. It contains 30 episodes, with a total of 17,308 frames, stored in parquet format for data and mp4 format for videos. Features include robot actions (e.g., positions of shoulder, elbow, wrist, and gripper), state observations (same joint positions as actions), image observations from front and wrist cameras (resolution 480x640, 3 channels, 30 fps), and metadata such as timestamp, frame index, episode index, index, and task index. The robot type is so_follower. The dataset is suitable for training or evaluating robot control models, especially for tasks involving visual and action feedback.

提供机构:
trytoycon
搜集汇总
数据集介绍
trytoycon/dish_pick_phaseB50_20260526_235523 数据集图片
构建方式
该数据集依托LeRobot机器人学习框架构建,面向桌面餐具抓取这一典型操作任务。构建过程中,操作者操控so_follower型机械臂在真实环境中执行取盘动作,系统以30帧每秒的频率同步采集六自由度关节位置与夹爪状态,并记录腕部与前置视角的双路视频流,最终形成30条完整演示回合,涵盖17308帧时序数据,以Parquet列式存储与AV1编码视频按块组织。
特点
数据集核心特征在于多模态同步感知与统一动作表示。每条样本同时包含低层关节状态、高层动作指令及双视角视觉观测,动作与状态空间均由肩部旋转、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转和夹爪开合六个维度构成,任务类型单一但示范完整,支持视觉-动作联合建模,视频分辨率达480×640,满足细粒度操作分析需求。
使用方法
使用者可借助LeRobot生态工具加载该数据集,通过标准接口读取Parquet中的结构化状态与动作序列,并关联对应视频文件。典型用法包括模仿学习策略训练、视觉-动作预测模型评估以及操作技能迁移研究。加载时需遵循meta/info.json定义的路径模板,按chunk与file索引定位数据分片,并可利用HuggingFace可视化空间在线浏览演示回放。
背景与挑战
背景概述
机器人学习领域长期受制于高质量操作演示数据的匮乏,模仿学习与视觉-运动策略的泛化能力因此难以充分验证。dish_pick_phaseB50_20260526_235523数据集依托LeRobot框架于2026年5月构建,由相关研究团队采集,聚焦于机械臂抓取餐具这一典型精细操作任务。数据集包含30个成功回合、17308帧同步记录的视觉与关节状态数据,涵盖前视与腕部双视角,为端到端策略学习提供了贴近真实场景的多模态示范,对推动家庭服务机器人操作研究具有积极的参考价值。
当前挑战
该数据集所对应的领域问题,是动态环境下餐具抓取中的视觉-运动映射与鲁棒控制,其难点在于目标物体的多样性、遮挡与光照变化会严重干扰策略的稳定性。构建过程中亦面临多重挑战:双摄像头与机械臂六自由度状态的严格时间同步要求高精度采集系统;演示数据需覆盖足够多的初始位姿与抓取轨迹,以避免策略过拟合;此外,仅30个回合的有限样本量可能制约模型泛化,数据标注与任务一致性维护同样需要在采集流程中审慎处理,以确保数据质量与可复现性。
常用场景
经典使用场景
在具身智能与机器人模仿学习的范例中,该数据集构筑了一个面向桌面级操作任务的标准化示范库。其以三十条同步采集的示范轨迹为核心,囊括前视与腕部双视角的视觉观测、六维关节位置状态以及对应动作指令,帧率稳定于三十赫兹,天然适配基于视觉-动作映射的策略学习任务,尤其适用于演示驱动的行为克隆与端到端操作策略训练,是该领域检验算法泛化性与稳定性的经典试炼场。
衍生相关工作
围绕该数据集,LeRobot生态催生了一系列关联工作,包括基于其轨迹开展的行为克隆策略复现、视觉-语言-动作模型的微调实验,以及面向抓放任务的强化学习与模仿学习混合训练研究。这些工作借助该数据集统一的接口与可视化工具,持续拓展着桌面操作任务在算法对比、数据增强与策略泛化方面的探索边界。
数据集最近研究
最新研究方向
在具身智能与机器人操作策略学习迅猛发展的背景下,该数据集围绕“拾取餐盘”这一典型家庭服务场景,为模仿学习与视觉-动作联合建模提供了细粒度且时序一致的示范数据。基于LeRobot框架构建,其融合前视与腕部双视角视频流,并以6自由度关节位置与夹爪状态作为低层动作空间,契合当前视觉-语言-动作模型对多模态感知与精细操控的研究趋势。近期研究前沿聚焦于利用此类真实机器人轨迹开展离线策略学习、跨任务泛化与动态环境适应,尤其在数据高效模仿学习与长程任务规划方向具有显著价值。该数据集为机器人操作策略的鲁棒性评估与算法对比提供了标准化基准,对推动家庭服务机器人的实用化进程具有积极意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务