遇见数据集

saipuneethgottam/pickplace_235cam_newdemos_20260526_161032_remapped

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

这是一个机器人操作数据集,专注于拾取放置任务。数据集使用LeRobot创建,包含100个训练集episodes,总帧数53178。数据特征包括:三个摄像头的视频观察(camera1和camera2分辨率为720x1280,camera3为480x640,均以30fps的AV1编码视频格式存储)、机器人状态(如肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置等6个关节的位置数据)和动作数据(同样为6个关节位置)。数据集以Parquet文件格式组织,机器人类型为“so_follower”,适用于机器人学习和控制任务。

--- 许可证:Apache-2.0 任务类别: - 机器人学 标签: - LeRobot 配置项: - 配置名称:默认 数据文件路径:data/*/*.parquet --- 本数据集由LeRobot构建,其官方仓库地址为:https://github.com/huggingface/lerobot。 可点击下方链接可视化本数据集: https://huggingface.co/spaces/lerobot/visualize_dataset?path=saipuneethgottam/pickplace_235cam_newdemos_20260526_161032_remapped (附带明暗模式适配的可视化徽章) ## 数据集说明 - **主页:** [需补充更多信息] - **论文:** [需补充更多信息] - **许可证:** Apache-2.0 ## 数据集结构 `meta/info.json` 文件包含以下元数据: json { "分块大小": 1000, "代码库版本": "v3.0", "数据文件总大小(MB)": 100, "数据文件路径模板": "data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet", "数据特征": { "动作(action)": { "数据类型": "float32", "字段名称": [ "肩关节旋移位置", "肩关节抬升位置", "肘关节屈曲位置", "腕关节屈曲位置", "腕关节旋转位置", "夹爪位置" ], "形状": [6] }, "回合索引(episode_index)": { "数据类型": "int64", "字段名称": null, "形状": [1] }, "帧索引(frame_index)": { "数据类型": "int64", "字段名称": null, "形状": [1] }, "全局索引(index)": { "数据类型": "int64", "字段名称": null, "形状": [1] }, "观测-图像-相机1(observation.images.camera1)": { "数据类型": "视频(video)", "详细信息": { "是否含音频": false, "视频通道数": 3, "视频编码格式": "av1", "恒定速率因子(CRF)": 30, "额外编码选项": {}, "快速解码开关": 0, "帧率": 30, "关键帧间隔": 2, "视频高度": 720, "是否为深度图": false, "像素格式": "yuv420p", "编码预设等级": 12, "视频处理后端": "pyav", "视频宽度": 1280 }, "维度名称": [ "高度", "宽度", "通道数" ], "形状": [720, 1280, 3] }, "观测-图像-相机2(observation.images.camera2)": { "数据类型": "视频(video)", "详细信息": { "是否含音频": false, "视频通道数": 3, "视频编码格式": "av1", "恒定速率因子(CRF)": 30, "额外编码选项": {}, "快速解码开关": 0, "帧率": 30, "关键帧间隔": 2, "视频高度": 720, "是否为深度图": false, "像素格式": "yuv420p", "编码预设等级": 12, "视频处理后端": "pyav", "视频宽度": 1280 }, "维度名称": [ "高度", "宽度", "通道数" ], "形状": [720, 1280, 3] }, "观测-图像-相机3(observation.images.camera3)": { "数据类型": "视频(video)", "详细信息": { "是否含音频": false, "视频通道数": 3, "视频编码格式": "av1", "恒定速率因子(CRF)": 30, "额外编码选项": {}, "快速解码开关": 0, "帧率": 30, "关键帧间隔": 2, "视频高度": 480, "是否为深度图": false, "像素格式": "yuv420p", "编码预设等级": 12, "视频处理后端": "pyav", "视频宽度": 640 }, "维度名称": [ "高度", "宽度", "通道数" ], "形状": [480, 640, 3] }, "观测-状态(observation.state)": { "数据类型": "float32", "字段名称": [ "肩关节旋移位置", "肩关节抬升位置", "肘关节屈曲位置", "腕关节屈曲位置", "腕关节旋转位置", "夹爪位置" ], "形状": [6] }, "任务索引(task_index)": { "数据类型": "int64", "字段名称": null, "形状": [1] }, "时间戳(timestamp)": { "数据类型": "float32", "字段名称": null, "形状": [1] } }, "全局帧率": 30, "机器人类型": "so_follower", "数据集拆分": { "训练集": "0:100" }, "总回合数": 100, "总帧数": 53178, "总任务数": 1, "视频文件总大小(MB)": 200, "视频文件路径模板": "videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4" } ## 引用说明 **BibTeX格式引用:** bibtex [需补充更多信息]

提供机构:
saipuneethgottam
搜集汇总
数据集介绍
saipuneethgottam/pickplace_235cam_newdemos_20260526_161032_remapped 数据集图片
构建方式
该数据集依托LeRobot框架构建,专注于机器人抓取与放置任务的操作数据采集。构建过程以so_follower机械臂为平台,通过三路摄像头同步记录视觉信息,其中camera1与camera2以1280×720分辨率、30fps帧率采集,camera3则以640×480分辨率辅助捕捉细节。每条轨迹包含6维关节位置与夹爪状态的动作及观测序列,并附带时间戳与任务索引,最终以Parquet列式存储格式按块组织,共整合100个回合、53178帧数据,形成单一任务下的标准化示范数据集。
使用方法
使用该数据集时,可借助LeRobot生态工具直接加载Parquet数据文件与对应视频流,通过meta/info.json中定义的路径模板定位各chunk内容。训练时以observation.images.camera1至camera3作为视觉输入,observation.state作为本体感知,action作为预测目标,task_index用于条件策略学习。数据集已划分train集(0:100),可直接用于模仿学习或强化学习的离线训练。可视化可通过Hugging Face Spaces提供的链接在线浏览,便于快速验证数据质量与任务语义。
背景与挑战
背景概述
在具身智能与机器人学习迅猛发展的浪潮中,高质量真实世界操作数据成为驱动策略泛化的关键要素。该数据集由LeRobot框架生成,于2026年5月创建,包含100条演示轨迹、共53178帧,采用三路摄像头(分辨率分别为1280×720、1280×720与640×480)与6自由度SO follower机械臂记录抓取放置任务,以30帧/秒同步采集视觉观测与关节位置、夹爪状态及动作序列。其核心研究问题在于为视觉-语言-动作模型提供多视角、高时空一致性的操作示范,以支撑模仿学习与端到端策略训练。作为LeRobot生态中的标准化数据资产,该数据集有助于降低机器人学习的数据壁垒,推动可复现研究。
当前挑战
该数据集所面对的领域问题在于:如何在多视角视觉输入与高自由度机械臂的连续控制之间建立稳健映射,使策略在接触丰富、物体位姿多变的抓取放置任务中仍能保持泛化能力,而稀疏奖励与演示偏差常导致模仿学习出现复合误差累积与视角依赖。构建过程中,三路摄像头需实现帧级时间同步与空间标定,720p与480p异构分辨率对特征对齐构成困难;AV1编码在高压缩比下可能引入伪影,影响视觉表征质量;关节状态、动作与视频流需保持严格时序一致,以避免训练信号错位。此外,仅100条演示在任务多样性上相对有限,单一任务类别可能制约策略向新物体与场景的迁移能力。
常用场景
经典使用场景
在机器人学习领域,该数据集凭借三路视觉观测与六维关节动作的时序对齐,常被用于模仿学习与视觉-动作策略的端到端训练,尤其适配拾取与放置这类接触密集型操作。研究者以30帧每秒采集的百余条演示轨迹为样本,将1280×720及640×480分辨率的多视角图像与机械臂状态、夹爪开合位置共同建模,使模型得以从视觉输入直接回归连续控制指令。此类场景强调时空一致性,数据集提供的逐帧时间戳与任务索引,为序列建模和策略泛化提供了可靠基础。
解决学术问题
该数据集主要回应机器人操作学习中演示数据稀缺与视觉-动作映射不稳定等常见难题。通过统一采集真实机械臂执行拾取放置任务的多模态记录,它缓解了仿真到现实迁移中的域差异,并为行为克隆、视觉表征学习及长时序决策等研究提供了可复现的基准。其意义在于以标准化格式降低数据预处理成本,使不同算法能在相同轨迹与观测条件下公平比较,进而推动策略鲁棒性与样本效率的评估范式走向规范化。
实际应用
在实际部署中,该数据集支持机械臂在仓储分拣、桌面整理及生产线上下料等场景中的技能习得。借助三路相机对工作空间的全面覆盖,训练所得策略可适应遮挡与光照变化,完成目标抓取与定点放置。其动作空间与状态空间一一对应,便于迁移至同类舵机驱动的低成本机械臂。开发者亦可利用该数据微调通用视觉-语言-动作模型,加速从演示到自主执行的落地进程。
数据集最近研究
最新研究方向
在具身智能与机器人操作学习领域,抓取-放置(pick-and-place)任务始终是检验感知-决策-控制闭环能力的核心基准。该数据集以三路摄像头(含双720p高分辨率与一480p辅助视角)构建多模态视觉观测,覆盖100个示范回合、逾五万帧、30fps的连续动作流,并采用SO-Follower机械臂的六维关节位置与夹爪状态作为动作空间,为视觉-语言-动作(VLA)模型的端到端训练提供了高保真示范基础。当前前沿研究正聚焦于利用此类多视角示范数据提升策略的视角不变性与空间泛化能力,同时结合扩散策略与模仿学习框架,探索在非结构化环境中的鲁棒迁移与长程任务组合。该数据集的发布亦呼应了开源机器人学习社区对标准化、可复现示范数据集的迫切需求,为跨本体策略迁移与多任务泛化研究提供了重要的实证支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务