遇见数据集

Voyager466920/pick_cup_and_place_20260527_121531

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人操作数据集,专门用于‘拾取杯子并放置’任务。它包含机械臂的动作数据(如肩部平移、肩部抬升、肘部弯曲、手腕弯曲、手腕旋转和夹爪位置)、状态观测数据(关节位置),以及来自顶部和手腕摄像头的视频观测(分辨率为480x640,30fps)。数据集还包括时间戳、帧索引、回合索引等元数据。总共有10个回合,5904帧,涉及一个任务,机器人类型为‘so_follower’。数据以Parquet和MP4格式存储,适用于机器人学习和强化学习研究。

许可证:Apache-2.0 任务类别: - 机器人学 标签: - LeRobot 配置: - 配置名称:default 数据文件:data/*/*.parquet 本数据集基于[LeRobot](https://github.com/huggingface/lerobot)构建。 <a class="flex" href="https://huggingface.co/spaces/lerobot/visualize_dataset?path=Voyager466920/pick_cup_and_place_20260527_121531"> <img class="block dark:hidden" src="https://huggingface.co/datasets/huggingface/badges/resolve/main/visualize-this-dataset-xl.svg"/> <img class="hidden dark:block" src="https://huggingface.co/datasets/huggingface/badges/resolve/main/visualize-this-dataset-xl-dark.svg"/> </a> ## 数据集说明 - **项目主页:** [需补充更多信息] - **论文:** [需补充更多信息] - **许可证:** Apache-2.0 ## 数据集结构 [meta/info.json](meta/info.json): json { "代码库版本": "v3.0", "帧率": 30, "数据特征": { "动作": { "数据类型": "float32", "名称列表": [ "肩部平移关节位置(shoulder_pan.pos)", "肩部抬升关节位置(shoulder_lift.pos)", "肘部弯曲关节位置(elbow_flex.pos)", "腕部弯曲关节位置(wrist_flex.pos)", "腕部旋转关节位置(wrist_roll.pos)", "夹爪位置(gripper.pos)" ], "形状": [6] }, "观测.状态": { "数据类型": "float32", "名称列表": [ "肩部平移关节位置(shoulder_pan.pos)", "肩部抬升关节位置(shoulder_lift.pos)", "肘部弯曲关节位置(elbow_flex.pos)", "腕部弯曲关节位置(wrist_flex.pos)", "腕部旋转关节位置(wrist_roll.pos)", "夹爪位置(gripper.pos)" ], "形状": [6] }, "观测.顶部图像": { "数据类型": "video", "形状": [480, 640, 3], "名称列表": ["高度", "宽度", "通道数"], "详细信息": { "视频高度": 480, "视频宽度": 640, "视频编码格式": "av1", "视频像素格式": "yuv420p", "是否为深度图": false, "视频帧率": 30, "视频通道数": 3, "是否包含音频": false, "视频GOP大小": 2, "视频恒定速率因子": 30, "视频编码预设参数": 12, "是否启用快速解码": 0, "视频解码后端": "pyav", "额外视频参数": {} } }, "观测.腕部图像": { "数据类型": "video", "形状": [480, 640, 3], "名称列表": ["高度", "宽度", "通道数"], "详细信息": { "视频高度": 480, "视频宽度": 640, "视频编码格式": "av1", "视频像素格式": "yuv420p", "是否为深度图": false, "视频帧率": 30, "视频通道数": 3, "是否包含音频": false, "视频GOP大小": 2, "视频恒定速率因子": 30, "视频编码预设参数": 12, "是否启用快速解码": 0, "视频解码后端": "pyav", "额外视频参数": {} } }, "时间戳": { "数据类型": "float32", "形状": [1], "名称列表": null }, "帧索引": { "数据类型": "int64", "形状": [1], "名称列表": null }, "回合索引": { "数据类型": "int64", "形状": [1], "名称列表": null }, "全局索引": { "数据类型": "int64", "形状": [1], "名称列表": null }, "任务索引": { "数据类型": "int64", "形状": [1], "名称列表": null } }, "总回合数": 10, "总帧数": 5904, "总任务数": 1, "分块大小": 1000, "数据文件总大小(单位:MB)": 100, "视频文件总大小(单位:MB)": 200, "数据文件路径格式": "data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet", "视频文件路径格式": "videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4", "机器人类型": "so_follower", "数据集划分": { "训练集": "0:10" } } ## 引用 **BibTeX格式:** bibtex [需补充更多信息]

提供机构:
Voyager466920
搜集汇总
数据集介绍
Voyager466920/pick_cup_and_place_20260527_121531 数据集图片
构建方式
该数据集依托LeRobot框架完成采集与组织,面向机械臂抓取与放置任务构建。构建过程以so_follower型机械臂为操作平台,通过遥操作或程序化控制方式执行拾杯放置动作,同步记录多模态时序数据。数据以30帧每秒的频率采样,总时长覆盖10个回合、5904帧,按每1000个回合为一个数据块进行分片存储,视觉观测以AV1编码视频形式保存,动作与状态信息则以Parquet列式文件存储,最终形成结构化、可直接加载的机器人学习数据集。
特点
数据集呈现典型的多模态机器人操作特征,包含动作指令、关节状态以及顶部和腕部两路视觉观测。动作与状态均为6维浮点向量,对应肩部旋转、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置,便于策略网络直接建模。视觉数据为480×640分辨率、30帧每秒的彩色视频,采用AV1编码以降低存储开销。整体数据规模适中,任务单一且标注清晰,适合作为机器人模仿学习与视觉运动策略研究的基准数据。
使用方法
使用者可借助LeRobot工具链加载该数据集,通过HuggingFace平台提供的可视化空间在线浏览各回合的视觉与状态轨迹。数据文件按Parquet格式组织,配合meta/info.json中的字段定义,可便捷地读取动作、状态、时间戳及回合索引等信息。训练时可将observation.images.top与observation.images.wrist作为视觉输入,observation.state作为本体感知输入,action作为监督目标,用于行为克隆或视觉-语言-动作模型的微调。数据路径与视频路径均遵循统一命名规范,便于批量处理与分布式训练。
背景与挑战
背景概述
在具身智能与机器人学习迅猛发展的当下,高质量的真实世界操作数据集成为算法突破的关键基石。pick_cup_and_place_20260527_121531数据集依托LeRobot框架构建,专注于机械臂抓取与放置任务,通过SO follower机器人平台采集了涵盖视觉观测与关节状态的多模态演示数据。该数据集的核心研究问题在于如何从有限示教中习得精细的操作策略,其30Hz的同步视频与本体状态记录为模仿学习与视觉运动控制研究提供了标准化的实验素材,对推动桌面级操作任务的泛化能力具有积极的参考价值。
当前挑战
机械臂抓取与放置任务的挑战在于其对视觉感知、运动规划与力控协调的高度耦合要求,物体位姿的细微变化即可导致抓取失败,而多指夹爪的接触动力学建模亦存在显著不确定性。本数据集构建过程中面临的核心难点包括:在真实物理环境中保持多模态数据的时间同步与空间标定精度,确保视觉观测与关节状态在30Hz下的严格对齐;同时,仅有的10条演示轨迹需覆盖足够的任务多样性,以支撑策略网络从有限样本中提取可泛化特征,这对数据采集的一致性与标注的规范性提出了严苛要求。
常用场景
经典使用场景
在机器人学习领域,抓取与放置任务始终是衡量操作策略泛化能力的基础试金石。该数据集依托LeRobot框架构建,经典使用场景聚焦于模仿学习范式下的视觉-动作策略训练。具体而言,研究者利用顶置与腕部双视角视频流作为视觉观测,结合六自由度机械臂的关节位置与夹爪状态,驱动策略网络学习从原始像素到动作序列的端到端映射。每一回合包含连续三十帧每秒的同步记录,十段演示轨迹共五千九百余帧,为行为克隆与扩散策略等算法提供了紧凑而真实的训练素材。
解决学术问题
该数据集直面机器人操作研究中演示数据稀缺与多模态表征对齐的难题。其通过同步采集关节状态、双视角图像与动作指令,使研究者能够系统探究视觉表征与本体感知的融合机制,检验策略在物体位姿变化下的鲁棒性。在学术层面,它缓解了仿真到现实迁移中真实操作数据不足的困境,为比较不同模仿学习算法的样本效率提供了统一基准,推动了从静态抓取到动态放置的连续控制研究,对具身智能的可复现性评估具有积极意义。
衍生相关工作
以该数据集为训练基础,衍生工作多集中于轻量化模仿学习策略与多模态融合架构的验证。部分研究借鉴其数据组织格式,在LeRobot生态内开展扩散策略与动作分块 transformer 的对比实验;亦有工作将其作为预训练语料,探索跨任务迁移与少样本微调方法。该数据集与开源工具链的紧密耦合,促进了社区在统一接口下复现并改进抓取放置基线,为后续引入语言条件与触觉反馈的研究提供了可扩展的起点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务