遇见数据集

kunhsiang/eval_exp9_sc4var_put_the_box_on_the_plate_20260527-151946

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是通过LeRobot平台创建的机器人学数据集,专门用于机器人控制任务,具体任务为将盒子放在盘子上。数据集包含一个完整的训练集,总共有1个任务、1个episode和2304帧数据,数据以parquet格式存储,视频文件以mp4格式存储。数据集的特征包括机器人的动作(如肩部、肘部、手腕和夹爪的位置)、观测状态(与动作相同的位置信息)以及来自三个摄像头(前视、顶部和夹爪)的图像观测,图像分辨率为480x640,帧率为30fps。此外,还包括时间戳、帧索引、episode索引等元数据。数据集使用Apache 2.0许可证,适用于机器人学习和控制研究。

许可证:Apache-2.0 任务类别: - 机器人学 标签: - LeRobot 配置项: - 配置名称:default 数据文件路径:data/*/*.parquet 本数据集依托LeRobot(https://github.com/huggingface/lerobot)构建。 <a class="flex" href="https://huggingface.co/spaces/lerobot/visualize_dataset?path=kunhsiang/eval_exp9_sc4var_put_the_box_on_the_plate_20260527-151946"> <img class="block dark:hidden" src="https://huggingface.co/datasets/huggingface/badges/resolve/main/visualize-this-dataset-xl.svg"/> <img class="hidden dark:block" src="https://huggingface.co/datasets/huggingface/badges/resolve/main/visualize-this-dataset-xl-dark.svg"/> </a> ## 数据集说明 - **主页**:[需补充更多信息] - **论文**:[需补充更多信息] - **许可证**:Apache-2.0 ## 数据集结构 [meta/info.json]: json { "代码库版本": "v3.0", "机器人类型": "so_follower", "总回合数": 1, "总帧数": 2304, "总任务数": 1, "分块大小": 1000, "数据文件总大小(MB)": 100, "视频文件总大小(MB)": 200, "帧率": 30, "数据集划分": { "训练集": "0:1" }, "数据路径格式": "data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet", "视频路径格式": "videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4", "特征项": { "动作(action)": { "数据类型": "float32", "字段名称": [ "肩关节偏航位置(shoulder_pan.pos)", "肩关节俯仰位置(shoulder_lift.pos)", "肘关节屈伸位置(elbow_flex.pos)", "腕关节屈伸位置(wrist_flex.pos)", "腕关节滚动位置(wrist_roll.pos)", "夹爪位置(gripper.pos)" ], "形状": [ 6 ] }, "观测状态(observation.state)": { "数据类型": "float32", "字段名称": [ "肩关节偏航位置(shoulder_pan.pos)", "肩关节俯仰位置(shoulder_lift.pos)", "肘关节屈伸位置(elbow_flex.pos)", "腕关节屈伸位置(wrist_flex.pos)", "腕关节滚动位置(wrist_roll.pos)", "夹爪位置(gripper.pos)" ], "形状": [ 6 ] }, "前视图像观测(observation.images.front)": { "数据类型": "视频", "形状": [ 480, 640, 3 ], "维度说明": [ "高度", "宽度", "通道数" ], "详细信息": { "视频高度": 480, "视频宽度": 640, "视频编码格式": "av1", "视频像素格式": "yuv420p", "是否为深度图": false, "视频帧率": 30, "视频通道数": 3, "是否包含音频": false } }, "顶视图像观测(observation.images.top)": { "数据类型": "视频", "形状": [ 480, 640, 3 ], "维度说明": [ "高度", "宽度", "通道数" ], "详细信息": { "视频高度": 480, "视频宽度": 640, "视频编码格式": "av1", "视频像素格式": "yuv420p", "是否为深度图": false, "视频帧率": 30, "视频通道数": 3, "是否包含音频": false } }, "夹爪视角图像观测(observation.images.gripper)": { "数据类型": "视频", "形状": [ 480, 640, 3 ], "维度说明": [ "高度", "宽度", "通道数" ], "详细信息": { "视频高度": 480, "视频宽度": 640, "视频编码格式": "av1", "视频像素格式": "yuv420p", "是否为深度图": false, "视频帧率": 30, "视频通道数": 3, "是否包含音频": false } }, "时间戳(timestamp)": { "数据类型": "float32", "形状": [ 1 ], "字段名称": null }, "帧索引(frame_index)": { "数据类型": "int64", "形状": [ 1 ], "字段名称": null }, "回合索引(episode_index)": { "数据类型": "int64", "形状": [ 1 ], "字段名称": null }, "全局索引(index)": { "数据类型": "int64", "形状": [ 1 ], "字段名称": null }, "任务索引(task_index)": { "数据类型": "int64", "形状": [ 1 ], "字段名称": null } } } ## 引用 **BibTeX格式:** bibtex [需补充更多信息]

提供机构:
kunhsiang
搜集汇总
数据集介绍
kunhsiang/eval_exp9_sc4var_put_the_box_on_the_plate_20260527-151946 数据集图片
构建方式
在具身智能与机器人操作学习领域,高质量的任务演示数据是策略训练与能力评估的基础。该数据集依托LeRobot框架构建,采集自so_follower型机械臂执行“将盒子放置于盘子上”这一特定操作任务的过程。整个构建流程以单回合演示为核心,全程以30帧每秒的频率同步记录机械臂的关节状态、动作指令以及前视、俯视与夹爪三路视觉观测,累计2304帧,并按统一时间戳对齐形成多模态时序数据。数据以Parquet列式存储与AV1编码视频文件分别承载低层状态与高维感知信息,最终以Apache-2.0许可发布,确保数据在机器人学习社区中的可复现与可共享。
特点
该数据集呈现出鲜明的多模态与精细时序特性,其核心价值在于为机器人操作任务提供密集而完整的感知-动作对。数据涵盖六维关节位置与动作向量,并辅以前、顶、夹爪三个视角的同步视频流,构成对操作场景的全方位视觉覆盖。单回合、单任务的设置使其更适用于评估模型在特定操控指令下的执行精度与鲁棒性,而非泛化性训练。所有视频流均采用统一的分辨率与编码参数,帧率与状态采样严格对齐,为模仿学习、视觉-动作联合建模以及机器人策略的离线评估提供了结构清晰、噪声可控的数据基础。
使用方法
使用该数据集时,研究者可借助LeRobot工具链直接加载Parquet格式的状态与动作序列,并通过内置的可视化接口在线浏览三路视频与对应轨迹。数据按train划分提供,用户既可将观测状态与视频帧作为输入、动作作为监督信号,用于行为克隆或时序策略学习,也可将其作为仿真环境中的参考演示,用于策略性能的基准测试。由于数据规模为单回合,建议将其定位于任务验证与模型调试场景,而非大规模预训练。加载时需注意路径中chunk与file索引的映射规则,并确保视频解码器支持AV1格式,以保障多模态数据读取的完整性与同步性。
背景与挑战
背景概述
在机器人学习领域,高质量、多样化的演示数据是训练泛化策略的关键。eval_exp9_sc4var_put_the_box_on_the_plate_20260527-151946数据集由LeRobot框架构建,生成于2026年5月,针对so_follower机器人平台,记录了一项将盒子放置于盘子上的操作任务。该数据集包含1个回合、2304帧、30帧每秒的视觉-动作数据,涵盖前视、顶视和夹爪三个视角,提供了六自由度关节位置和动作标注。其核心价值在于为视觉-语言-动作模型在精细操作场景中的评估提供标准化样本,推动了机器人操作策略的可复现研究。
当前挑战
该数据集所应对的领域挑战在于复杂接触动力学下的精确物体放置:机器人需在视觉引导下协调肩、肘、腕及夹爪的运动,克服遮挡、光照变化和物体位姿不确定性。构建过程中,主要难点包括:确保单次演示中动作序列的平滑性与标注同步性,避免多摄像头视频流的时序错位;处理高帧率视频编码带来的数据压缩与存储平衡;以及受限于单回合数据,难以覆盖任务空间中的多样初始条件。这些因素共同限制了模型泛化能力的充分评估。
常用场景
经典使用场景
在机器人学习与具身智能领域,基于视觉的操纵策略学习一直是核心议题。该数据集以“将盒子放置于盘子之上”这一典型桌面操作任务为脉络,依托LeRobot框架采集了单一回合、共计两千三百余帧的同步多视角视频与关节状态序列,涵盖前视、顶视与夹爪视角,并记录了六自由度动作指令与本体感知状态。其经典使用场景在于为模仿学习与视觉-动作策略模型提供细粒度、多模态的示范轨迹,使研究者能够在受控条件下探究机器人如何从高维视觉观测中提取空间关系并生成精确的抓取与放置动作。
解决学术问题
该数据集针对机器人操纵学习中示范数据稀缺与多视角感知融合困难等常见学术问题提供了实证基础。在学术研究中,如何让机器人理解“放置于”这类空间关系谓词、如何在单一任务中保持动作连贯性以及如何利用多视角视觉信息提升策略泛化能力,均是长期困扰研究者的难题。此数据集通过同步记录三路视频流与六维关节轨迹,为视觉-动作映射、任务条件策略学习以及空间关系推理等方向提供了可复现的基准,其意义在于推动小样本条件下精细操纵策略的验证与比较,并为后续多任务扩展提供参照。
衍生相关工作
围绕该数据集,衍生工作主要沿两条脉络展开。其一是在LeRobot生态内,研究者利用其标准化格式进行策略训练与可视化评估,推动了开源机器人学习工具链的完善;其二是基于此类单任务示范数据,后续工作常通过数据增强、多任务拼接或语言条件化扩展,构建更复杂的操作基准。该数据集亦可能启发针对空间关系谓词的组合泛化研究,以及多视角融合的模仿学习算法比较,为具身智能领域积累可复用的实验素材与方法论参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务