遇见数据集

kunhsiang/eval_exp9_sc2var_grasp_the_large_box_20260527-171730

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集由LeRobot创建,专注于机器人学领域,包含一个任务和单个情节,总帧数为2277帧,帧率为30fps。数据以Parquet格式存储,视频文件为MP4格式,使用AV1编解码器。数据集特征包括动作(如肩部、肘部、手腕和夹爪的位置)、观察状态(与动作相同的位置信息)以及来自前视、顶部和夹爪摄像头的图像观测(分辨率为480x640,3通道RGB)。元数据还包括时间戳、帧索引、情节索引和任务索引等信息。数据集适用于机器人控制、视觉感知和强化学习等任务。

This dataset is created using LeRobot and focuses on robotics. It contains one task and a single episode, with a total of 2277 frames at 30fps. The data is stored in Parquet format, and video files are in MP4 format using the AV1 codec. The dataset features include actions (e.g., positions of shoulder, elbow, wrist, and gripper), observation states (same position information as actions), and image observations from front, top, and gripper cameras (resolution 480x640, 3-channel RGB). Metadata also includes timestamps, frame indices, episode indices, and task indices. The dataset is suitable for tasks such as robot control, visual perception, and reinforcement learning.

提供机构:
kunhsiang
搜集汇总
数据集介绍
kunhsiang/eval_exp9_sc2var_grasp_the_large_box_20260527-171730 数据集图片
构建方式
在机器人学习领域,高质量的真实世界操作数据是训练通用策略的关键基础。该数据集由LeRobot框架构建,记录了so_follower机械臂执行抓取大盒子的单次任务过程。数据采集以30帧每秒的频率同步获取多路视觉信息与本体状态,涵盖肩部旋转、升降、肘部弯曲、腕部俯仰与滚转以及夹爪位置六个自由度的动作指令与观测状态。原始数据以Parquet列式存储格式按块组织,视频流则编码为AV1格式的MP4文件,最终通过LeRobot的标准化数据管道整合为统一结构,形成包含2277帧的单一训练回合。
特点
该数据集呈现出多模态同步观测与精细动作记录的双重特性。视觉层面集成前视、俯视与夹爪三个视角的480×640分辨率视频,为空间感知与操作理解提供丰富视觉线索。状态层面则完整保留六自由度关节位置的时间序列,动作与观测状态维度严格对齐,便于策略学习中的状态-动作映射建模。数据以30fps恒定帧率采样,时序一致性良好,且采用紧凑的列式存储与高效视频编码,兼顾了访问效率与存储经济性。单一任务回合的设计虽覆盖范围有限,却为特定抓取场景提供了高密度的连续轨迹样本。
使用方法
在具体应用中,研究者可借助HuggingFace平台提供的可视化工具直接浏览数据集的视频与轨迹。通过LeRobot库加载数据时,配置文件指明数据文件路径模式与视频键名,用户可依据meta/info.json中的特征定义解析各字段含义,提取动作序列与多视角观测图像。数据可自然适配模仿学习或强化学习流程,用于训练抓取策略或进行视觉-动作联合表征研究。由于数据集采用标准化的LeRobot格式,使用者还能便捷地将其与其他任务数据混合,以增强模型的泛化能力,或在该数据基础上进行二次标注与扩展实验。
背景与挑战
背景概述
机器人操作领域中,抓取与操控大尺寸物体始终是极具实用价值却鲜有系统研究的基础难题。该数据集由LeRobot框架构建,属评估实验序列,收录了单一回合共2277帧、以30fps采样的so_follower机械臂多视角操作数据,涵盖前视、顶视与夹爪三个480×640视频流及六维关节位置与动作标注。其核心研究问题在于为视觉引导的大尺寸物体抓取策略提供细粒度、多模态的真实操作记录,从而支撑模仿学习与端到端控制算法的评估。该数据集虽规模有限,却为机器人抓取领域补充了稀缺的实机数据资源,对推动操作策略的可复现研究具有参考意义。
当前挑战
大尺寸物体抓取所面临的领域挑战在于物体几何尺度超出夹爪有效行程,导致接触点选择、抓取姿态规划与力封闭条件均显著恶化,传统小型物体抓取策略难以直接迁移。构建过程中,单回合仅2277帧的数据体量难以覆盖抓取任务中丰富的初始位姿与接触扰动,策略泛化能力受限;多视角视频以AV1编码存储,在保证画质的同时需兼顾解码效率与帧对齐精度;六维关节状态与动作空间虽结构清晰,但缺乏力/触觉等接触模态,难以刻画抓取大尺寸物体时关键的接触力演化过程。此外,单任务、单回合的标注限制了任务多样性与统计显著性。
常用场景
经典使用场景
在机器人学习与具身智能研究领域,针对大尺寸物体的抓取任务始终是检验算法泛化能力与操作精度的试金石。该数据集依托LeRobot框架构建,记录了so_follower机械臂在单一回合内执行抓取大型箱体的完整操作序列,涵盖前视、顶视与夹爪三路视觉观测及六自由度关节位置信息,帧率达30fps,总帧数达2277帧,构成了视觉-动作联合建模的典型范式,为模仿学习与端到端策略训练提供了高质量的真实机器人演示数据。
解决学术问题
该数据集直面机器人操作研究中大尺寸物体抓取所面临的感知遮挡、运动规划约束与抓取位姿估计等核心难题。通过同步采集多视角视觉信息与关节状态、动作指令,它为研究者在有限演示样本条件下探索视觉运动策略的鲁棒性、多模态观测融合机制以及抓取行为的时序建模提供了实证基础,有助于缓解当前领域内大物体操作示范数据稀缺的困境,推动数据驱动方法在复杂抓取场景中的可复现性验证。
衍生相关工作
以该数据集为代表的LeRobot格式抓取数据,已在开源机器人学习社区中催生出一系列围绕模仿学习算法验证、视觉-语言-动作模型微调以及仿真到现实迁移的研究工作。其结构化元信息与标准化存储格式便于研究者开展策略网络架构对比实验,并促进了抓取任务中多视角融合、时序动作预测及数据集可视化工具链的迭代发展,为后续更大规模机器人操作数据集的构建提供了实践范本。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务