snack
收藏官方服务:
资源简介:
该数据集是一个基于LeRobot项目创建的机器人学演示数据集,包含50个完整的任务执行片段(episodes),总计32797帧数据。数据采用多模态形式,包括机器人动作指令(6维浮点动作向量,控制肩部平移、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)、关节状态观测(6维浮点状态观测向量,对应相同关节位置),以及来自两个摄像头的视觉观测(follower和realsense摄像头,每个提供480x640分辨率、30fps的RGB视频流)。此外,数据还包含时间戳、帧索引、episode索引等元数据字段。数据集以parquet格式存储,按1000帧分块,总数据量约300MB(其中视频数据占200MB)。所有50个episodes均被划分为训练集,适用于机器人模仿学习、行为克隆等任务的研发。
创建时间:
2026-07-25
原始信息汇总
数据集概述
- 名称: snack
- 创建工具: 该数据集使用 LeRobot 创建
- 许可证: apache-2.0
数据集结构
- 任务类型: robotics
- 机器人类型: so_follower
- 数据格式: Parquet 文件(data//.parquet)
- 数据划分: 仅包含训练集(train),共80个episodes
- 总帧数: 51,017
- 总任务数: 1
- 帧率: 30 fps
特征信息
- 动作(action): 6维浮点数组,包含肩部旋转、肩部升降、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置
- 观测状态(observation.state): 6维浮点数组,与动作特征相同
- 观测图像(observation.images):
- follower: 视频数据,分辨率480x640x3,30 fps,AV1编码
- realsense: 视频数据,分辨率480x640x3,30 fps,AV1编码
- 其他特征: 时间戳、帧索引、episode索引、索引、任务索引
数据文件信息
- 数据文件大小: 约100 MB
- 视频文件大小: 约200 MB
搜集汇总
数据集介绍

构建方式
该数据集通过LeRobot框架构建,专注于基于视觉的机器人操控任务。数据采集采用so_follower机器人,在自然场景中执行操作任务,包括50个完整的情节(episodes),共计32797帧数据。数据以多模态格式存储,涵盖6维关节动作(shoulder_pan、shoulder_lift、elbow_flex、wrist_flex、wrist_roll、gripper)、对应的观测状态,以及来自follower和realsense两个视角的480×640分辨率视频流,视频采用AV1编码,帧率为30fps。数据集被划分为训练集,所有50个情节均用于训练,数据以Parquet格式存储,视频以MP4格式组织。
特点
snack数据集具备高密度、多模态的机器人操作数据特性。其总帧数达3.2万,单个任务下包含50个情节,提供了丰富的示教样本。数据特征涵盖动作指令、状态观测和双视角视觉信息,其中视觉数据均以视频形式保存,便于后续的时序建模与模仿学习。数据集的fps为30,确保细粒度的时间分辨率,而机器人类型为so_follower,体现了其在特定机械臂操控任务中的适用性。此外,数据采用Apache-2.0协议开源,便于学术研究与工业应用。
使用方法
用户可通过LeRobot框架直接加载此数据集,利用HuggingFace Spaces中的可视化工具预览数据内容。数据集以`default`配置提供,数据文件路径为`data/*/*.parquet`,视频文件位于`videos/`目录。在代码中,可使用LeRobot的`Dataset`类加载,自动处理动作、状态、图像与时间戳等字段。数据集结构清晰,包含`frame_index`、`episode_index`与`index`等索引字段,便于按情节或帧进行检索。训练时,可结合`observation.images.follower`与`observation.images.realsense`的影像输入与6维动作向量,构建视觉-动作映射模型,适用于行为克隆、逆强化学习等范式。
背景与挑战
背景概述
snack数据集由研究团队利用LeRobot框架创建,专注于机器人操作领域中的模仿学习任务。该数据集以APACHE-2.0许可证发布,包含50个演示片段、总计32797帧图像及对应的动作状态记录,旨在解决机器人从人类演示中学习精细操作技能的核心问题。数据集依托so_follower机械臂平台,通过6自由度关节角度与夹爪状态数据,结合480×640分辨率的第一人称和第三方视角视频流,为研究人机交互中的技能迁移提供了高保真数据支撑。其发布对推动低成本、可复现的机器人学习实验具有重要参考价值。
当前挑战
snack数据集所应对的领域挑战在于如何从有限的人类演示中高效提取通用操作策略,尤其在零食抓取等非结构化场景中,机器人需要适应物体形状、位置与力度的动态变化。构建过程中的挑战包括:同步采集30帧/秒的多视角视频与6维关节动作数据,并确保时序对齐精度;压缩AV1编码视频在降低存储开销的同时,需避免运动模糊或关键细节损失;50个演示样本的规模可能限制模型泛化能力,需通过数据增强或跨任务迁移学习来缓解过拟合风险。
常用场景
经典使用场景
在机器人学习领域,snack数据集专注于面向精细操作任务的模仿学习研究。该数据集记录了机械臂执行抓取与放置食物的完整动作序列,包含6维关节空间的动作指令与状态观测,以及来自跟随相机和深度传感器的多视角视觉影像。其经典使用场景在于为基于视觉的机器人操控模型提供高质量的专家示范数据,支持行为克隆、逆强化学习等算法的训练与评估。数据以30赫兹的帧率采集,涵盖50个episode的交互轨迹,为构建鲁棒的闭环控制策略奠定了数据基础。
解决学术问题
该数据集有效解决了机器人精细操作中数据稀缺与泛化性不足的学术难题。通过提供多模态感知与连续动作对齐的标准化数据,snack支持研究者探索从视觉输入到关节运动的端到端映射关系,推动了模仿学习在非结构化环境中的适应性研究。其意义在于降低了机器人技能获取对人工编程的依赖,为理解“观察-决策-执行”的认知闭环提供了可复现的基准,促进了跨实验室的算法对比与验证。
衍生相关工作
snack数据集衍生了一系列相关工作,包括基于扩散策略的动作生成模型、采用Transformer架构的视觉-运动联合表征学习以及结合深度图像的三维重建与规划方法。研究者利用该数据训练的策略网络,在LeRobot框架下实现了跨任务的正迁移,并催生了如“协同注意力的多模态模仿学习”等创新算法。这些工作进一步验证了精细数据集在推动通用机器人技能泛化中的核心价值,为后续的机器人基础模型研究提供了范例。
以上内容由遇见数据集搜集并总结生成



