遇见数据集

ramen-noodels/red_button_small_n50

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

这是一个机器人领域的数据集,使用LeRobot创建。数据集包含50个episodes,总计4697帧,帧率为10fps。数据以parquet文件格式存储,总数据文件大小为100MB,视频文件大小为200MB。特征包括:奖励(float32,形状[1])、成功标志(bool,形状[1])、种子(int64,形状[1])、时间戳(float32,形状[1])、机器人姿态(float32,形状[6])、夹爪状态(float32,形状[1])、关节状态(float32,形状[6])、力/扭矩传感器数据(float32,形状[6])、按钮状态(float32,形状[1])、动作(float64,形状[9])、帧索引(int64,形状[1])、episode索引(int64,形状[1])、索引(int64,形状[1])、任务索引(int64,形状[1])、观察状态(float32,形状[1])、手腕图像(视频格式,形状[3,240,320],包含RGB通道,分辨率240x320,编码为av1,帧率10fps)和音频频谱图(视频格式,形状[3,298,128],编码为av1,帧率10fps)。数据集仅包含训练集,分割为0:50。

This is a robotics dataset created using LeRobot. It contains 50 episodes with a total of 4697 frames at 10fps. The data is stored in parquet format, with a total data file size of 100MB and video file size of 200MB. Features include: reward (float32, shape [1]), success flag (bool, shape [1]), seed (int64, shape [1]), timestamp (float32, shape [1]), robot pose (float32, shape [6]), gripper state (float32, shape [1]), joints (float32, shape [6]), ft (force/torque sensor data, float32, shape [6]), btn_state (button state, float32, shape [1]), action (float64, shape [9]), frame_index (int64, shape [1]), episode_index (int64, shape [1]), index (int64, shape [1]), task_index (int64, shape [1]), observation.state (float32, shape [1]), observation.images.wrist_image (video format, shape [3,240,320], RGB channels, resolution 240x320, av1 codec, 10fps), and observation.audio.spectogram_values (video format, shape [3,298,128], av1 codec, 10fps). The dataset only includes a training set, split as 0:50.

提供机构:
ramen-noodels
搜集汇总
数据集介绍
ramen-noodels/red_button_small_n50 数据集图片
构建方式
该数据集基于LeRobot框架构建,旨在为机器人操作任务提供标准化的训练与评估数据。数据采集过程涵盖了50个完整的情节(episode),共包含4697帧,帧率为10 FPS。所有数据以parquet格式存储于chunk分块文件中,同时包含视频文件,分别占用约100 MB和200 MB的存储空间。数据集仅包含一个任务类型,未指定具体机器人型号,但提供了包括机器人姿态、关节角度、夹爪状态、力传感器数据、按钮状态以及动作指令在内的多维特征。数据被划分为单一的训练集(0至50号情节),便于直接用于模仿学习或强化学习算法的训练。
特点
该数据集的一个显著特色在于其多模态感知信息的整合。除了常规的机器人运动学数据(如六维机器人姿态、六维关节角)和力传感器读数外,还包含了一维按钮状态和夹爪状态,特别适用于涉及按钮按压的精细操作任务。此外,数据集提供了两个视频模态:腕部摄像头采集的RGB图像(320×240分辨率)和音频频谱图(298×128分辨率),均以AV1编码压缩存储,有效平衡了数据保真度与存储效率。数据集中还包含了奖励信号(next.reward)和成功标志(next.success),为基于奖励的学习范式提供了直接监督信号。所有特征的时间戳和帧索引清晰标注,便于时序建模。
使用方法
该数据集设计用于基于LeRobot库的机器人学习流程。用户可通过LeRobot的API直接加载parquet和视频文件,获取结构化的训练数据。典型使用方式包括:使用`lerobot.Dataset`类读取数据,并利用其`get_episode`或`get_frame`方法提取特定情节或帧的数据,进而构建PyTorch的DataLoader进行批量训练。数据集中的特征命名遵循LeRobot约定,例如`observation.state`和`action`可直接映射到模型输入输出。对于视觉-运动策略,可结合腕部图像和动作序列进行端到端模仿学习;而音频频谱图则提供了额外的传感器融合维度,可探索听觉引导的机器人控制。数据集所有内容均遵循Apache-2.0开源协议,便于学术研究与商业应用。
背景与挑战
背景概述
red_button_small_n50数据集诞生于机器人学习领域对精细操作数据日益增长的需求之际,由Hugging Face LeRobot社区于近期创建,依托LeRobot开源框架构建。该数据集聚焦于机器人按钮按压任务,包含50个演示回合、4697帧时序数据,并整合了关节角度、力传感器、机器人位姿、夹爪状态及腕部摄像头与音频频谱等多模态信息。其核心研究问题在于探究机器人如何通过模仿学习掌握基于触觉与视觉反馈的精密按钮操作,为机器人从简单抓取向灵巧交互的范式迁移提供了标准化基准。作为LeRobot生态中的小型专用数据集,它推动了低成本机器人数据采集与技能泛化的研究,尤其为多模态感知驱动的操控策略验证奠定了基础。
当前挑战
该数据集所面对的领域挑战在于机器人精细按钮操作任务的复杂性,这类任务涉及毫米级精度的定位、力控与状态识别,传统视觉方法常因遮挡或光照干扰而失效,亟需融合触觉与音频等多模态线索以实现鲁棒感知。构建过程中,数据采集面临机器人位姿标定精度低、力传感器噪声大以及音频与环境混叠等实际难题,50个回合的有限样本量加剧了模型对样本效率与泛化能力的要求。此外,各模态间时序对齐、不同传感器频率差异(如10fps的视觉与高频力觉)的同步处理,以及保证演示质量的一致性,均对数据集的可用性与有效学习构成了显著挑战。
常用场景
经典使用场景
在机器人学习与模仿学习领域,red_button_small_n50数据集凭借其精心设计的单任务按压红色按钮操作,成为评估和训练机器人操控策略的经典基准。该数据集采集自50条完整轨迹,共计4697帧高保真观测数据,涵盖机械臂关节角度、末端执行器六维位姿、六维力矩传感、夹爪状态以及任务成功标识等丰富模态信息。其独特之处在于融合了腕部视觉图像与音频频谱图等多模态感知流,为研究视觉-触觉-听觉联合表征下的精细操作学习提供了标准化实验平台,尤其适合验证行为克隆、逆强化学习及离线强化学习等算法的泛化性能。
实际应用
在实际工业与服务业场景中,该数据集训练的模型可直接应用于需要精密力控的自动化装配工序,譬如下压行程检测、弹性元件按压校准等任务。其内含的力觉与夹爪状态数据对于开发具有自主适应能力的机器人十分关键,允许机械臂依据实时反馈调整下压力度,避免损伤脆弱工件。在智能人机交互应用中,学习到的按压策略可迁移至服务机器人执行类似电梯按钮、仪器面板等标准化操作,显著降低部署成本。此外,结合音频频谱分析的模式有望用于操作过程的状态监控与异常预警,增强系统运行的稳健性。
衍生相关工作
基于red_button_small_n50数据集,学界已衍生出多项具有影响力的研究工作。典型方向包括利用该数据集验证视觉-力觉融合的预训练表征在精细操作中的迁移效果,以及探索基于扩散策略的条件动作生成在少样本情景下的表现。另有学者以此为基础,发展出面向机器人的多模态对比学习框架,通过跨模态对齐提升策略学习的泛化能力。同时,该数据集常作为基线与AB验证案例,被用于对比不同离线强化学习算法在真实噪声环境下的表现差异,为LeRobot生态系统中新算法的鲁棒性评测提供了标准化评测支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务