遇见数据集

jogarulfop/2026-05-28_chakeitup_alubox_vf_0_1kHz

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,是一个机器人学数据集,包含50个总集数和32639个总帧数。数据格式为Parquet文件,视频文件为MP4格式。数据集特征包括动作(6维浮点数组,对应肩部旋转、肩部抬升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)、观察状态(与动作相同的6维浮点数组)、观察图像(顶部摄像头和腕部摄像头,分辨率480x640,3通道,30fps,AV1编码)、左触觉频谱图图像(分辨率224x224,3通道,30fps,AV1编码),以及时间戳、帧索引、集索引、索引和任务索引等元数据。机器人类型为so101_follower_dragontactile,总任务数为1,数据文件大小为100MB,视频文件大小为200MB。数据集适用于训练和评估机器人控制模型。

This dataset, developed using LeRobot, is a robotics dataset consisting of 50 total episodes and 32,639 total frames. The core data is stored in Parquet files, while the video files are in MP4 format. The dataset features include: actions (a 6-dimensional floating-point array corresponding to shoulder rotation, shoulder elevation, elbow flexion, wrist flexion, wrist rotation, and gripper position), observation states (a 6-dimensional floating-point array identical to the action array), observation images captured by the top-mounted camera and wrist camera (with a resolution of 480×640, 3 channels, 30 fps, and AV1 encoding), left tactile spectrogram images (with a resolution of 224×224, 3 channels, 30 fps, and AV1 encoding), as well as metadata such as timestamps, frame index, episode index, sample index, and task index. The robot platform is so101_follower_dragontactile, with a total of 1 task. The total size of the data files is 100 MB, and the total size of the video files is 200 MB. This dataset is applicable for training and evaluating robotic control models.

提供机构:
jogarulfop
搜集汇总
数据集介绍
jogarulfop/2026-05-28_chakeitup_alubox_vf_0_1kHz 数据集图片
构建方式
该数据集依托LeRobot框架构建,聚焦于机器人操作任务。数据采集过程中,通过SO101跟随机器人(配备Dragontactile触觉传感器)执行预设的‘铝箱夹取’动作,以30帧/秒的采样率同步记录多模态信息。数据集包含50个完整轨迹片段,总计32639帧,每个片段均存储了6维关节空间动作指令、6维本体感知状态、顶部与腕部RGB摄像头视频流(480×640分辨率),以及独特的左触觉传感器频谱图(224×224分辨率)。所有时序数据通过parquet分块文件与AV1编码视频文件组织,并严格对齐时间戳与帧索引,确保了多模态数据的时空一致性。
特点
本数据集的核心特色在于其融合了视觉、本体感知与触觉频谱的多模态架构。顶部与腕部摄像头提供了双视角的作业场景观察,而左触觉频谱图的引入为精细力交互研究(如抓取稳定性分析)提供了关键数据通道。所有数据均以30Hz的同步率采集,覆盖了连续动态操作过程。数据集结构规范,包含明确的特征字典描述每一维度的物理含义(如关节位置、图像尺寸与编码参数),并附有训练/测试集划分(全部50个片段归为训练集),便于直接用于模仿学习或逆强化学习模型的训练与验证。
使用方法
用户可通过LeRobot库便捷地加载与使用该数据集。典型流程包括:首先利用`lerobot.common.datasets.lerobot_dataset.LeRobotDataset`类,指定数据集路径与配置名‘default’初始化实例;随后通过迭代器依次获取每个时间步的观测字典(内含‘observation.state’、‘observation.images.top’等键值)与‘action’指令,构建策略网络的输入-输出对。数据集已预分割为训练集(所有50个片段),无需额外划分。若需可视化,可点击README中的‘visualize this dataset’徽章,在HuggingFace Space中直接预览视频与状态序列,以快速理解数据内容与质量。
背景与挑战
背景概述
该数据集由研究人员利用LeRobot框架于2026年创建,聚焦于机器人操作任务中的多模态感知与学习。核心研究问题在于如何通过融合视觉、触觉与本体状态信息,提升机器人对精细操作任务的执行能力。数据集以50个episode、约3.2万帧的规模,记录了SO101型机械臂在“Alubox”场景中的运动数据,包含顶视与腕部摄像头图像以及左侧触觉谱图,为模仿学习与强化学习提供了标准化测试平台,对推动触觉-视觉联合建模在机器人领域的应用具有重要价值。
当前挑战
该数据集面临的核心挑战包括:其一,机器人操作领域长期受困于高维传感数据的融合难题,如何有效整合视觉、触觉与本体信息以学习鲁棒策略仍是关键瓶颈;其二,数据集构建过程需解决多模态数据的高频同步与标定问题,例如触觉谱图与视觉流的30 FPS对齐;其三,50个episodes的规模有限,难以覆盖复杂任务中的多样化场景,对模型泛化性构成制约;此外,AV1视频编码格式虽提升压缩率,但可能引入解码延迟与质量损失,影响下游训练效率。
常用场景
经典使用场景
在机器人学习领域,该数据集为模仿学习与示教学习提供了高质量的多模态训练素材。数据集包含了50个完整演示回合,记录了机器人执行特定操作时的关节动作序列、顶部与腕部摄像头捕捉的视觉图像,以及左侧触觉传感器的频谱图信息。这些同步采集的数据以每秒30帧的速率保存,使得研究者能够利用行为克隆或逆强化学习等范式,训练机器人从示教中习得精细的抓取、放置与组装技能。其标准化的LeRobot格式与Apache-2.0许可协议,进一步降低了学术复现与跨平台迁移的门槛。
实际应用
在实际部署中,该数据集可赋能协作机器人完成高精度装配、易损物件操作及自适应抓取等任务。例如,结合腕部与顶部视觉信息,机器人能实时调整末端执行器姿态以应对工件位置偏移;而触觉频谱图则提供了接触力反馈,防止在抓取玻璃器皿或电子元件时造成损伤。此外,它可被用于开发跨场景的预训练基础模型,使同一套控制策略能在不同构型的机械臂间迁移,减少企业二次开发成本。在医疗辅助或家庭服务领域,这一数据集也能为柔性夹爪与安全交互控制器的设计提供关键训练依据。
衍生相关工作
基于该数据集,研究者已衍生出若干影响深远的学术工作。在算法层面,多模态融合机制被用于改进扩散策略以生成更平滑的动作轨迹;在表示学习方面,触觉-视觉对偶编码器的预训练范式得以验证,显著提升了微小物件操作的精度。部分工作还针对该数据集中的触觉频谱图特征,开发了基于频域分析的解耦模块,用于分离接触纹理与外力信息。此外,该数据集作为LeRobot生态的组成部分,促进了跨数据集迁移学习基准的建立,使诸如Robot-View Transformer等架构能够利用不同机器人的演示数据协同训练,从而在少样本场景中展现出更强的泛化能力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务