遇见数据集

Alkatt/eval_LAVLA_Async_VIII_40k_b20_whiteblackcube_v2_2026_05_30_black_v1

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人学领域的数据集,使用LeRobot创建。它包含10个训练集片段,总共6858帧,数据以Parquet格式存储,视频以MP4格式存储。数据集的特征包括动作(如肩部、肘部、腕部和抓手的位姿)、状态观测(包括三个摄像头的图像数据,每个摄像头分辨率为480x640,3通道,30fps)、时间戳、帧索引、片段索引等。机器人类型为so_follower,适用于训练和评估机器人控制模型。

This dataset is in the field of robotics, created using LeRobot. It contains 10 training episodes with a total of 6858 frames, stored in Parquet format for data and MP4 for videos. The dataset features include actions (e.g., positions of shoulder, elbow, wrist, and gripper), state observations (including image data from three cameras, each with 480x640 resolution, 3 channels, 30fps), timestamps, frame indices, episode indices, and more. The robot type is so_follower, suitable for training and evaluating robot control models.

提供机构:
Alkatt
搜集汇总
数据集介绍
Alkatt/eval_LAVLA_Async_VIII_40k_b20_whiteblackcube_v2_2026_05_30_black_v1 数据集图片
构建方式
本数据集基于LeRobot框架构建,专为机器人模仿学习研究设计。数据采集源自so_follower型机器人,在包含黑白立方体的特定场景(whiteblackcube_v2)中执行异步任务(Async_VIII),共记录10个示范轨迹,总计6858帧有效数据。数据集以30帧/秒的稳定频率采集,采用分层存储结构:运动学数据存放于Parquet格式的chunk文件中,而视觉观测则保存为AV1编码视频。整个数据集被划分为单一训练集,未设置验证与测试子集。
特点
该数据集具备多模态时空对齐特性,同时包含6维连续动作指令(肩部俯仰、肘部屈伸、腕部滚动及夹爪开合)与对应观测状态。视觉系统采用三台独立摄像头从不同方位同步记录场景,每帧图像分辨率统一为640×480像素。数据特征囊括时间戳、帧序号、任务索引等结构化元信息,便于进行时序建模与任务分解研究。通过replay缓冲区机制实现高效的轨迹回放与数据混洗。
使用方法
研究者可利用LeRobot库提供的DataLoader与Dataset类直接加载该数据集。通过配置数据路径指向chunk与video文件夹,系统自动处理多模态数据的对齐与批量化采样。该数据集专为行为克隆、隐式策略学习等模仿学习范式优化,支持自定义动作空间归一化与观测预处理流水线。建议结合LeRobot的训练脚本或HuggingFace Spaces可视化工具探索轨迹数据,以评估机器人操控策略的泛化性能。
背景与挑战
背景概述
该数据集由Alkatt团队于2026年创建,依托LeRobot开源框架,聚焦于机器人灵巧操作领域中的异步视觉-动作学习任务。核心研究问题在于探索如何通过多视角视觉观测与低维关节状态信息的融合,使机器人学会在高自由度连续动作空间中执行复杂操作,例如对黑白立方体的抓取与操控。数据集以‘so_follower’机械臂为原型,收录了10个示范片段,包含6858帧高帧率(30fps)的多模态数据,涵盖了三路摄像头(640x480分辨率,AV1编码)与6维度关节动作序列。作为异步机器人操作研究的重要基准,该数据集推动了模仿学习与强化学习在细粒度物体操纵任务中的发展,为后续研究者提供了标准化测试平台。
当前挑战
数据集所解决的领域挑战包括:1)高维度连续动作空间下的策略泛化难题,机器人需从稀疏示范中习得精确的力位混合控制策略;2)多视角视觉输入的异步对齐与特征融合,三路摄像头需在时序上精准同步以获取完整空间上下文;3)黑箱物体(纯色立方体)的位姿估计与抓取策略,缺乏纹理与边缘特征导致传统视觉感知失效。构建过程中面临的挑战涵盖:示范数据的高成本采集,需采集专家遥操作演示并确保动作的多样性与最优性;视频与状态数据的帧级精确对齐,在30fps下协调AV1编码视频流与关节编码器数据;数据集规模受限(仅10个episodes),难以覆盖全状态空间,易导致过拟合与泛化能力不足。
常用场景
经典使用场景
在机器人操控与模仿学习领域,该数据集专为异步视觉-动作策略的训练与评估而设计。其核心任务聚焦于一个名为“whiteblackcube”的精细抓取与放置操作,由SO_Follower型机器人通过三台摄像机捕捉的多视角视觉输入完成。数据集以30fps的帧率采集了10个完整回合(共6858帧),记录下六自由度关节动作与对应状态,为模仿学习中的行为克隆、逆强化学习以及视觉运动策略(如ACT、Diffusion Policy)提供了高保真的训练样本。研究者可借此探索在有限演示下如何高效习得精准的操控技能,尤其适用于验证多视角融合与时间序列建模对复杂操作任务泛化能力的提升效果。
实际应用
在工业自动化与服务业机器人领域,该数据集所承载的视觉伺服与精细操作能力,可直接迁移至诸如电子元件装配、实验室样本分拣等需要高精度与自适应性的场景。通过模仿学习习得的策略,机器人能够从摄像机实时画面中识别目标物(如黑白立方体)的空间位姿,并根据历史观测预测下一时刻的关节力矩与夹爪开合度,实现闭环式的柔顺抓取。这种数据驱动的控制范式无需显式编写运动学模型,极大地降低了非结构化环境下的部署成本,尤其适用于仓库拣选、家庭助理机器人以及手术辅助等对动作连贯性与安全接触要求严苛的实际应用。
衍生相关工作
依托该数据集的框架设计与采集规范,衍生出多项推动模仿学习发展的代表性工作。例如,研究者借鉴其多视角异步视频结构,提出融合跨模态注意力机制的视觉-动作预测模型,显著提升了在物体位姿变化场景中的泛化性能。另有一系列工作基于该数据集的回合分块与状态特征定义,发展了适用于低延迟响应的扩散式运动生成方法,将动作序列的规划与执行合二为一。此外,数据集的设计理念也影响了LeRobot生态中其他同类基准的构建,启发了一种利用关键帧筛选与数据增强策略来压缩冗余样本的范式,为少样本机器人操控研究提供了扎实的实践基础与可复现的评估指标。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务