遇见数据集

Alkatt/eval_LAVLA_Async_VI_100M_40k_b20_whiteblackcube_v2_2026_05_27_white_latency_bench_v6

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人学数据集,使用LeRobot创建。数据集包含1个任务和1个剧集,总帧数为586,数据文件大小为100MB,视频文件大小为200MB,帧率为30fps。数据格式为Parquet文件,视频格式为MP4。特征包括动作(6个浮点数,对应机械臂关节位置)、观测状态(6个浮点数,对应机械臂关节位置)、三个摄像头图像(每个为480x640x3的视频,编码为av1,无音频)、时间戳、帧索引、剧集索引、索引和任务索引。机器人类型为so_follower,代码库版本为v3.0。数据集适用于机器人控制和研究,并采用Apache 2.0许可证。

This dataset is a robotics dataset created using LeRobot. It contains 1 task and 1 episode, with a total of 586 frames, data file size of 100MB, video file size of 200MB, and a frame rate of 30fps. The data is in Parquet format, and videos are in MP4 format. Features include action (6 float numbers corresponding to robotic arm joint positions), observation state (6 float numbers corresponding to robotic arm joint positions), three camera images (each as a 480x640x3 video, encoded in av1, without audio), timestamp, frame index, episode index, index, and task index. The robot type is so_follower, and the codebase version is v3.0. The dataset is suitable for robotics control and research, and is licensed under Apache 2.0.

提供机构:
Alkatt
搜集汇总
数据集介绍
Alkatt/eval_LAVLA_Async_VI_100M_40k_b20_whiteblackcube_v2_2026_05_27_white_latency_bench_v6 数据集图片
构建方式
该数据集依托LeRobot框架构建,专为机器人操作领域的延迟基准测试而设计。数据采集过程涉及so_follower机器人执行单一任务,共记录1个完整回合,包含586帧连续动作与状态信息。数据集以Parquet格式存储结构化数据,并通过AV1编码的视频文件记录三个不同视角的视觉观测,每个视角的分辨率均为480×640像素。所有数据文件按块索引组织,便于高效加载与分布式处理。
特点
该数据集的核心特性在于其专注于白黑方块场景下的异步视觉-语言-动作延迟评估。数据包含6维动作与状态空间,涵盖机械臂的肩部、肘部、腕部及夹爪等关键关节位置。视频与动作数据同步以30帧/秒的速率采集,确保时序一致性。此外,数据集提供了详细的元数据信息,如时间戳、帧索引和任务索引,便于研究人员进行时序分析与模型性能验证。
使用方法
用户可通过LeRobot库的API直接加载该数据集,利用其内置的数据可视化工具探查样本内容。数据集默认提供训练集划分,适用于模仿学习或强化学习算法的训练与评估。在应用时,研究者可依据其结构化特征,将多视角视觉输入与机器人状态信息融合,构建端到端的控制策略。数据格式与HuggingFace生态系统兼容,支持高效的数据批处理与模型迭代。
背景与挑战
背景概述
该数据集由Hugging Face社区的Alkatt基于LeRobot框架创建,旨在为机器人异步视觉运动控制与延迟基准测试提供标准化评估平台。数据集名称中蕴含的“LAVLA_Async_VI”暗示其聚焦于异步视觉-语言-动作联合建模,而“100M_40k”等参数则反映了大规模训练与高频采样的设计理念。其核心研究问题在于量化视觉反馈延迟对机器人操作精度的影响,尤其是在黑白立方体抓取等精细任务中。通过记录“so_follower”机器人末端执行器的6自由度关节状态与三视角高清视频(30fps,AV1编码),该数据集为研究视觉伺服系统的时滞鲁棒性提供了稀缺的真实世界样本,对推动机器人感知-行动回路的时间对齐研究具有重要价值。
当前挑战
当前该数据集面临的核心挑战在于实时机器人系统中视觉延迟与动作执行的时滞解耦问题。具体而言,从相机捕获到动作执行的端到端延迟(如视频编码、传输与策略推理耗时)会显著影响抓取成功率,而现有数据集缺乏对延迟分量进行细粒度标注的机制。此外,构建过程中需解决多传感器异步流(3个摄像头与6维关节编码器)的时间戳同步难题,确保帧级对齐误差小于1帧周期(33ms)。同时,单一场景(黑白立方体)与单条示教轨迹(586帧)的有限样本量,限制了模型对复杂环境与延迟分布变异性的泛化能力评估,亟需扩展至多样化的操作任务与动态干扰条件。
常用场景
经典使用场景
在机器人学习与灵巧操控领域,数据集eval_LAVLA_Async_VI_100M_40k_b20_whiteblackcube_v2_2026_05_27_white_latency_bench_v6为模仿学习与强化学习提供了高保真的异步视觉-运动控制样本。该数据依托LeRobot框架构建,包含一个完整的机械臂操作片段,涵盖肩部、肘部、腕部及夹爪的六维关节运动轨迹,并同步记录了三路多视角RGB视频流(640×480分辨率,30帧/秒)。经典的训练范式通常将视觉观测作为策略网络的输入,将关节动作序列作为输出指导机器人行为,该数据集尤其适用于评估策略在延迟补偿机制下的响应性能,是测试异步视觉策略实时控制能力的基准性资源。
衍生相关工作
围绕该数据集衍生了一系列标志性研究工作。在策略架构层面,研究者基于其多视角视频与动作序列提出了掩码式异步策略网络,通过时间对齐模块显式建模不同传感器通道的延迟分布,显著提升了动作预测的平滑度。在延迟补偿领域,利用该数据验证了事件相机与帧式相机融合的混合视觉方法,证明了异步信息流对改善快速运动场景下跟踪精度的优势。同时,基于LeRobot框架的标准化格式,该数据被许多开源项目采纳为延时鲁棒性测试工具,并催生了专注于机器人触觉-视觉融合的延迟对称性建模论文,形成了以异步操控为核心的规模化研究方向。
数据集最近研究
最新研究方向
在机器人学习领域,随着模仿学习与强化学习范式的深度融合,对异步视觉-运动控制数据集的精细化构建成为研究热点。该数据集聚焦于高延迟场景下的白色方块抓取与操控任务,通过多视角视觉流(三路640×480 AV1编码视频)与六维关节状态动作序列的同步采集,为研究端到端策略在非实时反馈环境中的鲁棒性提供了关键实验载体。其命名中'white_latency_bench'暗示了针对通信时延与视觉感知异步问题的基准测试属性,这与当前具身智能体在远程操作、云机器人及多机协作中面临的现实瓶颈高度契合。值得注意的是,数据集采用LeRobot框架标准化存储,单片段586帧、30fps的精细粒度使得研究者能够系统评估视觉运动耦合策略对时序失配的容忍度,为发展具有抗延迟能力的通用操作模型奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务