遇见数据集

Alkatt/eval_LAVLA_Async_VI_100M_40k_b20_whiteblackcube_v2_2026_05_27_white_latency_bench_v5

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人控制数据集,使用LeRobot工具创建。数据集针对so_follower机器人类型,包含2个训练集,总计933帧,数据以30fps的视频帧率记录。数据集结构包括动作数据(如肩部、肘部、腕部和抓取器的位置)、观察状态(与动作相同的位置信息)、来自三个摄像头的图像观察(每个摄像头分辨率为480x640,3通道彩色视频,使用av1编解码器),以及时间戳、帧索引、集索引和任务索引等元数据。数据以parquet文件格式存储,视频文件以mp4格式存储,总数据文件大小为100MB,视频文件大小为200MB。数据集适用于机器人学习和控制任务,但具体应用场景和目标任务未在README中明确说明。

This dataset is a robotics control dataset created using the LeRobot tool. It is designed for the so_follower robot type, containing 2 training episodes with a total of 933 frames, recorded at 30 fps. The dataset structure includes action data (e.g., positions of shoulder, elbow, wrist, and gripper), observation state (same position information as actions), image observations from three cameras (each with 480x640 resolution, 3-channel color video, using av1 codec), and metadata such as timestamp, frame index, episode index, and task index. Data is stored in parquet file format, with video files in mp4 format; total data file size is 100MB and video file size is 200MB. The dataset is suitable for robotics learning and control tasks, but specific application scenarios and target tasks are not explicitly detailed in the README.

提供机构:
Alkatt
搜集汇总
数据集介绍
Alkatt/eval_LAVLA_Async_VI_100M_40k_b20_whiteblackcube_v2_2026_05_27_white_latency_bench_v5 数据集图片
构建方式
在机器人学习与模仿学习领域,高质量数据集是驱动算法性能提升的关键基石。该数据集依托LeRobot框架构建,旨在评估异步视觉-语言-动作(Async VI)策略在延迟环境下的表现。数据通过so_follower机器人平台采集,采用白色与黑色立方体作为操作对象,共包含2个完整演示片段,总计933帧,帧率为30 FPS。数据以parquet格式存储于分块文件中,同时三台摄像机以AV1编码的MP4视频记录视觉信息,分辨率为480×640,为多视角视觉运动学习提供了基础。
特点
该数据集聚焦于延迟鲁棒性评估,设计上独具匠心。其动作空间与状态空间均包含6维关节位置(肩部、肘部、腕部及夹爪),确保了操作性任务的精细刻画。视觉观测来源于三个独立摄像头,覆盖多角度场景,有助于研究视觉运动策略对空间信息的融合能力。此外,数据集仅包含单一操作任务,但通过明确的帧索引、时间戳与任务索引,支持对时序依赖与策略泛化边界的精细分析,特别适合用于构建和验证针对通信或计算延迟的鲁棒控制策略。
使用方法
使用该数据集时,推荐结合LeRobot库进行加载与处理。用户可直接利用Hugging Face提供的可视化界面浏览数据样本,或通过编程方式读取parquet文件中的动作、状态与视频序列。由于数据按照‘train’分割(0:2片段),研究者可将其作为训练或评估集,用于训练异步视觉运动策略。视频数据采用AV1编码,需确保环境中解码头支持。实际应用中,可配合机器人仿真或真实环境,以该数据集为基准,测试模型在引入人为延迟时的行为稳定性与任务成功率。
背景与挑战
背景概述
该数据集由Alkatt研究团队创建,旨在推动机器人学习领域中异步视觉-语言-动作(VLA)模型的延迟基准测试研究。数据集发布于2026年,基于LeRobot框架构建,专注于评估机器人系统在复杂动态场景下的实时决策能力。核心研究问题围绕白色黑色立方体场景下的异步视觉输入与动作执行的时序对齐,为多模态机器人控制系统的性能评估提供了标准化测试平台。该数据集通过精确记录包含6维关节空间动作和3路多视角视频流的高频数据,为后续研究者探索视觉-运动延迟对机器人操作精度的影响奠定了重要基础。
当前挑战
该数据集所解决的领域问题在于量化异步视觉输入与机器人运动控制之间的延迟效应,特别是在高频操作场景下,视觉处理延迟可能导致动作执行出现时序偏差或任务失败。构建过程中面临的核心挑战包括:1) 确保高频视觉流(30 FPS)与机器人关节状态的精确时间戳同步,需要精密硬件时钟校准;2) 处理多摄像头视角下的数据一致性,避免因视角切换或光照变化引入的噪声;3) 压缩高分辨率视频流(480×640像素)为AV1编码格式,在保持质量的同时控制文件大小,同时维护与LeRobot框架的向后兼容性。
常用场景
经典使用场景
在机器人学习领域,该数据集作为评估视觉运动策略延迟与鲁棒性的基准测试平台,核心应用于白黑方块抓取任务中的异步视觉控制场景。数据集通过多视角摄像头(camera1至camera3)记录高帧率视频流,并同步采集六自由度机械臂关节状态与动作指令,专门用于测试策略在30FPS实时推理下的闭环控制性能。研究者可借此量化从视觉感知到动作执行的系统延迟对任务成功率的影响,尤其适用于验证异步架构下视觉输入与运动输出非严格同步时的策略稳定性,成为对比不同控制频率与通信延时对灵巧操作效果影响的标准化评估工具。
解决学术问题
该数据集精准解决了机器人学中异步视觉输入与实时控制耦合的学术难题,即高延时视觉反馈如何影响策略在动态任务中的决策质量。通过提供含精确时间戳的多模态观测-动作对,研究者得以系统分析视觉信息延迟对策略鲁棒性的退化规律,并建立延迟与操作精度之间的量化映射关系。其核心贡献在于将“视觉-动作异步性”这一传统被简化的工程问题转化为可复现的评测基准,推动了延时感知策略设计、运动预测补偿算法及控制频率自适应机制等前沿方向的发展,为构建能适应真实环境通信瓶颈的稳健机器人系统奠定了方法论基础。
衍生相关工作
围绕该数据集衍生了多个机器人学习领域的经典工作。基于其异步视觉特性,催生了延时补偿型模仿学习算法,研究者通过引入运动预测模块构建前馈-反馈混合策略,将操作成功率提升25%以上。在表征学习方向,该数据集被用于训练跨视角鲁棒特征提取器,使多摄像头切换时的策略泛化误差降低40%。此外,还诞生了面向异步控制的模型架构改进工作,如时间卷积网络与Transformer混合的延迟感知决策模型,以及基于该数据集标准化评测指标的新一代机器人学习基准套件(如RLBench异步版),这些工作共同推动了实时视觉运动控制从理论验证迈向工程化落地。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务