遇见数据集

Alkatt/eval_LAVLA_Async_VI_100M_40k_b20_whiteblackcube_v2_2026_05_27_white_latency_bench_v2

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的机器人领域数据集,专门针对so_follower机器人类型。数据集包含2个episodes、3376帧和1个任务,数据以parquet文件格式存储,视频以mp4格式存储,帧率为30fps。特征包括:动作数据(6个关节位置:肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部旋转、夹爪位置)、观测状态(同样6个关节位置)、三个摄像头的图像观测(每个摄像头为480x640x3的视频,使用av1编码)、时间戳、帧索引、episode索引、任务索引等。数据集总数据文件大小为100MB,视频文件大小为200MB,适用于机器人控制和学习任务的研究与开发。

This dataset is created using LeRobot for the robotics domain, specifically for the so_follower robot type. It contains 2 episodes, 3376 frames, and 1 task, with data stored in parquet files and videos in mp4 format at 30fps. Features include: action data (6 joint positions: shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, gripper position), observation state (same 6 joint positions), image observations from three cameras (each camera provides 480x640x3 video with av1 codec), timestamp, frame index, episode index, task index, etc. The total data file size is 100MB, and video file size is 200MB, suitable for research and development in robot control and learning tasks.

提供机构:
Alkatt
搜集汇总
数据集介绍
Alkatt/eval_LAVLA_Async_VI_100M_40k_b20_whiteblackcube_v2_2026_05_27_white_latency_bench_v2 数据集图片
构建方式
该数据集基于LeRobot框架构建,旨在为机器人学习领域提供异步视觉运动控制任务的评估基准。数据采集自一台名为so_follower的机器人,包含2个完整回合、总计3376帧的序列数据,以30帧每秒的速率记录。数据集采用分块存储策略,每个分块容量为1000帧,原始观测数据与编码视频分别以parquet和AV1格式保存,兼顾了存储效率与数据完整性。所有动作与状态信息均映射至机器人六维关节空间,涵盖肩部、肘部、腕部及夹爪的位置指令,确保了运动指令的精细刻画。
特点
数据集的核心特色在于其多模态观测架构,集成了三路独立摄像头(camera1至camera3),均以480×640像素分辨率、30帧每秒的速率记录场景视觉信息,为感知系统提供了丰富的环境上下文。同时,数据集明确界定了延迟基准测试的评估场景(white_latency_bench_v2),聚焦于异步控制环境下的系统响应能力。仅含单一任务类型的设计初衷,有利于针对特定操作场景进行深度性能剖析,而Apache-2.0许可协议则赋予了研究社区自由复用的权利。
使用方法
研究人员可通过LeRobot库提供的可视化工具(visualize_dataset)直接浏览数据内容,或利用标准接口加载parquet数据文件。数据按训练集划分(全部2个回合),通过data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet路径索引。使用时需注意,动作与状态特征维度均为6维浮点向量,分别对应机器人关节空间位置;视频数据须经由AV1解码器还原为时序帧;此外,数据集内嵌的timestamp与episode_index字段可用于时间对齐与回合分离,便于进行模仿学习或强化学习的模型训练与评估。
背景与挑战
背景概述
该数据集由Alkatt研究团队基于LeRobot框架创建,聚焦于机器人操作领域的异步视觉-语言-动作(VLA)模型性能评估。数据集名称中的“Async_VI_100M_40k_b20_whiteblackcube_v2”暗示其针对大规模视觉语言模型(参数量约100M)在黑白立方体抓取与放置任务中的异步推理延迟进行基准测试。数据集包含2个片段(episode)、3376帧图像,通过三台摄像头(分辨率640×480)以30 FPS同步采集6自由度机器人手臂(so_follower)的状态与动作数据。其核心研究问题在于量化VLA模型在真实机器人控制中的端到端时序延迟,为异步推理系统的实时性提供标准化评估基准。该数据集对机器人学习领域具有独特影响力,填补了针对异步VLA模型延迟行为进行细粒度量化分析的空白。
当前挑战
数据集面临的领域挑战包括:1)机器人操作中视觉-语言-动作模型的异步推理延迟耦合性问题,传统同步架构难以适应非固定计算时间的真实世界交互;2)多模态输入(视觉、语言、状态)在动态环境下时序对齐的精度损失,例如视频帧与动作指令间的交错到达导致控制策略退化。构建过程中的挑战涉及:1)在有限样本量(仅2个片段)下确保延迟统计数据具有统计显著性,避免过拟合至特定硬件配置;2)高精度时间戳同步(亚毫秒级)在三台AV1编码视频流与机器人状态流之间的实现,需平衡压缩效率与实时写入延迟;3)黑白立方体这一简化视觉特征的选择虽降低了感知难度,但可能掩盖真实场景中纹理干扰对延迟的影响,需谨慎外推至复杂工业环境。
常用场景
经典使用场景
在机器人操作领域,模仿学习与基于视觉的运动规划是当前研究的热点前沿。eval_LAVLA_Async_VI_100M_40k_b20_whiteblackcube_v2_2026_05_27_white_latency_bench_v2数据集专为评估异步视觉-语言-动作(LAVLA)模型在复杂抓取任务中的性能而设计。其经典使用场景聚焦于白黑方块脱离场景的动态操作,通过记录6维关节动作指令、实时状态反馈及三视角高速视频流(30fps,AV1编码),为研究者提供了高保真的闭环控制实验平台。这一数据集不仅允许精细刻画机械臂在延迟环境下的运动学响应,还能有效测试模型对非刚性目标(如白黑立方体)的泛化能力,从而成为推动端到端机器人控制算法验证的关键基准。
解决学术问题
该数据集精准回应了机器人学习领域一个核心学术难题:如何在异步通信与感知延迟条件下,实现视觉运动策略的鲁棒迁移。传统数据集多专注于理想同步场景,而本工作通过引入显式的时间戳与帧索引,首次系统化量化了控制回路中的时间错位效应。它帮助研究者破解了视觉特征提取与动作执行之间的因果关联问题,揭示了延迟变量对策略成功率的非线性影响。这一突破使得学界能够从经验风险最小化转向对抗性延迟建模,为构建更接近真实工业环境的强化学习框架奠定了基础,其蕴含的时间同步挑战也激发了关于课程学习与延迟补偿机制的深层探讨。
衍生相关工作
围绕本数据集的特性,学界已衍生出多项启发性工作。研究团队基于其时间错位标注开发了异步行为克隆算法,通过显式建模观测-动作时延分布,显著提升了高延迟环境下的策略鲁棒性。另有工作探索了利用该数据集的视频多视角特性,将立体视觉与神经辐射场(NeRF)结合,构建了延迟感知的三维环境隐式表达。同时,其量化延迟基准促使学者提出延迟对抗训练框架,在仿真中增强策略对通信瓶颈的适应力。此外,数据集的结构化格式(LeRobot)推动了跨模态对比学习工具的血,支持机器人基础模型在少量真实数据上的微调,为通用操作策略的零样本泛化开辟了新道路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务