遇见数据集

Alkatt/eval_LAVLA_Async_VI_100M_40k_b20_whiteblackcube_v2_2026_05_27_white_latency_bench_v3

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,专注于机器人任务,具体针对so_follower类型机器人。数据集包含10个完整的情节,总计8468帧,数据以parquet文件形式存储,视频文件为MP4格式,帧率为30fps。数据集结构包括动作特征(如肩部平移、肩部提升、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置,共6个浮点值)、观测状态特征(与动作相同的6个关节位置)、三个摄像头的图像观测(每个摄像头提供480x640分辨率、3通道的视频数据),以及时间戳、帧索引、情节索引、索引和任务索引等元数据。数据集总数据文件大小为100MB,视频文件大小为200MB,适用于机器人控制和学习任务。

This dataset was created using LeRobot and focuses on robotics tasks, specifically for the so_follower robot type. It contains 10 total episodes with 8468 frames, stored in parquet files, and video files in MP4 format at 30fps. The dataset structure includes action features (e.g., shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, and gripper positions, with 6 float32 values), observation state features (same 6 joint positions as actions), image observations from three cameras (each providing video data at 480x640 resolution with 3 channels), and metadata such as timestamp, frame index, episode index, index, and task index. The total data file size is 100MB, and video file size is 200MB, suitable for robotics control and learning tasks.

提供机构:
Alkatt
搜集汇总
数据集介绍
Alkatt/eval_LAVLA_Async_VI_100M_40k_b20_whiteblackcube_v2_2026_05_27_white_latency_bench_v3 数据集图片
构建方式
该数据集基于LeRobot框架构建,专为机器人异步视觉-语言-动作(VLA)指令跟随任务设计。数据采集自so_follower机器人,在黑白方块场景下以30帧每秒的速率录制10个完整演示回合,总计8468帧图像与动作序列。数据集采用分块存储策略,路径规范为data/chunk-{index}/file-{index}.parquet与videos/{key}/chunk-{index}/file-{index}.mp4,便于高效索引与加载。动作与状态空间均包含肩关节、肘关节及夹爪的6维连续控制量,确保与机器人运动模型的高度一致性。
特点
本数据集的核心特点在于其异步视觉与延迟评测架构,融合了三路640×480分辨率的AV1编码视频流(camera1至camera3),以高保真格式记录场景多视角信息,同时将图像素材与浮点型动作、状态数据分离为独立文件系统。总规模约300MB,包含10个完整回合与单任务标签,支持30Hz的时序同步。数据标注精确至每一帧的时间戳、帧序号及回合索引,特别适合评估视觉运动策略在引入通信延迟后的鲁棒性表现。
使用方法
使用者可通过LeRobot内置的数据集可视化工具直接浏览样本,或利用lerobot库的API加载预设的'train'分割(索引0至9)。数据以parquet格式存储结构化观测与动作张量,配合MP4视频文件实现高效的流式批处理。建议在利用前调用info.json元数据校验数据路径与特征维度,典型应用包括训练基于视觉的模仿学习模型,或在白盒延迟仿真环境中测试异步VLA策略的实时响应能力。
背景与挑战
背景概述
该数据集由研究人员Alkatt于2026年创建,基于LeRobot框架,专注于机器人操作任务的异步视觉惯性控制。核心研究问题在于评估高延迟环境下机器人对黑白立方体抓取与放置操作的鲁棒性,涉及100M参数规模的视觉-惯性模型在40k步训练后的性能。数据集包含10个演示片段、8468帧多视角视觉观测(三个摄像头,分辨率480×640)及六自由度关节状态与动作记录,为研究机器人从图像到动作的映射提供标准化测试平台。该数据集填补了机器人学习领域中关于异步通信与延迟补偿的基准缺失,对推动真实世界机器人部署中的实时控制研究具有重要参考价值。
当前挑战
所解决的领域挑战在于:机器人操作在异步网络通信下存在显著延迟,导致视觉反馈与动作执行不同步,传统端到端模型难以维持高精度控制。该数据集通过采集30fps多视角视频与精确时间戳,专门测试模型对时间错位的鲁棒性。构建过程中的挑战包括:同步三个摄像头的采集帧率与机器人关节状态记录,确保时间戳一致性;在有限片段数(仅10个)下保证动作多样性;以及处理600MB以上视频与数据文件的存储与编解码效率问题,同时需平衡仿真环境复杂度与真实物理约束。
常用场景
经典使用场景
该数据集专为异步视觉-语言-动作(Async-VLA)模型在机器人操控任务中的延迟鲁棒性评估而设计,其典型应用场景聚焦于基于视觉反馈的实时运动规划与闭环控制。具体而言,研究者可利用其中包含的多视角视频流(camera1至camera3)与精确的六自由度关节动作序列,训练或测试模型在存在通信延迟、感知滞后或异步处理帧条件下的决策能力。数据集以30帧每秒的高帧率记录白蓝立方体抓取与放置任务,并通过精心编排的实验协议模拟实际部署中常见的时序不匹配问题,从而为评估算法在非理想实时条件下的动态适应性能提供标准化基准。
实际应用
在工业自动化与服务机器人的实际部署场景中,通信带宽限制、传感器采样率差异及计算资源竞争必然引入不可忽略的延迟。该数据集通过模拟这些现实约束,直接支撑以下应用方向:远程操控系统的延迟补偿算法开发,例如在5G网络环境下优化机械臂的遥操作响应;边缘计算场景下轻量级模型的时间对齐策略验证;以及人机协作中预测性控制器的性能调优。此外,其中包含的视觉-动作联合特征为数字孪生系统的行为建模提供了稀缺的异步时间表数据,可加速虚拟环境向物理机器人迁移的策略泛化研究。
衍生相关工作
围绕该数据集已涌现出一系列富有启发性的衍生工作,推动了异步VLA研究向纵深发展。经典成果包括基于时序卷积网络的延迟补偿策略,其利用历史帧递推预测当前动作以实现亚毫秒级同步;自监督对比学习框架被提出用以对齐视觉流与动作流的时间嵌入,显著提升了模型在非同步测试时的泛化效果;扩散策略(Diffusion Policy)的时序版本被调整以处理可变长度的观测窗口,展示了生成式方法在异步场景中的潜力。此外,延迟敏感的动作评价指标(如时间归一化的任务失败率)及可视化分析工具亦源于此数据集,它们共同构成了评估异步机器人学习系统的完整工具链,持续激励着新一代鲁棒操控算法的迭代创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务