遇见数据集

Alkatt/eval_LAVLA_Async_VI_100M_40k_b20_whiteblackcube_v2_2026_05_27_white_latency_bench_v12

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的机器人数据集,专为机器人学习任务设计。数据集包含一个名为so_follower的机器人类型,总共有10个episodes和8350帧数据。数据以parquet文件格式存储,分为多个块(chunks),每个块大小为1000帧。数据集包括动作数据(如肩部、肘部、腕部和抓取器的位置)、状态观测数据(与动作相同),以及来自三个摄像头的图像观测数据(每个摄像头分辨率为480x640,帧率30fps,视频编码为av1)。此外,还包含时间戳、帧索引、episode索引、任务索引等元数据。数据集总数据文件大小为100MB,视频文件大小为200MB,适用于训练和评估机器人控制模型。

This dataset was created using LeRobot and is designed for robotics learning tasks. It features a robot type called so_follower, with a total of 10 episodes and 8350 frames. The data is stored in parquet format, organized into chunks of 1000 frames each. The dataset includes action data (e.g., positions of shoulder, elbow, wrist, and gripper), state observation data (same as actions), and image observations from three cameras (each with a resolution of 480x640, 30fps, and av1 video codec). Additionally, it contains metadata such as timestamps, frame indices, episode indices, and task indices. The total data file size is 100MB, and the video file size is 200MB, making it suitable for training and evaluating robot control models.

提供机构:
Alkatt
搜集汇总
数据集介绍
Alkatt/eval_LAVLA_Async_VI_100M_40k_b20_whiteblackcube_v2_2026_05_27_white_latency_bench_v12 数据集图片
构建方式
本数据集名为eval_LAVLA_Async_VI_100M_40k_b20_whiteblackcube_v2_2026_05_27_white_latency_bench_v12,专为机器人学领域的异步视觉-语言-动作建模与延迟基准测试而构建。数据集采用LeRobot框架生成,包含10个完整演示片段,总计8350帧数据,全部归属于单一任务。数据以Parquet格式存储于分块文件中,每块容量设定为1000帧,同时辅以三路摄像头(camera1、camera2、camera3)捕获的AV1编码视频,每帧分辨率均为480×640像素,以30帧/秒的帧率记录机器人操作过程中的视觉信息。动作与观测状态数据均为6维浮点向量,对应肩部、肘部、腕部及夹爪的关节位置,确保状态-动作对的精确对齐。
特点
该数据集的核心特点在于其面向异步延迟评估的专门设计,名称中明确标注了“white_latency_bench”,强调其在白色背景下对机器人操作延迟的量化测试功能。数据集仅包含10个片段,但总视频文件体积达200MB,数据文件共100MB,这种小样本高密度特性使其特别适合用于快速迭代的基准测试与模型鲁棒性验证。特征空间包括三视角同步视频、关节状态与动作序列,且所有观测均带有时间戳和帧索引,便于分析异步控制策略中的时序对齐问题。此外,完整的LeRobot兼容架构使得数据集可直接接入现有的机器人学习流水线,降低了预处理成本。
使用方法
数据集的使用依托于LeRobot生态,用户可通过其可视化工具直接浏览数据内容。数据以默认配置加载,读取路径为data/*/*.parquet,视频文件则通过video_path中的模板获取。训练集划分覆盖全部10个片段(train: 0:10),支持直接用于模仿学习或强化学习场景中的策略训练。建议在加载时利用LeRobot的数据集类自动解析特征字典,尤其关注action与observation.state之间的因果关系。对于延迟基准任务,可结合timestamp字段计算指令到执行间的响应时间差。数据格式为Parquet,支持高效的列式访问,适合与PyTorch或TensorFlow数据管道集成,进行批处理训练。
背景与挑战
背景概述
该数据集名为eval_LAVLA_Async_VI_100M_40k_b20_whiteblackcube_v2_2026_05_27_white_latency_bench_v12,由Alkatt团队基于LeRobot框架创建,专注于机器人模仿学习领域。数据集构建于2026年,旨在研究异步视觉-运动控制策略在机器人操作中的性能,特别是针对黑白色块抓取任务的时序对齐与延迟补偿问题。通过记录10个演示片段、共计8350帧的高频多视角视觉与关节状态数据,该数据集为评估视觉运动策略在非同步传感器-执行器环境下的鲁棒性提供了标准化基准,对推动具身智能中实时控制与感知融合的研究具有重要参考价值。
当前挑战
该数据集的核心挑战在于解决异步视觉输入与机器人执行器之间的延迟失配问题,这在真实场景中常由传感器采样速率不均或通信瓶颈引发。构建层面面临两大难点:一是需在30帧/秒的高频采样下精确同步3个相机视角与6自由度关节动作,确保时间戳一致性;二是数据采集过程涉及复杂的内容化环境(黑白色块与背景),要求算法具备高效的特征提取与空间定位能力,以避免视觉混淆导致的策略失败。
常用场景
经典使用场景
该数据集聚焦于异步视觉-语言-动作(Async VI)联合学习范式下的机器人操纵任务,尤其适用于在具有挑战性的环境下评估白噪声干扰和时延对策略鲁棒性带来的影响。经典使用场景是利用单任务、多视角视频与高维状态动作序列,训练和测评基于模仿学习或视觉强化学习的机器人控制模型,检验模型对不可预测延迟与视觉噪声的适应能力。
实际应用
在实际工业与服务业机器人应用中,该数据集可用于开发能够应对网络波动和传感器延迟的鲁棒控制算法,例如在远程操作或低带宽通信条件下的机器人装配、物料搬运和精细抓取任务。其提供的高帧率多视角视频与精确动作标注,为机器人工程师调试和优化实时控制系统中的延迟补偿模块提供了重要数据支撑。
衍生相关工作
基于该数据集,研究者已开展了关于延迟感知的模仿学习架构设计与视觉特征时序对齐方法的探索,衍生出如时延解耦策略网络和多模态一致性学习等代表性工作。这些研究不仅提升了模型在异步控制场景下的表现,还启发了一系列关于机器人系统延迟建模与在线适应机制的后续研究工作,成为评估视觉-运动延迟鲁棒性的重要参考基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务