遇见数据集

Alkatt/eval_LAVLA_Async_VI_100M_40k_b20_whiteblackcube_v2_2026_05_27_white_latency_bench_v1

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的,专注于机器人技术领域。数据集包含机器人动作、状态观测和图像数据,具体特征包括:动作数据(如肩部平移、肩部升降、肘部弯曲、腕部弯曲、腕部旋转和夹爪位置)、观测状态(与动作数据类似)、以及来自三个摄像头的图像观测(每个摄像头分辨率为480x640,3通道,视频编码为av1,帧率为30fps)。数据集结构包括总episodes为2,总帧数为3394,总任务数为1,数据文件大小为100MB,视频文件大小为200MB,帧率为30fps,分割为训练集(索引0到2)。机器人类型为so_follower,适用于机器人跟随任务。

This dataset was created using LeRobot. It is focused on robotics and includes data on robot actions, state observations, and image observations. Key features encompass action data (e.g., shoulder pan position, shoulder lift position, elbow flex position, wrist flex position, wrist roll position, gripper position), observation state (similar to action data), and image observations from three cameras (each with a resolution of 480x640, 3 channels, video codec av1, and frame rate of 30fps). The dataset structure comprises total episodes of 2, total frames of 3394, total tasks of 1, data file size of 100MB, video file size of 200MB, frame rate of 30fps, and a split for training (indices 0 to 2). The robot type is so_follower, suitable for robot following tasks.

提供机构:
Alkatt
搜集汇总
数据集介绍
Alkatt/eval_LAVLA_Async_VI_100M_40k_b20_whiteblackcube_v2_2026_05_27_white_latency_bench_v1 数据集图片
构建方式
该数据集基于LeRobot框架构建,旨在评估异步视觉-语言-动作(Async VI)模型在机器人操作任务中的延迟性能。数据采集环境设定为黑白立方体目标操作场景(whiteblackcube),通过so_follower机器人执行40k步长的轨迹,并采用异步控制策略记录动作与观察。数据集包含2个完整片段,共计3394帧,以30帧/秒的采样频率同步记录。视频数据采用AV1编码,分辨率为480×640像素,三台独立摄像头分别捕获多视角图像,而6维动作与状态数据(含肩部、肘部、腕部及夹爪关节)则以浮点型序列存储。数据按1000帧大小分块,组织结构清晰,便于分批次加载。
使用方法
数据集可通过LeRobot库的Dataset接口直接加载,需指定配置名为‘default’,并指向data/目录下的Parquet文件。用户需确保环境中安装了LeRobot及其依赖(如AV1解码器)。首先调用lerobot.Dataset.from_path()函数指向数据集路径,系统将自动解析meta/info.json中的特征映射。训练时,可通过chunks_size参数控制内存负载,例如以1000帧为单位流式读取。该数据集适用于时序动作预测与延迟敏感性分析任务,典型用法包括:构建异步策略模型时,将3路摄像头图像作为视觉输入,6维关节状态作为历史上下文,预测未来第k步的动作序列。建议使用HuggingFace的可视化工具预览轨迹,并参考LeRobot的示例脚本进行模型微调。
背景与挑战
背景概述
该数据集由Alkatt研究团队于2026年创建,基于LeRobot框架构建,旨在评估异步视觉-语言-动作(LAVLA)模型在机器人操作任务中的延迟性能。核心研究问题聚焦于多模态输入下机器人代理的实时响应能力,特别是白色和黑色立方体抓取与摆放的精细操作场景。数据集包含2个示范轨迹,共计3394帧,通过三台摄像机以30帧每秒的速率捕捉,覆盖了so_follower机器人6自由度动作空间与状态空间。其发布为机器人学习领域中延迟感知系统的研究提供了标准化基准,推动了从仿真到真实机器人部署的协同优化。
当前挑战
该数据集面临的核心挑战包括:1)领域问题层面,机器人操作任务的实时性依赖于低延迟视觉-动作映射,但多摄像头编码(AV1)与高帧率(30fps)带来的数据处理延迟,削弱了模型在动态环境中的响应速度;2)构建过程中,仅2个示范轨迹的有限数据规模难以覆盖多样化操作场景,且parquet分块与视频分片存储格式增加了数据加载与同步的复杂性;3)动作与状态空间的高维连续特性(6维)放大了策略泛化难度,而单一任务(白黑立方体)的设定限制了其在多任务迁移场景下的评估普适性。
常用场景
经典使用场景
在机器人学习与遥操作领域,该数据集聚焦于异步视觉反馈下的双臂协同操作任务,尤其适用于评估在存在通信延迟和白噪声干扰条件下,机器人系统对立方体抓取与摆放的实时控制性能。通过记录高帧率(30 FPS)的多视角视频流与机械臂六自由度关节状态信息,研究者可基于此数据集训练模仿学习或强化学习模型,探索视觉-运动映射策略在非理想传感环境中的鲁棒性。其经典使用场景涵盖延迟补偿算法验证、多模态感知融合分析以及人机协作中异步指令的执行效率基准测试。
解决学术问题
该数据集旨在解决机器人操作研究中关于异步通信与视觉延迟对决策性能影响的量化评估难题。传统机器人数据集多假设同步理想传感环境,而本数据集通过引入真实运行时延与噪声干扰,为学术界提供了稀缺的基准测试资源,从而支撑延迟感知策略学习、视觉运动预测补偿及自适应控制算法等方向的研究。其意义在于推动机器人系统从实验室理想条件向复杂动态现实场景迁移,深化对通信瓶颈下操作鲁棒性的理解,并为构建更具韧性的自主作业系统奠定数据基础。
实际应用
在实际应用中,该数据集可部署于远程手术、危险环境作业及工业精密装配等对操作时序有严格要求的场景。例如,通过模拟网络延迟下的机械臂抓取与调整动作,该数据有助于开发延迟容忍度更高的远程操控界面,确保操作者在长距离通信中仍能精准执行任务。此外,数据集中的多视角视频流可训练视觉伺服系统,使其在部分信息滞后的情况下仍能维持对目标物体的跟踪与抓取稳定性,从而提升自动化产线的抗干扰能力。
数据集最近研究
最新研究方向
在机器人操作学习领域,该数据集聚焦于异步视觉-语言-动作(Async VI)范式下的延迟敏感型操控任务研究。其名称中蕴含的'white_latency_bench'暗示了当前前沿方向对通信时延与感知-执行异步性的关注,这与具身智能体在真实世界中面临的传感器滞后、网络抖动等动态挑战高度契合。数据集包含多视角视觉观测与六自由度机械臂状态-动作轨迹,为探索基于大规模预训练模型(100M参数)的鲁棒策略提供了基准。近期相关热点事件如LeRobot社区推进的模仿学习标准化、以及针对'white-black-cube'等模块化物体操作的通用技能泛化研究,均借助此类结构与场景可控的数据集来验证模型在低延迟约束下的实时决策能力。该数据集的出现有助于推动从仿真到真实环境的迁移研究,尤其在评估视觉运动策略对异步输入响应的稳定性方面具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务