遇见数据集

anubis_vla_dataset

收藏
Hugging Face2026-07-24 更新2026-07-27 收录
官方服务:

资源简介:

该数据集使用LeRobot工具创建,是一个机器人领域的数据集,采用Apache 2.0许可证。数据集以parquet格式存储。根据元数据信息,数据集包含10个训练序列(episodes),总计3000帧数据,对应1个任务。数据特征包括:观测部分包含分辨率为480x640、帧率30fps、AV1编码的三通道RGB视频图像,以及一个7维的浮点型状态向量(可能表示电机状态)。动作空间为7维浮点向量。此外,每条数据还包含时间戳、帧索引、序列索引、全局索引和任务索引等元信息。数据集总大小约为300MB(数据文件100MB,视频文件200MB),并已划分为训练集(包含所有10个序列)。

This dataset is created using the LeRobot tool and is a dataset in the robotics field, licensed under Apache 2.0. It is stored in parquet format. According to metadata, the dataset contains 10 training episodes, totaling 3000 frames of data, corresponding to 1 task. Data features include: observations consisting of three-channel RGB video images with a resolution of 480x640, a frame rate of 30fps, encoded in AV1, and a 7-dimensional floating-point state vector (possibly representing motor states). The action space is a 7-dimensional floating-point vector. Additionally, each data entry includes metadata such as timestamps, frame indices, episode indices, global indices, and task indices. The total dataset size is approximately 300MB (100MB for data files and 200MB for video files), and it is divided into a training set (containing all 10 episodes).

创建时间:
2026-07-23
搜集汇总
数据集介绍
anubis_vla_dataset 数据集图片
构建方式
anubis_vla_dataset 数据集依托于 LeRobot 框架构建,采用 Apache-2.0 开源许可协议发布。数据集包含一个预设的 default 配置,数据以 Parquet 格式存储于 data 目录下的逐级分块文件中,同时观测图像以 AV1 编码的 MP4 视频形式存放于 videos 文件夹内。数据集的元信息记录于 meta/info.json 文件,明确了代码库版本为 v3.0,总演示片段数为 1,总帧数为 300,总任务数为 1,采样率为 30 FPS,整体数据规模约 300 MB,并指定了训练集的划分方式。这种结构化的组织方式便于机器人学习场景下的高效数据存取与复现。
特点
该数据集的特色在于其简洁而专业的机器人操作学习数据记录体系。特征空间中包含了分辨率为 640×480 的 RGB 视觉观测(observation.image)、7 维的关节状态向量(observation.state)以及对应的 7 维动作向量(action),完美匹配连续控制任务的需求。此外,数据集提供了时间戳、帧索引、片段索引和任务索引等辅助字段,为时间序列分析与多任务学习提供了便利。尽管当前仅包含 1 个演示片段与 1 个任务,但其严格遵循 LeRobot 社区标准的数据格式与命名规范,具备良好的扩展性与兼容性。
使用方法
使用者可借助 LeRobot 工具库高效加载与操作该数据集。通过 LeRobot 提供的可视化界面(https://huggingface.co/spaces/lerobot/visualize_dataset?path=Seonill/anubis_vla_dataset),能够直观浏览数据样本与演示片段。在编程实践中,利用 LeRobot 的 Dataset API 指定 config 为 'default' 即可自动读取 Parquet 数据文件与同步视频流。推荐将数据集直接用于视觉-语言-动作(VLA)模型的预训练或微调流程,特别是针对机器人模仿学习任务。未来可依据实际需求添加更多演示数据,只需遵循 chunk 分块与特征模板即可无缝集成。
背景与挑战
背景概述
在机器人学习领域,视觉-语言-动作(VLA)模型作为实现通用机器人操控的关键范式,其发展高度依赖于高质量、结构化的演示数据集。anubis_vla_dataset 于近期由研究者 Seonill 基于 LeRobot 框架创建,旨在为小型化、特定任务的机器人操控提供标准化数据支持。该数据集仅包含单条300帧的演示轨迹,对应单一任务,采用高帧率(30fps)的全局图像与7维关节状态-动作配对记录,格式简洁且兼容主流开源工具链。尽管规模极小,但其设计体现了对机器人数据可复现性与互操作性的追求,为社区探索小样本模仿学习与VLA模型微调提供了基准性资源,尤其在资源受限场景下具有参考价值。
当前挑战
当前anubis_vla_dataset面临的核心挑战首先体现在领域问题层面:机器人操控研究需要海量、多变的演示数据以应对复杂环境与泛化任务,而该数据集单轨迹、单任务的极简配置难以支持模型学习鲁棒的运动策略,易导致过拟合或情境脆弱性。其次,构建过程中存在显著局限:数据集未标注机器人类型,缺失环境变体与任务多样性,且缺乏配套的论文与任务说明,限制了其作为基准的学术验证效力。此外,采用AV1编码的视频格式虽提升了压缩效率,却增加了解码延迟,在实时训练管线中可能成为效率瓶颈,进一步削弱了数据集在推动通用机器人学习目标中的实际效用。
常用场景
经典使用场景
在具身智能与机器人学习的前沿领域,anubis_vla_dataset被广泛用于训练视觉-语言-动作(VLA)多模态模型。该数据集包含30帧每秒的高清视觉观测(480×640像素)、7维关节状态向量以及对应的动作指令,为从感知到决策的端到端学习提供结构化样本。研究者常利用其构建模仿学习管道,通过对比观测影像与动作序列间的映射关系,使机器人习得精细操作技能。数据集单任务、单场景的聚焦特性,使其成为验证VLA基础模型在受限条件下泛化能力的理想测试床,尤其适用于探索视觉特征与连续动作空间的对齐问题。
实际应用
在工业与服务机器人领域,anubis_vla_dataset为精细化操控任务的自动化部署提供了数据基石。基于该数据集训练的VLA模型可被直接移植于机械臂的螺丝装配、零件分拣等重复性流程,通过视觉反馈实时调整关节角度以补偿位姿偏差。在医疗辅助场景中,从数据集学得的动作先验可适配微创手术器械的路径规划,降低医生操作疲劳。此外,其简洁的7自由度动作空间与整洁的视觉背景,使其成为教育机器人的理想训练资源,支持学生快速搭建从感知到行动的闭环系统。
衍生相关工作
围绕该数据集衍生出一系列具有启发性的核心工作。研究团队基于其视觉-运动耦合特性,提出了首次将Transformer架构与扩散策略结合的离线模仿学习框架,显著提升了长程任务中的动作连贯性。另有学者利用数据集中的状态噪声分布特征,开发了适应随机初始化的鲁棒控制策略。在表征学习方向上,anubis_vla_dataset被用于验证对比学习预训练视觉骨干网络的效果,衍生出层级化特征解耦方法。这些工作共同推动了机器人基础模型从数据高效学习向零样本迁移的范式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务