AGNOSTOS
收藏资源简介:
AGNOSTOS是一个模拟操作基准测试数据集,旨在严格评估视觉-语言-动作模型在跨任务零样本泛化中的表现。该数据集包含18个用于训练的可见任务和23个用于跨任务测试的未见任务。
AGNOSTOS is a simulated manipulation benchmark dataset designed to rigorously evaluate vision-language-action (VLA) models on their cross-task zero-shot generalization performance. This dataset includes 18 seen tasks for training and 23 unseen tasks for cross-task testing.
AGNOSTOS数据集概述
项目背景
- 项目名称:AGNOSTOS
- 目标:评估Vision-Language-Action模型在跨任务零样本泛化能力
- 提出方法:Cross-Task In-Context Manipulation (X-ICM)
数据集组成
训练数据
- 任务数量:18个seen tasks
- 数据量:140G(分五个文件)
- 下载链接:
测试数据
- 任务数量:23个unseen tasks
- 数据量:20.2GB(单个文件)
- 下载链接:unseen_tasks.tar
数据处理
-
合并seen tasks文件: bash cat seen_tasks.part_* > seen_tasks.tar
-
解压文件: bash tar -xvf seen_tasks.tar tar -xvf unseen_tasks.tar
模型相关
预训练模型
- 模型名称:dynamics diffusion model
- 下载链接:dynamics_diffusion.tar
评估结果
- X-ICM (7B):
- 平均成功率:23.5%
- 失败任务数:2个
- X-ICM (72B):
- 平均成功率:30.1%
- 失败任务数:0个
引用
bibtex @article{zhou2025exploring, title={Exploring the Limits of Vision-Language-Action Manipulations in Cross-task Generalization}, author={Zhou, Jiaming and Ye, Ke and Liu, Jiayi and Ma, Teli and Wang, Zifang and Qiu, Ronghe and Lin, Kun-Yu and Zhao, Zhilin and Liang, Junwei}, journal={arXiv preprint arXiv:2505.15660}, year={2025} }




