LARYBench
收藏资源简介:
LARY(Latent Action Representation Yielding)是一个用于评估潜在动作表示的统一基准框架。该数据集旨在解决视觉-语言-动作(VLA)模型中显式动作数据不足的问题,通过利用大规模人类视频数据来学习与本体无关的潜在动作表示。数据集包含超过100万段视频(1000小时)、62万张图像对和59.5万条运动轨迹,涵盖151个动作类别和11种机器人实体。LARY支持三个互补的评估维度:1)从视频或图像对中提取潜在动作表示;2)评估潜在动作捕捉高级语义动作(做什么)的能力;3)评估潜在动作解码低级物理机器人动作(如何做)的能力。实验结果表明,未经动作监督训练的通用视觉基础模型在潜在动作表示任务上优于专门的嵌入式LAMs,且潜在特征空间比像素空间更符合物理动作空间。该数据集适用于机器人操作、具身AI和视觉-动作对齐等研究领域。
LARYBench 数据集概述
数据集基本信息
- 数据集名称: LARY (Latent Action Representation Yielding Benchmark)
- 托管平台: Hugging Face
- 许可证: MIT
- 任务类别: 机器人学、其他
- 语言: 中文、英文
- 标签: Embodied-AI, Latent Action, Robotic manipulation
- 规模: 1M < n < 10M
数据集简介
LARY 是一个用于评估潜在动作表示的统一评估框架。它为任何生成潜在动作表示(LAMs 或视觉编码器)的模型提供了三个互补的评估流程:
get_latent_action: 从视频或图像对中提取潜在动作表示。classification: 探测潜在动作捕获动作语义(动作类型识别)的能力。regression: 探测潜在动作解码物理机器人动作(动作回归)的能力。
该数据集旨在解决利用大规模人类视频数据集的关键挑战,即如何将视觉信号转换为与本体无关的表示(即潜在动作),并严格评估其从视觉观察中推导出鲁棒控制的能力。
数据集规模与构成
- 视频数据: 超过 120 万(1.2M)个视频,总计约 1000 小时,涵盖 151 个动作类别。
- 图像对数据: 62 万(620K)个图像对。
- 运动轨迹数据: 59.5 万(595K)条轨迹。
- 覆盖范围: 涵盖 11 种机器人实体,包括模拟和真实环境中的第一人称(egocentric)和第三人称(exocentric)视角的人类与机器人智能体。
主要特点与贡献
- LARYBench 基准: 首次将潜在动作表示的评估与下游策略性能解耦。该基准从两个互补维度探测表示质量:高级语义动作(做什么)编码和机器人控制所需的低级物理动态(如何做)。
- 大规模数据引擎: 开发了自动化数据引擎,用于重新分割和重新标注大规模语料库,以支持严格评估。
- 关键发现: 通过系统评估 11 个模型,揭示了两个一致发现:
- 与动作相关的特征可以在没有显式动作监督的大规模视觉预训练中出现。
- 基于潜在特征的空间往往比基于像素的空间更能与机器人控制对齐。
支持的数据集
分类数据集(视频模式)
human_1strobot_1stlibero
回归数据集(图像对模式)
calvin(步长 5)vlabench(步长 5, 15, 30)agibotbeta(步长 45)robocoin(步长 10)
数据目录结构
$DATA_DIR/ ← LARYBench 数据集根目录 ├── classification/ ← 分类数据 │ ├── EPIC-KITCHENS/ │ ├── EgoDex/ │ ├── AgiBotWorld-Beta/ │ ├── LIBERO/ │ └── ... └── regression/ ← 回归数据 ├── calvin/{train_stride5,val_stride5}/ ├── vlabench/ ├── agibot_45/ ├── robocoin_10/ └── vlabench_{15,30}/
发布内容
- [x] 代码
- [x] 文本标注 (链接:https://github.com/meituan-longcat/LARYBench/tree/main/data)
- [x] 验证数据集
- [x] 训练数据集
相关资源
- 项目主页: https://meituan-longcat.github.io/LARYBench
- 论文: https://github.com/meituan-longcat/LARYBench/blob/main/LARYBench.pdf





