MultiNet
收藏资源简介:
MultiNet是一个全面的开放源代码基准测试软件套件,旨在促进通用智能模型的开发和评估。它包含一个大规模的通用数据集,汇集了来自多个领域(视觉、语言、控制)的大量数据,包括图像字幕、视觉问答、常识推理、机器人控制、数字游戏玩法、模拟移动/操作等多种任务。此外,MultiNet还提供了一个开源的数据管理SDK,用于方便地下载和使用数据集。它还引入了一套系统化的评估工具和指标,用于评估最先进的视觉语言模型和视觉语言行动模型的泛化能力。通过开源这些工具和资源,MultiNet旨在促进社区对通用智能系统的开发和研究。
MultiNet is a comprehensive open-source benchmark software suite designed to facilitate the development and evaluation of general-purpose intelligent models. It includes a large-scale general-purpose dataset that aggregates extensive data from multiple domains including vision, language, and control, covering various tasks such as image captioning, visual question answering (VQA), commonsense reasoning, robot control, digital game playing, simulated locomotion/manipulation, and more. Additionally, MultiNet provides an open-source data management SDK to enable convenient downloading and utilization of the dataset. It also introduces a systematic set of evaluation tools and metrics for assessing the generalization capabilities of state-of-the-art vision-language models and vision-language-action models. By open-sourcing these tools and resources, MultiNet aims to promote the development and research of general intelligent systems within the research community.
MultiNet 数据集概述
数据集简介
MultiNet是一个多模态动作模型通用基准测试平台,主要评估视觉-语言-动作模型(VLMs/VLAs)在多种动作数据(如机器人学、程序生成游戏)上的性能。
核心功能
-
数据集下载与转换
- 提供开源视觉-语言+控制/动作数据的集中下载
- 支持将不同格式的控制数据统一转换为TensorFlow Dataset格式
-
模型评估框架
- 支持零样本评估GPT-4.1、GPT-4o、Pi0、OpenVLA等SOTA模型
- 提供GenESIS框架用于将VLMs适配到不同任务/数据集
-
测试与提交
- 提供测试数据集分割和评估指南
- 支持用户提交模型结果到官方排行榜
数据集版本
- v0.1 (2024-11-08): 专注于真实世界机器人任务
- v0.2 (2025-05-22): 扩展至程序生成的OOD游戏环境
技术特点
- 支持多种动作空间评估
- 提供确定性推理实现要求
- 包含完整的评估指标实现
使用方法
-
环境配置 bash conda create -n multinet python=3.10 conda activate multinet git clone https://github.com/ManifoldRG/MultiNet.git cd MultiNet/src pip install -r requirements.txt
-
数据集操作
- 下载数据集:
python centralized_downloader --dataset_name <name> --output_dir <dir> - 格式转换:
python centralized_translation --dataset_name <name> --dataset_path <path> --output_dir <dir>
- 下载数据集:
-
模型评估
- 支持GPT系列、OpenVLA、Pi0等多种模型评估
- 提供完整的评估流程脚本
相关资源
- 论文:
- v0.1: https://arxiv.org/abs/2411.05821
- v0.2: https://arxiv.org/abs/2505.05540
- 数据集规范: https://multinet.ai/static/pdfs/MultiNet_Dataset_Spec_Paper.pdf
- 官网: https://multinet.ai
- 框架代码: https://github.com/ManifoldRG/MultiNet/tree/main/src/modules

- 1MultiNet: An Open-Source Software Toolkit \& Benchmark Suite for the Evaluation and Adaptation of Multimodal Action Models1Metarch 2Manifold Research 3乔治亚理工学院 · 2025年



