遇见数据集

MECoBench

收藏
arXiv2026-07-01 更新2026-07-02 收录
数据链接:
官方服务:

资源简介:

MECoBench是由复旦大学、上海创新研究院及香港中文大学联合构建的多模态具身协作基准数据集,旨在系统评估多智能体在视觉接地环境中的合作能力。数据集包含192个测试案例,涵盖八类现实世界活动任务,支持并行与顺序两种协作结构,并集成多样化合作模式与通信机制,数据来源于VirtualHome家庭模拟器,通过场景接地与协作配置两阶段流程生成。该数据集主要应用于多模态大语言模型的具身智能研究,致力于解决多智能体在动态视觉观察下的协调、探索与通信等核心挑战,推动协作机器人在家庭辅助等实际场景中的应用。

MECoBench is a multimodal embodied collaboration benchmark dataset co-developed by Fudan University, Shanghai Institute of Innovation and The Chinese University of Hong Kong. It is designed to systematically evaluate the collaborative capabilities of multiple agents in visually grounded environments. The dataset includes 192 test cases covering eight categories of real-world activity tasks, supports two collaborative architectures: parallel and sequential, integrates diverse cooperation modes and communication mechanisms, and is generated via a two-stage workflow of scene grounding and collaboration configuration based on the VirtualHome household simulator. This dataset is primarily used for embodied intelligence research with multimodal large language models (LLMs), aiming to address core challenges such as coordination, exploration and communication of multiple agents under dynamic visual observations, and promote the application of collaborative robots in practical scenarios like home assistance.

创建时间:
2026-07-01
原始信息汇总

MECoBench 数据集概述

项目名称:MECoBench: A Systematic Study of Multimodal Agent Collaboration in Embodied Environments

核心目标:系统性评估多智能体在具身环境中的协作能力。

平台与环境

  • 基于 VirtualHome 模拟环境。
  • 使用经过修改的 VirtualHome v2.3.0 Unity 可执行文件(称为 MECoBench Simulator),支持多智能体房间限制和额外摄像头控制。
  • 提供 Linux、macOS(Apple Silicon/Intel)、Windows(32/64位)等多种平台的模拟器版本。

任务数据集

  • 包含两种任务集合类型:
    • 并行任务parallel.json
    • 顺序任务sequential.json
  • 示例任务(小规模)位于 data/examples/ 目录:
    • parallel_5.json
    • sequential_5.json
  • 完整任务集需从 Hugging Face 下载:https://huggingface.co/datasets/q-i-n-g/MECoBench,置于 data/task/ 目录下。

代码与资源

  • 代码仓库位于 GitHub:https://github.com/q-i-n-g/MECoBench
  • 包含修改后的 VirtualHome Python API,支持多智能体交互。
  • 移除内容:生成数据脚本、中间任务知识资产、本地笔记本、私有服务 URL 及机器特定启动脚本。

评估功能

  • 支持多种通信模式:
    • base(基础模式)
    • no_comm(无通信)
    • discuss_then_act(先讨论后行动)
    • leader_worker(领导者-工作者模式)
    • shared_memory(共享记忆)
  • 可配置智能体数量(默认2个)、最大步数、模型别名(通过 eval/agents/models.json)。
  • 输出结果:每个 case 的 result.json 及批次级 summary.json

引用论文

  • arXiv: https://arxiv.org/abs/2606.31966
  • BibTeX 引用格式由仓库提供。
搜集汇总
数据集介绍
MECoBench 数据集图片
构建方式
MECoBench的构建基于VirtualHome模拟器,涵盖八类真实世界活动模板,其中五个源自WAH、三个新增。任务构建采用两阶段流水线:场景接地阶段从模板中采样子目标,将目标对象随机放置于合法初始位置;协作结构分配阶段则依据任务目标,将公寓划分为并行动作或顺序协作两种模式。并行任务中所有智能体可自由访问所有房间;顺序任务中智能体被分配至不相交区域,需通过对象传递实现跨空间协作。最终形成96个任务,每个任务在并行与顺序设置下各评估一次,共192个测试用例,每个任务包含2至7个子目标。
特点
MECoBench的核心特点在于系统性地支持对多模态具身智能体协作的细粒度分析。它涵盖三种协作模式(孤立、去中心化与中心化)及四种通信协议(无通信、广播、讨论、领导者),并支持灵活的团队规模(1至5个智能体)与探索难度控制。基准测试不仅评估任务完成效果与效率,还引入劳动分工、冲突动作率与交接失败率等协作质量指标。实验揭示协作收益呈倒U型曲线,通信是关键驱动因素,且中心化协调在小规模团队中更优,而去中心化协调在团队扩展时更具竞争力。
使用方法
MECoBench的使用方法遵循迭代的“观察-通信-行动”工作流。每一时间步,每个智能体获取全景环境观察,并根据所选的协作协议生成通信信息。通信后,智能体依据当前观察、历史轨迹、对话记录、记忆及任务目标决定下一步动作。系统支持不同先验信息设置(如完整位置先验、无位置先验或含噪声先验),以评估协作的鲁棒性。默认采用广播协议,并行任务设置60步有效预算,顺序任务设置80步有效预算。代码与数据集已开源,便于研究人员复现实验并扩展至更复杂的场景。
背景与挑战
背景概述
多模态大语言模型在具身智能体领域展现出巨大潜力,然而多数研究聚焦于单智能体场景,忽视了现实世界中多智能体协作的普遍需求。为系统探究该问题,复旦大学与香港中文大学的研究团队于2026年提出了MECoBench基准。该基准基于VirtualHome模拟器,涵盖八类日常活动任务,并创新性地设计了并行与空间受限的顺序两种协作结构。通过支持可变的团队规模、多种协作模式(隔离、集中、分散)及通信机制,MECoBench为深入理解多模态具身环境下智能体协作的机制与边界提供了系统性测试平台,推动了该领域从理论探讨迈向实验验证。
当前挑战
MECoBench面临的核心挑战包括:1) 领域问题层面,多模态具身协作需在动态视觉观察下协调感知、探索、通信与动作生成,解决因环境变化引发的感知冲突与空间矛盾,这远超纯文本协作的难度;2) 构建过程中,需设计兼具真实性与多样性的任务模板,并平衡并行与顺序两种协作结构的复杂度,确保场景的合理性与可复现性;此外,评估平台需支持细粒度可控实验,如隔离通信分析协作增益瓶颈,并应对团队规模扩大带来的协调开销,避免性能因冲突增加而饱和甚至下降。
常用场景
经典使用场景
在具身智能研究领域,多模态大语言模型作为智能体在视觉环境中的协作能力尚缺乏系统的评估工具。MECoBench作为一个多模态具身协作基准,最经典的使用场景是评估和比较不同规模的智能体团队在家庭环境中的并行与顺序协作任务表现。研究者可借助该平台,在统一的虚拟家居场景中,通过控制团队规模、协作模式和通信协议等变量,系统地观察和分析MLLM智能体在视觉感知受限、空间约束和动态环境下的协作行为,从而揭示多智能体协作的内在机制与局限性。
解决学术问题
该数据集系统性地解决了多模态具身智能体协作评估中缺乏标准化基准的核心学术问题。以往的研究多聚焦于单智能体或纯文本协作,忽略了视觉感知、空间协调和物理约束对协作效果的影响。MECoBench通过构建包含192个测试用例、涵盖8类真实世界任务的评估平台,首次实现了对协作结构、团队规模、通信模式等因素的细粒度控制与分析。其引入的倒U型协作效能曲线、通信必要性验证以及鲁棒性测试等发现,为理解多智能体系统中的协调复杂度与协作增益之间的权衡提供了坚实的经验基础。
衍生相关工作
MECoBench的提出催生了多项衍生研究工作。一方面,基于该基准对协作模式的系统分析,研究者开发了共享记忆机制和视觉增强型领导协作等改进协议,有效提升了小规模团队的协作效率并降低了通信开销。另一方面,基准中揭示的幻觉信念传播和冲突行为等失败模式,促使研究者设计了专门的冲突消解与信念验证模块。此外,后续工作还在此基础上探索了混合能力团队(如强领导者加弱执行者)的协作模式,发现领导者的视觉感知能力对整体协作效能具有关键影响,这些工作共同推动了多模态多智能体协作研究向更实用、更鲁棒的方向发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务