CoCoBench
收藏官方服务:
资源简介:
CoCoBench是一个面向多智能体具身协同任务规划的合作协调基准测试,由南京大学、AgiBot与清华大学联合构建。该数据集包含897个经真值验证的实例,围绕任务分配、顺序排序、互斥访问与交接协调四种协同构造设计,每个实例均基于可执行的家庭场景任务。数据集通过符号模板在AI2-THOR仿真环境中生成,并经放置、可执行性及协调信号三重质量控制。其旨在精准诊断多智能体协同中的具体失败模式——如工作重复、顺序违规、资源冲突与交接不同步,从而为改进模型架构与提升协同能力提供明确方向。
提供机构:
南京大学; AgiBot; 清华大学创建时间:
2026-08-28
原始信息汇总
📊 CoCoBench 数据集总结
CoCoBench 是一个用于评估具身多智能体任务规划中协作协调能力的基准数据集。其核心目标并非单纯评估视觉语言模型(VLM)能否解决单个任务,而是重点检验模型能否高效协调多个智能体完成协作。
一、 核心评估维度
数据集通过精心设计的实例,将不同的协调机制进行隔离,以便精准定位模型的失败原因。共包含四个核心评估维度(D1-D4):
| 维度 | 机制 | 失败信号 |
|---|---|---|
D1 |
独立并行 / 任务分配 | 单个智能体完成所有工作,其他智能体闲置 |
D2 |
顺序依赖 / 时序规划 | 在先决条件满足前采取行动 |
D3 |
资源排他 / 冲突解决 | 两个智能体争抢同一工具或位姿 |
D4 |
接力传递 / 生产者-消费者 | 消费者对空传输缓冲区进行操作 |
二、 数据集规模与构成
- 总实例数:897 个
- 任务族:6 个(A, C, G, H, J, K)
- 智能体数量:2–4 个
- 场景类型:厨房、客厅、卧室
- 评估方式:不依赖审判模型,成功与否直接由模拟器的目标状态进行判定。
各任务族详情:
| 任务族 | 实例数 | 场景 | 主题 |
|---|---|---|---|
A |
41 | 厨房 | 杂货存储,有序柜装载 |
C |
204 | 客厅 / 卧室 | 有序容器装载,接力 |
G |
104 | 客厅 / 卧室 | 并行个人物品分类 |
H |
206 | 卧室 / 客厅 | 抽屉存储和有序装载 |
J |
112 | 卧室 / 客厅 | 跨区交接接力 |
K |
230 | 厨房 | 共享刀具切片下的排他 |
推荐子集:rep240 子集(240 个实例),按维度×智能体数×单元进行分层抽样,适合在合理成本下进行全面覆盖的评估运行。
三、 评估运行与指标
评估方式:
- 支持通过命令行进行批量评估、条件扫描(集中式/分布式 × 图像/盲测)和单任务评估。
- 内置了
random、greedy、mock等基准模型;支持 OpenAI 兼容和 Anthropic 兼容的 VLM 后端。
关键指标:
success:任务成功与否subgoal_success_rate:子目标成功率legal_plan:计划合法性construct_score:分维度协调得分(范围 [0, 1])makespan:任务完成时间跨度load_imbalance:负载不均衡度dependency_violations:依赖违规次数occupancy_conflicts:占用冲突次数
四、 扩展性与仓库结构
- 添加新模型:用户可通过实现
choose(prompt, image_path, menu) -> str方法并在eval/vlm_policy.py中注册来集成新的模型后端。 - 仓库布局:代码库结构清晰,包含评估脚本(
eval/)、任务配置(task_config/)、实例生成工具(tools/)、运行驱动脚本(run_eval.sh)等。所有 897 个实例均版本化管理于benchmark/task_config/目录下,无需额外下载数据集。
搜集汇总
数据集介绍

构建方式
CoCoBench构建于AI2-THOR仿真环境之中,旨在精细剖析具身多智能体协作中的协调机制。该基准围绕任务分配、时序排序、互斥访问与交接协调四种核心协作构念,系统设计了十类可执行的家务任务模板。每个实例均由符号化模板实例化生成,并历经三重质量控制关卡:放置验证确保物体可行性与空间适配,预言机验证确认任务可解性,度量筛选则确保预言机轨迹接近构念满分。最终,该基准包含897个经预言机验证的实例,覆盖四种房间类别、三种团队规模(2至4个智能体),所有任务共享统一的高层技能接口,涵盖导航、拾取、放置、切割等基础操作。
特点
CoCoBench的独特之处在于其构念级别的评估视角,将多智能体协调能力从任务成功中解耦。它提供四种构念专属的协调得分:D1基于制造跨度评估任务分配的均衡性,D2通过前提违规率衡量时序遵从度,D3结合资源冲突率与时间效率量化互斥调度的无冲突性,D4则依据缓冲区的溢出与空闲事件评价交接过程的节奏协调性。这种细粒度度量体系能够揭示最终成功轨迹中隐藏的无效重复、等待或冲突行为,使协调缺陷得以精准定位。基准还支持集中式与分布式两种策略协议,以及图像与盲态观察设置,便于系统剖析状态聚合、通信机制与感知能力对协作效能的影响。
使用方法
使用CoCoBench时,研究者通过其高层技能接口部署多智能体协调策略,在每个时间步为各智能体提供参数化动作菜单,并由固定执行器驱动仿真环境运行。评估流程自动记录完整轨迹,依据最终状态判定任务成功率,同时计算相应的构念得分。基准支持两种协议:集中式规划器聚合所有智能体观察并决策,分布式规划器则令各智能体独立选择动作。研究者可自由调节团队规模、观察输入与通信选项,以进行对照实验。通过对比任务成功率与构念得分,使用者能够区分最终成功与协调质量,诊断特定协调机制下的失败模式,从而指导模型架构与训练策略的优化。
背景与挑战
背景概述
CoCoBench是由南京大学与智元机器人等机构于2026年联合推出的多智能体具身协调基准,聚焦家庭场景中可执行任务的协作规划评估。该基准由Yang Chen等学者主导构建,核心研究问题在于:现有具身智能体基准虽能评估任务完成或单一智能体效能,却难以细粒度诊断多智能体协调失败,如重复劳动、顺序违规、资源竞争及交接失步等。CoCoBench基于AI2-THOR模拟环境,设计了897个经oracle验证的实例,覆盖任务分配、顺序依赖、互斥访问与交接协调四类协调构造,并提出构造级评分体系,以区分有效协调与单纯达成目标。该基准已成为评估多模态大模型协作能力的重要工具,推动了对多智能体协调机制的深入理解,并为设计针对性模型架构与提升协调能力提供了新方向。
当前挑战
CoCoBench所面对的挑战深远而多维。在研究领域层面,它直击多智能体具身协调评估中的核心难题:现有基准或聚焦单智能体任务完成,或仅以整体成功率概括多智能体行为,掩盖了协调失败的具体机制;因此,如何分离任务达成与协作质量、构建可量化的协调构造,并设计轨迹级指标以诊断无效尝试、等待与冲突,成为首要挑战。在基准构建过程中,挑战同样严峻:需在自研的高层技能接口下,确保实例可执行且具诊断力,这要求通过放置、oracle与metric三重质量门控,剔除不可行、模糊与弱诊断实例;同时,要平衡四类协调构造的覆盖与团队规模差异,并保证评分函数能敏感捕捉协调质量而非仅任务成功,这些均为基准的构建带来了显著的技术难度。
常用场景
经典使用场景
CoCoBench作为多智能体具身协作领域的创新性基准,其核心使用场景在于对多模态大语言模型(MLLMs)驱动的具身智能体在协作任务中的协调能力进行细粒度评估。该基准通过精心设计的897个可执行家庭任务实例,围绕任务分配、顺序排序、互斥访问和交接协调四种关键协调构念,为研究者提供了系统化的评估框架。其独特之处在于不仅关注最终任务成功率,更引入轨迹级构念分数,能够精准捕捉重复劳动、顺序违规、资源竞争及交接失同步等隐蔽性协调失败,从而实现了对智能体协作质量的全方位度量。这一设计使得CoCoBench成为检验多智能体系统在真实家庭场景中协作规划能力的标准测试平台。
解决学术问题
CoCoBench针对现有具身智能体基准中协调能力诊断不足的学术空白,解决了多智能体协作评估中聚合指标掩盖关键失败模式的核心问题。传统基准或聚焦单智能体任务完成,或以整体任务成功率概括多智能体行为,无法有效区分协调失败的具体类型。CoCoBench通过明确界定四种反复出现的协调构念,并设计对应的构念级评分函数,成功将任务成功与协调质量分离,实现了对协作过程中机制特定失败的归因分析。这一创新不仅揭示了模型在不同协调维度上的能力差异,更验证了强整体性能不必然蕴含均衡的协调能力,为多智能体系统的定向优化提供了可量化的理论依据,推动了具身智能评测从结果导向向过程导向的范式转变。
衍生相关工作
CoCoBench的提出衍生了一系列开创性研究工作,推动了具身多智能体协调评估领域的发展。其构念级评估理念启发了后续研究对协调机制的深入解剖,例如基于任务分配效率、顺序合规性、资源调度无冲突性和交接节奏等维度,开发出更精细的诊断工具。相关派生工作包括探索不同通信机制对去中心化协调的补偿效应,验证符号协调能力作为主要瓶颈的假设,以及构建可扩展团队规模下的协作性能预测模型。这些衍生工作不仅拓展了CoCoBench的评估框架,还促成了新型模型架构的设计,这些架构显式推理协作执行过程。同时,CoCoBench的高质量数据实例和开源代码为社区提供了标准化测试平台,激励了多模态学习、知识蒸馏及强化学习等方法在协作规划中的融合应用,形成了活跃的研究生态。
以上内容由遇见数据集搜集并总结生成



