遇见数据集

MAVLN

收藏
github2026-09-30 更新2026-10-01 收录
数据链接:
官方服务:

资源简介:

MAVLN是一个基于HM3D场景的多智能体视觉语言导航基准,包含11,724个任务片段,覆盖145个场景,团队最多包含4个智能体,每个任务有平均5个子任务,最多8个。任务采用三种指令模式:分散、集中和集中隐式。

MAVLN is a multi-agent visual-language navigation benchmark based on HM3D scenes, which contains 11,724 task episodes covering 145 scenes. Each team can include up to 4 agents, and each task has an average of 5 subtasks with a maximum of 8. Three instruction modes are adopted for the tasks: decentralized, centralized, and centralized implicit.

创建时间:
2026-09-30
原始信息汇总

MA-VLN 数据集概述

基本信息

  • 标题:Systematic Multi-Agent Vision-and-Language Navigation: Formulation, Benchmark, and Method
  • 作者:Yunzhe Xu, Zhe Liu
  • 机构:Shanghai Jiao Tong University
  • 项目主页:https://xyz9911.github.io/mavln/
  • 论文:https://arxiv.org/abs/2609.35965
  • 数据集地址:https://github.com/xyz9911/MA-VLN

数据集简介

MAVLN 是首个对多智能体视觉语言导航(Multi-Agent VLN)进行系统化形式化的基准,将多智能体 VLN 建模为受约束的协调问题。每个任务由携带依赖关系和资源约束(presence locks 与 holding chains)的子任务组成。

基准构成(MAVLN Benchmark)

每个任务是一个子任务的有向无环图。除依赖关系外,两种资源原语限制智能体的行为:

  • holding chain(持有链):智能体携带物体,在交付前不能完成其他任何任务。
  • presence lock(在场锁):智能体必须停留在目标位置,直到队友释放它。

只有当所有子任务在这些约束下均成功时,任务才算成功。

数据规模

指标 数值
Episodes(回合数) 11,724
Unique missions(唯一任务数) 3,908
Scenes (HM3D)(场景数) 145
Average path length(平均路径长度) 35.9 m
Agents per team(每队智能体数) 最多 4
Subtasks per episode(每回子任务数) 平均 5,最多 8

指令模式

每个任务在三种指令模式下渲染:

  • decentralized(去中心化):每个智能体一条指令。
  • centralized(中心化):整个团队一条指令。
  • centralized-implicit(中心化隐式):一条团队指令但不包含智能体归属。

数据划分(场景不相交)

Split Missions Scenes
Train 3,079 128
Val-unseen 386 7
Test-unseen 443 10

方法(TRISS)

TRISS 是一个面向协调的导航系统,由三部分组成:

  • 基于 LLM 的子任务调度器:从任务指令中提取原子导航指令池,每轮最多为每个智能体分配一个指令,推理语言中陈述的约束。
  • 共享拓扑记忆:所有智能体实时构建一张拓扑地图;DUET 风格的跨模态规划器结合每个智能体自身的指令在其上推理。
  • 冲突感知执行:无冲突目标分配与基于冲突的搜索生成无碰撞路径,同时拓扑维护防止失败或漂移的执行污染共享地图。

实验结果(Test-unseen)

LLM 结果为三次运行的平均值。

Scheduler Navigator SR ↑ SPL ↑ CSR ↑ CSPL ↑ TC ↑ MAC ↓
Oracle ETPNav 5.6 4.2 28.7 22.4 100.0 0.85
Oracle TRISS 9.3 5.2 33.3 20.0 100.0 1.42
Gemma4 · decentralized TRISS 8.3 4.4 33.2 19.5 95.8 1.22
Qwen3.6 · decentralized TRISS 7.9 4.1 32.1 18.7 97.4 1.26
Gemma4 · centralized TRISS 6.8 3.9 31.6 18.6 95.0 1.13
Qwen3.6 · centralized TRISS 8.4 4.2 32.4 19.1 96.5 1.03
Gemma4 · centralized-implicit TRISS 7.1 3.7 29.6 17.0 92.8 0.97
Qwen3.6 · centralized-implicit TRISS 6.8 3.5 28.8 16.5 96.5 1.03

指标说明

  • SR:任务成功率。
  • SPL:按路径长度加权的成功率。
  • CSR:条件子任务成功率,遵守所有依赖与资源约束。
  • CSPL:CSR 的路径长度加权对应指标。
  • TC:任务完成度。
  • MAC:多智能体冲突。

致谢

实现基于 Habitat 3(https://github.com/facebookresearch/habitat-lab),并使用 HM3D(https://aihabitat.org/datasets/hm3d/)场景数据集。

引用

bibtex @article{xu2026mavln, title={Systematic Multi-Agent Vision-and-Language Navigation: Formulation, Benchmark, and Method}, author={Xu, Yunzhe and Liu, Zhe}, journal={arXiv preprint arXiv:2609.35965}, year={2026}}

发布说明

代码、MAVLN 基准与模型检查点将在该仓库中发布。

搜集汇总
数据集介绍
MAVLN 数据集图片
构建方式
在视觉语言导航领域,单智能体遵循单一指令的范式已趋于成熟,然而现实场景中的复杂任务往往需要多机器人团队的协同。MAVLN基准的构建依托一套经过验证的四阶段流水线,于HM3D的145个场景中生成11,724个回合,每支团队最多容纳四台智能体,并在三种指令模式下各渲染一遍。每个任务被组织为子任务构成的有向无环图,同时施加持有链与存在锁两类资源约束,从而将多智能体导航严格形式化为受约束的协调问题。
特点
MAVLN的显著特征在于其同时刻画了依赖关系与资源约束,超越了对多智能体导航的简单叠加。任务平均路径长度达35.9米,每回合平均包含5个子任务,最多可达8个。指令体系覆盖去中心化、中心化与中心化隐式三种模式,分别对应逐智能体指令、团队统一指令与无智能体归属的团队指令。数据集按场景划分训练、验证与测试集,并配备约束感知的评估指标,如条件子任务成功率与多智能体冲突数。
使用方法
使用MAVLN时,研究者可在Habitat 3仿真环境中加载HM3D场景与任务回合,依据任务的有向无环图与资源约束设计调度与导航策略。评估可借助基准提供的场景不相交划分,在未见场景上检验泛化能力,并采用任务成功率、路径长度加权成功率、条件子任务成功率及多智能体冲突等指标进行多维衡量。配套的TRISS系统展示了如何耦合大语言模型子任务调度器、共享拓扑记忆与冲突感知执行机制,为后续方法提供了可复现的基线参照。
背景与挑战
背景概述
视觉语言导航(Vision-and-Language Navigation, VLN)长期聚焦于单体智能体遵循单条指令的范式,然而现实世界中诸多任务已超越个体能力边界,亟需多机器人团队的协同作业。在此背景下,上海交通大学的研究人员于2026年提出了MAVLN,首次将多智能体VLN系统性地形式化为受约束的协调问题,其中每个任务由携带依赖关系与资源约束(如持有链与存在锁)的子任务构成。该基准依托HM3D场景数据集,包含145个场景中的11,724个回合,支持至多四个智能体在三种指令模式下的协作。MAVLN的推出填补了多智能体VLN形式化与评估基准的空白,为后续研究奠定了方法论与实验基础。
当前挑战
该数据集所应对的核心领域挑战在于,多智能体VLN要求智能体在遵循自然语言指令的同时,处理子任务间的复杂依赖与资源约束,并实现无冲突的协同导航,这远超单智能体VLN的难度。在构建过程中,研究团队面临多重挑战:其一,设计可验证的四阶段制作流程,以确保每个任务在依赖与资源约束下逻辑自洽;其二,在HM3D场景中生成多样化且场景不相交的训练、验证与测试划分,避免数据泄漏;其三,定义约束感知的评估指标,如条件子任务成功率与多智能体冲突数,以准确衡量团队协调性能。这些挑战共同构成了多智能体VLN研究的关键瓶颈。
常用场景
经典使用场景
在具身智能与机器人协同领域,多智能体视觉语言导航旨在令机器人团队依据自然语言指令完成单个智能体无法胜任的复杂任务。MAVLN最为经典的用法,是将每一次任务建模为带依赖与资源约束的有向无环图,各智能体须在保持链条与存在锁的制约下协同完成原子子任务。研究者常在三类指令范式下评测调度与导航性能,即分散式、集中式与集中隐式,并借助约束感知指标衡量团队在场景中同时达成子任务的成功率与路径效率。
衍生相关工作
围绕MAVLN,研究者提出了协调就绪的导航系统TRISS,其融合基于大语言模型的子任务调度器、共享拓扑记忆与冲突感知执行机制,成为该基准上的综合基线。以TRISS为参照,后续工作得以在调度策略、跨模态规划与多机冲突消解等维度展开比较与改进。该数据集及其配套方法为多智能体视觉语言导航衍生出新的算法设计与评测范式,促进了团队协同导航研究的持续深化。
数据集最近研究
最新研究方向
面向多机器人协同的视觉语言导航正从单智能体范式向受约束的协作决策演进。MAVLN数据集通过构建含依赖关系与资源约束(持有链、在场锁)的子任务有向无环图,在145个HM3D场景中生成11,724个情节,并设置去中心化、集中化及隐式集中化三种指令模式,系统刻画了多智能体在语义调度、拓扑记忆共享与无碰撞执行方面的耦合挑战。基于该基准,研究者提出TRISS基线,融合大语言模型子任务调度、共享拓扑记忆与冲突感知执行机制,实验揭示调度、导航与执行环节仍存在显著提升空间,为具身智能体团队协作与复杂任务规划提供了关键评测平台与方向指引。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务