MAVLN
收藏资源简介:
MAVLN是一个基于HM3D场景的多智能体视觉语言导航基准,包含11,724个任务片段,覆盖145个场景,团队最多包含4个智能体,每个任务有平均5个子任务,最多8个。任务采用三种指令模式:分散、集中和集中隐式。
MAVLN is a multi-agent visual-language navigation benchmark based on HM3D scenes, which contains 11,724 task episodes covering 145 scenes. Each team can include up to 4 agents, and each task has an average of 5 subtasks with a maximum of 8. Three instruction modes are adopted for the tasks: decentralized, centralized, and centralized implicit.
MA-VLN 数据集概述
基本信息
- 标题:Systematic Multi-Agent Vision-and-Language Navigation: Formulation, Benchmark, and Method
- 作者:Yunzhe Xu, Zhe Liu
- 机构:Shanghai Jiao Tong University
- 项目主页:https://xyz9911.github.io/mavln/
- 论文:https://arxiv.org/abs/2609.35965
- 数据集地址:https://github.com/xyz9911/MA-VLN
数据集简介
MAVLN 是首个对多智能体视觉语言导航(Multi-Agent VLN)进行系统化形式化的基准,将多智能体 VLN 建模为受约束的协调问题。每个任务由携带依赖关系和资源约束(presence locks 与 holding chains)的子任务组成。
基准构成(MAVLN Benchmark)
每个任务是一个子任务的有向无环图。除依赖关系外,两种资源原语限制智能体的行为:
- holding chain(持有链):智能体携带物体,在交付前不能完成其他任何任务。
- presence lock(在场锁):智能体必须停留在目标位置,直到队友释放它。
只有当所有子任务在这些约束下均成功时,任务才算成功。
数据规模
| 指标 | 数值 |
|---|---|
| Episodes(回合数) | 11,724 |
| Unique missions(唯一任务数) | 3,908 |
| Scenes (HM3D)(场景数) | 145 |
| Average path length(平均路径长度) | 35.9 m |
| Agents per team(每队智能体数) | 最多 4 |
| Subtasks per episode(每回子任务数) | 平均 5,最多 8 |
指令模式
每个任务在三种指令模式下渲染:
- decentralized(去中心化):每个智能体一条指令。
- centralized(中心化):整个团队一条指令。
- centralized-implicit(中心化隐式):一条团队指令但不包含智能体归属。
数据划分(场景不相交)
| Split | Missions | Scenes |
|---|---|---|
| Train | 3,079 | 128 |
| Val-unseen | 386 | 7 |
| Test-unseen | 443 | 10 |
方法(TRISS)
TRISS 是一个面向协调的导航系统,由三部分组成:
- 基于 LLM 的子任务调度器:从任务指令中提取原子导航指令池,每轮最多为每个智能体分配一个指令,推理语言中陈述的约束。
- 共享拓扑记忆:所有智能体实时构建一张拓扑地图;DUET 风格的跨模态规划器结合每个智能体自身的指令在其上推理。
- 冲突感知执行:无冲突目标分配与基于冲突的搜索生成无碰撞路径,同时拓扑维护防止失败或漂移的执行污染共享地图。
实验结果(Test-unseen)
LLM 结果为三次运行的平均值。
| Scheduler | Navigator | SR ↑ | SPL ↑ | CSR ↑ | CSPL ↑ | TC ↑ | MAC ↓ |
|---|---|---|---|---|---|---|---|
| Oracle | ETPNav | 5.6 | 4.2 | 28.7 | 22.4 | 100.0 | 0.85 |
| Oracle | TRISS | 9.3 | 5.2 | 33.3 | 20.0 | 100.0 | 1.42 |
| Gemma4 · decentralized | TRISS | 8.3 | 4.4 | 33.2 | 19.5 | 95.8 | 1.22 |
| Qwen3.6 · decentralized | TRISS | 7.9 | 4.1 | 32.1 | 18.7 | 97.4 | 1.26 |
| Gemma4 · centralized | TRISS | 6.8 | 3.9 | 31.6 | 18.6 | 95.0 | 1.13 |
| Qwen3.6 · centralized | TRISS | 8.4 | 4.2 | 32.4 | 19.1 | 96.5 | 1.03 |
| Gemma4 · centralized-implicit | TRISS | 7.1 | 3.7 | 29.6 | 17.0 | 92.8 | 0.97 |
| Qwen3.6 · centralized-implicit | TRISS | 6.8 | 3.5 | 28.8 | 16.5 | 96.5 | 1.03 |
指标说明
- SR:任务成功率。
- SPL:按路径长度加权的成功率。
- CSR:条件子任务成功率,遵守所有依赖与资源约束。
- CSPL:CSR 的路径长度加权对应指标。
- TC:任务完成度。
- MAC:多智能体冲突。
致谢
实现基于 Habitat 3(https://github.com/facebookresearch/habitat-lab),并使用 HM3D(https://aihabitat.org/datasets/hm3d/)场景数据集。
引用
bibtex @article{xu2026mavln, title={Systematic Multi-Agent Vision-and-Language Navigation: Formulation, Benchmark, and Method}, author={Xu, Yunzhe and Liu, Zhe}, journal={arXiv preprint arXiv:2609.35965}, year={2026}}
发布说明
代码、MAVLN 基准与模型检查点将在该仓库中发布。





