MazeBench
收藏资源简介:
MazeBench是一个用于多模态模型视觉迷宫推理的基准和数据集。每个模型仅接收一个迷宫图像和一个固定提示,然后必须判断宝藏是否可达,并在可达时返回一个有效的最短路径的JSON。
MazeBench is a benchmark and dataset dedicated to visual maze reasoning for multimodal models. Each model only receives a single maze image and a fixed prompt, and is required to determine whether the treasure is reachable. If reachable, it shall return a valid JSON-formatted shortest path.
MazeBench 数据集概述
数据集基本信息
- 数据集名称:MazeBench
- 核心用途:用于评估多模态大语言模型(MLLMs)的视觉迷宫推理能力。
- 任务描述:模型接收一个迷宫图像和一个固定提示词,必须判断宝藏是否可达。如果可达,则需以JSON格式返回一条有效的最短路径。
- 论文标题:From Pixels to BFS: High Maze Accuracy Does Not Imply Visual Planning
- 论文链接:https://arxiv.org/abs/2603.26839
- 博客文章:https://albertoagentic.com/maze-benchmark.html
- 数据集托管地址:https://huggingface.co/datasets/albertoRodriguez97/MazeBench
数据集内容与结构
- 评估集规模:包含110个迷宫。
- 迷宫特征:涵盖8种结构家族,网格尺寸从5x5到20x20。
- 数据文件:
- 110个迷宫PNG图像文件(
gen_maze_001.png...gen_maze_110.png)。 - 一个包含地面真值标注的JSON文件(
maze_annotations.json)。
- 110个迷宫PNG图像文件(
- 标注信息:包含可达性、最短路径长度以及被接受的最短路径。
基准测试设计
- 输入:直接从文件夹加载迷宫图像,并向每个模型发送相同的固定提示词。
- API限制:在API调用中禁用工具使用,并避免API强制的结构化输出。
- 评估流程:在本地解析和验证JSON,根据手动转录的最短路径标注对预测进行评分。
- 核心指标:
solved(解决率)。模型必须正确识别可达性,并且在可达的迷宫中返回一条长度正确的被接受的最短路径。
项目仓库结构
主要目录与文件如下:
benchmark/:包含基准测试运行器、提示词、模型适配器、解析器、验证和评分代码。scripts/maze_generator/:包含程序化迷宫生成器,支持精灵渲染和标注。paper/:包含arXiv论文的LaTeX源文件和图表。mazes_imgs/:包含博客文章中使用的10个手动整理的迷宫图像。acl-style-files/:包含ACL LaTeX格式模板。
使用与获取
-
环境要求:Python 3.10+。运行实际模型时需要相应的API密钥(通过环境变量设置)。
-
快速测试:可使用命令
python3 -m benchmark.main --model mock:baseline在不调用外部API的情况下进行冒烟测试。 -
数据集下载: bash pip install huggingface_hub huggingface-cli download albertoRodriguez97/MazeBench --repo-type dataset --local-dir generated_mazes/
-
迷宫生成:可通过
python3 -m scripts.maze_generator生成示例迷宫,输出至generated_mazes/目录。
输出与评分
- 输出目录:每次基准测试运行会在
benchmark/outputs/下生成一个带时间戳的目录,包含原始文本、请求/响应快照、解析后的JSON、汇总CSV/JSONL文件以及运行报告。 - 评分逻辑:位于
benchmark/utils/evaluation.py。一个迷宫被视为“已解决”需同时满足:可达性判断正确、最短路径长度正确、返回的路径与标注中一条被接受的最短路径匹配。
引用
如需引用,请使用提供的BibTeX条目。




