遇见数据集

Plancraft

收藏
arXiv2025-09-30 收录
官方服务:

资源简介:

该数据集名为Plancraft,旨在通过文本和基于Minecraft制作界面的多模态接口,测试大型语言模型代理的规划能力。它不仅包含故意设计的无解示例,以挑战代理在决策制定上的能力,而且还对开源和闭源的大型语言模型与手工策划的规划器进行了基准测试。该数据集的任务是评估大型语言模型在决策制定和规划能力方面的表现。

The dataset named Plancraft is designed to test the planning capabilities of large language model (LLM) agents through a multimodal interface integrating text and Minecraft's crafting interface. It intentionally incorporates unsolvable examples to challenge agents' decision-making skills, and also conducts benchmark evaluations for both open-source and closed-source large language models as well as hand-crafted planners. The core task of this dataset is to evaluate the performance of large language models in decision-making and planning.

搜集汇总
数据集介绍
Plancraft 数据集图片
构建方式
Plancraft 数据集基于《我的世界》合成界面构建,通过 Python 实现游戏逻辑与视觉呈现,利用游戏文件及 Wiki 中的物品图像进行图像叠加,生成与真实界面像素一致的多模态观察。数据集包含纯文本与图像两种接口,任务通过递归遍历物品依赖树生成,从原始材料到最终产品的逐步规划路径被精确模拟。为增加挑战性,每个任务随机引入 4、8 或 16 个干扰物品,并剔除手写规划器轨迹超过 30 步的无效样例。最终采集 1145 个训练样例、570 个验证样例和 580 个测试样例,并按复杂度均分为五个等级。
使用方法
Plancraft 提供标准化接口,智能体通过 'move' 和 'smelt' 动作与环境交互,并可调用 'think'、'search'(基于 Minecraft Wiki 的 RAG 检索)和 'impossible' 等特殊动作。环境反馈以文本形式传递格式错误或状态变化,支持早期停止机制(连续 10 步无新物品合成即视为卡住)和最大步数限制(80 步)。评估指标包括任务成功率、规划长度、动作效率、不可解任务 F1 分数及总 token 消耗,支持零样本、少样本和微调等多种实验设置,便于系统化消融分析。
背景与挑战
背景概述
Plancraft是由爱丁堡大学Gautier Dagan、Frank Keller和Alex Lascarides于2024年提出的多模态规划评估数据集,旨在系统评估基于大语言模型(LLM)的智能体在复杂规划任务中的表现。该数据集以《我的世界》(Minecraft)的合成界面(Crafting GUI)为核心环境,兼具纯文本与多模态交互接口,并整合了Minecraft Wiki作为外部知识库以支持检索增强生成(RAG)评估。Plancraft的核心研究问题聚焦于LLM智能体在多步规划中的决策能力、任务可行性判断以及工具使用效率,填补了现有基准仅关注成功率而忽视规划质量与任务可解性判断的空白。其引入的不可解任务子集与专家规划器对比机制,为智能体的鲁棒性与效率评估提供了全新范式,对推动具身智能与规划推理领域的研究具有重要影响力。
当前挑战
Plancraft所解决的领域问题核心在于LLM智能体在规划任务中面临的多重挑战:一是现有基准仅以成功率为唯一指标,忽视了规划效率、质量及成本,导致对真实场景复杂性的刻画不足;二是智能体缺乏对任务可解性的判断能力,面对不可解任务时易陷入无效循环,增加推理开销。在构建过程中,数据集面临的关键挑战包括:如何设计低层级符号动作空间(如smelt与move)以精确反映合成逻辑,同时抽象控制动态以聚焦规划与空间推理;如何生成涵盖从单步到多步、包含干扰项的多样化任务,并确保所有示例均可通过专家规划器验证;以及如何整合Minecraft Wiki作为知识库,并在RAG流水线中实现完美检索与解析的上界估计,以隔离检索模块对规划性能的影响。
常用场景
经典使用场景
Plancraft 作为一个面向大语言模型智能体的多模态规划评估数据集,其经典使用场景聚焦于测试智能体在受限环境中的多步规划与决策能力。该数据集基于《我的世界》合成界面,要求智能体通过文本或图像观察,执行移动、熔炼等底层动作,将原材料逐步合成为目标物品。与传统基准不同,Plancraft 不仅评估任务完成率,还通过引入手写规划器作为参照,衡量智能体路径的效率与质量,从而在可控条件下模拟真实世界中复杂、多层次的规划挑战。
解决学术问题
该数据集解决了现有智能体评估中过度依赖成功率、忽视规划质量与任务可行性的学术问题。Plancraft 通过纳入故意不可解的子集,首次系统性地考察智能体对任务可解性的判断能力,填补了此前基准中普遍存在的“任务必然可解”假设带来的评估偏差。这一设计推动了更细粒度的性能度量方法,如动作效率与F1分数,为研究智能体在资源不足或约束冲突下的鲁棒决策提供了标准化的实验平台,对提升大语言模型在真实场景中的可靠性与经济性具有深远意义。
实际应用
在实际应用中,Plancraft 为开发更智能的自动化助手提供了关键测试场。例如,在工业流程编排、虚拟环境任务执行或家庭机器人操控等场景中,智能体常需在有限资源下进行多步规划并判断任务可行性。Plancraft 的低层次动作空间与多模态接口,使开发者能评估和优化智能体的工具调用、检索增强生成与错误恢复能力,从而推动更高效、更安全的自主系统落地,减少因盲目执行不可解任务而造成的计算资源浪费。
数据集最近研究
最新研究方向
Plancraft数据集聚焦于评估大语言模型智能体在复杂规划任务中的决策能力,尤其关注任务可行性的判断与多模态信息融合。该数据集基于Minecraft合成界面,创新性地引入不可解任务子集,挑战智能体在资源缺失时主动识别并终止无效规划的能力。前沿研究围绕检索增强生成(RAG)整合外部知识库、思维链推理策略(如ReAct)以及微调对规划效率的影响展开。实验表明,虽然搜索工具显著提升成功率,但多模态环境下视觉语言模型仍面临巨大瓶颈,而不可解任务机制在优化推理成本的同时,对小型模型构成了不成比例的挑战。这一方向紧密关联AI安全与自主系统鲁棒性,推动了从单一成功率向规划质量与资源效率并重的评估范式转变。
相关研究论文
  • 1
    Plancraft: an evaluation dataset for planning with LLM agents爱丁堡大学 · 2024年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务