遇见数据集

NL-pddlgym

收藏
arXiv2026-08-17 更新2026-08-19 收录
数据链接:
官方服务:

资源简介:

NL-pddlgym是一个用于评估从自然语言生成PDDL规划规范的基准数据集,由柏林工业大学与弗劳恩霍夫FOKUS研究所联合创建。该数据集包含711个规划问题,覆盖23个领域,每个问题均配有可执行的gym环境,用于自动验证计划的可应用性。数据集的构建基于pddlgym中的经典域和问题,并利用DeepSeek v4 Flash模型对剩余问题描述进行生成,同时保留原始逻辑结构。该数据集旨在解决LLM辅助符号规划中缺乏标准化基准和自动验证的问题,为评估规划模型生成的可执行计划提供可靠依据。

NL-pddlgym is a benchmark dataset for evaluating natural language-to-PDDL planning specification generation, jointly developed by the Technical University of Berlin and the Fraunhofer FOKUS Institute. It comprises 711 planning problems across 23 distinct domains, with each problem paired with an executable gym environment to automatically validate the applicability of generated plans. The dataset is built upon classic domains and problems from the original pddlgym framework, and the DeepSeek v4 Flash model is utilized to generate descriptions for the remaining problems while preserving their original logical structures. This dataset addresses the gap of lacking standardized benchmarks and automated validation mechanisms in LLM-aided symbolic planning, providing a reliable basis for evaluating executable plans generated by planning models.

创建时间:
2026-08-17
原始信息汇总

PDDLCoder是一个用于从自然语言描述中自动生成可应用的PDDL(规划领域定义语言)文件的代理式LLM形式化工具。

核心特性

  • 代理式方法:采用ReAct智能体,零样本创建、分析和优化PDDL 1.2领域与问题文件,无需预设的PDDL或人工反馈。
  • 自适应工具选择:智能体将语法错误、不可解模型和语义不可行计划视为不同的失败状态,在最多50次迭代中自适应选择合适的工具(共8种)。
  • 外部验证工具集成:包括VAL语法检查、Fast Downward规划器验证,以及LLM对计划物理/逻辑可行性的反馈。
  • 可执行验证:生成的计划映射到目标环境的动作模式后,在gym环境中逐步执行验证,确保所有动作适用且终止状态满足目标。

性能表现

在NL-pddlgym基准测试的留出测试集(4个未见领域的106个问题)上,PDDLCoder使用DeepSeek v4 Flash模型对89.6%的问题生成了可应用的计划,显著优于先前LLM-Formalizers改编版本的最高45.3%和直接LLM-Planners的74.5%。

评估基准(NL-pddlgym)

  • 包含711个规划问题,覆盖23个领域,每个问题配备自然语言描述和可执行的pddlgym环境。
  • 测试集由4个留出领域(Elevator、Hanoi、Ring and Peg、Satellite)的106个问题组成,在训练/验证分割中从未出现。

流水线类型

流水线 描述
pddl_coder 具备8种工具的ReAct代理
rigid 固定分步流水线:生成领域→生成问题→修复语法→修复不可解性→结合计划反馈
chain_of_thought 无工具的CoT基线,直接生成计划

运行要求与安装

  • 需要Python 3.12、uv、VAL(Parser二进制文件需在PATH中)和Fast Downward 24.06.1(作为同级目录检出)。
  • 安装命令:uv sync --locked
  • 可通过Docker(docker-compose.yml)构建包含VAL和Fast Downward的镜像,或使用vLLM本地服务模型。
  • 支持多种模型:deepseek_v4_flash(通过OpenRouter)、gemma_4_31b、gpt_oss_120b、qwen_36_35b_a3b、glm_47_flash、llama_4_scout(本地推理)。

输出与测试

  • results/*.csv:每个问题的失败阶段、运行时间、输入/输出token数、各工具调用次数及文件路径。
  • logs/:调试日志,包含完整的模型交互。
  • pddl/generated/plans/:生成的PDDL文件和计划。
  • 测试通过uv run pytest运行。
搜集汇总
数据集介绍
NL-pddlgym 数据集图片
构建方式
NL-pddlgym数据集的构建源自对经典规划领域与问题描述的系统性抽象化处理。研究团队从原始pddlgym实现及classical-domains仓库中选取了23个领域,并额外设计了三个全新领域,形成了涵盖711个规划问题的大规模语料库。每个问题均配套了基于PDDL的gym可执行环境,同时依据规划领域特点,为每个领域手工撰写了领域描述及2至3个种子问题描述,再借助DeepSeek v4 Flash模型,按照种子模式自动生成其余问题的自然语言描述,保证了物体、初始状态及目标信息的忠实保留。在描述内容上,DNL与PNL刻意隐去了谓词签名、动作参数、前提条件及效果等结构化信息,仅提供高层任务概述、动作名称、对象列表、初始状态及目标,以营造抽象的规划设定,从而检验模型从自然语言推断完整PDDL规范的能力。
使用方法
NL-pddlgym的设计旨在支持端到端的语言到PDDL形式化研究,使用方式明确而灵活。研究者可利用训练与验证分割进行模型优化,并保留四个完整领域作为只读的测试集,以评估跨领域泛化能力。具体流程中,模型接收自然语言描述(DNL及PNL),生成相应的PDDL领域文件与问题文件,随后通过经典规划器(如Fast Downward)生成规划,并借助MapAgent将此规划映射为与实际gym环境动作模式匹配的形式。最终,在pddlgym环境中顺序执行映射后的动作,依据规划的可应用性判定成功与否。该基准不仅为LLM辅助的符号规划提供了标准化流程,也支持对不同生成方法(如PDDLCoder、NL2Plan、VML_PDDL)进行公平比较,其等级指标(L0至L3)清晰刻画了从句法有效到规划可应用的逐步能力,为领域进步提供了可靠的量化依据。
背景与挑战
背景概述
NL-pddlgym数据集由柏林工业大学与Fraunhofer FOKUS的研究团队于2026年构建,旨在解决大语言模型(LLM)在长期规划任务中生成逻辑不一致或不可执行计划的问题。该数据集包含711个规划问题,覆盖23个领域,每个问题均配备可执行的gym环境,用于自动化验证计划的可应用性。其核心研究问题在于,如何通过自然语言描述生成形式化的PDDL(规划域定义语言)模型,并确保生成的计划能够实际执行。NL-pddlgym的提出填补了现有基准测试在计划可应用性验证上的空白,为LLM辅助符号规划提供了标准化评估框架,对推动AI规划与LLM结合的研究具有重要意义。
当前挑战
NL-pddlgym所面临的挑战首先体现在领域问题的复杂性上,即LLM生成的PDDL模型需准确反映自然语言描述中的动态环境,但现有方法常因模型僵化或缺乏反馈而失效,导致计划不可应用。其次,在数据集构建过程中,需确保语言描述与底层PDDL语义的一致性,同时保持抽象性以允许多种有效编码,这要求人工精心撰写领域描述和种子问题,并借助LLM扩展其余问题,过程中需克服描述歧义和验证标准缺失的难题。此外,计划映射与执行环境的无缝集成也是一大挑战,需保证生成的计划能正确映射到gym接口并成功执行,从而获得可重复的评估结果。
常用场景
经典使用场景
NL-pddlgym数据集在自动规划与自然语言处理交叉领域中扮演着关键角色,其经典使用场景集中于评估从自然语言描述生成PDDL(规划领域定义语言)模型的能力。该数据集包含711个规划问题,覆盖23个经典规划域,并为每个问题提供可执行的gym环境。研究者利用此基准测试LLM-Formalizer框架的性能,例如PDDLCoder,其通过迭代生成、分析和细化PDDL代码,最终实现89.6%的规划成功率。该数据集的设计确保了对规划适用性的严格评估,超越了传统的语法有效性或可解性检查,成为衡量LLM辅助符号规划系统有效性的标准测试平台。
解决学术问题
在学术研究领域,NL-pddlgym解决了长期困扰研究者的关于LLM规划能力评估缺乏标准化基准的问题。此前的方法多依赖于静态或部分规格的PDDL定义,无法全面检验模型在抽象自然语言描述下自主推断谓词、前提条件和效应的能力。该数据集通过提供抽象描述和可执行gym环境,使得自动化验证成为可能,从而解决了LLM生成计划的不可靠性和不可验证性问题。它为比较不同LLM-Formalizer方法(如NL2Plan、VML_PDDL)和LLM-Planner方法(如COT、ISR-LLM)提供了公平的平台,推动了该领域向更严谨、可复现的方向发展,促进了关于LLM在自动规划中角色的深入理解。
实际应用
在实际应用中,NL-pddlgym的推出极大地促进了LLM辅助符号规划从理论研究向工程实践的转化。它为开发智能规划系统提供了可靠的测试环境,尤其在需要从自然语言指令生成可执行计划的应用场景,如机器人任务规划、智能家居控制、物流调度等。利用该数据集,开发者可以训练和优化PDDLCoder等智能代理,使其能够自主生成符合物理和逻辑约束的规划,减少人工干预和错误率。此外,由于数据集包含可执行环境,它支持端到端的验证,确保了生成计划在实际执行中的可行性,这对于部署安全关键的应用至关重要,推动了自动规划技术在更广泛领域的落地。
数据集最近研究
最新研究方向
NL-pddlgym作为一项前沿基准,正推动自然语言到符号规划形式化的研究转向执行层面的语义验证。该数据集涵盖711个规划问题与23个领域,并提供可执行的环境用于自动化验证计划适用性,突破了既有基准仅关注语法有效性或结构相似性的局限。配套的PDDLCoder框架通过智能体迭代生成与修正PDDL规范,在测试集上实现了89.6%的适用计划生成成功率,显著优于传统形式化方法和直接LLM规划方法。这一进展凸显了通用大语言模型在零样本条件下联合生成领域与问题文件的潜力,同时揭示了模型能力差异带来的性能瓶颈,为构建鲁棒、可复现的LLM辅助符号规划评估体系奠定了重要基石。
相关研究论文
  • 1
    PDDLCoder: Agentic PDDL Generation for LLM-Assisted Symbolic Planning柏林工业大学; 弗劳恩霍夫FOKUS研究所 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务