NL-pddlgym
收藏资源简介:
NL-pddlgym是一个用于评估从自然语言生成PDDL规划规范的基准数据集,由柏林工业大学与弗劳恩霍夫FOKUS研究所联合创建。该数据集包含711个规划问题,覆盖23个领域,每个问题均配有可执行的gym环境,用于自动验证计划的可应用性。数据集的构建基于pddlgym中的经典域和问题,并利用DeepSeek v4 Flash模型对剩余问题描述进行生成,同时保留原始逻辑结构。该数据集旨在解决LLM辅助符号规划中缺乏标准化基准和自动验证的问题,为评估规划模型生成的可执行计划提供可靠依据。
NL-pddlgym is a benchmark dataset for evaluating natural language-to-PDDL planning specification generation, jointly developed by the Technical University of Berlin and the Fraunhofer FOKUS Institute. It comprises 711 planning problems across 23 distinct domains, with each problem paired with an executable gym environment to automatically validate the applicability of generated plans. The dataset is built upon classic domains and problems from the original pddlgym framework, and the DeepSeek v4 Flash model is utilized to generate descriptions for the remaining problems while preserving their original logical structures. This dataset addresses the gap of lacking standardized benchmarks and automated validation mechanisms in LLM-aided symbolic planning, providing a reliable basis for evaluating executable plans generated by planning models.
PDDLCoder是一个用于从自然语言描述中自动生成可应用的PDDL(规划领域定义语言)文件的代理式LLM形式化工具。
核心特性
- 代理式方法:采用ReAct智能体,零样本创建、分析和优化PDDL 1.2领域与问题文件,无需预设的PDDL或人工反馈。
- 自适应工具选择:智能体将语法错误、不可解模型和语义不可行计划视为不同的失败状态,在最多50次迭代中自适应选择合适的工具(共8种)。
- 外部验证工具集成:包括VAL语法检查、Fast Downward规划器验证,以及LLM对计划物理/逻辑可行性的反馈。
- 可执行验证:生成的计划映射到目标环境的动作模式后,在gym环境中逐步执行验证,确保所有动作适用且终止状态满足目标。
性能表现
在NL-pddlgym基准测试的留出测试集(4个未见领域的106个问题)上,PDDLCoder使用DeepSeek v4 Flash模型对89.6%的问题生成了可应用的计划,显著优于先前LLM-Formalizers改编版本的最高45.3%和直接LLM-Planners的74.5%。
评估基准(NL-pddlgym)
- 包含711个规划问题,覆盖23个领域,每个问题配备自然语言描述和可执行的pddlgym环境。
- 测试集由4个留出领域(Elevator、Hanoi、Ring and Peg、Satellite)的106个问题组成,在训练/验证分割中从未出现。
流水线类型
| 流水线 | 描述 |
|---|---|
| pddl_coder | 具备8种工具的ReAct代理 |
| rigid | 固定分步流水线:生成领域→生成问题→修复语法→修复不可解性→结合计划反馈 |
| chain_of_thought | 无工具的CoT基线,直接生成计划 |
运行要求与安装
- 需要Python 3.12、uv、VAL(Parser二进制文件需在PATH中)和Fast Downward 24.06.1(作为同级目录检出)。
- 安装命令:
uv sync --locked。 - 可通过Docker(docker-compose.yml)构建包含VAL和Fast Downward的镜像,或使用vLLM本地服务模型。
- 支持多种模型:deepseek_v4_flash(通过OpenRouter)、gemma_4_31b、gpt_oss_120b、qwen_36_35b_a3b、glm_47_flash、llama_4_scout(本地推理)。
输出与测试
results/*.csv:每个问题的失败阶段、运行时间、输入/输出token数、各工具调用次数及文件路径。logs/:调试日志,包含完整的模型交互。pddl/generated/和plans/:生成的PDDL文件和计划。- 测试通过
uv run pytest运行。

- 1PDDLCoder: Agentic PDDL Generation for LLM-Assisted Symbolic Planning柏林工业大学; 弗劳恩霍夫FOKUS研究所 · 2026年




