tencent/PlanningBench
收藏资源简介:
PlanningBench是一个用于评估和训练大型语言模型在复杂文本规划任务上的合成规划基准和数据构建框架。它关注模型是否能够将目标、约束、资源、时间窗口、依赖关系、优先级和目标协调成一个可执行且可验证的计划。与手工编写的固定规划示例集合不同,PlanningBench将真实规划场景抽象为可重用的任务分类、约束家族和难度因素。该基准旨在测试在耦合约束下的完整计划成功,而不仅仅是局部需求满足。它针对自包含的文本规划问题,其中构建和验证计划所需的所有信息都在输入中提供。每个实例包含一个规划问题和相应的验证检查清单,以便评估模型输出在约束满足和目标质量方面的表现。当前版本发布了467个合成规划实例,所有实例均用于评估,应视为基准/测试数据而非训练数据。数据通过手动编写和检查,不包含专有业务数据、用户日志、客户数据、生产数据或企业工作流记录。任务分类包括六个高级规划家族:调度与时间表、项目与生产操作、路由与旅行、应急响应与公共服务、分配与匹配、以及班次与劳动力调度。数据构建框架采用约束驱动的合成管道,支持跨任务、约束和解决方案结构的可控多样性,并通过约束紧密度、资源稀缺性、目标冲突、子任务依赖性和全局协调要求等因素调整难度。
# PlanningBench:面向大语言模型(Large Language Model)评测与训练的可扩展可验证规划数据集 <p align="center"> <img src="asset/hunyuanlogo.png" alt="腾讯混元" width="220"/> <img src="asset/cn_ruc_logo.png" alt="中国人民大学" width="360"/> </p> <p align="center"> <a href="https://arxiv.org/abs/2605.20873"><img src="https://img.shields.io/badge/arXiv-PlanningBench-b31b1b.svg" alt="arXiv"/></a> <a href="https://huggingface.co/datasets/tencent/PlanningBench"><img src="https://img.shields.io/badge/HuggingFace-Dataset-yellow" alt="Hugging Face"/></a> <a href="./LICENSE-PlanningBench.txt"><img src="https://img.shields.io/badge/Licence-PlanningBench-blue.svg" alt="Licence"/></a> <a href="./data/PlanningBench-eval.jsonl"><img src="https://img.shields.io/badge/Data-467%20Planning%20Data-green" alt="Data"/></a> </p> PlanningBench是一款面向复杂文本规划任务的合成规划基准测试集与数据构建框架,用于大语言模型的评测与训练。其核心考察目标为:模型能否将各类任务目标、约束条件、资源、时间窗口、依赖关系、优先级与任务目标整合为可执行且可验证的规划方案。 与固定的手写规划示例集不同,PlanningBench将真实规划场景抽象为可复用的任务分类体系、约束集族与难度因子。该基准测试集旨在评测模型在耦合约束下生成完整规划方案的能力,而非仅满足局部需求的表现。 ### 概述 <div align="center"> <img src="asset/planningbench-logo.png" alt="PlanningBench标志" width="400"/> </div> PlanningBench面向自包含型文本规划问题,即输入中已提供构建与验证规划方案所需的全部信息。每个数据实例均包含规划问题与对应的验证清单,以便对模型输出的约束满足度与目标完成质量进行评测。 本仓库当前发布**467条合成规划实例**,且全部467条实例仅用于**评测**,请将其视为基准测试/测试数据而非训练数据。 已发布的数据均经过人工编写与审核,**不包含**专有商业数据、用户日志、客户数据、生产数据或企业工作流记录。本次质量管控与审核由人工标注人员参与,但基准实例并非由其从零创建。 ### 发布内容 本仓库包含以下内容: text PlanningBench/ ├── data/ │ └── PlanningBench-eval.jsonl # 467条合成评测实例 ├── asset/ │ ├── planningbench-logo.png # PlanningBench基准测试集标志 │ ├── hunyuanlogo.png # 腾讯混元标志 │ ├── cn_ruc_logo.png # 中国人民大学校徽 │ ├── figure-data.png # 任务分类体系与数据分布示意图 │ └── figure-framework.png # 数据构建框架示意图 ├── LICENSE-PlanningBench.txt └── README.md ### 任务分类体系与数据分布 我们定义了PlanningBench所使用的任务空间,将规划问题划分为6个高级规划类别、30余种具体任务类型与多种子任务变体。 该分类体系基于规划结构而非仅表面应用领域进行组织,涵盖了时间冲突、资源分配、覆盖与公平性、路径协调、生产依赖、应急响应优先级等各类规划难度来源。 <p align="center"> <img src="asset/figure-data.png" alt="PlanningBench任务分类体系与数据分布" width="760"/> </p> 六个高级规划类别如下: - **调度与排程**:时间冲突、时间窗口与执行顺序 - **项目与生产运营**:里程碑、依赖关系、产能与连续性 - **路径规划与出行调度**:路径选择、时空协调与换乘 - **应急响应与公共服务**:时效性、优先级分配与重规划 - **分配与匹配**:兼容性与产能限制下的资源分配 - **排班与劳动力调度**:覆盖范围、轮班公平性与可用性 ### 数据构建框架 PlanningBench采用约束驱动的合成流程。其构建过程将真实规划场景抽象为任务与约束分类体系,采样任务-约束配置组合,生成自包含型规划问题,附加验证清单或评分标准,并结合自动筛选与人工质量管控审核。 <p align="center"> <img src="asset/figure-framework.png" alt="PlanningBench构建框架" width="760"/> </p> 该流程包含两个主要阶段: 1. **任务与约束分类体系构建**:将典型规划场景归纳为任务类别、具体任务、子任务变体、通用约束、任务专属约束与专用状态约束 2. **约束驱动的合成与难度增强**:生成器(Generator)生成候选规划实例,求解器(Responder)尝试对其进行求解,校验器(Critic)依据验证清单对输出结果进行验证。基于已求解与未求解实例的反馈信息,调整采样策略以适配合适的任务难度 该设计支持在任务、约束与求解结构层面实现可控的多样性。可通过约束紧密度、资源稀缺性、目标冲突、子任务依赖与全局协调需求等因素调整任务难度。 ### 引用 若您使用PlanningBench,请引用以下文献: bibtex @article{zhao2026planningbench, title={PlanningBench: Generating Scalable and Verifiable Planning Data for Evaluating and Training Large Language Models}, author={Zhao, Ziliang and Xu, Zenan and Wang, Shuting and Qian, Hongjin and Lei, Yan and Hu, Minda and Wang, Zhao and Dou, Shihan and Dou, Zhicheng and Zhou, Pluto}, journal={arXiv preprint arXiv:2605.20873}, year={2026} } ### 许可证 许可证信息请参见[`LICENSE.txt`](./LICENSE.txt)。




