遇见数据集

AdaPlanBench

收藏
github2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

AdaPlanBench是一个用于评估大型语言模型代理在逐步披露的世界约束和用户约束下自适应规划能力的基准测试数据集。

AdaPlanBench is a benchmark dataset for evaluating the adaptive planning capabilities of large language model agents under gradually disclosed world constraints and user constraints.

创建时间:
2026-05-30
原始信息汇总

AdaPlanBench 数据集概述

基本信息

  • 数据集名称:AdaPlanBench
  • 发布机构:官方仓库,作者为 JiayuJeff
  • 数据集地址
    • GitHub:https://github.com/JiayuJeff/AdaPlanBench
    • Hugging Face:https://huggingface.co/datasets/JiayuJeff/AdaPlanBench
  • 相关论文:arXiv 2606.05622(https://arxiv.org/abs/2606.05622)

数据集目标

AdaPlanBench 是一个用于评估大语言模型(LLM)智能体在逐步披露的双重约束下进行自适应规划能力的基准测试。

核心任务与约束类型

智能体需要在收到渐进式反馈后,不断修正策略,生成有效且高质量的计划。约束分为两类:

  • 🌍 世界约束(World Constraints):环境中不可用或不起作用的工具和对象
  • 👤 用户约束(User Constraints):用户偏好,禁止某些工具属性、使用模式或行为

关键特性

  • 双重约束评估:在同一规划任务中联合测试世界层面的工具约束和用户层面的偏好约束
  • 渐进式披露:约束在多个回合中逐步揭示,智能体必须不断适应
  • 可调节约束负载:每个查询提供六种环境配置文件(论文中使用低/中/高三种,配置文件4-6用于压力测试)
  • 多轮反馈循环:智能体与裁判模型迭代交互,直至成功、提前停止或超出回合预算
  • 全面评估指标:报告准确率、有效计划率(VPR)、平均轮次和重复违规率

数据集规模与结构

  • 查询数量:307 个家庭规划查询
  • 每个查询:包含多个环境配置文件(ban_pool),逐步增加约束负载
  • 数据文件:位于 domain_metadata/housing/final/query_housing_macgyver_resample.json
  • Hugging Face 加载方式: python from datasets import load_dataset dataset = load_dataset( "json", data_files="https://huggingface.co/datasets/JiayuJeff/AdaPlanBench/resolve/main/adaplanbench_queries.json", field="data", split="train", )

数据字段说明

字段 描述
query_id 唯一查询标识符
query 自然语言描述的家庭规划任务
ban_pool 环境配置文件列表,约束负载依次递增
ban_pool[].tools 不可用或不起作用的工具/对象
ban_pool[].prefs 用户偏好约束
ban_pool[].metadata.post_sampling.candidate_iterative_sample_num 约束负载配置文件索引

主要实验结果

  • 自适应规划仍然困难:在中等约束配置文件下,最强模型 GPT-5 仅达到 67.75% 准确率,大多数模型低于 45%,开源模型通常在 30% 或更低
  • 有效计划不等于成功计划:高有效计划率并不保证最终任务成功
  • 更多约束使规划更难:性能随约束负载从低到高增加而下降
  • 仅跟踪约束是不够的:模型必须主动探索替代解决方案策略并保持计划质量
  • 用户约束尤其具有挑战性:用户约束的重复违规频率高于世界约束
搜集汇总
数据集介绍
AdaPlanBench 数据集图片
构建方式
AdaPlanBench构建于家庭规划领域,围绕307个自然语言形式的家居任务查询展开。每个查询均配备一个约束池(ban_pool),内含从低到高不同负载等级的环境剖面,分别定义不可用的工具/物体(世界约束)以及用户偏好约束。系统采用渐进式披露机制:智能体在每一轮提出计划后,由裁判模型依据当前已揭示的约束和评价维度进行校验,若违反约束或质量不达标则返回反馈信息,驱动智能体迭代调整直至成功、触发提前停止或用尽轮次预算。基准支持通过ban_iterative_sample_num参数灵活切换约束负载等级,从而实现可控难度的自适应规划评测。
特点
该基准的核心特色在于双重约束联合评测与渐进式披露机制。世界约束与用户偏好约束在同一规划任务中交替出现,模拟真实环境中信息逐步完善的场景。约束负载可调节,提供六档环境剖面以满足不同难度需求,其中三档在论文中使用,其余用于压力测试。多轮反馈循环与综合指标体系——涵盖准确率、有效计划率、平均迭代轮数及重复违反率——共同构成全面评价框架。实验表明,用户约束的重复违反率显著高于世界约束,揭示当前模型在适应主观偏好与行为模式限制方面面临更大挑战。
使用方法
用户可通过GitHub仓库或Hugging Face平台获取数据。本地运行时先安装依赖并配置API密钥或自定义模型端点,然后通过命令`python -m env.run --config env/run_config.yaml --model 模型名称`启动基准测试。支持通过命令行参数或配置文件调整约束负载、模型参数(温度、最大生成长度)、裁判模型列表与合并策略、反馈策略(如是否注入记忆块、是否直接提取反馈)以及运行时参数(并发数、最大轮次、提前停止条件)。结果输出至results/runs目录,包含配置快照、聚合指标及逐查询详情,并可通过附带的主表评估脚本生成LaTeX格式结果表。
背景与挑战
背景概述
AdaPlanBench基准测试于2025年由JiayuJeff等研究者提出,旨在系统评估大语言模型智能体在渐进式披露的双重约束下进行自适应规划的能力。该研究聚焦于家庭环境中的规划任务,要求智能体在面对世界约束(环境中不可用或失效的工具与物体)和用户约束(用户对工具属性、使用模式或行为的偏好)时,能够动态调整策略并生成有效规划。基准测试设计了多轮反馈循环,智能体需在约束逐步揭示的过程中迭代改进。这一研究填补了现有规划基准中缺乏同步测试双重约束与渐进式反馈机制的空白,推动了LLM在复杂、交互式规划场景中的应用研究,对智能体鲁棒性和适应性能力的评估具有重要参考价值。
当前挑战
AdaPlanBench所面临的挑战主要体现在两方面。在领域问题上,LLM智能体在渐进式披露的双重约束下规划表现不佳:即使最强模型GPT-5在中等约束下准确率仅达67.75%,多数模型低于45%,而开放权重模型通常在30%以下。用户约束尤其困难,模型在用户偏好上的重复违反频率远高于世界约束,表明模型对主观偏好和用法限制的适应能力欠缺。在构建过程中,研究者需设计多轮反馈机制与约束渐进式披露协议,确保每个查询包含多个环境配置,并平衡约束负载的梯度划分(低/中/高),同时维持评估指标(准确率、有效规划率、平均轮次等)的公正性与可重复性,这些对数据集的构建与标准化提出了较高要求。
常用场景
经典使用场景
在大型语言模型(LLM)的自主规划能力评估中,AdaPlanBench 被设计为一个渐进式双重约束下的自适应规划基准。其主要应用场景是模拟家庭环境中规划任务,如整理物品或安排日程,要求模型在每轮交互中基于逐步揭示的环境约束(如工具不可用)和用户约束(如偏好限制)不断调整和优化规划方案。通过多轮反馈循环,该基准评估模型从初始规划到最终成功执行的全过程适应能力,成为检验 LLM 在动态、受限环境中规划鲁棒性的经典测试平台。
解决学术问题
AdaPlanBench 针对学术研究中 LLM 在复杂动态环境下的规划局限性展开探索。它系统性地解决了两个核心问题:一是模型在约束逐步揭示而非一次性给出时能否保持策略有效性,二是模型能否同时遵循世界层面的工具限制和用户层面的主观偏好。研究表明,即使如 GPT-5 等强大的模型,在中度约束下准确率仅为 67.75%,凸显了自适应规划的困难。该基准通过量化准确率、合法计划率和重复违规率等指标,揭示了模型对约束累积的高度敏感性,为理解 LLM 规划能力的边界提供了关键洞见,推动了从静态规划向动态自适应规划研究范式的转变。
衍生相关工作
基于 AdaPlanBench 研究思路,衍生出多个探索性工作。其一是约束负荷适应策略研究,即分析模型在不同约束强度下如何从记忆型约束追踪转向主动探索替代方案。其二是多维度评测细化,通过分离工具约束和用户约束的判决模型,揭示模型对主观偏好的适应性弱于客观限制。此外,该基准还启发了一系列关于反馈策略优化的工作,如全证据反馈与精简反馈的比较、记忆注入对规划成功率的影响,以及在不同停止准则下模型行为的差异化分析,为后续开发更鲁棒的规划 Agent 奠定了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务