遇见数据集

plan-failure-bench

收藏
github2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

这是一个可机器检查的基准,用于评估大型语言模型在机器人任务规划中的失败情况。它包含陷阱标记的指令、符号世界、通过CI验证的真实标签、语义混淆以及种植与观察的混淆矩阵。基准交叉了六种陷阱家族,使用可判定协议,其中拒绝和澄清是一等答案,每个标签都是机器检查的证明,且没有检测计数出现在没有其假阳性对应项的情况下。

This is a machine-checkable benchmark for evaluating failure cases of large language models (LLMs) in robotic task planning. It includes trap-marked instructions, symbolic worlds, CI-verified ground truth labels, semantic confusions, and a confusion matrix for planting and observation. The benchmark spans six trap families using a decidable protocol, where rejection and clarification serve as first-class answers, every label is a machine-checkable proof, and no detection counts exist without their corresponding false positive counterparts.

创建时间:
2026-07-24
原始信息汇总

数据集概述

该数据集是一个用于评估大型语言模型(LLM)在机器人任务规划中故障模式的基准测试。

核心设计理念

  • 跨陷阱族评估:该基准跨越六个不同的陷阱族,并使用一个统一的、可判定的协议进行测试,解决了现有基准测试仅针对单一陷阱族或依赖人类/LLM评判的局限性。
  • 机器可验证:模型回答被限制在一个JSON DSL中,包括plan(计划)、infeasible(不可行,附带原因)或clarify(澄清,带候选对象)。所有判定均由确定性检查器自动完成,无需人工或LLM评判。
  • 成对指标:每次检测(Detection)都会报告其假阳性(False Positives)计数。模型如果总是拒绝,会被明确识别出来。
  • 语义混淆测试:所有测试均在原始文本和经过语义混淆(将所有语义内容词替换为无意义标记)两种条件下进行,以评估模型是依赖语义模式匹配还是真正的状态推理。

基准内容与结构

  • 指令与陷阱:包含60条指令,每条指令都植入了6种陷阱之一,并带有对应的证明义务。

  • 陷阱家族

    • valid:无陷阱,期望模型给出一个可通过检验的计划。
    • unreachable_goal:目标不可达(例如,目标缺失、被密封或不可移动)。
    • missing_capability:任务需要机器人不具备的能力。
    • ambiguous_referent:指令中存在歧义指代(如“那个杯子”但桌子有两个杯子)。
    • precondition_trap:一个看似合理的行动顺序会撞上隐藏的先决条件(如进入一扇紧闭的门)。
    • sequencing_trap:指令中给出的顺序会妨碍目标实现。
    • constraint_trap:诱人的路线违反了环境中的硬性约束(如不能携带液体通过地毯走廊)。
  • 环境(Worlds)

    • house_01:7个房间,6扇门,10个物品,2个轨迹约束(锋利物品不能进育儿室,液体不能通过地毯走廊)。所有已发布的模型结果都基于此环境。
    • office_01:9个房间,8扇门,11个物品,有一组自己的30条指令集和混淆词汇库。

评测流程

  1. 每个已标注的指令和一个符号化的世界模型输入给固定的提示词(Prompt)。
  2. 模型输出一个JSON格式的响应。
  3. 一个确定性的检查器模拟并验证该响应,给出一个判定结果。
  4. 所有结果汇总成一个“种植 vs. 观察”矩阵,并统计检测数和假阳性数。

初步结果与发现(基于4个模型的16次运行)

  • 关键模型表现对比

    • Llama 3.3 70B:格式一致性差(30条指令中有18个格式错误),但能检测出大部分不可行性陷阱。其规划判断在语义混淆后基本不受影响。
    • Qwen 2.5 7B:格式一致性好(3/30格式错误),但几乎从不拒绝指令(零假阳性,低检测率)。其失败模式在两个环境中均得到复现。语义混淆会使其从默从转向结构性约束匹配,但同时增加了格式错误和新的假阳性。
    • Gemini 3.1 Flash Lite:格式合规性完美,陷阱检测率高(12/13),但无法解决任何排序陷阱,且假阳性高(4/17)。其过度拒绝行为由表面语义驱动。
    • Gemini 3.6 Flash:在house_01环境的原始和混淆条件下均获得完美结果:格式完美,检测出全部13个陷阱,零假阳性,解决所有9个有效种子,包括所有排序陷阱和约束陷阱。其判定基于状态追踪,而非词法模式匹配。
  • 关键发现

    • “能力缺失”陷阱:所有模型均难以给出精确的“missing_capability”诊断,除了Gemini 3.6在特定种子上的第一次成功。
    • 格式纪律:Llama 3.3的格式错误是其自身习惯,而非提示词问题。即使使用多种不同的提示词,其格式问题依然存在。
    • 采样噪声:针对Qwen的采样实验证明,其“永不拒绝”的模式是模型本身的属性,而非解码策略的噪声。
    • 混淆对推理的影响:语义混淆会削弱模型进行拓扑推理的能力(如推断房间的隔离性),但基于明确陈述事实的推理(如“地窖没有门”)在混淆后依然稳健。

数据集访问与资源

搜集汇总
数据集介绍
plan-failure-bench 数据集图片
构建方式
该数据集的构建基于符号化世界模型,涵盖房间、门、物品及单槽机械臂与安全约束。每条指令嵌入六类陷阱之一:不可达目标、缺失能力、歧义指代、前提条件陷阱、顺序陷阱及约束陷阱。每类陷阱配备机械可验证的证明义务,可行种子附带参考规划,不可行种子经超近似搜索证明无解,歧义性通过绑定计数确认。所有标签均在持续集成中自动重验证,确保标注与执行结果的一致性。
使用方法
用户通过固定提示模板调用待测模型,模型以JSON格式返回规划、不可行或澄清三类响应。确定性检查器逐步骤模拟并输出唯一判定结果,全程无需人工或AI评判。每条指令均配有符号化世界定义及可复现种子,支持在两种环境(house_01与office_01)及两种条件(明文与语义混淆)下执行评估。结果以混淆矩阵与计数表呈现,表格由提交记录自动生成,确保可复现性。
背景与挑战
背景概述
plan-failure-bench 诞生于大语言模型在机器人任务规划中系统性失效的研究前沿。现有评估如 PlanBench 虽已揭示模型规划能力欠佳,但多聚焦单一陷阱族,依赖人工或语言模型评判,或将结果压缩为单一成功率指标,难以刻画模型失败模式的完整图景。该基准由 Munawar Kazmi 等人于近期创建,旨在通过一种可判定的协议跨越六类已知规划陷阱——包括不可达目标、缺失能力、指代歧义、前提条件陷阱、顺序陷阱与约束陷阱,要求模型以机器可检查的动作语言回应,拒绝与澄清均作为一等答案,从而直接检验模型是否以指令所预测的方式失败。其核心创新在于,每个标签均配有机械可验证的证明,且检测率永不脱离可行指令上的假阳性数据单独报告。该基准已对 Llama 3.3 70B、Qwen 2.5 7B 及 Gemini 系列模型进行测试,揭示了不同模型截然相反的失败轮廓:大模型常以格式包装掩盖判断能力,小模型则保持格式纪律却几乎从不拒绝,这些发现为理解语言模型规划行为的本质——究竟是状态追踪还是词法模式匹配——提供了关键证据,并已在两个环境上得到复现。
当前挑战
该数据集着力应对的核心挑战涵盖两大层面。在领域问题层面,现有评估方法存在根本性局限:单一陷阱族的测试难以反映多类失效交织的复杂场景,人工或 LLM 评判引入主观性与不可复现性,成功率的统计掩盖了失败模式的类别差异,且检测报告往往缺失假阳性对照数据,使得模型系统性回避而非真正理解的问题无从暴露。plan-failure-bench 以统一的六类陷阱套件、机器可检查的判定协议以及成对报告的检测-假阳性矩阵,填补了这一方法论空白。在构建层面,研究人员面临的技术挑战包括:确保每个种子都有机械证明义务并可在 CI 中持续重验——可行种子需有被检查器与独立 PDDL 工具链共同接受的标准规划,不可行种子需通过声音过近似搜索证明不可达;设计具有区分度的陷阱对,如同一把刀在一个种子中合法移动而在另一个中可拒绝,同一约束语句在一个种子中存在合规路径而在另一个中无解;构建语义混淆的对照组以控制词法匹配效应,并随 token 版本演化,即便 v1 数据的 token 混淆性被 v2 修正,也保留所有版本记录以避免结论被悄然替换。此外,跨环境复现的稳定性、格式纪律与规划判断的分离测量、以及采样噪声与模型真实行为边界的区分,构成了持续的方法学挑战。
常用场景
经典使用场景
在大语言模型机器人任务规划的研究中,plan-failure-bench 构建了一个符号化世界(如 house_01 和 office_01),包含房间、门、物品、单夹持器以及每步必须满足的安全约束。每个指令均植入一个已知陷阱,涵盖六大失败家族:不可达目标、缺失能力、歧义指代、前提条件陷阱、排序陷阱和约束陷阱。模型需以机器可检查的 JSON DSL 回答(规划、不可行或澄清),确定性检查器模拟每一步并输出唯一判定。该基准通过混淆版本(语义词汇替换为无意义标记)评估模型在语义剥离后的规划判断能力,每类陷阱均伴随机械证明义务,确保标签的可靠性。
解决学术问题
此数据集解决了现有评估的碎片化问题:先前工作每次仅测试单一陷阱家族,或依赖人类/大语言模型裁判评分,或将性能压缩为单一成功率。plan-failure-bench 在单一可判定协议下横跨六种陷阱家族,将拒绝和澄清作为一等答案,每个标签均为机器可验证的证明,且检测计数始终与假阳性成对报告。这避免了模型因过度拒绝而虚假表现良好的偏差,能够精确区分模型是真正具备规划判断能力还是仅依赖词汇模式匹配,从而揭示语义理解与状态跟踪之间的根本差异。
实际应用
在实际应用中,该基准可直接用于测评和筛选适合机器人任务规划的大语言模型。例如,结果表明 Gemini 3.6 Flash 在两个环境下均达到完美对角线(13/13 陷阱检测、零假阳性、9/9 可行种子解决),其规划判断本质上是状态跟踪而非词汇模式匹配;而 Llama 3.3 70B 虽格式故障率高但检测能力稳健,Qwen 2.5 7B 则几乎从不拒绝任何指令。这些洞察可指导机器人系统设计者选择最适合其安全关键任务的模型,或针对特定失败模式进行微调与增强。
数据集最近研究
最新研究方向
近期研究聚焦于构建一个跨越六种预设陷阱类别的可判定基准框架,通过机器可验证的指令响应协议,系统性地评估大语言模型在机器人任务规划中的故障预测能力。该基准引入混淆矩阵来同时报告检测率与其对应的假阳性率,杜绝了以往仅依赖单一成功率或人工评分的评估偏差。初步实验揭示了模型间截然相反的失败模式:如Llama 3.3 70B在格式合规性上存在缺陷但能识别多数不可行陷阱,而Qwen 2.5 7B严格遵守格式却几乎不拒绝任何指令。语义混淆条件下的测试进一步分化了模型行为,表明部分模型的规划判断能力并不依赖于表层语义匹配,而是具备真正的状态跟踪能力。这一研究方向为理解大语言模型在具身智能中的安全边界与信任壁垒提供了可复现的量化工具,其意义在于将故障检测从模糊的定性描述推向具有严格证明义务的机械判定过程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务