plan-failure-bench
收藏资源简介:
这是一个可机器检查的基准,用于评估大型语言模型在机器人任务规划中的失败情况。它包含陷阱标记的指令、符号世界、通过CI验证的真实标签、语义混淆以及种植与观察的混淆矩阵。基准交叉了六种陷阱家族,使用可判定协议,其中拒绝和澄清是一等答案,每个标签都是机器检查的证明,且没有检测计数出现在没有其假阳性对应项的情况下。
This is a machine-checkable benchmark for evaluating failure cases of large language models (LLMs) in robotic task planning. It includes trap-marked instructions, symbolic worlds, CI-verified ground truth labels, semantic confusions, and a confusion matrix for planting and observation. The benchmark spans six trap families using a decidable protocol, where rejection and clarification serve as first-class answers, every label is a machine-checkable proof, and no detection counts exist without their corresponding false positive counterparts.
数据集概述
该数据集是一个用于评估大型语言模型(LLM)在机器人任务规划中故障模式的基准测试。
核心设计理念
- 跨陷阱族评估:该基准跨越六个不同的陷阱族,并使用一个统一的、可判定的协议进行测试,解决了现有基准测试仅针对单一陷阱族或依赖人类/LLM评判的局限性。
- 机器可验证:模型回答被限制在一个JSON DSL中,包括
plan(计划)、infeasible(不可行,附带原因)或clarify(澄清,带候选对象)。所有判定均由确定性检查器自动完成,无需人工或LLM评判。 - 成对指标:每次检测(Detection)都会报告其假阳性(False Positives)计数。模型如果总是拒绝,会被明确识别出来。
- 语义混淆测试:所有测试均在原始文本和经过语义混淆(将所有语义内容词替换为无意义标记)两种条件下进行,以评估模型是依赖语义模式匹配还是真正的状态推理。
基准内容与结构
-
指令与陷阱:包含60条指令,每条指令都植入了6种陷阱之一,并带有对应的证明义务。
-
陷阱家族:
valid:无陷阱,期望模型给出一个可通过检验的计划。unreachable_goal:目标不可达(例如,目标缺失、被密封或不可移动)。missing_capability:任务需要机器人不具备的能力。ambiguous_referent:指令中存在歧义指代(如“那个杯子”但桌子有两个杯子)。precondition_trap:一个看似合理的行动顺序会撞上隐藏的先决条件(如进入一扇紧闭的门)。sequencing_trap:指令中给出的顺序会妨碍目标实现。constraint_trap:诱人的路线违反了环境中的硬性约束(如不能携带液体通过地毯走廊)。
-
环境(Worlds):
house_01:7个房间,6扇门,10个物品,2个轨迹约束(锋利物品不能进育儿室,液体不能通过地毯走廊)。所有已发布的模型结果都基于此环境。office_01:9个房间,8扇门,11个物品,有一组自己的30条指令集和混淆词汇库。
评测流程
- 每个已标注的指令和一个符号化的世界模型输入给固定的提示词(Prompt)。
- 模型输出一个JSON格式的响应。
- 一个确定性的检查器模拟并验证该响应,给出一个判定结果。
- 所有结果汇总成一个“种植 vs. 观察”矩阵,并统计检测数和假阳性数。
初步结果与发现(基于4个模型的16次运行)
-
关键模型表现对比:
- Llama 3.3 70B:格式一致性差(30条指令中有18个格式错误),但能检测出大部分不可行性陷阱。其规划判断在语义混淆后基本不受影响。
- Qwen 2.5 7B:格式一致性好(3/30格式错误),但几乎从不拒绝指令(零假阳性,低检测率)。其失败模式在两个环境中均得到复现。语义混淆会使其从默从转向结构性约束匹配,但同时增加了格式错误和新的假阳性。
- Gemini 3.1 Flash Lite:格式合规性完美,陷阱检测率高(12/13),但无法解决任何排序陷阱,且假阳性高(4/17)。其过度拒绝行为由表面语义驱动。
- Gemini 3.6 Flash:在
house_01环境的原始和混淆条件下均获得完美结果:格式完美,检测出全部13个陷阱,零假阳性,解决所有9个有效种子,包括所有排序陷阱和约束陷阱。其判定基于状态追踪,而非词法模式匹配。
-
关键发现:
- “能力缺失”陷阱:所有模型均难以给出精确的“missing_capability”诊断,除了Gemini 3.6在特定种子上的第一次成功。
- 格式纪律:Llama 3.3的格式错误是其自身习惯,而非提示词问题。即使使用多种不同的提示词,其格式问题依然存在。
- 采样噪声:针对Qwen的采样实验证明,其“永不拒绝”的模式是模型本身的属性,而非解码策略的噪声。
- 混淆对推理的影响:语义混淆会削弱模型进行拓扑推理的能力(如推断房间的隔离性),但基于明确陈述事实的推理(如“地窖没有门”)在混淆后依然稳健。
数据集访问与资源
- 代码与数据仓库:https://github.com/munawarkazmi/plan-failure-bench
- 每个种子的详细结果:docs/seed_review.md
- 原始记录文件:results/
- 工作论文:paper/;编译版PDF:paper/paper.pdf
- 许可证:MIT





