ProcessTBench
收藏资源简介:
ProcessTBench是一个用于评估大型语言模型(LLM)在流程挖掘框架下生成计划能力的合成数据集。该数据集基于TaskBench构建,包含532个基础查询,每个查询被重新表述5到6次,平均每个查询有4.08个解决方案计划。数据集涉及使用40种独特工具的行动序列,并提供了相应的真实计划以Petri网格式。数据集的创建过程包括从TaskBench中选择最具挑战性的子集,使用LLM生成计划,并通过事件日志解析器和计划一致性检查器进行处理。ProcessTBench旨在支持研究LLM在复杂和动态环境中的计划生成行为,特别是在处理多语言和重新表述查询时的表现。
ProcessTBench is a synthetic dataset designed to evaluate the plan generation capabilities of Large Language Models (LLMs) within the process mining framework. Built upon TaskBench, this dataset includes 532 base queries, each of which is rephrased 5 to 6 times, with an average of 4.08 solution plans per query. It covers action sequences utilizing 40 distinct tools, and provides corresponding ground-truth plans in Petri net format. The dataset creation process involves selecting the most challenging subset from TaskBench, generating plans with LLMs, and processing the data via event log parsers and plan consistency checkers. ProcessTBench aims to support research on the plan generation behaviors of LLMs in complex and dynamic environments, particularly their performance when handling multilingual and rephrased queries.
ProcessTBench 数据集概述
数据集内容
生成的计划和变体
- 描述: 包含不同计划,用于提供过程ID中的问题目标。
- 生成方式: 使用
generate_plans_and_variants.py生成。
改写后的查询
- 描述: 对 TaskBench 数据集中的问题进行改写。
- 生成方式: 使用
paraphrase_queries.py生成。 - 来源: TaskBench 数据集 (https://github.com/microsoft/JARVIS/tree/main/taskbench)。
过程模型
- 描述: 包含生成的计划的过程模型。
- 生成方式: 使用归纳矿工(inductive miner),阈值分别为 0、0.1 和 0.2。
- 额外信息: 将问题的参考DAG转换为Petri网,示例生成代码在
dag_to_petri_net_results.py中。
一致性质量
- 描述: 包含通过一致性检查评估改写查询质量的结果。
- 生成方式: 使用
generate_plans_conformance_quality_rephrased.py和generate_plans_conformance_quality_original.py生成。
TaskBench 数据
- 文件:
taskbench_multimedia.jsontaskbench_multimedia_dag.jsontaskbench_multimedia_dag_partitioned.json(多进程分区)tool_desc_multimedia.json
其他文件
- 工具和模型:
utils.pymy_model.py(嵌入和LLM模型设置)readme.mdrequirements.txt




