Text-to-Log Dataset
收藏资源简介:
本数据集为合成文本-日志对数据集,由慕尼黑大学和曼海姆大学的研究团队创建,旨在弥合非结构化文本与结构化事件日志之间的鸿沟。数据集包含约3287条样本,源于两个真实事件日志:交通罚款管理流程(2887条)和脓毒症病例治疗流程(400条),每条样本均由前沿大型语言模型(如GPT-5.1、Qwen3-max等)将原始事件日志转换为逼真的警察报告或出院摘要。创建过程采用多样化角色、提示和随机解码策略,确保文本的语义丰富性与现实性,同时保留原始事件日志的时间与事件信息。该数据集主要用于微调开源语言模型,使其能够从自然语言描述中自动提取高保真事件日志,从而为过程挖掘技术解锁此前未被利用的组织知识,如事故报告、手册等文本资源。
This dataset is a synthetic text-log pair dataset developed by a research team from LMU Munich and the University of Mannheim, aiming to bridge the gap between unstructured text and structured event logs. It contains approximately 3,287 samples derived from two real-world event logs: the traffic fine management process (2,887 samples) and the sepsis patient treatment process (400 samples). Each sample is generated by cutting-edge large language models (LLMs, e.g., GPT-5.1, Qwen3-max) that convert raw event logs into realistic police reports or discharge summaries. The dataset creation process adopts diverse roles, prompts, and random decoding strategies to ensure the semantic richness and realism of the generated text, while preserving the temporal and event information from the original event logs. This dataset is primarily intended for fine-tuning open-source large language models, enabling them to automatically extract high-fidelity event logs from natural language descriptions, thereby unlocking previously untapped organizational knowledge—such as incident reports, manuals, and other textual resources—for process mining techniques.
数据集详情总结
项目概述
该项目提供了一个实验框架和代码,用于研究将非结构化文本数据转换为可执行的事件日志,以支持流程挖掘(PM)。项目提出了一种可扩展的流水线,利用大语言模型(LLMs)作为智能数据转换器,弥合组织"暗数据"(如支持票据、手册和内部报告)与结构化事件日志之间的差距。
关键特性与贡献
- 文本到日志框架:一种可扩展的流水线,将原始非结构化文本转换为与标准流程挖掘工具兼容的高保真结构化事件数据。
- 专门微调:在合成构建的文本到日志数据集上对LLMs进行微调,而非仅使用标准提示技术。
- 性能基准测试:实验证明微调显著优于零样本和少样本提示方法。
源数据集
项目基于两个公开的真实事件日志(由Felix Mannhardt及同事整理):
| 数据集 | 领域 | 来源 |
|---|---|---|
| Road Traffic Fine Management Process | 意大利警方的交通罚款管理信息系统(警方报告) | https://data.4tu.nl/articles/_/12683249/1 |
| Sepsis Cases | 荷兰医院脓毒症患者轨迹(医疗摘要) | https://data.4tu.nl/articles/_/12707639/1 |
这些日志被抽样以创建子集,作为评估LLM生成事件日志的基准真实数据。
实验流程
合成数据生成
- 使用三个基础模型:
gpt-5.1、qwen3-max、mistral-medium-2508 - 温度在[0.6, 0.9]范围内按示例均匀采样,top-p为0.9
- 使用YAML配置文件中定义的人物角色和提示词进行多样化生成
微调与推理
微调设置:
- 基础模型:Llama-3.1-8B-Instruct、Ministral-8B-Instruct-2410、Qwen2.5-7B-Instruct
- LoRA SFT方法,20个epoch,有效批量大小为32
- 学习率2e-4,采用线性调度器和5步预热
- 使用单次提示(包括随机训练示例)和可选领域知识
推理设置:
- 使用三个微调后的LoRA适配器及未修改的基础模型
- 零样本或单次提示,温度0.7,top-p 0.9
- 所有报告的运行均启用了领域知识增强
评估方法
- 轨迹级指标:计算Levenshtein距离、Kendalls Tau相似性、分类和数值重叠量
- 过程级指标:使用Alpha、Inductive和Heuristics挖掘器,计算精度(Precision)、拟合度(Fitness)和F1分数
主要结果
- 监督微调(SFT)平均提高了事件日志质量,使推导出的过程模型比单次或零样本提示生成的日志更优质
- 跨分布实验表明,从GPT-5.1生成的文本上训练、在Qwen3生成的文本上评估时,SFT依然有效
- 消融实验结果证实,即使训练数据来自不同的文本分布或不同领域,SFT也能提高事件日志质量
环境与依赖
- Python 3.12.0
- 依赖通过
pip install -r requirements.txt安装 - 微调和推理在NVIDIA A40(48GB VRAM)上测试
- 所有运行使用固定随机种子42
许可证
该项目采用MIT许可证。




