遇见数据集

Text-to-Log Dataset

收藏
arXiv2026-09-01 更新2026-09-03 收录
官方服务:

资源简介:

本数据集为合成文本-日志对数据集,由慕尼黑大学和曼海姆大学的研究团队创建,旨在弥合非结构化文本与结构化事件日志之间的鸿沟。数据集包含约3287条样本,源于两个真实事件日志:交通罚款管理流程(2887条)和脓毒症病例治疗流程(400条),每条样本均由前沿大型语言模型(如GPT-5.1、Qwen3-max等)将原始事件日志转换为逼真的警察报告或出院摘要。创建过程采用多样化角色、提示和随机解码策略,确保文本的语义丰富性与现实性,同时保留原始事件日志的时间与事件信息。该数据集主要用于微调开源语言模型,使其能够从自然语言描述中自动提取高保真事件日志,从而为过程挖掘技术解锁此前未被利用的组织知识,如事故报告、手册等文本资源。

This dataset is a synthetic text-log pair dataset developed by a research team from LMU Munich and the University of Mannheim, aiming to bridge the gap between unstructured text and structured event logs. It contains approximately 3,287 samples derived from two real-world event logs: the traffic fine management process (2,887 samples) and the sepsis patient treatment process (400 samples). Each sample is generated by cutting-edge large language models (LLMs, e.g., GPT-5.1, Qwen3-max) that convert raw event logs into realistic police reports or discharge summaries. The dataset creation process adopts diverse roles, prompts, and random decoding strategies to ensure the semantic richness and realism of the generated text, while preserving the temporal and event information from the original event logs. This dataset is primarily intended for fine-tuning open-source large language models, enabling them to automatically extract high-fidelity event logs from natural language descriptions, thereby unlocking previously untapped organizational knowledge—such as incident reports, manuals, and other textual resources—for process mining techniques.

创建时间:
2026-09-01
原始信息汇总

数据集详情总结

项目概述

该项目提供了一个实验框架和代码,用于研究将非结构化文本数据转换为可执行的事件日志,以支持流程挖掘(PM)。项目提出了一种可扩展的流水线,利用大语言模型(LLMs)作为智能数据转换器,弥合组织"暗数据"(如支持票据、手册和内部报告)与结构化事件日志之间的差距。

关键特性与贡献

  • 文本到日志框架:一种可扩展的流水线,将原始非结构化文本转换为与标准流程挖掘工具兼容的高保真结构化事件数据。
  • 专门微调:在合成构建的文本到日志数据集上对LLMs进行微调,而非仅使用标准提示技术。
  • 性能基准测试:实验证明微调显著优于零样本和少样本提示方法。

源数据集

项目基于两个公开的真实事件日志(由Felix Mannhardt及同事整理):

数据集 领域 来源
Road Traffic Fine Management Process 意大利警方的交通罚款管理信息系统(警方报告) https://data.4tu.nl/articles/_/12683249/1
Sepsis Cases 荷兰医院脓毒症患者轨迹(医疗摘要) https://data.4tu.nl/articles/_/12707639/1

这些日志被抽样以创建子集,作为评估LLM生成事件日志的基准真实数据。

实验流程

合成数据生成

  • 使用三个基础模型:gpt-5.1qwen3-maxmistral-medium-2508
  • 温度在[0.6, 0.9]范围内按示例均匀采样,top-p为0.9
  • 使用YAML配置文件中定义的人物角色和提示词进行多样化生成

微调与推理

微调设置

  • 基础模型:Llama-3.1-8B-Instruct、Ministral-8B-Instruct-2410、Qwen2.5-7B-Instruct
  • LoRA SFT方法,20个epoch,有效批量大小为32
  • 学习率2e-4,采用线性调度器和5步预热
  • 使用单次提示(包括随机训练示例)和可选领域知识

推理设置

  • 使用三个微调后的LoRA适配器及未修改的基础模型
  • 零样本或单次提示,温度0.7,top-p 0.9
  • 所有报告的运行均启用了领域知识增强

评估方法

  • 轨迹级指标:计算Levenshtein距离、Kendalls Tau相似性、分类和数值重叠量
  • 过程级指标:使用Alpha、Inductive和Heuristics挖掘器,计算精度(Precision)、拟合度(Fitness)和F1分数

主要结果

  • 监督微调(SFT)平均提高了事件日志质量,使推导出的过程模型比单次或零样本提示生成的日志更优质
  • 跨分布实验表明,从GPT-5.1生成的文本上训练、在Qwen3生成的文本上评估时,SFT依然有效
  • 消融实验结果证实,即使训练数据来自不同的文本分布或不同领域,SFT也能提高事件日志质量

环境与依赖

  • Python 3.12.0
  • 依赖通过 pip install -r requirements.txt 安装
  • 微调和推理在NVIDIA A40(48GB VRAM)上测试
  • 所有运行使用固定随机种子42

许可证

该项目采用MIT许可证。

搜集汇总
数据集介绍
Text-to-Log Dataset 数据集图片
构建方式
面对过程挖掘领域对结构化事件日志的迫切需求与现有非结构化文本数据利用不足之间的矛盾,本文构建了Text-to-Log数据集。该数据集的构建过程独具匠心,首先从Road Traffic Fine Management Process和Sepsis Cases两个真实事件日志中精心采样,分别选取2887条和400条具有代表性的轨迹;随后,利用多种前沿基础模型(如GPT-5.1、Qwen3-max、Mistral-medium)将结构化轨迹转化为多样化的自然语言文本,如警察报告和出院摘要。为增强文本的真实性和多样性,研究中设定了不同性别、职业、性格的人物角色,并配合多种任务描述提示,同时采用随机温度(0.6-0.9)的随机解码策略。通过人工标注评估,确认合成文本在语义保真度和时间清晰度上均达到较高水平,为后续模型微调奠定了坚实的数据基础。
特点
Text-to-Log数据集具有鲜明的原创性和实用性特征。它是首个将自然语言过程描述与结构化XES事件日志配对的开源数据集,填补了该研究方向的空白。数据集的构建巧妙地将真实流程知识与合成文本生成技术相结合,既保证了事件顺序和时间戳的准确性,又通过多角色、多提示和随机采样解码引入了丰富的文本风格和内容多样性。数据集包含两大领域样本:道路罚款处理过程(以短轨迹为主,但变体丰富)和败血症治疗过程(轨迹较长且复杂),覆盖了不同复杂度和领域特性,为评估模型在不同场景下的泛化能力提供了独特视角。此外,数据集的公开可用性(含代码与样例)促进了研究的可复现性和领域内后续工作的开展。
使用方法
Text-to-Log数据集专为训练和评估大语言模型(LLM)在从非结构化文本自动生成事件日志任务中的表现而设计。使用该数据集时,研究者可将合成的文本报告(如警察报告)作为模型输入,要求LLM输出符合XES标准的轨迹。支持多种使用范式:零样本提示、单样本提示以及监督微调(SFT)。数据集被划分为训练、开发和测试子集,便于进行参数高效微调(如LoRA)和系统评估。其评测框架涵盖两个层次:在轨迹级别,分析生成轨迹的语法合规性、变体数量、幻觉率以及事件顺序和属性的相似性;在过程级别,应用Inductive Miner和Heuristics Miner算法挖掘过程模型,并以适应度、精确度和F1分数评估整体质量。该数据集还支持跨域和跨分布泛化测试,例如在道路罚款数据训练后评估其生成医疗出院摘要的能力,为过程挖掘中利用非结构化数据提供了标准化基准和工具。
背景与挑战
背景概述
流程挖掘(Process Mining)作为从事件数据中提取洞见、优化运营流程的关键技术,其效能严格依赖于结构化事件日志的可用性。然而,传统的事件日志构建高度依赖领域专家与流程挖掘专家的手工劳动,耗费巨大且效率低下,致使大量蕴含于事故工单、操作手册及文本报告中的组织知识长期未获充分利用。为突破这一瓶颈,慕尼黑大学等机构的研究人员于2026年提出Text-to-Log数据集,旨在探究大语言模型(LLM)作为自动化数据翻译器的潜力。通过构建从非结构化文本到结构化事件日志的配对数据,并基于此对开源大语言模型进行监督微调,该研究验证了模型跨领域提取高保真事件日志的能力,为流程挖掘领域开辟了规模化利用非结构化文本资源的新路径,具有重要的学术价值与应用前景。
当前挑战
Text-to-Log数据集面临的挑战体现在多层面。在领域层面,核心难题在于将自然语言过程描述精确映射为符合XES标准、包含完整属性与时间戳的事件日志,现有方法多依赖提示工程或未经验证的模型,难以保证生成数据的语法有效性与语义保真度。在数据构建层面,首个挑战是缺乏天然的文本-日志对齐语料,需借助前沿生成模型合成训练数据,但需确保合成文本的多样性、真实性与对原始日志的忠实度,避免模型过拟合于特定文本分布。此外,跨领域泛化与分布外迁移性能的保持,以及对象中心事件日志(OCEL)等复杂数据结构的兼容,仍是待解决的关键难点。
常用场景
经典使用场景
Text-to-Log数据集作为连接非结构化文本与结构化事件日志的桥梁,其经典使用场景在于利用微调后的大语言模型(LLM)将自然语言过程描述自动转换为符合XES标准的事件日志。该数据集包含成对的自然语言文本(如警情报告、医疗出院摘要)及其对应的真实事件日志,为监督式微调提供了高质量的训练语料。研究者可在此数据集上训练轻量级、开放权重的LLM,使其能够精准地提取活动序列、时间戳及属性信息,从而将过程挖掘技术的应用范围拓展至非结构化文本资源。该数据集尤其适用于警务流程、医疗流程等文本密集型领域,旨在替代繁琐的人工日志构建流程,实现从文本到事件数据的自动化转化。
实际应用
该数据集在实际应用中展现出显著价值,尤其是在组织级过程分析场景。企业积累了海量的非结构化文本资源,如事故工单、操作手册、客户服务记录及医疗报告,而传统方法难以高效利用。借助Text-to-Log数据集微调后的LLM,可自动将这些文本转化为可执行的事件日志,无缝对接主流过程挖掘工具(如PM4Py),从而发现真实业务流程,识别瓶颈与偏差。例如,在警务场景中,可将警情报告自动转为交通罚款处理过程的事件日志;在医疗场景中,可从出院摘要提取患者诊疗轨迹。该流程不仅大幅削减了人工数据准备成本,还解锁了之前无法用于过程挖掘的数据源,赋予组织更深层次的运营洞察。
衍生相关工作
Text-to-Log数据集的提出催生了多项衍生工作。一方面,研究者基于该数据集探讨了不同规模LLM(如Llama3.1-8B、Ministral-8B和Qwen2.5-7B)在文本到事件日志转换中的性能差异,并系统比较了零样本、少样本与监督微调策略的影响。另一方面,该数据集促进了过程挖掘评估框架的完善,促使从轨迹级别(如Levenshtein距离、Kendall's Tau)和流程级别(如模型拟合度、精确度)多维度衡量生成日志的质量。此外,后续工作已着手将其扩展至对象中心事件日志(OCEL)的生成,并探索利用强化学习与可验证奖励提升模型的跨域泛化能力,为过程挖掘中自动化数据转化的后续研究树立了基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务