遇见数据集

logdx-ci

收藏
Hugging Face2026-05-23 更新2026-05-24 收录
官方服务:

资源简介:

LogDx-CI是一个专门用于评估持续集成(CI)日志缩减工具的基准测试数据集。该数据集旨在测试各种日志处理工具(如RTK、grep、tail、混合路由器和LLM摘要生成器)在压缩CI失败日志时,是否保留了足够的关键证据,以支持大型语言模型(LLM)进行准确的根因诊断。数据集包含35个真实的CI失败案例,这些案例来自公开可见的GitHub Actions运行记录,并经过了隐私审计处理。数据以两种互补的格式提供:一种为扁平化的元数据表格,包含27个字段,涵盖案例的基本信息、标签和根因摘要,适用于快速浏览和过滤;另一种为完整的每案例数据包,包含原始日志文件、详细的案例元数据、完整的嵌套式真值标注(包括必需信号、证据片段、相关文件、预期诊断等)、标签文件以及隐私审计记录。数据被划分为6个分割(dev, holdout, stress, v2_dev, v2_holdout, v2_stress),总计35个案例,覆盖了8种主要的失败类别(如测试断言失败、编译错误、类型错误、依赖安装失败等)和超过7个不同的开发生态系统(如Python的pytest、Rust的cargo、Go测试等)。该数据集适用于文本分类、问答和文本生成等任务,特别是用于评估和比较不同日志缩减方法在辅助LLM进行自动化根因分析方面的效果,并附带基准测试结果。

LogDx-CI is a benchmark dataset specifically designed for evaluating continuous integration (CI) log reduction tools. It aims to test whether various log processing tools (including RTK, grep, tail, hybrid routers, and LLM summarizers) retain sufficient key evidence when compressing CI failure logs to support large language models (LLMs) in accurate root cause diagnosis. The dataset contains 35 real CI failure cases sourced from publicly visible GitHub Actions runs, which have undergone privacy auditing. Data is provided in two complementary formats: one is a flattened metadata table with 27 fields covering basic case information, labels, and root cause summaries, suitable for quick browsing and filtering; the other is a complete per-case data package containing raw log files, detailed case metadata, comprehensive nested ground truth annotations (including required signals, evidence snippets, relevant files, expected diagnoses, etc.), label files, and privacy audit records. The data is divided into 6 splits (dev, holdout, stress, v2_dev, v2_holdout, v2_stress), totaling 35 cases, covering 8 major failure categories (such as test assertion failures, compilation errors, type errors, dependency installation failures, etc.) and over 7 different development ecosystems (e.g., Pythons pytest, Rusts cargo, Go testing, etc.). This dataset is suitable for tasks like text classification, question answering, and text generation, particularly for evaluating and comparing different log reduction methods in assisting LLMs with automated root cause analysis, and it comes with benchmark results.

创建时间:
2026-05-16
原始信息汇总

数据集概述:LogDx-CI

LogDx-CI 是一个专为CI日志缩减工具设计的基准测试数据集,用于评估这些工具在保留足够证据以供大语言模型进行根因诊断方面的表现。

核心信息

数据集结构与使用方式

数据集提供两种格式,包含相同的35个案例:

  • 格式一:扁平元数据表格(通过 load_dataset 或 Dataset Viewer 浏览)

    • 包含27列,每行对应一个案例的元数据、标签和根因摘要。
    • 共6个数据切分,35行。
    • 适用场景:浏览、按类别/生态/切分过滤、构建仪表盘。
    • 示例代码: python from datasets import load_dataset ds = load_dataset("eyuansu71/logdx-ci")
  • 格式二:完整案例包(通过 snapshot_download 获取)

    • 每个案例包含4个文件:raw.log(原始CI失败日志)、case.json(安全元数据)、ground_truth.json(AI起草+作者验证的完整嵌套标注)、tags.json(标签)。
    • 适用场景:运行基准测试、训练、需要原始日志或完整标注的工作。
    • 示例代码: python from huggingface_hub import snapshot_download local_dir = snapshot_download(repo_id="eyuansu71/logdx-ci", repo_type="dataset")

数据切分

切分 案例数 说明
dev 5 v1 原型波次开发集
holdout 5 v1 原型波次留出集
stress 6 v1 原型波次压力集
v2_dev 3 v2 正式波次开发集
v2_holdout 10 v2 正式波次留出集
v2_stress 6 v2 正式波次压力集
总计 35

覆盖范围

  • 8种失败类别test_assertion, compile_error, type_error, lint_failure, dependency_install, docker_build, timeout_or_oom, multi_failure,并包含 scatteredmatrix_or_monorepo_failure 作为跨领域标签。
  • 7+个生态系统:包括 Python (pytest)、Rust (cargo)、Go (go test)、Java (Maven)、Node (pnpm + jest + biome)、Docker (buildx)、helm/k8s、Terraform、Gradle、TCL (cpython)、Airflow、TypeScript (tsc)、Redis 等。

主要发现与领先方法

根据对 35个真实CI失败案例3个模型系列(Claude Haiku 4.5, Claude Sonnet 4.6, OpenAI gpt-5-mini)的评估,排名前3和垫底4的方法在不同模型系列中表现稳定。

排名 方法 总体得分(案例加权)
1 hybrid-grep-120k-rtk-tail 0.670
2 hybrid-grep-120k-tail 0.666
3 llm-summary-v1-gpt-5-mini (v1.2新增) 0.664
4 grep 0.639
5 llm-summary-v1-haiku (v1.1升级为头条) 0.632
6 tail-200 0.614

隐私与注意事项

  • 隐私:所有原始CI日志来自公开的GitHub Actions运行,并经过隐私审查流程,无隐私泄露记录。
  • 注意事项
    • 当前为v1.2预印本版本,目标于v1.3扩展至50+案例。
    • 标注由AI起草并由项目作者单一人验证,非独立人工标注。
    • 目前仅测试了3个模型系列,不包括Gemini、Llama或DeepSeek。
    • 未进行独立的第三方复现评估。
    • 案例中包含20个历史排除项,评估时会进行零分弃权处理以保持分母正确。

引用

bibtex @misc{qin2026logdx, title = {{LogDx-CI}: Benchmarking CI Log Reduction Tools for LLM Root-Cause Diagnosis}, author = {Qin, Bowen}, year = {2026}, howpublished = {url{https://github.com/eyuansu62/LogDx}}, note = {v1.2 release; cases corpus at url{https://huggingface.co/datasets/eyuansu71/logdx-ci}}, }

搜集汇总
数据集介绍
logdx-ci 数据集图片
构建方式
LogDx-CI基准数据集的构建根植于对持续集成流水线中日志缩减工具效能的系统评估需求。数据集精心遴选35个真实世界的CI失败案例,这些案例源自公开可见的GitHub Actions运行日志,覆盖8种故障类别与7个以上技术生态体系。每个案例均经过隐私审计,确保敏感信息被妥善处理。数据以双轨格式呈现:其一为扁平化的元数据表,便于浏览与基础筛选;其二为核心案例包,包含原始日志、结构化元数据、经过AI起草及作者验证的完整标注信息,以及标签与隐私审计记录。这种双层架构兼顾了数据可访问性与深度分析的复杂性需求。
特点
该数据集最显著的特色在于其针对CI日志缩减工具的专精性评估框架。它系统地审视了RTK、grep、tail、混合路由器及LLM摘要等多种工具在保留大型语言模型根因诊断所需证据方面的效能。数据集通过严格定义的故障类别(如测试断言失败、编译错误、类型错误等)与跨领域标签(如分布式故障、矩阵或单体仓库故障)构建了层次化的评估体系。其标杆性发现揭示了混合方法(如hybrid-grep-120k-rtk-tail)在跨模型家族中的稳定优势位置,为日志分析工具的效能评估提供了坚实的实验基础。
使用方法
使用LogDx-CI数据集有两种主要路径。对于需进行数据浏览与基础过滤的任务,研究者可通过Hugging Face的load_dataset函数加载扁平化的元数据表,利用其27列信息进行按故障类别、技术生态或数据划分的筛选操作。而对于需要原始日志或完整嵌套标注信息以运行基准测试、开展训练或执行深度分析的场景,则应采用huggingface_hub库的snapshot_download方法下载完整的案例包,从而获取raw.log、ground_truth.json等核心文件,实现针对CI日志缩减工具效能的系统评估与复现研究。
背景与挑战
背景概述
持续集成(CI)日志分析与根因诊断是软件工程领域的关键挑战,随着CI/CD流水线的广泛采用,海量冗长的构建日志使得高效获取故障证据变得尤为困难。LogDx-CI数据集由新加坡国立大学Qin Bowen于2026年创建,旨在系统评估各类日志缩减工具在保留根因诊断证据方面的效能。该基准包含35个真实CI故障案例,覆盖测试断言、编译错误、类型错误、超时等8类故障范畴,横跨pytest、cargo、go test等7种以上技术生态。通过对比基于RTK、grep、tail、混合路由及大模型摘要等不同缩减策略,其核心研究问题在于探究哪种方法能最大程度保留供大语言模型进行根因分析的关键信息。该数据集已成为评估日志缩减工具与自动化诊断流程融合效果的重要标杆,为CI故障诊断领域的实证研究提供了标准化的评估框架。
当前挑战
LogDx-CI数据集构建过程中面临多重挑战。在领域问题层面,CI日志的极度冗长与噪声密集特性使得传统缩减方法往往在压缩规模与保留诊断证据之间难以平衡,机械截断(如tail-200)和模式匹配(如grep)虽能快速缩减,却可能丢失关键上下文;大模型摘要虽能提炼要点,但存在信息失真风险。在数据构建层面,挑战主要集中于三点:其一,从公开GitHub Actions运行中采集日志后,需对35个案例逐一执行200k行截断、长行拆分及隐私审核,确保无敏感信息泄露;其二,引用诊断标准由AI草拟后仅经单人验证,缺乏独立第三方人工标注,精度存在局限;其三,案例规模(35例)尚不足以覆盖CI故障的全部分布特征,且仅评估了Anthropic与OpenAI两家大模型系列,结论的泛化性有待扩充验证。
常用场景
经典使用场景
LogDx-CI数据集专为评估持续集成(CI)日志缩减工具而设计,其核心用途是衡量不同缩减策略在保留根因诊断关键证据方面的效能。研究者可通过该基准,对比多种典型方法,如基于规则的工具(grep、tail)、机器学习驱动的RTK日志分析器以及大语言模型(LLM)摘要生成技术。数据集的35个真实CI故障案例,覆盖测试断言失败、编译错误、类型错误、依赖安装问题、Docker构建失败、超时及多故障等8类场景,且横跨pytest、cargo、go test、Maven等7种以上生态系统,为系统性评估日志缩减后LLM是否仍能准确诊断根因提供了标准化测试平台。
实际应用
在实际软件工程场景中,LogDx-CI可用于指导CI/CD流水线中日志处理模块的选型与优化。开发团队可利用该基准评估不同日志缩减工具在自身项目环境下的表现,从而选择能最大程度保留根因诊断线索的策略。例如,排行榜显示的混合路由方法(hybrid-grep-120k-rtk-tail)在35个案例中综合得分最高,可作为推荐的默认配置。此外,该数据集支持通过HuggingFace Datasets库进行扁平元数据浏览,也可下载包含原始日志与完整标注的案例包,便于集成到持续的CI监控告警系统或自动化故障定位工作流中,提升运维效率。
衍生相关工作
LogDx-CI的发布催生了多个方向的研究工作。其技术报告中提出的两阶段基准方法论(原型波次与正式波次)被后续研究采纳为LogEval类工作的标准设计范式。此外,数据集排行榜中表现突出的混合路由策略(如grep-120k-rtk-tail)已被RTK社区采纳为官方推荐配置。基于该数据集,研究者进一步探索了LLM作为诊断代理(agent-loop)的潜力,例如gpt-5-mini在代理循环模式下诊断评分达0.749,显著优于单次摘要方法。这些衍生工作共同推动了从简单规则匹配到语义感知的CI日志分析技术演进,并使LogDx-CI成为评估下一代编码智能体根因诊断能力的核心基准之一。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务