遇见数据集

MultiCloudSRE-Ops

收藏
Hugging Face2026-05-27 更新2026-05-28 收录
官方服务:

资源简介:

多云运维 SRE 故障排查挑战数据集是一个专注于站点可靠性工程(SRE)领域,特别是多云环境下微服务系统故障诊断与恢复的数据集。该数据集基于一个部署在阿里云、腾讯云和 AWS 三朵云上的真实电商微服务系统构建,旨在模拟和评估在复杂、分布式云原生环境中进行故障排查的能力。数据集的核心内容围绕一系列预设的故障场景(Case),每条数据记录代表一个独立的故障排查挑战,包含结构化字段:id(题目的唯一标识符)、case(包含完整的故障案例数据,如故障标题、详细现象描述、故障注入脚本和恢复脚本)、ideal_answer(提供针对故障的理想答案,包括分析、逻辑推理、验证方法和解决方案)、rubrics(定义评估答案的评分标准数组,包含评价准则、分值和标签)和prompt(作为输入提示的字符串,描述需解决的故障现象)。数据集覆盖了10类典型的云原生和混合云故障类型,例如组合故障(如幽灵超时)、配置问题(如配置漂移、跨云配置错误)、网络问题(如DNS幻觉、网络抖动)、资源问题(如资源耗尽、资源限制误配)、复杂故障(如扇出风暴、综合故障)以及具有时间特性的故障(如短时故障)。数据集规模较小(少于1000条样本),主要适用于评估和训练人工智能系统(特别是大型语言模型或智能运维AIOps工具)在问答(Question-Answering)和文本生成(Text-Generation)任务上的表现,具体场景是自动化或辅助的SRE故障诊断、根因分析和解决方案生成,也可用于SRE技能培训、混沌工程实验验证以及多云运维场景下的基准测试。

The Multi-Cloud Operations SRE Fault Troubleshooting Challenge Dataset is a dataset focused on the field of Site Reliability Engineering (SRE), specifically targeting fault diagnosis and recovery in microservice systems within multi-cloud environments. It is built upon a real e-commerce microservice system deployed across Alibaba Cloud, Tencent Cloud, and AWS, aiming to simulate and evaluate fault troubleshooting capabilities in complex, distributed cloud-native environments. The core content of the dataset revolves around a series of predefined fault scenarios (Case), with each data record representing an independent fault troubleshooting challenge. It includes structured fields: id (unique identifier for the challenge), case (containing complete fault case data, such as fault title, detailed symptom descriptions, fault injection scripts, and system recovery scripts), ideal_answer (providing an ideal answer for the fault, including analysis, step-by-step logical reasoning, methods for verifying root causes, and final solutions), rubrics (an array defining scoring criteria for evaluating answers, containing specific evaluation criteria, points, and tags), and prompt (a string serving as an input prompt for models or evaluators, typically describing the fault phenomenon to be resolved). The dataset covers 10 typical cloud-native and hybrid cloud fault types, such as combined faults (e.g., ghost timeouts), configuration issues (e.g., configuration drift, cross-cloud configuration errors), network problems (e.g., DNS hallucinations, network jitter), resource issues (e.g., resource exhaustion, resource limit misconfigurations), complex faults (e.g., fan-out storms, comprehensive faults), and time-sensitive faults (e.g., short-term faults). With a small scale (less than 1000 samples), it is primarily suitable for evaluating and training artificial intelligence systems (especially large language models or AIOps tools) in question-answering and text-generation tasks, specifically for automated or assisted SRE fault diagnosis, root cause analysis, and solution generation. It can also be used for SRE skill training, chaos engineering experimental validation, and benchmarking in multi-cloud operations scenarios.

创建时间:
2026-05-25
原始信息汇总

数据集概述:Multi-Cloud SRE Challenge Dataset

这是一个面向多云运维 SRE 故障排查的中文挑战数据集,基于真实的三朵云(阿里云、腾讯云、AWS)电商微服务系统构建。

数据集详情

  • 语言: 中文
  • 许可证: MIT
  • 任务类别: 问答、文本生成
  • 标签: SRE、DevOps、Kubernetes、多云、混沌工程、微服务、AIOps、故障排查
  • 数据规模: n < 1K(小于1000条)

数据结构

每条数据包含以下字段:

字段 类型 说明
id string 题目唯一标识
case object 完整的案例数据(注入脚本、恢复脚本、故障现象等)
ideal_answer object 理想答案(故障信息、推理过程、验证方法、解决方案等)
rubrics array 评分标准(含 criterion、points、tags)
prompt string 满分答案 prompt

覆盖的故障类型

  1. 幽灵超时 - IOChaos + NetworkChaos + PodChaos 组合故障
  2. 配置漂移 - 环境变量篡改导致服务不稳定
  3. DNS 幻觉 - DNSChaos 解析故障
  4. 扇出风暴 - 多重下游故障叠加
  5. 资源耗尽 - StressChaos + OOMKill + CrashLoopBackOff
  6. 跨云配置错误 - 跨云环境变量配置错误
  7. 资源限制误配 - CPU/Memory limit 过低
  8. 网络抖动+配置误改 - 混合故障
  9. 短时故障 - 时间窗口故障(已自愈+延迟注入)
  10. 综合故障 - 真实故障 + 烟雾弹配置

使用方式

python from datasets import load_dataset

ds = load_dataset("your-username/sre-challenge-dataset")

查看第一条数据

print(ds[train][0][prompt]) print(ds[train][0][ideal_answer])

添加新案例

bash python add_case.py --id new-case-id --title "标题" --prompt "故障现象" --case case.json --ideal ideal.json

引用

若使用本数据集,请引用:

bibtex @dataset{sre_challenge_2025, title={Multi-Cloud SRE Challenge Dataset}, year={2025}, publisher={HuggingFace} }

搜集汇总
数据集介绍
MultiCloudSRE-Ops 数据集图片
构建方式
该数据集围绕多云环境下电商微服务系统的运维挑战而构建,依托阿里云、腾讯云与AWS三朵真实云平台,精心设计了涵盖多种复杂故障类型的案例体系。每条数据包含唯一标识、完整的Case对象(涵盖注入脚本、恢复脚本及故障现象)、理想答案(详述故障信息、推理过程、验证方法与解决方案)、评分标准及提示词字段。通过标准化脚本注入与恢复机制,确保每个故障场景可复现、可评估,从而构建了一个兼具真实性与系统性的SRE故障排查基准。
特点
数据集的核心特色在于其故障类型的多样性与复杂性,囊括了幽灵超时、配置漂移、DNS幻觉、扇出风暴、资源耗尽、跨云配置错误等十种典型且相互交织的运维异常。特别引入了组合故障与时间窗口故障等高级场景,如IOChaos与NetworkChaos的混合注入,以及已自愈故障与延迟注入的并存,旨在考察模型在真实世界中面对多故障并发、故障隔离与根因定位的深度推理能力。评分标准精细且维度丰富,为模型表现提供了量化依据。
使用方法
使用者可通过HuggingFace的datasets库便捷加载数据集,调用load_dataset函数即可获取训练集,每条数据均包含直观的字段结构与JSON格式示例。数据集既可直接用于问答与文本生成任务的训练与评估,也支持通过add_case.py脚本灵活扩展新故障案例。建议研究者在评估模型时,结合rubrics评分字段对各维度表现进行细粒度打分,从而全面衡量模型在多云SRE场景下的故障诊断与方案推荐能力。
背景与挑战
背景概述
在云计算与微服务架构深度普及的当下,站点可靠性工程(SRE)已成为保障分布式系统稳定运行的核心基石。然而,跨多云环境(如阿里云、腾讯云、AWS)的运维复杂度呈指数级增长,传统故障注入与排查方法难以覆盖多样化的混沌场景。基于此背景,MultiCloudSRE-Ops数据集于2025年由多云运维领域的研究团队构建并发布至HuggingFace,旨在系统性地评估和提升人工智能模型在多云电商微服务系统中的故障诊断与根因分析能力。该数据集聚焦于10类典型的自创性复合故障,如幽灵超时、配置漂移及跨云配置错误,为AI运维(AIOps)及混沌工程研究提供了高保真的评测基准,对推动智能化故障定位技术的落地具有显著意义。
当前挑战
该数据集所解决的核心领域挑战在于,现有运维基准测试多局限于单一云平台或简单故障模式,缺乏对多云环境中多故障并发、时间窗口故障及烟雾弹配置等复杂场景的建模,导致AI模型在实际运维中的泛化能力不足。构建过程中,团队面临两大技术难题:一是如何在真实的三朵云电商系统上安全复现生产级故障现象,需兼顾注入脚本的精确性与恢复机制的可靠性;二是为每条故障数据设计多维度的评分标准(rubrics),涉及故障识别准确性、推理过程完整性及解决方案有效性等核心维度,确保评测的客观与可复现。此外,数据量级(n<1K)有限,如何在有限样本中覆盖广泛的故障类型分布,亦是数据集设计中的关键平衡挑战。
常用场景
经典使用场景
在云原生与微服务架构日益普及的背景下,该数据集为评估和提升大语言模型在多云环境中的故障排查能力提供了标准化的测试基准。其经典使用场景涵盖从单点到复合故障的诊断推理,包括网络抖动、配置漂移、资源耗尽等十类典型SRE故障。研究人员可基于该数据集构建问答与生成任务,系统性地考察模型在多故障隔离、跨云环境感知、时间窗口故障理解等方面的综合表现。
解决学术问题
该数据集直面当前AIOps领域缺乏多云场景下标准化SRE评测数据的痛点,解决了故障诊断任务中标注数据稀疏、故障类型单一、场景脱离真实业务环境等核心问题。它首次将阿里云、腾讯云、AWS三朵真实云环境中的微服务系统故障案例结构化,为学术界研究多故障并发推理、跨云配置错误识别、混沌工程效果验证等前沿方向提供了可复现的实验平台,推动了云运维智能从理论验证迈向实证研究。
衍生相关工作
该数据集已催生出多个有影响力的衍生研究方向:一是基于此构建的多故障隔离评估指标,促使研究者提出分步推理与因果图谱结合的诊断框架;二是围绕十类故障类型衍生出的提示工程工作,探索了结构化思维链提示在复杂运维任务中的效果;三是融合混沌工程与LLM的自动化实验平台,实现了故障注入-推理-恢复的全链路评估闭环。这些工作共同推动了SRE智能运维从单点工具向系统化解决方案演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务