遇见数据集

saas-vendor-status-incidents-daily

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

该数据集是一个 SaaS 供应商状态页面数据集,每天自动重建,追踪 1,127 个供应商的公开状态页面,记录其发布的事件历史。数据集包含两个表格:incidents(事件表,记录供应商状态页面上发布的事件,共14,721行,覆盖618个供应商)和vendors(供应商映射表,共1,127个供应商)。数据来源于各供应商的公共状态页面API,每天自动探测并更新。支持805个供应商的解析(包括Atlassian Statuspage、Statusio、Instatus、Better Stack等平台),其余供应商(如Apple、Microsoft 365等)标记为不支持解析。AWS、Azure、Google Cloud等主流云服务商通过其公共feed解析。该数据集适用于时间序列预测、表格分类、文本分类等任务,可用于分析供应商可靠性、事件模式、影响分析、SRE/DevOps监控、第三方风险管理等场景。数据采用CC BY 4.0许可证,可自由使用。

This dataset is a SaaS vendor status page dataset, automatically rebuilt daily, tracking the public status pages of 1,127 vendors and recording their published incident history. The dataset contains two tables: incidents (incidents published on vendor status pages, 14,721 rows covering 618 vendors) and vendors (vendor mapping table, 1,127 vendors). Data is sourced from each vendors public status page API and automatically probed and updated daily. It supports parsing for 805 vendors (including platforms such as Atlassian Statuspage, Statusio, Instatus, Better Stack, etc.), while the remaining vendors (e.g., Apple, Microsoft 365, etc.) are marked as unsupported. Major cloud service providers such as AWS, Azure, and Google Cloud are parsed through their public feeds. The dataset is suitable for tasks such as time series forecasting, tabular classification, text classification, and can be used for analyzing vendor reliability, incident patterns, impact analysis, SRE/DevOps monitoring, third-party risk management, etc. The data is licensed under CC BY 4.0 and can be freely used.

创建时间:
2026-09-04
原始信息汇总

SaaS 供应商状态页面数据集

数据集概览

该数据集是一个每日自动重建的SaaS供应商状态页面与事件记录集合,涵盖1,127家供应商14,721条事件记录。数据来源于各供应商公开发布的状态页面及其事件API,采用CC BY 4.0许可证,语言为英文。

数据规模与结构

  • 数据量级:10K至100K行
  • 上次重建时间:2026-09-05 12:15 UTC
  • 数据文件
    • data/incidents.csv:事件记录,14,721行,覆盖618家供应商
    • data/vendors.csv:供应商地图,1,127家

数据集包含两个配置

1. incidents(默认配置)

每条记录对应供应商在其状态页面上发布的一个事件,包含以下字段:

字段 含义
vendor_slug 供应商稳定标识符
vendor 供应商显示名称
platform 状态页面平台(如statuspage、statusio、instatus等)
incident_id 供应商自有事件ID
title 事件标题
impact 影响级别(none/minor/major/critical/maintenance)
state 事件状态(调查中/已识别/监控中/已解决等)
started_at 事件开始时间(ISO-8601格式)
resolved_at 解决时间(未解决则为空)
resolved_inferred 是否推断得出解决时间
updated_at 供应商最后更新时间戳
url 事件详情页链接
first_seen 管道首次记录该事件的时间

2. vendors

记录每家供应商的状态页面平台使用情况,包含:

字段 含义
slugname 标识符和显示名称
platform 检测到的平台类型(或标记为unsupported/dead)
base 机器可读状态端点基础URL
supported 是否可被每日轮询解析
last_state 上次轮询时的状态
last_checked 轮询时间戳

覆盖范围与局限性

  • 可解析供应商:1,127家中的805家;其余如Apple、Microsoft 365、Notion等定制HTML页面无法解析,标记为supported=false
  • 定制解析:AWS、Azure、Google Cloud等大型云服务商通过各自的公开订阅源进行解析
  • 数据说明:状态页面内容由供应商自主发布,空事件历史不代表未发生故障;数据集不推测"正常"状态

更新频率与典型应用场景

  • 每日自动更新
  • 适用于时间序列预测、表格分类、文本分类等任务
  • 可用于SRE/DevOps监控、供应商管理、第三方风险评估、事件管理、停机分析等场景

使用方式

python from datasets import load_dataset inc = load_dataset("APProjects/saas-vendor-status-incidents-daily", "incidents", split="train") vendors = load_dataset("APProjects/saas-vendor-status-incidents-daily", "vendors", split="train")

相关资源

数据支撑的配套可视化平台:approjects-vendor-status-watch.static.hf.space,以及MIT许可的GitHub Actions模板:vendor-status-watch-template。数据集引用格式为"Vendor Status Watch, https://github.com/APVentureEngine/vendor-status-watch"。

搜集汇总
数据集介绍
saas-vendor-status-incidents-daily 数据集图片
构建方式
在云计算与SaaS服务日益普及的今天,第三方服务的可靠性成为企业运维的关键关注点。本数据集通过自动化任务每日重新探测1127家SaaS厂商的公开状态页面,记录其发布的每一次故障事件(包括标题、影响程度、开始与结束时间、永久链接等),并回填了早期数据至618家厂商的历史事件。构建流程覆盖了多种状态页平台(如Atlassian Statuspage、Status.io、Instatus、Better Stack等),利用各平台公共API或页面解析技术获取结构化信息,最终形成包含14,721条事件记录的incidents表与1127家厂商信息的vendors表。数据以CSV格式存储,并每日更新,为用户提供持续、新鲜的厂商状态与故障历史视图。
特点
本数据集的核心特点在于其广泛的覆盖范围与精细的字段设计。incidents表详细记录了每次事件的唯一标识、发布状态、影响级别(none/minor/major/critical/maintenance)、当前状态(investigating/identified/monitoring/resolved等),以及事件开始、结束与最后更新时间,并标注了结束时间是否为推断值。vendors表则描绘了厂商使用的状态页平台、机器可读的API基础URL以及我们能否解析其页面。尤为特殊的是,数据集涵盖了像AWS、Azure、Google Cloud等采用定制化页面的厂商,通过其公开订阅源进行解析,确保数据的完整性与准确性。此外,数据集忠实反映厂商自主发布的信息,不合成任何“正常”状态,避免了误导性结论。
使用方法
数据集以Hugging Face格式提供,可直接通过datasets库加载,也可通过CSV文件使用Pandas进行数据分析。用户可基于incidents表进行时间序列分析,如统计各厂商事件频率、持续时间、影响级别等;利用vendors表研究厂商状态页平台分布。推荐示例代码可以快速识别故障最频繁的厂商。对于需要实时监控的用户,数据集还关联了付费的Vendor Status Digest服务,可通过Webhook每日推送所选厂商的状态变更、事件更新与恢复情况,并支持Slack、Discord、Teams等通道。同时,数据遵循CC BY 4.0许可,允许自由使用与分享,为可靠性工程、第三方风险管理与供应商评估提供了极具价值的数据基础。
背景与挑战
背景概述
在分布式系统与云服务日益普及的今天,第三方SaaS服务的可靠性与可用性已成为企业运维与风险管理的关键考量。该数据集由APProjects团队于2026年构建,旨在系统性地追踪并记录全球主流SaaS供应商的公开状态页面及其事故历史。通过每日自动化任务,数据集中囊括了1,127家供应商的映射信息与14,721条事故记录,覆盖618家供应商,其核心研究问题在于揭示SaaS生态系统的真实故障模式与供应商的透明沟通实践。此数据集不仅为站点可靠性工程(SRE)与开发运维(DevOps)领域提供了宝贵的时序数据基础,支持事件预警模型与供应商风险评估,还推动了第三方风险管理研究从依赖主观报告向实证数据的转变,对云服务可靠性研究具有重要的奠基性作用。
当前挑战
该数据集面临的挑战涉及领域问题与构建过程两个层面。在领域层面,SaaS供应商状态页面作为故障信息的非标准化来源,存在格式异构、数据完整性参差不齐的问题,许多网络巨头(如AWS、Microsoft 365)采用定制页面而无公共JSON接口,导致自动化解析仅覆盖805/1127家供应商,形成数据覆盖缺口,同时,状态页面仅反映供应商主动披露的信息,空历史不代表零事件,可能引入选择性报告偏差。在构建过程层面,数据采集需每日轮询众多异构端点,处理平台间API限流(部分接口最多返回50条记录)、时间戳时区不一致、事故状态推断(如通过消失推断结束时间)带来的噪声,以及持续维护供应商清单与解析器适应页面改版的复杂性,均对数据质量与管道稳定性构成显著挑战。
常用场景
经典使用场景
在云计算与SaaS服务日益成为企业关键基础设施的当下,该数据集为时间序列预测、异常检测及分类任务提供了珍贵的实证素材。其核心价值在于囊括了逾千家SaaS厂商的状态页历史记录,涵盖事件时间戳、影响等级及解决状态等结构化字段。研究者常以此为基准,构建服务中断趋势分析模型,预测特定厂商或行业整体的故障概率,检验不同事件响应策略的有效性。同时,基于文本的事件标题与描述字段,亦被广泛应用于文本分类与事件严重性评估,为服务可靠性工程提供可量化的研究支撑。
衍生相关工作
基于该数据集的丰富内涵,已衍生出多项极具前沿性的研究与实践成果。例如,研究者利用其时间序列维度,开发出自动化的事件摘要与根因分析算法,实现在海量记录中快速定位共性故障模式。亦有工作探索将事件影响等级与NLP模型结合,创建智能化的事件优先级分类器,以辅助值班工程师精准调度资源。更进一步,该数据集已成为联邦学习中验证跨机构隐私保护预测模型的共享基准,推动了多方协作下风险评估模型的进展。这些探索极大地拓展了状态页数据的应用边界,为智能运维与AIOps领域注入了新的活力。
数据集最近研究
最新研究方向
在云服务与SaaS生态日益成为数字经济基石的当下,该数据集聚焦于供应商状态页面的持续监测与故障事件的历史回溯,为站点可靠性工程(SRE)与第三方风险管理提供了前所未有的量化视角。其每日重建机制覆盖逾千家供应商,不仅刻画了Twilio、Cloudflare等业界巨擘的故障披露频次,更通过结构化的事件时间线、影响等级与解析状态,支撑了时间序列预测、异常检测及供应商可靠性对比等前沿研究。该数据尤为强调‘披露即沟通’的辩证观,避免将事件数量简单等同于服务劣化,从而引导研究向更 nuanced 的可靠性评估与风险预警模型演进,对构建韧性数字基础设施具有重要实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务