遇见数据集

Awesome-CloudComputing-Datasets

收藏
github2026-05-11 更新2026-06-04 收录
官方服务:

资源简介:

这是一个关于云计算领域的数据集合集,收集和整理了多个公开的云计算相关数据集,包括主机集群追踪、GPU 使用、功耗数据、LLM 推理等主题。合集覆盖了来自 Google、Microsoft、Alibaba 等发布者的真实世界数据集,提供了每个数据集的详细信息,如发布者、大小、机器数量、持续时间和收集方法。

This is a curated dataset collection in the field of cloud computing. It gathers and organizes multiple publicly available cloud computing-related datasets, covering topics such as host cluster traces, GPU utilization, power consumption data, and LLM inference. The collection includes real-world datasets released by publishers like Google, Microsoft, Alibaba and other institutions. Detailed information is provided for each dataset, including its publisher, dataset size, number of machines, collection duration and data collection methodology.

创建时间:
2024-03-01
原始信息汇总

数据集概述

该页面是一个 云计算的公开数据集清单,由华南理工大学计算机科学与工程学院的林伟伟教授实验室与鹏城实验室共同整理,旨在为云计算领域的研究者和从业者提供全面的、结构化的数据集索引。资源按数据集类型分为三大类,每类下包含一系列具体数据集。


一、主机集群轨迹(Host Cluster Traces)

此类别包含 26 个数据集,主要记录物理主机或容器的资源使用、作业调度、功耗等轨迹。

数据集名称 发布时间 是否公开 发布者 数据规模 机器数量 持续时间 数据采集方法 特殊标签
Google Power Data 2024 Google 45.4KB 57 1个月 真实世界 功耗数据
Azure LLM Inference Dataset 2024 Microsoft 313KB 或 702KB - 1天 或 9天 真实世界 LLM推理
Acme 2023 Google 80GB 588 6个月 真实世界 GPU, LLM预训练/推理/SFT
Alibaba GPU Traces 2020 Alibaba 1.36GB 1800 2个月 真实世界 GPU
Helios 2020 SenseTime 343MB 802 6个月 真实世界 GPU
Marconi100 2020 Italian National Supercomputing Center 33.4GB 960 9个月 真实世界 功耗数据
Stadia Cloud Gaming Dataset 2020 Marc Carrascosa 153MB - 5个月 真实世界 -
SURFsara 2019 SURFsara 41.3GB 5 8个月 真实世界 功耗数据
Google Cluster Data V1 2009 Google 29.8MB - 7小时 真实世界 -
Google Cluster Data V2 2011 Google 186GB 12583 29天 真实世界 -
Google Cluster Data V3 2019 Google 2.4TB 96000 1个月 真实世界 -
SPEC Cloud Iaas 2018 SPEC - - 1年 真实世界 -
Alibaba Cluster Trace V1 (2017) 2017 Alibaba 232MB 1300 12小时 真实世界 -
Alibaba Cluster Trace V1 (2018) 2018 Alibaba 98GB 4000 8天 真实世界 -
Dionatrafk 2018 Dionatr a F . Kirchoff 321KB - 1个月 真实世界 -
ATLAS Cluster Traces 2011, 2018, 2016 Carnegie Mellon University 16.7MB 1600 5年 真实世界 -
Philly 2017 Microsoft 6.6GB 552 3个月 真实世界 GPU
SPEC CPU 2006, 2017 SPEC - - 1年 真实世界 -
Autoscale Analyser 2015 H.S. Bhathiya 1.086MB 2 47小时 真实世界 -
Intel Netbatch logs 2012 Ohad Shai 2.53GB - 1个月 真实世界 -
OpenCloud Hadoop Workload 2010 Parallel Data Lab - 64 20个月 真实世界 -
Yahoo Webscope Dataset 2010 Yahoo 33KB - - 真实世界 -
SWIM Workload 2009, 2010 Facebook 2.14MB 3000 1天 真实世界 -
SPEC power_ssj2008 2008 SPEC - - 1年 真实世界 功耗数据
GWA-T-4 AuverGrid 2006 Delft University of Technology 13MB 5 - 真实世界 -
GWA-T-1 DAS2 2005 Delft University of Technology 35MB 5 - 真实世界 -
GWA-T-10 SHARCNet 2005 Delft University of Technology 33MB 10 - 真实世界 -
GWA-T-3 NorduGrid 2003 Delft University of Technology 20MB 75 - 真实世界 -
Parallel Workloads Archive 2005 DG Feitelson - - - 真实世界 -

二、虚拟机集群轨迹(VM Cluster Traces)

此类别包含 11 个数据集,主要记录虚拟机(VM)或微服务实例的资源使用、生命周期等轨迹。

数据集名称 发布时间 是否公开 发布者 数据规模 机器/VM数量 持续时间 数据采集方法
Alibaba MicroServices Traces V1 2021 Alibaba 61.1GB 10000 12小时 真实世界
Alibaba MicroServices Traces V2 2022 Alibaba 2TB 40000 13天 真实世界
CERIT-SC Workloads 2016 Dalibor Klusacek 11MB - 1年 真实世界
OpenNebula Virtual Machine Profiling Dataset 2021 Prasad Purnaye 2.6MB 6 63小时 真实世界
Fruktus 2020 Piotr Nawrocki 176KB - 11个月 真实世界
Chameleon Cloud traces 2017 Science Clouds 1.5GB - 5年 真实世界
Azure Public Dataset 2017, 2019 Microsoft 117GB, 235GB 2 million, 2.6 million 30天, 30天 真实世界
Scout 2018 Hsu Chin-Jung 587MB - 1天 真实世界
IBM Docker Registry traces 2018 Ali Anwar 1.5GB - 75天 真实世界
Business Critical Workloads 2015 Delft University of Technology 284MB 1250 1个月 真实世界
Planetlab VM traces 2011 Beloglazov Anton 5.2MB - 10天 真实世界

三、网络轨迹(Web Traces)

此类别包含 6 个数据集,主要记录网络流量、HTTP请求、入侵检测等数据。

数据集名称 发布时间 是否公开 发布者 数据规模 机器数量 持续时间 数据采集方法
ISCX 2016 Canadian Institute for Cybersecurity 26.3MB - 1年 真实世界
Amazon Resource Cost 2012 Queens University 87.1KB - 4天 真实世界
Cloud Intrusion Detection Dataset 2012 DARPA Intrusion Detection Evaluation Group of MIT Lincoln Laboratory 70MB 45 7周 真实世界
Wikipedia Web Traces from WikiBench 2007 Wikipedia 5TB - 9年 真实世界
KDD Cup 1999s Dataset 1998 MIT Lincoln Labs 1.31MB - - 真实世界
NASA HTTP Traces 1995 Kennedy Space Center 20.7MB - 1个月 真实世界

关键特征与标签说明

  • 标签说明:部分数据集带有特定标签,以帮助用户快速识别其侧重点。
    • $${color{red} ext{ extbf{GPU}}}$$:表示该数据集专注于GPU(图形处理器)的资源使用或作业调度。
    • $${color{purple} ext{ extbf{LLMs}}}$$:表示该数据集与大型语言模型(LLMs)相关,如推理或训练。
    • $${color{green} ext{ extbf{Power}}}$$:表示该数据集专注于功耗相关数据。
  • 数据来源:所有列出的数据集均为真实世界采集。
  • 可用性:大部分数据集(标记为“是”)对公众开放,少部分(如SPEC系列)需要特定权限或未公开。
搜集汇总
数据集介绍
Awesome-CloudComputing-Datasets 数据集图片
构建方式
Awesome-CloudComputing-Datasets 是由华南理工大学计算机科学与工程学院林伟伟教授实验室与鹏城实验室联合构建的系统性云计算数据集资源库。该资源库通过广泛调研和筛选,汇集了来自全球知名机构(如Google、Microsoft、Alibaba等)发布的真实世界云计算轨迹数据,涵盖主机集群、虚拟机集群及Web访问三大类。每个数据集均按照统一的信息格式进行整理,包括发布者、规模、机器数量、持续时间及收集方法等关键元数据,确保研究人员能够快速定位所需数据源。
使用方法
用户可直接通过GitHub仓库浏览分类目录,每个数据集条目均附有原始论文链接与数据下载地址。资源库提供了标准化的元数据表格,用户可根据发布者、规模或时间等条件快速定位目标数据集。对于需要批量分析的研究场景,建议直接访问各数据集的官方仓库获取原始文件。该资源库持续更新,用户可通过Star或Fork跟踪最新收录的动态,并参考配套的综述论文《Public Datasets for Cloud Computing: A Comprehensive Survey》获取更深入的分析视角。
背景与挑战
背景概述
云计算作为现代信息技术的基石,其高效运行依赖于对大规模集群工作负载、资源消耗及系统行为的深刻理解。由华南理工大学林伟伟教授实验室与鹏城实验室联合开发的Awesome-CloudComputing-Datasets数据集,自发布以来便成为该领域的重要资源。该数据集系统梳理了自2003年至2024年间,来自Google、Microsoft、Alibaba等顶尖机构及学术界的数十个公开云计算数据集,涵盖主机集群、虚拟机集群及Web服务等多种类型。其核心研究问题聚焦于通过真实世界采集的轨迹数据,揭示云数据中心的资源调度、能耗管理、性能优化及系统可靠性等关键挑战,为学术界和工业界提供了宝贵的基准测试与模型验证素材,有力推动了云计算研究从理论走向实践。
当前挑战
该数据集所应对的领域挑战主要在于:云环境的高度动态性与异构性使得资源利用效率低下、能耗失控及服务质量保障困难,亟需基于真实轨迹的建模与优化方案。在构建过程中,挑战同样显著:首先,数据来源多样且格式不一,需耗费大量精力进行标准化清洗与标注;其次,部分数据集(如SPEC Cloud Iaas)因商业敏感性未公开,限制了覆盖广度;再者,随着GPU、微服务及大语言模型推理等新兴负载涌现,现有数据集的时效性与代表性面临考验,如何持续追踪并整合最新轨迹成为长期难题。
常用场景
经典使用场景
在云计算领域,真实工作负载轨迹数据是驱动系统优化与性能评估的基石。该数据集汇聚了来自Google、Microsoft、Alibaba等全球领先云服务商的集群追踪数据,覆盖了从CPU/GPU资源调度到微服务架构的多层次负载特征。研究者可借助这些数据复现大规模数据中心的运行状态,进而验证调度算法、资源分配策略及能耗管理模型的效能。其经典使用场景包括:基于Google Cluster Data V3的96,000台机器追踪数据,构建负载预测模型;利用Alibaba GPU Traces分析异构计算环境下的资源争用模式;以及通过Azure LLM Inference Dataset探索大语言模型推理任务的资源消耗规律。这些场景不仅揭示了云环境中动态负载的复杂性,更为学术研究提供了可量化、可复现的基准测试平台。
解决学术问题
该数据集系列系统性地解决了云计算学术研究中长期存在的核心难题——缺乏大规模、多样化、真实标注的公开数据。传统研究常受限于私有数据集不可复现的困境,导致调度优化、能效建模、异常检测等方向的理论成果难以横向对比。该资源通过提供跨平台(Google、Alibaba、Azure)、跨维度(主机集群、虚拟机、微服务、Web流量)的标准化追踪数据,使得学者能够:1)量化分析数据中心能耗与负载波动的耦合关系(如Marconi100功率数据);2)验证GPU集群中任务调度公平性与吞吐量的权衡模型(如Philly与Helios数据集);3)评估微服务拓扑结构对资源碎片化的影响(如Alibaba MicroServices Traces V2)。这些突破显著提升了云计算研究的可重复性与结论可信度,推动了从经验性调优向数据驱动理论的范式转变。
实际应用
在实际产业应用中,该数据集已成为云服务商优化基础设施运营效率的关键参考。例如,Google Power Data被用于训练数据中心热力学模型,指导冷却系统动态调节以降低PUE;Alibaba GPU Traces支撑了异构资源池中深度学习训练任务的智能排布,使集群利用率提升约15%。此外,Azure Public Dataset中涵盖的2.6百万虚拟机生命周期记录,直接赋能了微软Azure的弹性伸缩策略设计,通过分析用户资源申请模式,实现了预留实例与按需实例的混合部署优化。在边缘计算场景下,Stadia云游戏数据集帮助服务商预判用户会话时长与带宽需求,从而减少延迟抖动。这些实践表明,该数据集架起了学术模型与工程落地之间的桥梁,其影响力已从单一集群管理延伸至跨区域资源协同、碳足迹追踪等新兴领域。
数据集最近研究
最新研究方向
随着云计算与人工智能技术的深度融合,特别是大语言模型(LLMs)的爆发式增长,该领域的研究焦点正从传统的集群负载与资源调度转向GPU密集型工作负载与LLM全生命周期(预训练、推理、微调)的细粒度追踪分析。Awesome-CloudComputing-Datasets汇集了来自Google、Microsoft、阿里巴巴等业界巨头的真实生产环境数据,其中Acme与Azure LLM Inference Dataset等最新发布的GPU与LLM推理数据集,为理解大规模分布式训练中的资源竞争、能耗优化及推理延迟建模提供了前所未有的实证基础。这些数据不仅支撑着云原生环境下AI基础设施的性能调优与能效管理,更推动着绿色计算与智能运维等前沿方向的发展,对构建高效、可持续的下一代云计算生态具有里程碑式的意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务