遇见数据集

CloudCons

收藏
arXiv2026-06-12 更新2026-06-13 收录
数据链接:
官方服务:

资源简介:

CloudCons是由浙江大学等机构构建的综合性端到端基准测试数据集,旨在评估云资源整合场景下的预测模型性能。该数据集整合了华为云、微软Azure和谷歌Borg的异构工作负载轨迹,涵盖周期性、突发性和噪声负载等多种模式,包含超过1.14亿个数据点,时间粒度包括5分钟、30分钟和1小时。数据集通过严格的清洗、插值和聚合流程构建,确保了数据质量和多样性。该数据集主要应用于云资源管理领域,旨在解决预测模型在资源整合决策中的实际效用评估问题,为平衡资源效率与服务可靠性提供关键见解。

CloudCons is a comprehensive end-to-end benchmark dataset constructed by Zhejiang University and other institutions, aiming to evaluate the performance of prediction models in cloud resource consolidation scenarios. This dataset integrates heterogeneous workload traces from Huawei Cloud, Microsoft Azure and Google Borg, covering various workload patterns including periodic, bursty and noisy loads, and contains over 114 million data points with time granularities of 5 minutes, 30 minutes and 1 hour. The dataset is built through rigorous cleaning, interpolation and aggregation processes to ensure data quality and diversity. It is mainly applied in the field of cloud resource management, aiming to address the practical utility evaluation problem of prediction models in resource consolidation decision-making, and provide key insights for balancing resource efficiency and service reliability.

创建时间:
2026-06-12
原始信息汇总

数据集概述:CloudCons

CloudCons 是一个专为云资源整合场景设计的标准化基准数据集,旨在弥合时间序列预测精度与下游决策效用之间的差距。

数据来源与隐私

  • 数据来源:整合了来自多个真实云平台的工作负载轨迹,包括:
    • 华为云:通过 sir-lab 公开发布的轨迹。
    • 微软Azure:Azure Public Dataset V2。
    • 谷歌Borg:ClusterData 2019。
  • 合规性:作为衍生基准,CloudCons 的发布遵循原始数据所有者的开源许可(CC BY 4.0 和 MIT 许可证)。
  • 匿名化:数据集仅包含严格的技术指标日志(如CPU使用率、内存使用率),不涉及个人身份信息或敏感用户内容。

数据集特点

CloudCons 包含了四个具有不同特征的工作负载子集:

  • Huawei2025:具有结构异质性和强时间依赖性。
  • Azure2019:表现出独特的“脉冲状”形态,尖峰度高。
  • Borg2019-d:以低资源利用率为特征,伴有频繁、混乱的高频抖动。
  • Borg2019-e:表现出卓越的周期性规律,具有高度同步的24小时昼夜节律。

核心影响

  1. 多样化、真实世界的工作负载评估:通过整合异质的真实轨迹,确保评估在概念漂移和不同云环境下的鲁棒性。
  2. 弥合预测与决策之间的鸿沟:引入端到端评估套件,使研究者能够针对实际的系统性能(资源效率与可靠性)而非单纯的曲线拟合来优化模型。
  3. 可操作的行业洞察:提供了关于预测分位数选择的严格分析,为平衡资源效率与服务可靠性之间的权衡提供策略指导。

如何使用

  • 数据访问:所有处理后的数据集(Huawei2025, Azure2019, Borg2019-d, Borg2019-e)均托管在 Hugging Face 上,可通过以下链接直接访问和下载: https://huggingface.co/datasets/kdd2026-cloudcons/CloudCons-ds
  • 源代码:项目源代码包含以下模块:
    • forecasting_bench/:时间序列预测评估
    • predictor/:统计与基础模型
    • DeepModel/:深度学习模型训练与评估
    • simulation/:端到端模拟与优化
搜集汇总
数据集介绍
CloudCons 数据集图片
构建方式
CloudCons数据集构建于来自华为云、微软Azure和谷歌Borg三大主流云服务商的真实工作负载轨迹之上。通过统一的数据处理管道,研究团队执行了严格的质量过滤,剔除了时长不足7天、缺失值比例超过0.125%以及零方差的无信息序列,并采用插值法填补缺失值以保障数据连续性。随后,原始高频数据被聚合为5分钟、30分钟和1小时三种粒度,最终生成了四个覆盖多元时间尺度和工作负载特征的数据集,为后续基准测试提供了丰富且高质量的输入。
特点
该数据集的核心特点在于其异质性工作负载的全面覆盖。Huawei2025展现了高自相关性与结构异质性并存的特点,兼具周期性模式与随机波动;Azure2019则以高平稳段水平伴随突发尖峰为典型特征,呈现出脉冲式负载形态;Borg2019-d以近零基线和高频噪声为主,对模型的鲁棒性提出了严苛挑战;而Borg2019-e则表现出高度同步的昼夜节律。这种跨云平台、跨模式的多元特性,使得CloudCons能够系统性地评估不同预测模型在多样化云环境中的泛化能力与鲁棒性。
使用方法
数据集旨在支撑端到端的云资源整合评估范式。使用者首先从历史负载序列出发,通过统计模型、深度学习模型或时序基础模型生成未来需求预测;随后,这些预测值被输入至优化算法(如启发式算法FFD/BFD、元启发式算法ACO或数学规划求解器Gurobi)中,以最小化活跃物理机数量为目标生成虚拟机放置决策。最终,评估套件从预测误差、资源效率、负载均衡、服务可靠性以及不确定性量化五个维度,对模型与优化算法的协同表现进行全方位度量,从而揭示预测精度与下游决策效用之间的真实关联。
背景与挑战
背景概述
CloudCons数据集由浙江大学Xiaobin Zhang团队联合Datadog AI Research等机构于2026年提出,旨在弥合云资源整合场景中时间序列预测精度与下游决策效用之间的鸿沟。当前云数据中心因保守过度配置导致CPU利用率长期徘徊于15%-20%,亟需高效资源整合策略。尽管先进的时序基础模型展现出零样本泛化潜力,但现有基准评测仅关注预测误差,未能验证其实际决策价值。CloudCons通过整合华为云、微软Azure和谷歌Borg的多源异构工作负载,构建了首个面向云资源整合的端到端基准,覆盖从同步昼夜节律到随机突发脉冲等多样化负载特征,为评估预测模型在真实云环境中的决策效用提供了标准化平台。
当前挑战
CloudCons面临的核心挑战在于揭示预测精度与决策效用之间的非对齐现象。实验发现,虽然基础模型在预测准确性上具备优势,但该优势并未天然转化为更优的整合决策,甚至在高同步性工作负载中,传统统计模型反而能通过更精准的峰值捕获实现更低的服务违规率。构建过程中,工作量表征的异质性是主要难点:跨平台的负载波动模式差异显著,从Azure的脉冲式突发到Google Borg的高频噪声,要求评估框架具备多维度量化能力。此外,概率分位数选择策略的敏感性分析表明,中位数预测不足以应对云负载波动,需要在资源效率与服务可靠性间进行精细校准,这对模型的不确定性量化能力提出了严峻考验。
常用场景
经典使用场景
CloudCons数据集的核心经典使用场景在于评估并验证云资源整合场景下时间序列预测模型的端到端决策效用。它模拟了“先预测后优化”的工作流,将历史工作负载数据转化为具体的整合决策。研究者可利用该数据集,全面评测从传统统计模型(如ARIMA)到深度学习方法(如PatchTST)乃至前沿时间序列基础模型(如Chronos、TimesFM)在预测准确性及下游资源整合质量两个维度的综合表现,从而系统性地比较不同模型在真实云环境中的实际价值。
实际应用
在实际应用中,CloudCons为云服务提供商优化数据中心运营提供了可操作指南。其核心价值在于通过分位数敏感性分析,为不同业务场景量身定制资源整合策略:对于成本敏感的批处理任务,推荐使用α∈[0.4,0.6]的中等分位数预测以在利用率和可靠性间取得平衡;而对要求高可靠性的关键服务,则需选用α≥0.8的高分位数预测来确保充足的安全裕度。此外,该数据集支持云运营商根据工作负载特征(如Azure的脉冲型突发或Google Borg的同步昼夜节律)选择最优模型与优化器的组合,从而在保证服务水平协议的同时大幅提升资源利用率。
衍生相关工作
CloudCons的发布催生了一系列重要学术工作:首先,它确立了一种将决策效用纳入时间序列模型评估的新基准范式,后续研究如Gift-Eval扩展了多领域泛化性能评估;其次,其揭示的预测精度与决策效用错位现象直接推动了决策感知学习领域的发展,研究者开始探索方向梯度等方法以显式对齐预测与优化目标;最后,针对基础模型在特定场景中的局限性,衍生出如TOTO等针对可观测性领域定向优化的基础模型,以及利用反馈微调策略增强下游决策质量的混合架构模型。这些工作共同拓展了AIOps领域的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务