遇见数据集

provision-aware-predictions

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是供应感知流量预测研究的预测输出成果,专注于非对称损失函数和符合性容量带的研究。数据集包含三个网络流量数据集(Abilene、GÉANT、CESNET-TimeSeries24)的预测结果,这些结果由六种预测架构(LSTM、DLinear、iTransformer、PatchTST、Chronos-Bolt零样本、DCRNN)生成,每种架构包含20个不同的随机种子。此外,数据集还包括用于CQR/ACI校准扫描的分位数训练带预测,针对三个目标覆盖率(0.05、0.10、0.20)。数据集采用分层文件结构组织,包含五种不同的扫描类型:非对称平方损失扫描、L1非对称损失扫描、基线模型输出、校准参数扫描以及特定硬件条件下的训练结果。每个.npz文件包含测试集预测值、验证集预测值、对应的地面真实链路负载数据,对于校准单元还包含分位数训练带的上边界。该数据集旨在支持网络流量预测、容量规划、符合性预测和时间序列分析等任务,为研究非对称损失函数和预测不确定性量化提供标准化的模型输出。数据集不包含原始流量数据,但提供了原始数据来源的指引。

This dataset is the predictive output of the Supply-Aware Traffic Forecasting research, focusing on asymmetric loss functions and compliance capacity bands. It contains prediction results from three network traffic datasets (Abilene, GÉANT, CESNET-TimeSeries24), generated by six forecasting architectures (LSTM, DLinear, iTransformer, PatchTST, Chronos-Bolt zero-shot, DCRNN), each with 20 different random seeds. Additionally, the dataset includes quantile training band predictions for CQR/ACI calibration scans, targeting three coverage levels (0.05, 0.10, 0.20). The dataset is organized in a hierarchical file structure with five different scan types: asymmetric squared loss scan, L1 asymmetric loss scan, baseline model outputs, calibration parameter scans, and training results under specific hardware conditions. Each .npz file contains test set predictions, validation set predictions, corresponding ground-truth link load data, and for calibration units, the upper bound of the quantile training band. The dataset aims to support tasks such as network traffic forecasting, capacity planning, compliance prediction, and time series analysis, providing standardized model outputs for research on asymmetric loss functions and prediction uncertainty quantification. It does not include raw traffic data but provides guidance on original data sources.

创建时间:
2026-05-28
原始信息汇总

数据集概述

数据集名称:Provisioning-Aware prediction artifacts(Provisioning-aware 预测工件)

许可证:CC-BY-4.0

标签:网络流量预测、容量规划、保形预测、时间序列

一句话描述:该数据集包含《Provisioning-Aware Traffic Forecasting》研究中所有结果表格和图表的重现所需的预测输出,是论文的规范性复现路径。


数据集内容

预测工件覆盖范围

  • 3 个网络流量数据集:Abilene、GÉANT、CESNET-TimeSeries24
  • 6 种预测架构:
    • LSTM
    • DLinear
    • iTransformer
    • PatchTST
    • Chronos-Bolt(零样本)
    • DCRNN
  • 20 个随机种子
  • 此外,还包含针对 CQR/ACI 校准扫描的分位数训练带预测(LSTM,3 个目标覆盖率)

文件组织结构

每个数据集对应多种扫描类型,目录结构为:

<dataset><sweep>/<cell>/seed<N>/<model>_predictions.npz

扫描类型说明

扫描目录 内容
<ds>_pareto_asym 平方非对称损失扫描(针对不同的运营商比率)
<ds>_pareto_asym_l1 尖点线性(L1)非对称损失扫描(针对不同的比率)
<ds>_baselines DCRNN 和 Chronos-Bolt 基线(非对称比率 5:1)
<ds>_calib_pareto CQR / ACI 校准扫描,包含 q_loq_hi 带训练(目标覆盖率 0.05 / 0.10 / 0.20)
abilene_patchtst_cpu PatchTST / Abilene 组合(因 MPS 限制在 CPU 上训练)

cell 可以是:

  • 运营商比率名称(如 ratio_5_1
  • 基线标签(如 baseline_mse
  • 目标覆盖率标签(如 alpha_0.10

每个 cell 下包含 20 个按种子划分的子目录。

工件文件内容

每个 .npz 文件包含:

  • predictions:测试集预测结果 (T_test, num_links)
  • L_test_aligned:测试集真实链路负载 (T_test, num_links)
  • val_predictions:验证集上的预测结果
  • L_val_aligned:验证集上的真实链路负载

对于校准扫描单元格,还额外包含 _qlo_qhi 变体,分别对应 CQR 和 ACI 使用的分位数训练带边缘。


模型


数据来源

  • Abilene:来自德克萨斯大学奥斯汀分校,其条款未明确允许重新分发
  • GÉANT:来自 TOTEM 项目,其条款未明确允许重新分发
  • CESNET-TimeSeries24:采用 CC-BY 许可证(Koumar 等,Sci. Data 12:338, 2025),用户需直接从原始来源获取

本数据集不包含原始流量数据,但代码仓库中提供了加载和预处理这三个数据集的脚本。


引用

请参考代码仓库的 README 文件获取相关论文和数据集的引用信息。

搜集汇总
数据集介绍
provision-aware-predictions 数据集图片
构建方式
该数据集专为网络流量预测与容量规划研究设计,构建过程中综合三大公开流量数据集(Abilene、GÉANT、CESNET-TimeSeries24),并采用六种预测架构(LSTM、DLinear、iTransformer、PatchTST、Chronos-Bolt零样本、DCRNN)在20个不同随机种子下生成预测结果。每个种子对应的预测文件存储于以数据集与扫描类型命名的目录中,涵盖不对称损失扫描、基线模型和校准扫描等多种实验配置。校准扫描中还包含基于分位数回归训练的CQR/ACI置信带预测结果,支持多目标覆盖率评估。
特点
该数据集的核心特色在于其系统化的实验设计与可复现性。所有预测文件均采用统一的`.npz`格式存储,包含测试集与验证集的预测值及真实负载数据,便于直接调用。数据集跨越三种代表性的网络流量场景,覆盖多种主流时序预测模型,并特别针对容量规划中的不对称损失函数与共形预测校准进行了专项扫描。此外,数据集中不包含原始流量数据,确保遵守数据分发条款,同时通过提供完整的模型输出作为论文结果的标准复现路径。
使用方法
用户可直接从HuggingFace下载压缩后的预测文件,并利用NumPy库加载`.npz`文件以获取预测值与真实值。对于需要对照论文结果的研究者,数据集提供了完整的目录结构以便按模型、种子和实验配置提取对应数据。对于校准实验,额外的`_qlo`和`_qhi`文件提供了共形预测所需的置信带边界。模型参考权重存储于独立的检查点仓库,但值得注意的是,本预测数据集本身即是论文结果的权威复现源,用户无需重新训练即可复现所有图表。
背景与挑战
背景概述
网络流量预测是网络容量规划与运营管理的核心环节,其精度直接影响到资源分配的效率和服务质量保障。近年来,随着深度时序模型的快速发展,研究者们逐渐关注到预测误差的不对称性在带宽预配置决策中的关键作用——过度预配造成资源浪费,而欠预配则危及服务可用性。在此背景下,Provisition-Aware预测工件数据集由Suryansh S.等人构建,旨在系统探究非对称损失函数与保形预测方法在网络流量预测中的适用性。该数据集整合了Abilene、GÉANT及CESNET-TimeSeries24三个经典网络流量数据集,涵盖LSTM、DLinear、iTransformer、PatchTST、Chronos-Bolt零样本及DCRNN六种先进预测架构,并提供了多种操作比率下非对称损失训练的预测输出。通过标准化评估流程,该数据集为网络容量规划领域提供了一个可复现的基准,推动了非对称损失与保形预测在时序预测中的交叉应用研究。
当前挑战
该数据集着力应对两大核心挑战。其一,在领域问题层面,传统网络流量预测研究多采用对称损失函数(如均方误差),其优化目标与实际容量规划场景中过度预配与欠预配代价不等的现实相脱节,导致资源分配策略无法同时兼顾效率与鲁棒性;同时,传统点预测缺乏不确定性的量化表达,难以直接支撑基于风险决策的带宽预配置。其二,在数据构建过程中,原始流量数据因涉及UT Austin与TOTEM等机构的使用条款而无法直接重新分发,需借助专用加载脚本完成下载与预处理,增加了数据复用的门槛;此外,跨架构、跨随机种子的预测结果需在统一的文件组织规范下管理,确保复现路径的明确性与完整性,而子目录与文件命名规则的精心设计正是为了保障这一目标。
常用场景
经典使用场景
在网络流量预测与容量规划领域,该数据集被用于评估非对称损失函数下的预测模型性能。它整合了Abilene、GÉANT和CESNET-TimeSeries24三个经典网络流量数据集,提供了六种主流架构的预测输出,包括LSTM、DLinear、iTransformer、PatchTST、Chronos-Bolt零样本模型和DCRNN。每个模型在多种操作者比例下运行二十个随机种子,生成了丰富的预测结果,为对比研究不同损失函数对网络资源调配的影响提供了标准化的实验平台。
衍生相关工作
该数据集衍生出多项经典工作,例如共形分位数回归和自适应共形推断在流量预测中的系统对比,以及基于非对称损失的Pareto最优预测调配研究。此外,Chronos-Bolt等预训练时序模型在零样本流量预测场景下的评估,为跨域知识迁移探索开辟了新方向。这些工作共同构成了一个从损失函数设计到不确定性量化再到实际部署的完整研究链条。
数据集最近研究
最新研究方向
该数据集聚焦于网络流量预测与容量规划的前沿融合领域,通过引入非对称损失函数与共形预测技术,构建了面向资源配置优化的预测框架。研究核心在于利用LSTM、DLinear、iTransformer等多种架构在Abilene、GÉANT及CESNET-TimeSeries24等真实网络流量数据集上进行系统性实验,探索不同操作比率下预测误差的非对称代价。尤其值得关注的是,共形校准带(CQR/ACI)的引入为容量规划提供了统计上严格的不确定性量化,使网络运营商能够基于风险感知阈值进行动态资源分配。这一方向与当前网络运维中愈发强调的‘预见性自智’理念高度契合,通过将预测不确定性与业务损失函数直接耦合,推动了网络流量工程从‘预测-反应’模式向‘预测-规划’闭环演化,对降低过度配置成本与提升服务等级协议(SLA)履行率具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务