遇见数据集

长排队压力预测训练数据

收藏
浙江省数据知识产权登记平台2026-07-04 更新2026-07-05 收录
官方服务:

资源简介:

本数据集包含数千条存在排队压力的TPU性能监控数据,经清洗、筛选及特征工程,衍生出能效比、延迟乘积等特征,以请求排队长度作为回归预测目标。数据按8:1:1划分为训练集、验证集和测试集,可直接用于监督学习模型训练。对外部企业而言,本数据可用于训练排队长度预测模型,帮助负载均衡系统提前感知队列积压风险,动态调整请求分发策略或扩容决策,避免服务超时和资源浪费,提升系统吞吐能力。此外,本数据集可为机器学习模型提供高质量训练数据,用于训练流量预测模型、弹性伸缩决策模型等,具有重要的行业应用价值。本数据集具有独立性:通过明确筛选条件独立抽取、清洗、重索引,并自主设计衍生特征及因变量计算规则。必要性:原始数据中大量零排队记录会稀释排队场景的特征,导致预测模型对积压不敏感;本数据集直接提供聚焦排队压力的干净数据,是TPU负载调度优化训练任务的基础。1.加工前的数据说明:原始数据为TPU推理任务性能监控日志,以表格形式存储,每行代表一个采样时刻,按时间顺序编号。总样本量达数千行,所有字段均为数值型且无缺失值。原始数据包含TPU利用率、显存使用、温度、功率、首token延迟、每token延迟、吞吐量、显存带宽利用率共8个字段,以及作为预测目标的请求排队长度。 2.处理规则:首先,聚焦于存在排队压力的工况,选取请求排队长度大于0的样本,剔除零排队记录。其次,对筛选后的数据进行质量检查,剔除功率为负等明显错误记录,并剔除所有字段完全相同的重复记录。接着,基于原始字段计算衍生特征:能效比等于吞吐量除以功率,延迟乘积等于首token延迟乘以每token延迟。因变量为请求排队长度。之后,按原始时间顺序重新赋予连续编号,去除因筛选造成的不连续。最后,将处理后的全部数据按8:1:1比例划分为训练集、验证集和测试集。基于随机森林回归算法构建排队长度预测模型,以10个自变量(8个原始字段加2个衍生特征)为输入,请求排队长度的对数值为输出。通过网格搜索优化超参数,特征重要性分析表明吞吐量、每token延迟和显存带宽利用率是影响排队长度的关键因素。模型在测试集上达到良好的预测精度,验证了本数据集的有效性。 3.数据内容描述:最终产出数据集包含10个自变量,1个因变量。所有样本均存在排队压力,覆盖了不同积压程度的典型运行状态。该数据集结构清晰、指标完整,可直接用于训练排队压力场景下的排队长度预测模型。

创建时间:
2026-04-17
搜集汇总
数据集介绍
长排队压力预测训练数据 数据集图片
背景与挑战
背景概述
该数据集来源于TPU推理任务性能监控日志,通过筛选存在排队压力的工况,剔除零排队及异常记录,并衍生能效比、延迟乘积等特征,以请求排队长度为回归预测目标。数据按8:1:1比例划分为训练集、验证集和测试集,结构清晰,可直接用于训练排队长度预测模型,辅助负载均衡系统提前感知队列积压风险,优化请求分发与扩容决策。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务