云计算显存压力评估数据
收藏资源简介:
本数据可用于深度学习训练任务调度系统,通过实时监测不同模型训练时的显存占用特征,动态划分显存资源池并预警潜在溢出风险,自动调整任务优先级和资源配额;为云服务商提供显存压力预测接口,支持客户在部署AI模型时预判所需显存规格,避免资源浪费或训练中断;推动异构计算资源标准化管理,提升AI基础设施的利用率和稳定性。一、加工前的数据说明 原始数据为分布式TPU集群在深度学习推理服务场景下产生的运营监测数据,包含12个特征字段:唯一标识编号、TPU利用率(%)、显存使用量(GiB)、TPU工作温度(℃)、TPU实时功率(W)、首token延迟(ms)、每token延迟(ms)、系统吞吐量(tokens/s)、请求队列长度、显存带宽利用率(%)、显存压力等级评分、显存压力等级。数据为非同一采集源、非时间序列的结构化监测记录,完整记录了硬件运行参数与显存资源使用状况。 二、处理规则 数据清洗:对原始数据进行去重、剔除超出物理阈值的异常值,并对缺失值采用剔除方式处理,确保数据完整性与有效性。评分算法:基于“显存使用”(正向指标,权重0.4,归一化参考上限80GiB)、“显存带宽利用率”(正向指标,权重0.35)与“请求排队长度”(正向指标,权重0.25,归一化参考上限50),采用加权求和方式计算综合评分。公式为: 显存压力等级评分=0.4×(显存使用/80)+0.35×(显存带宽利用率/100)+0.25×(请求排队长度/50)。各项指标分别归一化至0~1区间,最终评分映射至0~100区间。 等级划分:高压:评分≥80;中压:50≤评分<80;低压:评分<50。 三、数据内容描述 清洗后的数据集共1001条记录,每条记录包含12个字段,涵盖TPU硬件运行指标(利用率、温度、功率等)、显存资源使用情况(使用量、带宽利用率)及推理效率指标(延迟、吞吐量)。核心统计特征如下:显存使用量均值14.2GiB(标准差±3.5GiB),TPU功率中位数198W,首token延迟P95为356ms。标注字段“显存压力等级”采用三级分类体系(低压/中压/高压),其与显存使用量(r=0.72)及带宽利用率(r=0.68)呈显著正相关。该数据集适用于AI加速器资源调度优化、推理任务优先级划分、云计算基础设施效能评估等场景。




