机器学习平台显存效率评估数据
收藏资源简介:
本数据可用于机器学习平台资源监控系统,通过实时分析不同算法任务的显存占用特征,自动标记低效任务并触发动态资源回收机制;支持企业客户按项目维度查询历史显存利用率曲线,为其提供资源配额调整建议和算法优化方向参考;建立跨企业显存效率基准指标体系,促进行业从粗放式资源投入到精细化效能管理的转型。一、加工前的数据说明 原始数据为分布式TPU集群在深度学习推理服务场景下产生的运营监测数据,包含12个特征字段:唯一标识编号、TPU利用率(%)、显存使用量(GiB)、TPU工作温度(℃)、TPU实时功率(W)、首token延迟(ms)、每token延迟(ms)、系统吞吐量(tokens/s)、请求排队长度、显存带宽利用率(%)、显存效率等级_评分、显存效率等级。数据为非同一采集源、非时间序列的结构化监测记录,完整记录了TPU设备运行过程中的各项性能指标及效率评估结果。 二、处理规则 数据清洗:对原始数据进行去重、剔除超出物理阈值的异常值,并对缺失值采用剔除方式处理,确保数据完整性与有效性。 评分算法:基于“显存带宽利用率(%)”(正向指标,权重0.5)、“TPU利用率(%)”(正向指标,权重0.3)与“显存使用(GiB)”(反向指标,权重0.2),采用极值归一化后加权求和计算综合评分。具体计算公式为:显存效率等级评分=0.5×显存带宽利用率归一化值+0.3×TPU利用率归一化值+0.2×(1-显存使用归一化值)。其中各项归一化均基于全数据集的最大最小值进行,将各指标映射至0~1区间后加权求和,最终评分映射至0~100区间。 等级划分:高效:评分≥75;正常:40≤评分<75;低效:评分<40。 三、数据内容描述 清洗后的数据集共1001条记录,每条记录包含12个字段,涵盖TPU硬件运行指标(利用率、温度、功率等)、显存性能参数(使用量、带宽利用率)及推理效率指标(延迟、吞吐量、队列长度)。核心统计特征如下:TPU利用率均值68.3%(标准差±12.4%),显存使用量呈右偏分布(中位数14.2GiB),首token延迟与吞吐量存在显著负相关(r=-0.72)。标注字段“显存效率等级”采用三级分类体系(高效、正常、低效),为TPU资源配置优化、推理任务调度及硬件能效评估提供量化依据,适用于AI加速器性能调优与异常检测场景。




