遇见数据集

机器学习平台显存效率评估数据

收藏
浙江省数据知识产权登记平台2026-07-08 更新2026-07-09 收录
官方服务:

资源简介:

本数据可用于机器学习平台资源监控系统,通过实时分析不同算法任务的显存占用特征,自动标记低效任务并触发动态资源回收机制;支持企业客户按项目维度查询历史显存利用率曲线,为其提供资源配额调整建议和算法优化方向参考;建立跨企业显存效率基准指标体系,促进行业从粗放式资源投入到精细化效能管理的转型。一、加工前的数据说明 原始数据为分布式TPU集群在深度学习推理服务场景下产生的运营监测数据,包含12个特征字段:唯一标识编号、TPU利用率(%)、显存使用量(GiB)、TPU工作温度(℃)、TPU实时功率(W)、首token延迟(ms)、每token延迟(ms)、系统吞吐量(tokens/s)、请求排队长度、显存带宽利用率(%)、显存效率等级_评分、显存效率等级。数据为非同一采集源、非时间序列的结构化监测记录,完整记录了TPU设备运行过程中的各项性能指标及效率评估结果。 二、处理规则 数据清洗:对原始数据进行去重、剔除超出物理阈值的异常值,并对缺失值采用剔除方式处理,确保数据完整性与有效性。 评分算法:基于“显存带宽利用率(%)”(正向指标,权重0.5)、“TPU利用率(%)”(正向指标,权重0.3)与“显存使用(GiB)”(反向指标,权重0.2),采用极值归一化后加权求和计算综合评分。具体计算公式为:显存效率等级评分=0.5×显存带宽利用率归一化值+0.3×TPU利用率归一化值+0.2×(1-显存使用归一化值)。其中各项归一化均基于全数据集的最大最小值进行,将各指标映射至0~1区间后加权求和,最终评分映射至0~100区间。 等级划分:高效:评分≥75;正常:40≤评分<75;低效:评分<40。 三、数据内容描述 清洗后的数据集共1001条记录,每条记录包含12个字段,涵盖TPU硬件运行指标(利用率、温度、功率等)、显存性能参数(使用量、带宽利用率)及推理效率指标(延迟、吞吐量、队列长度)。核心统计特征如下:TPU利用率均值68.3%(标准差±12.4%),显存使用量呈右偏分布(中位数14.2GiB),首token延迟与吞吐量存在显著负相关(r=-0.72)。标注字段“显存效率等级”采用三级分类体系(高效、正常、低效),为TPU资源配置优化、推理任务调度及硬件能效评估提供量化依据,适用于AI加速器性能调优与异常检测场景。

创建时间:
2026-03-31
搜集汇总
数据集介绍
机器学习平台显存效率评估数据 数据集图片
背景与挑战
背景概述
该数据集基于分布式TPU集群深度学习推理场景的运营监测数据加工而成,包含1001条记录及12个关键字段,涵盖TPU利用率、显存使用量、延迟、吞吐量等性能指标,并依据显存带宽利用率、TPU利用率和显存使用量加权计算的评分,将显存效率划分为高效、正常、低效三个等级。数据可用于机器学习平台资源监控系统,辅助识别低效任务、动态回收资源,并为项目维度的显存利用率查询与资源配额优化提供量化依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务