遇见数据集

显存效率平衡分类训练数据

收藏
浙江省数据知识产权登记平台2026-07-04 更新2026-07-05 收录
官方服务:

资源简介:

本数据集包含数千条TPU运行监控数据,经清洗及特征工程,以显存效率平衡状态作为二分类预测目标。该状态综合评估了显存使用与吞吐量的匹配程度,用于判断当前显存配置是否支撑高效的计算输出。数据按8:1:1划分为训练集、验证集和测试集,可直接用于二分类模型训练。对外部企业而言,本数据可用于训练显存效率平衡状态预警模型,帮助大模型推理服务商、AI算力平台根据当前负载特征(利用率、温度、延迟、排队等)实时判断显存使用是否处于高效平衡区间,从而指导批处理大小调整、模型并行策略优化或显存容量规划,避免显存浪费或成为性能瓶颈。此外,本数据集可作为成本优化、资源调度等系统的训练基础。本数据集具有独立性:通过自主构造显存效率平衡状态作为预测目标,该状态并非任何单一原始字段的直接复制或简单阈值判断,而是基于显存使用与吞吐量的耦合关系计算得出,具有明确的资源效率意义和独创性。必要性:原始数据仅提供独立的显存使用和吞吐量值,缺乏综合性的显存效率平衡指标;企业自行构造该指标需要额外的领域知识和验证,本数据集直接提供标准化、经过验证的分类训练数据,是TPU显存效率优化任务的基础。1.加工前的数据说明 原始数据为TPU推理任务性能监控日志,以表格形式存储,每行代表一个采样时刻,按时间顺序编号。原始数据包含TPU利用率(%)、显存使用(GiB)、TPU温度(℃)、TPU功率(W)、首token延迟(ms)、每token延迟(ms)、吞吐量(tokens/s)、请求排队长度、显存带宽利用率(%)共9个字段。 2. 处理规则 首先,对原始数据进行质量检查,剔除显存使用为负、吞吐量为零或负等异常记录。其次,基于显存使用和吞吐量两个字段,通过特定运算生成显存效率指标(吞吐量与显存使用的比值),并根据该指标的分布设定阈值,将样本划分为两类:当该指标高于阈值时标记为“高效平衡”状态,否则标记为“低效失衡”状态。具体规则为:计算吞吐量除以显存使用,若结果大于20则判为高效平衡,否则为低效失衡。该阈值经过业务验证,能够有效区分显存利用的合理区间。完成计算后,保留显存效率平衡状态作为分类预测目标。之后,将处理后的数据按8:1:1比例随机划分为训练集、验证集和测试集。基于随机森林分类算法构建显存效率平衡状态预测模型,以TPU利用率、温度、功率、首token延迟、每token延迟、请求排队长度、显存带宽利用率共7个自变量为输入,显存效率平衡状态为输出。通过网格搜索优化超参数,特征重要性分析表明利用率和每token延迟是影响显存效率平衡状态的关键因素。模型在测试集上达到良好的分类精度,验证了本数据集的有效性。 3. 数据内容描述 最终产出数据集包含7个自变量(TPU利用率、温度、功率、首token延迟、每token延迟、请求排队长度、显存带宽利用率),1个因变量(显存效率平衡状态)。该数据集结构清晰、指标完整,可直接用于训练显存效率平衡状态分类模型。

创建时间:
2026-04-17
搜集汇总
数据集介绍
显存效率平衡分类训练数据 数据集图片
背景与挑战
背景概述
本数据集包含数千条TPU运行监控数据,经数据清洗与特征工程后,基于显存使用与吞吐量的比值构造了“显存效率平衡状态”二分类标签,以判断当前显存配置是否支撑高效计算输出。数据包含TPU利用率、温度、延迟、排队长度等7个自变量及1个因变量,已按8:1:1划分为训练集、验证集和测试集,可直接用于训练显存效率平衡预警模型,帮助优化批处理大小、模型并行策略或显存容量规划。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务