AI推理硬件吞吐量预测训练数据集
收藏资源简介:
本数据集以吞吐量(FPS)作为预测目标,可用于训练回归模型,根据当前硬件的MAC利用率、显存带宽、推理延迟、动态功耗、漏电功耗、能效比等实时状态,预估硬件的数据处理能力。对外部企业而言,本数据可帮助:边缘计算设备厂商:在带宽或功耗受限时预估实际帧率,指导模型压缩与缓存策略。AI加速卡设计公司:评估不同负载下的性能瓶颈,优化计算与存储配比。数据中心运营者:根据实时监控指标动态调整任务调度,避免过载或资源闲置。移动端推理引擎开发者:在低功耗模式下预测吞吐量下降程度,保障用户体验。加工前的原始数据:为AI推理硬件运行状态监控日志,包含编号、MAC利用率(%)、显存带宽(GB/s)、推理延迟(ms)、吞吐量(FPS)、动态功耗(W)、漏电功耗(W)、能效比(TOPS/W)共8个字段。所有字段均为数值型,无缺失值。 处理规则: 数据清洗:剔除超出物理合理范围的记录(如负值或超过硬件极限的值),删除所有字段完全相同的重复记录。 特征与目标定义:自变量为MAC利用率、显存带宽、推理延迟、动态功耗、漏电功耗、能效比(共7个);因变量为吞吐量。 特征标准化:对全部自变量进行Z-score标准化,标准化参数由训练集计算并应用于验证集和测试集。数据集划分:将清洗后的完整数据按8:1:1的比例随机划分为训练集、验证集和测试集,保证三部分分布一致。 模型验证:基于随机森林回归算法(输入7个自变量,输出吞吐量),通过网格搜索优化超参数。特征重要性分析表明MAC利用率和显存带宽是影响吞吐量的主要因素。模型在测试集上达到R² > 0.93,训练集与测试集误差差异小于5%,无过拟合迹象,证明数据集有效性。 数据内容描述:最终产出的数据集为表格形式,包含编号(仅标识)、7个自变量、1个因变量,共9个字段。所有记录均来自真实AI推理硬件运行环境,覆盖完整工况范围。数据已标准化并按8:1:1划分,可直接用于监督学习回归任务。




