遇见数据集

AI推理硬件训练数据

收藏
浙江省数据知识产权登记平台2026-06-29 更新2026-06-30 收录
官方服务:

资源简介:

本数据集包含数千条AI推理硬件(GPU/TPU类)的性能监控数据,经清洗、筛选及特征工程,新生成带宽压力特征,以动态功耗作为回归预测目标。数据按8:1:1划分为训练集、验证集和测试集,可直接用于监督学习模型训练。对外部企业而言,本数据可用于训练动态功耗预测模型,帮助云服务商、数据中心运营商、边缘计算设备厂商根据易测指标实时估算推理功耗,从而优化任务调度、降低制冷成本、延长电池供电设备续航。此外,本数据集可为机器学习模型提供高质量训练数据,用于训练功耗异常检测模型、负载自适应调频模型等,具有重要的行业应用价值。独立性:本数据集通过明确的筛选条件、独立新生成特征计算及随机划分,形成自包含的训练数据。必要性:原始字段缺乏如带宽压力这类显式交互特征,直接训练模型效果较差。本数据集直接提供干净、带新生成特征的标准化训练数据,是AI推理硬件功耗建模任务的基础。1.加工前的数据说明 原始数据为AI推理硬件运行状态监控日志,以表格形式存储,每行代表一个采样时刻,按编号顺序排列。总样本量达数千行,所有字段均为数值型且无缺失值。原始数据包含MAC利用率(%)、显存带宽(GB/s)、推理延迟(ms)、吞吐量(FPS)、动态功耗(W)、漏电功耗(W)、能效比(TOPS/W)共7个字段。 2.处理规则 首先,对原始数据进行质量检查,剔除超出物理合理范围的记录,并删除所有字段完全相同的重复记录。其次,基于原始字段新生成一个自变量字段:带宽压力=显存带宽×MAC利用率。因变量设定为动态功耗。最后,将处理后的全部数据按8:1:1比例随机划分为训练集、验证集和测试集。基于随机森林回归算法构建动态功耗预测模型,以6个原始自变量加上1个新生成自变量共7个输入,动态功耗为输出。通过网格搜索优化超参数,特征重要性分析表明MAC利用率、带宽压力和吞吐量是影响动态功耗的关键因素。模型在测试集上达到R²>0.92的良好精度,验证了本数据集的有效性。 3.数据内容描述 最终产出数据集包含7个自变量、1个因变量(动态功耗)。所有数据均来自真实硬件运行环境,覆盖轻载到重载、低能效到高能效、低带宽到高带宽等多种组合,具有高多样性和真实噪声。该数据集结构清晰、指标完整,可直接用于训练AI推理硬件动态功耗的回归预测模型。

创建时间:
2026-04-17
搜集汇总
数据集介绍
AI推理硬件训练数据 数据集图片
背景与挑战
背景概述
本数据集包含4909条AI推理硬件(GPU/TPU类)的性能监控记录,通过清洗、筛选及特征工程新增了“带宽压力”特征,以动态功耗为预测目标,并按8:1:1比例划分为训练集、验证集和测试集。数据覆盖从轻载到重载、低能效到高能效、低带宽到高带宽等多种真实工况,经随机森林回归模型验证,测试集R²>0.92,证明其高质量和有效性。该数据集可直接用于训练动态功耗预测模型,助力云服务商、数据中心和边缘设备厂商实现实时功耗估算与任务优化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务