遇见数据集

软件行业算力节点负载均衡数据

收藏
浙江省数据知识产权登记平台2026-06-29 更新2026-06-30 收录
官方服务:

资源简介:

本数据可用于AI算力集群管理平台,通过实时分析各节点负载数据动态调整任务分配策略,优化资源利用率并避免单点过载;为云服务商提供节点健康度评估服务,支持通过可视化看板实时监控各区域算力负载分布,辅助客户选择最优资源部署方案;推动建立跨平台的算力资源调度标准,提升行业整体计算资源利用效率。一、加工前的数据说明 原始数据为分布式TPU集群在深度学习推理服务场景下产生的运营监测数据,包含12个特征字段:唯一标识编号、TPU利用率(%)、显存使用量(GiB)、TPU工作温度(℃)、TPU实时功率(W)、首token延迟(ms)、每token延迟(ms)、系统吞吐量(tokens/s)、请求队列长度、显存带宽利用率(%)、算力节点负载均衡度_评分、算力节点负载均衡度。 二、处理规则 数据清洗:对原始数据进行去重、剔除超出物理阈值的异常值,并对缺失值采用剔除方式处理,确保数据完整性与有效性。 评分算法:基于“TPU利用率”与70%的偏离程度(越接近70%得分越高,权重0.35)、“显存使用”反向计分(权重0.25)、“请求排队长度”反向计分(权重0.25)与“吞吐量”正向计分(权重0.15),采用加权求和方式计算综合评分。具体计算公式如下: 算力节点负载均衡度评分=0.35×(1-|TPU利用率-70%|/70%)+0.25×(1-显存使用归一化值)+0.25×(1-请求排队长度归一化值)+0.15×吞吐量归一化值。其中:TPU利用率以70%为最优基准点,得分为 1 - |利用率 - 70%| / 70%,即利用率每偏离1个百分点,扣减约1.4286%的得分。当得分出现负值时,取max(0, 得分)确保得分非负。显存使用与请求排队长度:采用极值归一化后反向计分,使用量/排队长度越小得分越高。吞吐量:采用极值归一化正向计分,吞吐量越高得分越高。各项指标归一化均基于全数据集的最大最小值进行,最终评分映射至0~100区间。 等级划分: 均衡:评分≥75;轻度失衡:45≤评分<75;严重失衡:评分<45。 三、数据内容描述 清洗后的数据集共1001条记录,每条记录包含12个字段,涵盖TPU硬件运行指标(利用率、温度、功率等)、显存资源使用情况(使用量、带宽利用率)及推理效率指标(延迟、吞吐量)。该数据集适用于云计算资源调度优化、AI推理加速策略评估、分布式算力节点负载均衡算法研发等场景。

创建时间:
2026-03-31
搜集汇总
数据集介绍
软件行业算力节点负载均衡数据 数据集图片
背景与挑战
背景概述
该数据集包含1001条分布式TPU集群在深度学习推理场景下的运营监测记录,涵盖利用率、显存、温度、延迟等12项指标,并基于TPU利用率、显存使用、请求排队长度及吞吐量等指标加权计算节点负载均衡度评分(0-100分),划分为均衡、轻度失衡和严重失衡三个等级。数据适用于AI算力集群的负载均衡调度、资源优化及跨平台算力调度标准制定等场景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务