推理服务延迟敏感度数据
收藏资源简介:
本数据对外部企业具有多重应用价值:云服务商可根据延迟敏感度评分将推理任务分类调度,高敏感任务分配至独占实例或预留资源以保障SLA,低敏感任务使用Spot实例或混合部署以降低成本;AI应用开发企业可依据敏感度等级优化模型部署策略,高敏感应用采用批处理尺寸较小的配置,低敏感应用可适当增大并发以提升吞吐;算力租赁平台可为不同敏感度任务制定差异化定价策略,高敏感任务收取溢价以覆盖资源预留成本;企业IT运维团队可将敏感度评分作为服务质量监控指标,当高敏感任务出现延迟抖动时立即触发告警与自动迁移;硬件供应商可展示其芯片在低延迟场景下的响应能力,为实时推理场景客户提供选型依据。一、加工前的数据说明 原始数据为分布式TPU集群在深度学习推理服务场景下产生的运营监测数据,包含首token延迟(ms)、每token延迟(ms)与请求排队长度,三个指标共同反映服务实时性特征。数据为非同一采集源、非时间序列的结构化监测记录,完整记录了推理任务的延迟表现。 二、处理规则 数据清洗:对原始数据进行去重、剔除超出物理阈值的异常值(如延迟为负或排队长度超过硬件上限),并对缺失值采用剔除方式处理,确保数据完整性与有效性。评分算法:基于“首token延迟”(反向指标,权重0.4)、“每token延迟”(反向指标,权重0.4)与“请求排队长度”(反向指标,权重0.2),采用极值归一化后加权求和计算综合评分。具体计算公式为:延迟敏感度评分=[0.4×(1-首token延迟归一化值)+0.4×(1-每token延迟归一化值)+0.2×(1-请求排队长度归一化值)]×100。其中各项归一化均基于全数据集的最大最小值进行,将各指标映射至0~1区间后加权求和,最终评分映射至0~100区间。 等级划分:高敏感:评分≥70;中敏感:40≤评分<70;低敏感:评分<40。 三、数据内容描述 清洗后的数据集共1001条记录,新增“延迟敏感度评分”与“敏感度等级”两列。高敏感主要对应在线推理场景;中低敏感多为离线批量处理任务。该数据可用于自动化调度决策,为不同延迟要求的任务分配差异化资源,适用于云平台服务等级协议保障与推理任务优先级划分场景。




