间歇性任务识别数据
收藏资源简介:
本数据对外部企业具有多重应用价值:云服务商可根据任务类型制定差异化资源调度策略,间歇型任务适合使用Spot实例或弹性扩容机制以应对瞬时流量高峰,持续型任务可分配预留实例或长期资源以保障稳定性;AI平台运营团队可依据任务类型分布优化集群资源池规划,为间歇型任务预留弹性资源池,避免与持续型任务争抢资源;算力租赁平台可针对不同任务类型设计差异化计费模式,间歇型任务按峰值计费,持续型任务按时长计费,提升资源利用率与收益;企业IT成本分析部门可统计两类任务的占比与资源消耗,评估混合部署策略的经济效益;模型部署服务商可根据任务类型为客户推荐合适的部署方案,间歇型任务推荐使用Serverless架构,持续型任务推荐使用独占实例。一、加工前的数据说明 原始数据为分布式TPU集群在深度学习推理服务场景下产生的运营监测数据,包含请求排队长度、首token延迟、每token延迟与吞吐量,分别反映任务等待状态、首次响应速度、后续处理效率与整体输出能力。数据为非同一采集源、非时间序列的结构化监测记录,可用于综合推断任务的负载特征。 二、处理规则 数据清洗:对原始数据进行去重、剔除超出物理阈值的异常值(如排队长度为负、延迟为负或吞吐量为零),并对缺失值采用剔除方式处理,确保数据完整性与有效性。 评分算法:间歇性评分=I(排队长度≤3)×40+I(首token延迟>60)×30+I(每token延迟<15)×20+I(吞吐量>1200)×10。其中I(·)为指示函数,条件成立时取1,否则取0。评分≥60判定为“间歇型”,否则为“持续型”。 等级划分:间歇型、持续型二级。 三、数据内容描述 清洗后的数据集共1001条记录,新增“间歇性评分”(K列)与“任务类型”(L列)两列。该数据综合了排队、延迟与吞吐特征,间歇型任务通常对应实时交互场景或瞬时流量高峰,持续型任务对应批量处理或稳定负载场景。通过任务类型识别,可为资源调度、实例选型、计费模式设计提供量化依据,适用于云计算弹性伸缩与混合部署优化场景。




