TPU首token延迟训练数据
收藏官方服务:
资源简介:
本数据用于训练回归模型,根据TPU实时状态(利用率、显存使用、温度、功率、请求排队长度、显存带宽利用率)预测首token延迟。在实际大语言模型(LLM)在线推理服务中,首token延迟直接影响用户等待的第一印象,是服务质量的关键指标。 通过本数据集训练的模型,能够:帮助云服务商:实时监控TPU负载与排队情况,提前预测首token延迟是否即将超过服务等级协议(SLA)阈值(如50ms),并据此触发动态扩容、请求限流或优先级调度,避免因响应过慢导致用户流失。帮助AI芯片厂商:分析不同负载条件下首token延迟与硬件状态(温度、功率、带宽利用率)的关联,定位性能瓶颈是计算、访存还是热节流,为芯片调度策略优化提供数据支撑。帮助模型部署工程师:在离线仿真环境中评估排队策略、并发上限对首token延迟的影响,提前优化系统参数。
提供机构:
中昊芯英(杭州)科技有限公司创建时间:
2026-06-12
搜集汇总
数据集介绍

背景与挑战
背景概述
该数据集基于企业居间服务业务中与律所合作的历史记录(包括合作时间、频率和金额),采用RFM模型进行综合评分与分层,将合作主体划分为A至D四个价值等级。其核心应用在于支持对律所实施差异化运营管理,例如为高价值客户配置专属资源,对低价值客户制定激活策略,从而优化资源配置与合作效率。
以上内容由遇见数据集搜集并总结生成



