Alibaba GPU Cluster Dataset 2023
收藏资源简介:
该数据集包含2023年8月两周内在我们的生产GPU集群中运行的所有DLT作业信息(例如,作业ID、开始时间、结束时间、资源分配等)。该集群包括超过800个主机,通过三层Clos网络互连。数据集详细记录了作业、工人和网络拓扑的信息。
This dataset contains detailed information on all DLT jobs running on our production GPU cluster across the two-week window in August 2023, including job ID, start time, end time, resource allocation, and other related metrics. The cluster comprises over 800 hosts interconnected via a three-tier Clos network. The dataset thoroughly documents information pertaining to jobs, workers, and network topologies.
Alibaba GPU Cluster Dataset 2023
数据集概述
该数据集描述了2023年8月在阿里云生产GPU集群中运行的深度学习训练(DLT)作业的信息,持续时间为两周。该集群包含超过800个主机,通过三层Clos网络互连。
数据集内容
数据集包含以下文件:
-
job.csv: 包含每个作业的信息,如作业名称、ID、类型(例如PyTorch和TensorFlow)、模型(例如ResNet、GPT和LLama)、开始时间、结束时间等。 -
worker.csv: 包含每个作业的每个工作者的信息,如关联的主机IP和资源使用情况(例如GPU和CPU)等。 -
topo.csv: 包含集群网络拓扑的信息。每行对应一个主机,并指定其在三层Clos网络中的位置,即连接到哪个ASW(ToR交换机)、PSW(汇聚交换机)和DSW(核心交换机)。
数据集用途
基于上述信息,可以识别在任何给定时间哪些作业(和模型)在哪些主机的GPU上运行,以及这些GPU之间的互连。通过进一步假设计算和通信工作负载(因为我们不知道运行作业的具体超参数),可以估计集群上计算和通信的整体分布。




