遇见数据集

多GPU流水线并行训练系统运行日志

收藏
官方服务:

资源简介:

本数据集记录了针对大模型训练中计算资源利用率低和显存压力大等问题,采用流水线并行(Pipeline Parallelism)技术在多 GPU 环境下进行深度学习模型训练的完整运行日志。实验基于 PipeDream-V 策略,在 2 台配置有 NVIDIA RTX 2080 Ti 的服务器集群(共 8 GPU)上进行。数据涵盖了系统初始化、各阶段(Stage)的步数(Step)、处理的 Token 数量以及详细的时间开销(精确到秒)。该数据集生成于 2024 年 1 月,详细记录了在微批次(Micro-batch)输入下,不同 GPU 阶段的流水线作业情况。数据经过标准化的 I/O 重定向采集与完整性校验,为优化分布式训练系统的调度算法提供关键的实测数据支持。

提供机构:
浦江国家实验室
搜集汇总
数据集介绍
多GPU流水线并行训练系统运行日志 数据集图片
背景与挑战
背景概述
本数据集记录了采用PipeDream-V流水线并行策略,在8块NVIDIA RTX 2080 Ti GPU上进行大模型训练的完整运行日志,涵盖初始化、各阶段步数、处理的Token数量及精确到秒的时间开销。数据于2024年1月生成,经过标准化采集与校验,旨在为优化分布式训练系统的调度算法提供实测支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务