遇见数据集

rig-logs

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

该数据集是 rig 项目(https://github.com/honglu2875/rig)中所有 GPT 预训练运行的完整训练日志归档。它包含 300 次运行,分布在 10 个不同的研究中,记录了每个优化器步骤的损失和学习率曲线,以及每个诊断步骤的逐层参数、梯度和更新统计信息。原始日志未经过降采样,保留了完整的记录分辨率。 数据集结构按研究组织,每个研究文件夹包含多个运行子文件夹,每个运行包含以下文件: - training.riglog:记录每个步骤的损失、学习率、梯度范数等。 - diagnostics.riglog:记录每个诊断步骤的逐层统计信息。 - result.json:包含配置、最终指标和来源信息。 - validation.csv:记录验证损失。 此外,每个研究还包含 records.jsonl(运行摘要)和 snapshot.json.gz(用于轻量级消费的精选曲线快照)。 运行名称编码了关键变量,例如“500m-20tpp-bs128-lr2e-8-s1337”表示 500M 参数规模、20 tokens per parameter、批大小 128、基础学习率 2^-8、种子 1337。 数据集涵盖了多种实验设置,包括批大小、学习率、种子、模型规模(60M、125M、250M、500M)、上下文长度(1k 和 8k)、密集和 MoE(混合专家)架构等。硬件平台包括 TPU v4 和 TPU v6 lite,不同配置下运行结果可能存在微小差异(由于浮点非关联性)。 该数据集适用于研究缩放定律、超参数迁移、学习率与批大小扫描、梯度尖峰分析、MoE 路由行为等任务。用户可以通过 huggingface_hub 和 rig 库的 logpack 模块读取 .riglog 文件。

This dataset is a complete archive of training logs for all GPT pre-training runs in the rig project (https://github.com/honglu2875/rig). It contains 300 runs distributed across 10 different studies, recording loss and learning rate curves at each optimizer step, as well as layer-wise parameter, gradient, and update statistics at each diagnostic step. The original logs are not downsampled, preserving full resolution. The dataset is organized by study, with each study folder containing multiple run subfolders. Each run includes the following files: training.riglog (records loss, learning rate, gradient norm, etc. per step), diagnostics.riglog (records layer-wise statistics per diagnostic step), result.json (contains configuration, final metrics, and source information), and validation.csv (records validation loss). Additionally, each study contains records.jsonl (run summaries) and snapshot.json.gz (curated curve snapshots for lightweight consumption). Run names encode key variables, e.g., 500m-20tpp-bs128-lr2e-8-s1337 indicates 500M parameters, 20 tokens per parameter, batch size 128, base learning rate 2^-8, seed 1337. The dataset covers a variety of experimental settings, including batch size, learning rate, seed, model size (60M, 125M, 250M, 500M), context length (1k and 8k), dense and MoE (Mixture of Experts) architectures. Hardware platforms include TPU v4 and TPU v6 lite, with minor differences in results across configurations due to floating-point non-associativity. This dataset is suitable for studying scaling laws, hyperparameter transfer, learning rate and batch size sweeps, gradient spike analysis, MoE routing behavior, etc. Users can read .riglog files via huggingface_hub and the logpack module of the rig library.

创建时间:
2026-08-19
原始信息汇总

rig training logs 数据集概述

基本信息

  • 数据集名称: rig training logs
  • 许可证: MIT
  • 标签: training-logs、scaling-laws、hyperparameter-transfer、tpu、jax
  • 数据集地址: https://huggingface.co/datasets/quintic/rig-logs

数据集内容

该数据集包含 honglu2875/rig 中所有 GPT 预训练运行的完整训练日志,共 300 次运行,涵盖 10 项研究。日志保持完整记录分辨率,未进行降采样处理,具体包括:

  • 每个优化器步骤的损失和学习率曲线
  • 每个诊断步骤的逐层参数、梯度和更新统计

数据组织结构

每个研究目录下包含:

<study>/ <run-name>/ training.riglog # 损失、学习率、梯度范数(每步) diagnostics.riglog # 逐范围统计(每诊断步) result.json # 配置、最终指标、来源信息 validation.csv # 验证集损失 records.jsonl # 每次运行的账目记录 snapshot.json.gz # 精简曲线快照

运行命名规则

运行名称反映变量差异,例如 500m-20tpp-bs128-lr2e-8-s1337 表示:

  • 500M 参数规模
  • 每个参数 20 个 token
  • 批次大小 128
  • 基础学习率 2^-8
  • 随机种子 1337

硬件配置

不同研究使用不同的硬件拓扑,种子不能单独标识运行结果:

研究 硬件
batch-sweep-60M TPU v4 — 4 进程,16 芯片
lr-batch-sweep-125M TPU v4 — 4 进程,16 芯片
batch-sweep-250M TPU v4 — 4 进程,16 芯片
batch-sweep-500M 混合:6 次 TPU v4,6 次 TPU v6 lite
lr-transfer-250M TPU v4 — 4 进程,16 芯片
lr-sweep-8k-60M TPU v4 — 4 进程,16 芯片
moe-lr-sweep-8k TPU v4 — 4 进程,16 芯片
batch-size-grid-8k TPU v4 — 4 进程,16 芯片
seed-variance-60M TPU v6 lite — 1 进程,8 芯片
seed-variance-125M TPU v4 — 4 进程,16 芯片

重要发现:相同配置和种子在不同拓扑(8 芯片 vs 16 芯片)上运行,结果相差 0.004 至 0.023 nats,与种子效应大小相当。这是由浮点非结合性导致的,无法通过设置种子解决。

文件格式

.riglog 是压缩二进制日志格式:

  • 8 字节魔数、固定头部、列表(用整数 ID 定位序列)、定宽记录
  • 比长格式 CSV 小约 21 倍,单次内存复制即可读取
  • 可通过 Python 的 logpack 模块读取

研究汇总

研究 运行次数 参数规模 变量 日志目录
batch-size-sweep-60M 75 60M batch × LR × seed batch-sweep-60M
lr-batch-sweep-125M 27 125M batch × LR × seed lr-batch-sweep-125M
batch-size-sweep-250M 36 250M batch × LR × seed batch-sweep-250M
batch-size-sweep-500M 12 500M batch × LR × seed,5 和 20 TPP batch-sweep-500M
3-seed-gradient-spike 12 250M LR × seed lr-transfer-250M
8k-lr-sweep-60M 15 60M 8k 上下文下 LR × seed lr-sweep-8k-60M
moe-lr-sweep-8k 18 60M/125M LR × seed,8 专家中的 top-2 moe-lr-sweep-8k
batch-size-grid-8k 42 60M/125M 8k 下 batch × LR × seed,密集和路由 batch-size-grid-8k
seed-variance 63 60M/125M 固定 MoE 配方下的 seed seed-variance-60M, seed-variance-125M
transfer-charts 派生图表,非运行仪表盘

关键研究发现

  • 批大小 16 在所有场景中表现最优:最佳 batch-32 运行在 60M 密集模型上损失 0.39 nats,路由模型 0.27,125M 上 0.05;最佳 batch-64 运行分别损失 1.30、1.15 和 0.31
  • MoE 路由优势:路由阶梯在 2^-8 学习率达到峰值(与密集相同),在每个学习率上以相等的活跃参数和匹配计算量优于密集模型 0.07–0.12 nats,内存约为 1.7 倍
  • 历史 MoE 优化器说明:所有归档的 reference_moe 运行和路由臂在提交 102a264 之前,采用了错误的 AdamW 权重衰减推断(基于数组秩),修正后的配方无法逐位复现这些运行

使用方式

python from huggingface_hub import hf_hub_download from rig import logpack

path = hf_hub_download("quintic/rig-logs", "batch-sweep-60M/60m-5tpp-bs128-lr2e-8-s1337/training.riglog", repo_type="dataset") log = logpack.read_log(path) log.series("train_loss") # 每个优化器步骤 log.series("grad.l2_norm", "block", 7) # 每层,来自诊断

搜集汇总
数据集介绍
rig-logs 数据集图片
构建方式
该数据集源自于rig项目,记录了300次GPT预训练运行的完整训练日志,覆盖十个研究。每次运行包含训练日志(损失、学习率、梯度范数等)、诊断日志(每层参数、梯度统计)、配置结果及验证损失。数据以高效的二进制格式存储,并附带快照文件供轻量级消费。构建过程中严格遵循可复现性,训练流不变于进程数,拓扑差异由硬件记录显式标注。
特点
数据集的核心特色在于其全分辨率、未被降采样的原始日志,提供了每个优化器步骤的损失和学习率曲线,以及每诊断步骤的逐层统计。运行命名清晰表明关键参数,如模型规模、每参数token数、批次大小、学习率及种子。跨拓扑的数值差异被量化记录,强调种子不能唯一确定结果。此外,日志格式紧凑,约为CSV的1/21,支持高效读取。
使用方法
使用者可通过HuggingFace hub下载日志文件,并利用rig库的logpack模块解析。示例代码展示如何获取指定运行的训练损失序列或梯度范数。数据集的布局为<研究>/<运行名>/,便于按需访问。配套的仪表板总结数据,但完整分析需读取.riglog文件。命令示例展示了如何复现研究设计,包括批次、学习率、种子的网格搜索。
背景与挑战
背景概述
Rig-logs数据集诞生于大语言模型预训练研究的前沿,由honglu2875团队于2024年创建,旨在系统性地探索GPT模型在规模、批次大小、学习率及种子等超参数维度上的扩展律与迁移规律。该数据集记录了300次完整的训练运行,跨越十个精心设计的研究,覆盖从60M到500M参数的不同规模,并同步捕获训练损失、学习率曲线及逐层参数统计,为理解模型训练动态提供了高分辨率、未降采样的原始数据。其核心研究问题聚焦于批次-学习率联合缩放、种子变异性及MoE架构的优化行为,对超参数迁移、训练可复现性及大规模模型调参策略产生了深远影响,成为连接理论假设与实证验证的桥梁。
当前挑战
数据集所应对的领域挑战在于揭示训练动态中的不可预测现象,如梯度尖峰,这些现象难以通过传统稀疏采样捕捉,而该数据集通过全分辨率日志和深层诊断帧提供了解决方法。在构建过程中,面临了多硬件拓扑(TPU v4与v6)下结果一致性的严峻挑战,尽管数据流保持种子不变,但不同设备数的浮点归约顺序差异导致0.004至0.023 nats的偏差,无法仅靠种子控制。此外,早期诊断日志采用冗长CSV格式,导致内存消耗庞大且读取低效,促使开发紧凑的.riglog二进制格式,缩小约21倍并优化读取速度。同时,对于包含MoE架构的旧运行,因AdamW权重衰减规则修正,无法逐位复现,需明确区分归档数据的原始性。
常用场景
经典使用场景
rig-logs 数据集为大规模语言模型预训练研究提供了前所未有的精细观测窗口。该数据集收录了跨越十个研究、涵盖三百次完整训练的日志,以全分辨率记录了每一步优化器的损失与学习率曲线,并深入至每一层的参数、梯度及更新统计。这一数据集的经典使用场景在于支持对 GPT 预训练动态的微观剖析,研究者可借此精确复现实验条件,深入探究不同批量大小、学习率与随机种子组合下的训练行为,从而验证并扩展关于缩放法则与超参数迁移的理论认知。
解决学术问题
该数据集直面当前大模型训练中若干核心学术难题:它解决了训练日志粒度不足、难以纵向比对的问题,以统一格式提供了跨规模、跨拓扑的完整记录,使得关于梯度尖峰、种子方差及硬件差异对训练影响的研究得以在实证层面展开。通过记录训练流在进程数下不变、但浮点累加顺序导致结果差异的现象,数据集为理解非确定性来源提供了关键证据,推动了关于训练可复现性与硬件无关性的深入讨论。
衍生相关工作
该数据集促生了一系列聚焦训练动力学与稳定性的衍生研究。基于其梯度尖峰记录,相关工作深入探讨了训练中不稳定性出现的条件与机制,提出了缓解策略的假说并加以验证。数据集对种子方差的分析激发了关于随机性影响的研究,推动了更严谨的实验报告规范。对批量与学习率关系的详尽揭示,则为超参数迁移理论提供了数据支撑,衍生出关于最优批量规模的理论推导与实证检验,进一步丰富了缩放法则的内涵。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务