遇见数据集

beetle-phase-transition

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

该数据集记录了Beetle语言模型在训练过程中感应头(induction head)阶段转变的机制指标。数据来源于BeetleLM的多个检查点,涵盖不同规模的模型(2B、24B等)和多种训练课程(双语、单语)。数据集包含六个配置,对应不同的数据模式:trajectories(全训练过程对数间隔的检查点指标)、trajectories_hires(转变窗口密集采样)、head_properties(每个头的属性,如重复依赖性、集中度、位置稳定性)、ablation(头消融下的关联回忆,含随机和熵匹配控制)、transition_fits(断点变化点拟合及自举置信区间)、cascade_stages(前文头/感应头/关联回忆开始的步骤与尺度)、final_revision(主分支上的最终指标)。每个配置包含的字段有:前缀匹配分数(best_ps)、感应头数量(n_induction_heads)、关联回忆准确率(ar_acc)、前文头分数(best_pth)、残差流有效秩(mean_effective_rank)、重复依赖性(repeat_dependence)等。主要发现包括:PS在约第8k步发生尖锐转变,从基线0.028上升至0.64-0.84;转变不受双语课程或语言影响;消融实验表明感应头功能有效;存在三阶段级联(前文头先形成,然后感应头,最后功能关联回忆)。数据集适用于可解释性研究、训练动力学分析、阶段转变检测、以及语言模型内电路形成机制的研究。

This dataset records the mechanistic indicators of the induction head phase transition during the training of the Beetle language model. The data originates from multiple checkpoints of BeetleLM, covering models of different sizes (2B, 24B, etc.) and various training curricula (bilingual, monolingual). The dataset includes six configurations corresponding to different data modes: trajectories (log-spaced checkpoint indicators for the full training process), trajectories_hires (dense sampling within the transition window), head_properties (attributes of each head, such as repeat dependence, concentration, position stability), ablation (associative recall under head ablation, with random and entropy-matched controls), transition_fits (breakpoint change point fitting with bootstrap confidence intervals), cascade_stages (steps and scales for the onset of previous-head/induction-head/associative recall), and final_revision (final metrics on the main branch). Each configuration contains fields including prefix matching score (best_ps), number of induction heads (n_induction_heads), associative recall accuracy (ar_acc), previous-head score (best_pth), effective rank of residual stream (mean_effective_rank), and repeat dependence (repeat_dependence). Key findings include: a sharp PS transition around step ~8k, rising from baseline 0.028 to 0.64-0.84; the transition is unaffected by bilingual curriculum or language; ablation experiments show induction heads are functionally effective; a three-stage cascade exists (previous-head forms first, then induction head, finally functional associative recall). The dataset is suitable for interpretability research, training dynamics analysis, phase transition detection, and studying the formation mechanisms of circuits within language models.

创建时间:
2026-09-05
原始信息汇总

BeetleLM 归纳头相变数据集

数据集概览

该数据集记录了 Beetle 语言模型在训练过程中归纳电路(induction circuit)形成的逐检查点机制指标,旨在追踪训练期间归纳头(induction heads)的形成过程。数据集遵循 Apache-2.0 许可证,属于可解释性(interpretability)研究范畴,覆盖归纳头、训练动态和相变等主题。

数据集配置结构

由于不同文件包含六种不同的数据模式,为避免加载时出现类型转换错误,数据被划分为七个独立配置

配置名称 内容说明
trajectories 全训练过程按对数间隔采样的逐检查点归纳指标
trajectories_hires 相变窗口(步骤 6k-30k)的密集采样数据
head_properties 各头的属性(重复依赖性、集中度、位置稳定性)
ablation 头部消融下的联想回忆表现,含随机和熵匹配对照组
transition_fits 断棍(broken-stick)变点拟合结果及 bootstrap 置信区间
cascade_stages 不同课程和规模下的 PTH/IH/AR 起始步骤
final_revision main 版本(step-* 扫描未覆盖)的最终指标

核心指标说明

指标列名 含义
best_ps 各头中最大的前缀匹配分数(参照 Olsson 等人 2022 年的方法)
n_induction_heads 前缀匹配分数大于 0.3 的头的数量
ar_acc 在重复随机 token 序列上的联想回忆准确率
best_pth 最大的前一个 token 头分数
mean_effective_rank 残差流的有效秩
repeat_dependence 重复输入上的 PS 减去长度匹配的非重复输入上的 PS

其中 repeat_dependence 是判断高 PS 头是否为真正归纳头的关键指标:候选头约为 0.7,而其他头约为 0.0003。

主要发现

相变现象

PS 分数在约第 8k 步前维持在机会水平(0.028,即均匀因果注意力在平均查询位置的值),随后急剧上升至 0.64–0.84,有 4–9 个头跨越阈值。

与课程和语言无关

  • 五种双语课程下相变起始时间变化甚微
  • 荷兰语、英语、德语、意大利语和中文的单语模型均在相近计算预算下出现该现象
  • 表明该相变是优化过程和架构本身的属性,而非双语训练所特有

电路功能性验证

消融前 3 个归纳头使联想回忆从 0.052 降至 0.001;消融三个熵匹配的对照头后,联想回忆仍保持 0.057,证明归纳电路不仅是存在,而且具有实际功能。

三阶段级联

  1. 前一个 token 头首先形成(约第 1.5–2k 步)
  2. 归纳头约 7.5k 步后形成
  3. 功能性联想回忆再约 17k 步后出现

2B 模型在阶段一内终止训练,因此表现出前一个 token 的结构但从未形成归纳头。

注意事项与局限

  • 2B 模型截断问题:2B 检查点阶梯止于 4096–7127 步,低于相变阈值,其平坦的 PS 曲线是截断造成的,不能证明归纳头不存在
  • 单语模型混淆:单语模型使用 fineweb3 语料库构建,语言与语料库在该比较中相互混淆
  • 时间分辨率有限:相隔一个对数网格步(8192 vs 16384)的起始时间在 20 个检查点下无法区分
  • 缺少种子运行:24B 和 2B 规模无种子运行;种子仅限 HumanScale 的 B2/B3
  • 规模可分离性受限:仅两种规模,无法将 token 预算与模型规模分开考量
搜集汇总
数据集介绍
beetle-phase-transition 数据集图片
构建方式
本数据集源于对Beetle语言模型训练进程中感应电路形成机制的精细追踪,通过逐检查点记录一系列机制性指标,系统刻画了模型内部结构的演化轨迹。数据以多个独立配置(configs)形式组织,涵盖轨迹、高分辨率轨迹、头部属性、消融实验、转变拟合及级联阶段等六个维度,每个配置对应特定的数据模式,从而避免了因模式冲突导致的加载错误。轨迹配置采用对数间隔采样,覆盖整个训练过程,而高分辨率配置则密集采样转变窗口,以捕捉突变细节。
特点
数据集的核心特质在于其多维度、精细化的机制指标集合,包括前缀匹配得分(PS)、感应头数量、联想回忆准确率、前token头得分、残差流有效秩及重复依赖性等。特别地,重复依赖性指标能够有效区分真正的感应头与仅基于位置注意的头部,展现出极佳的判别力。数据揭示了模型训练中的相变现象:PS在约8000步后从随机水平跃升至0.64-0.84,且这一转变与课程设置或语言类型无关,而是一个优化和架构层面的固有属性。消融实验证实感应电路的功能性,而级联阶段数据则展示了前token头、感应头和功能联想回忆依次形成的三阶段级联,为理解语言模型内部机制提供了宝贵的时间序列证据。
使用方法
使用者可通过HuggingFace的datasets库便捷加载各配置,例如使用load_dataset函数指定' trajectories'或'ablation'等配置名,即可获取对应结构的数据表。每条记录均包含训练步数(step)及相应的机制指标,便于绘制随训练进程变化的曲线或进行变换点分析。对于研究训练动力学和可解释性的学者,该数据集支持复现论文中的主要发现,如相变临界点的拟合、级联阶段的时序分析,以及不同规模模型的行为对比。需注意,各配置的数据模式不同,应依据具体分析目的选用合适的配置,并参考数据集的注意事项以避免误解,如2B模型的截断现象和采样密度的限制。
背景与挑战
背景概述
该数据集由Suchir Salhan等人创建,旨在探究Beetle语言模型训练过程中归纳头(induction heads)的涌现机制。研究聚焦于一个核心问题:在自回归语言模型训练中,实现上下文学习的关键电路是否以离散相变的形式突然形成。通过记录不同训练检查点下的机械论指标,数据集为验证归纳头相变假说提供了细粒度的时序证据。其影响力在于,它不仅证实了相变普遍存在于多种语言课程和单语模型中,还揭示了前文词头、归纳头与联想回忆功能构成的三阶段级联过程。这一发现对理解大型语言模型的训练动态与可解释性具有重要价值。
当前挑战
数据集构建与解析面临多重挑战。首先,领域问题的核心难点在于精确识别并量化归纳电路的形成,而非简单观察损失下降。为此,研究者创新性地引入重复依赖性指标,有效辨别真归纳头与仅依靠位置注意力的伪阳性。其次,构建过程遭遇显著障碍:多检查点指标schema不一,直接合并数据表时发生类型转换错误,迫使采用多配置分发的方案。此外,两尺度(2B与更大规模)的检查点阶梯在有限对数间隔下难以精准分辨相变节点,且单语对照中语言与语料混杂,种子运行缺失,导致模型规模与计算预算的影响不可分离,这些均构成数据解释上的局限性。
常用场景
经典使用场景
该数据集聚焦于Beetle语言模型训练过程中归纳头(induction heads)的涌现动态,为研究Transformer内部机制提供了精细的逐检查点度量。其经典使用场景在于追踪归纳电路的形成阶段,涵盖前缀匹配得分、联想召回准确率及头部属性等关键指标。研究者可借助这些轨迹数据,揭示模型从随机初始化到功能完备的相变过程,尤其适用于验证或扩展Olsson等人提出的归纳头理论框架。数据集的多种配置支持对不同训练阶段、分辨率及消融条件的深入剖析,从而成为可解释性研究中剖析学习动态的基准资源。
解决学术问题
该数据集有效解决了大型语言模型内部机制研究中长期存在的观测难题,即缺乏高时间分辨率的训练动态记录。通过提供跨检查点的归纳指标、头部属性及消融结果,它使研究者能够精确捕捉归纳头从无到有的突变时刻,并区分‘真正的归纳行为’与偶然的注意力模式(如重复依赖性指标)。这一数据资源促进了关于相变普遍性、时间级联顺序及模型规模影响的实证探讨,为理解优化与架构如何共同塑造功能电路提供了可复现的数据基础,推动了机械可解释性领域从静态分析向动态研究的范式转变。
衍生相关工作
该数据集衍生的相关工作可推动多个方向的深入研究。基于其轨迹与相变数据,后续研究可探索不同规模、种子的模型是否呈现一致的涌现动力学,以验证相变的普遍性,并进一步分析缩放定律与训练动态的耦合关系。高分辨率数据可支持更精细的相变点自动检测方法开发,以及利用内插技术预测未见过的检查点状态。头部属性与消融结果则激励对归纳头功能冗余性、鲁棒性的机理研究,促进‘电路破坏’分析。此外,级联时序数据为构建训练阶段预测模型提供了训练素材,有望实现早期能力预警,亦可启发少样本学习、上下文学习等上层能力的涌现机制研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务