遇见数据集

juiceb0xc0de/gemma-4-e2b-saes

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

Gemma-4-E2B SAE Atlas是一个针对Google Gemma-4-E2B模型残差流层训练的稀疏自编码器(SAE)图谱数据集。它使用JumpReLU稀疏自编码器和自适应拉格朗日控制器进行训练,无需手动逐层超参数调优,自动将每层残差流激活分解为49,152个学习特征。该数据集是逐层构建的,包括训练结果(如解释方差、稀疏度、死特征百分比等),并基于先验的神经普查分析来指导训练优先级。部分层已完成训练(如层0-5),其他层正在训练或排队中。

Gemma-4-E2B SAE Atlas is a complete layer-by-layer sparse autoencoder (SAE) atlas for the Google Gemma-4-E2B model, trained using JumpReLU sparse autoencoders with an adaptive Lagrangian controller that eliminates manual per-layer hyperparameter tuning. It decomposes residual stream activations at each layer into a sparse dictionary of 49,152 learned features. The dataset is built incrementally per layer, including training results (e.g., explained variance, sparsity, dead feature percentage) and is informed by prior neural census analysis to guide training priorities. Some layers (e.g., layers 0-5) are completed, while others are in training or queued.

提供机构:
juiceb0xc0de
搜集汇总
数据集介绍
juiceb0xc0de/gemma-4-e2b-saes 数据集图片
构建方式
该数据集基于Gemma-4-E2B指令微调模型,采用JumpReLU稀疏自编码器(SAE)架构,对其所有残差流层进行逐层特征分解。每层SAE将激活维度扩展至49,152个特征(24倍过完备),并利用自适应增广拉格朗日控制器实现稀疏性自动调控,将L0稀疏度作为硬约束而非软惩罚,通过投影对偶上升法自动寻找各层KKT点,无需人工调参。训练数据源自预分词后的FineWeb-Edu语料,每层以约500个活跃特征为目标,迭代步数自适应收敛,最终形成覆盖全层级的SAE图谱。
特点
该数据集的核心特点在于其全层覆盖与自动化训练机制:从第0层到第34层,每层均训练独立的SAE模型,且控制器能根据各层动力学自动调整超参数平衡,如第2层因纠缠悬崖现象需要2.2倍步数和λ值,而第0层则仅需3,501步。此外,数据集提供了详细的训练状态、解释方差(EV)和死神经元比例等指标,部分层如第3层存在不稳定训练问题并建议使用最佳检查点,体现了真实训练过程的透明度与严谨性。这种动态自适应机制显著降低了计算成本,支持在单个A100上以低于20美元完成全模型SAE训练。
使用方法
用户可通过Hugging Face平台直接加载该数据集的预训练SAE权重,对Gemma-4-E2B模型各残差流层的激活进行稀疏分解分析。具体使用时,需结合预定义的49,152维字典将输入激活映射为稀疏特征表示,利用JumpReLU激活函数与每特征自适应阈值提取表征。建议优先使用标记为'best ckpt'的检查点以获取最佳性能,对于不稳定层如第3层需特别注意选择。此外,数据集配备交互式脑图谱(Brain Atlas)可视化工具,支持跨35层×8组件×16行为类别的神经普查查询,便于研究人员探索模型中与特定行为相关的稀疏模式。
背景与挑战
背景概述
随着大型语言模型(LLMs)内部机制的透明化需求日益迫切,稀疏自编码器(SAE)已成为解析模型残差流激活的重要工具。Gemma-4-E2B SAE Atlas 数据集由研究者 juiceb0xc0de 创建,旨在对 Google 发布的 Gemma-4-E2B-it 模型的每一残差流层训练跳跃ReLU(JumpReLU)稀疏自编码器,从而构建完整的层级SAE图谱。该研究基于前期的脑图谱分析(涵盖35层×8组件×16行为类别的神经普查),识别出早期三层的行为领导权转移、深层门控稀疏化事件以及选择性平台等结构性发现,并据此指导了SAE训练优先级。该数据集通过自适应拉格朗日控制器自动调节稀疏目标参数,实现了无需人工逐层调优的完整模型SAE训练,显著降低了计算成本(单张A100 GPU总花费低于20美元),为可解释性研究提供了高效、可复现的基准,对理解大模型内部机制具有重要推动作用。
当前挑战
该数据集面临的核心挑战在于:首先,需要解决大型语言模型内部激活的高维度和复杂性,通过将残差流激活分解为49,152个稀疏特征(24倍过完备)来捕捉有意义的表示,但传统稀疏自编码器训练依赖繁琐的逐层超参数网格搜索,效率低下且易受人为调优偏差影响。其次,构建过程中遇到的困难包括不同层之间的动态差异显著,例如第2层所需的训练步数和平衡参数λ比第0层高出2.2倍,这与脑图谱中发现的纠缠悬崖现象一致,需要自适应控制器能够稳健地自动找到每层的自然KKT点。此外,部分训练层(如第3层)出现不稳定现象,需要采用最佳检查点回滚策略,而后续层(第7-34层)仍在排队训练中,数据集面临持续扩建和时间管理挑战。
常用场景
经典使用场景
Gemma-4-E2B SAE数据集的核心应用在于为大规模语言模型(LLM)的内部表示提供稀疏编码的可解释性分析。通过在每个残差流层上训练JumpReLU稀疏自编码器(SAE),该数据集将高维神经激活分解为49,152个稀疏且可解释的特征字典,从而支持对模型行为在逐层粒度上的精确拆解。这一方法尤为适用于研究模型的内部计算机制,例如追踪信息在深层网络中的传递路径、识别特定层级的神经选择性偏好,以及揭示与输入语义类别相关的激活模式。研究者利用该数据集能够在不依赖繁复超参数调优的情况下,系统性地探究模型内部表示的稀疏性与可解释性之间的平衡关系。
解决学术问题
在学术领域,该数据集解决了大规模神经网络可解释性研究中的关键瓶颈,即如何在不依赖人工干预的前提下,实现跨所有层的系统性稀疏编码。传统的SAE训练需要针对每一层手动调整稀疏性目标,过程耗时且难以复现。Gemma-4-E2B SAE数据集通过引入自适应增广拉格朗日控制器,将L0稀疏度作为硬约束进行动态优化,使各层自动收敛至唯一KKT点,彻底消除了网格搜索与人为调参的负担。这一突破使得全模型SAE图谱的构建成本降至极低,显著推动了可解释性研究向深层次、规模化方向迈进,为理解注意力头功能分化、门控机制涌现以及层级间领导权转移等现象提供了量化工具。
衍生相关工作
基于该数据集衍生出的相关工作主要集中在两大方向:一是利用SAE特征对模型进行行为层面的因果干预,例如通过抑制或增强特定稀疏特征来调控模型输出倾向,从而在推理阶段实现轻量级的可控生成;二是借鉴其自适应调参思想,将增广拉格朗日方法推广至其他类型的稀疏编码任务,如图像表示学习与多模态特征解耦。此外,该完整层间SAE图谱已成为后续研究基准,催生了针对特征可分离性度量的新指标,以及跨模型稀疏编码一致性对比的相关工作。这些衍工作不仅巩固了数据集在可解释性研究中的基础地位,也为更广泛的神经符号融合与认知架构探索铺平了道路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务