gemma-4-e2b-atlas
收藏资源简介:
该数据集包含四个独立配置,主要用于模型(特别是基于Transformer架构的模型)行为分析与评估。bouncer_analysis配置包含24,625条记录,每条记录包含分割标识和原始记录内容,可能用于模型输出或中间结果分析。bouncer_scores配置包含35条记录,关联模型层与记录,可能用于计算或存储模型在不同层上的评分。per_head配置设计用于注意力头级别的详细分析,包含层编号、组件类型、头编号、维度数、非零方差、分类标签、分离分数等多个特征,旨在量化注意力头的行为特性,但当前版本未包含实际样本数据。prompts配置包含825条文本提示,每条提示具有类别和子类别标签,可用于生成模型输入或评估任务。数据集整体侧重于提供模型内部机制(如层、注意力头)的可解释性数据,以及配套的文本提示集合。
This dataset contains four independent configurations, primarily intended for behavior analysis and evaluation of models, especially those based on the Transformer architecture. The bouncer_analysis configuration consists of 24,625 records, each containing a split identifier and the original record content, which may be used for analysis of model outputs or intermediate results. The bouncer_scores configuration includes 35 records that associate model layers with records, potentially used for calculating or storing model scores across different layers. The per_head configuration is designed for detailed attention head-level analysis, featuring multiple attributes including layer number, component type, head number, dimension count, non-zero variance, classification labels, and separation scores. It aims to quantify the behavioral characteristics of attention heads, but no actual sample data is included in the current version. The prompts configuration contains 825 text prompts, each with category and sub-category labels, which can be used for generating model inputs or evaluation tasks. Overall, the dataset focuses on providing interpretable data about internal model mechanisms such as layers and attention heads, as well as a supporting collection of text prompts.
基于您提供的README文件内容,以下是对该数据集的详细总结。
数据集概述
该数据集名为 gemma-4-e2b-atlas,托管于 Hugging Face 平台,主要围绕 Gemma 4 模型(推测为E2B版本)的神经元分析、组件分析、提示词分类等机械可解释性研究内容。数据集包含多个配置(config),每个配置对应一个独立的数据子集,所有数据仅提供训练集(train split)。
数据集结构与配置
数据集共包含 9个配置,具体如下:
| 配置名称 | 描述 | 样本数 | 数据集大小 |
|---|---|---|---|
| bouncer_analysis | 分析数据,包含 split 和 record 字段 |
24,625 | 4.23 MB |
| bouncer_scores | 每层(layer)的 bouncer 得分,包含 layer 和 record 字段 |
35 | 156.69 MB |
| coactivation | 神经元共激活分析,记录层、组件、神经元对及其相关性 | 26,265 | 1.48 MB |
| code_analysis | 代码特征分析,包含每个组件的代码桶、纠缠/选择神经元列表 | 240 | 129.82 KB |
| component_summary | 组件级汇总,统计特征数量、F统计量、代码桶、分类信息等 | 240 | 29.05 KB |
| per_head | 每注意力头(head)的统计,包括维度、分离分数、分类信息 | 590 | 65.43 KB |
| prompts | 提示词数据,包含类别、子类别和提示词文本 | 825 | 99.90 KB |
| separation | 神经元分离分析,记录每层/组件的 F 统计量分数 | 240 | 9.99 MB |
| taxonomy | 神经元分类数据,包含激活率、平均激活值、标准差等 | 1,248,768 | 80.33 MB |
关键特征字段说明
每个配置具有不同的特征,以下列出重点字段:
- 公共字段:
layer(层索引)、component(组件名称,如注意力或MLP) - 神经元与激活:
neuron_a、neuron_b(神经元对)、activation_rate、mean_activation、std_activation - 分类与代码分析:
class(分类标签)、code_bucket(代码桶)、entangled_neurons、selective_neurons - 统计指标:
correlation(相关性)、fstat_top(顶部F统计量)、top_sep_score(最高分离分数) - 提示词:
category、subcategory、prompt(文本)
数据规模概要
| 指标 | 数值 |
|---|---|
| 总配置数 | 9 |
| 总样本数(所有配置合计) | 约 1,276,548 |
| 总下载大小 | 约 141.56 MB |
| 总数据集大小 | 约 253.57 MB |
数据用途
该数据集适用于机械可解释性研究,具体可用来分析:
- 神经元共激活模式
- 注意力头部的分离性
- 代码相关的神经元选择性
- 神经元分类与激活统计
- 提示词驱动的模型行为分析
所有数据仅提供训练集,无验证集或测试集。




