遇见数据集

tmax-2b-atlas

收藏
Hugging Face2026-06-28 更新2026-06-29 收录
官方服务:

资源简介:

本数据集是allenai/tmax-2b混合SSM/Mamba/Transformer语言模型的内部机制图谱,通过分析模型在8,965个多样化提示语料上的激活构建,旨在揭示模型各层、组件、注意力头和特征方向的功能,而非用于对话或基准测试。它以SQLite数据库形式组织,包含12张表,总计超过1000万行数据,核心内容包括层元数据、特征分类和激活统计、注意力头选择性分析、OV/QK/FC矩阵的SVD分解、Logit Lens输出、特征对相关性、特征角色标签、合规行为对比统计、Sub-Zero分类器精度等。数据集覆盖全部24层,但仅包含语言标记化组件,排除了非语言组件的噪声。关键发现包括注意力机制是分布式的、MLP/SSM门特征主导Logit Lens、早期层轴在多语言能力上具有显著损伤但总体可编辑性高。适用于特征提取、模型可解释性、机制分析、稀疏自编码器研究等任务。

This dataset is the internal mechanism atlas of the allenai/tmax-2b hybrid SSM/Mamba/Transformer language model, constructed by analyzing the model's activations across 8,965 diverse prompt corpora. It is designed to uncover the functional roles of each layer, component, attention head, and feature direction of the model, rather than being intended for dialogue or benchmarking tasks. Organized as a SQLite database, the dataset contains 12 tables with a total of over 10 million rows of data. Its core content includes layer metadata, feature classification and activation statistics, attention head selectivity analysis, SVD decomposition of OV/QK/FC matrices, Logit Lens outputs, feature pair correlations, feature role labels, compliance behavior comparative statistics, Sub-Zero classifier accuracy, and more. The dataset covers all 24 layers of the model, but only retains language tokenization components while excluding noise from non-linguistic components. Key findings from this dataset include that the attention mechanism is distributed, MLP/SSM gate features dominate the Logit Lens, and early layer axes exhibit significant impairments in multilingual capabilities but overall high editability. This resource is suitable for tasks such as feature extraction, model interpretability, mechanistic analysis, and sparse autoencoder research.

创建时间:
2026-06-28
原始信息汇总

数据集概述

数据集名称juiceb0xc0de/tmax-2b-atlas

任务类型:机械可解释性数据集,用于分析混合SSM/Mamba/Transformer语言模型allenai/tmax-2b的内部机制。

模型allenai/tmax-2b(24层,包含6个注意力层和18个混合层)

探测语料:8,965 个多样化提示(prompts)

数据集内容:这是一个模型内部机制的“大脑图谱”,记录了每个层、组件、头部和特征方向在语料上的激活统计、功能标签、电路分析等信息,而非聊天数据或基准测试。

数据格式:SQLite 数据库,包含以下11个表:

表名 行数 说明
layers 24 每层的元数据和完成标志
features 681,984 每(层、组件、特征索引)的特征分类和激活统计
per_head 168 6个注意力层中每个头部的选择性和顶级代码统计
ov_circuits 48 对W_V @ W_O进行SVD分解,以及QK/FC频谱指标
logit_lens 6,528 每个特征促进/抑制的输出token
coactivation 14,201 特征对之间的相关性
code_analysis 4,680 “纠缠”与“选择性”角色标签
compliance_behaviour_features 681,984 每个特征在真实风格与官方风格之间的对比(F统计量与差值)
compliance_behaviour_per_head 168 每个头部在合规/行为风格上的对比统计
subzero_layer 24 每层的分类器准确率和奇异向量摘要
subzero_svs 96 每个投影方向上的“守护者”奇异值
subzero_capability 365 DAS轴的能力损伤与栅栏决策

关键发现

  • 注意力分布广泛:OV频谱集中度为0.060,有效秩约79。
  • MLP/SSM门控主导logit lens:峰值出现在第15层和第20层的gate特征上,F统计量超过590。
  • 最严重的“手术”意外出现在早期:第1层linattn_in_proj_z轴0在所有五个领域均未能通过能力栅栏,对多语言能力损伤高达0.60。
  • 其余方向可编辑性高:365个Sub-Zero轴中有335个(91.8%)通过了能力栅栏,平均损伤仅为0.029。

重要说明

  • Sub-Zero分析专门寻找区分官方风格与真实风格的方向,并通过DAS旋转和能力栅栏测试移除这些方向是否损害代码、数学、推理、事实或多语言能力。它并非对所有重要方向的普查。
  • 混合SSM/Mamba层中包含不进行语言token化的组件,本数据集未探测这些组件,以避免噪声。相关方法正在开发中。

使用方式:通过SQLite连接,运行SQL查询。示例: python import sqlite3 import pandas as pd

conn = sqlite3.connect("tmax-2b-atlas.sqlite") df = pd.read_sql_query("SELECT * FROM features WHERE layer_id=15 AND component=gate ORDER BY fstat DESC LIMIT 20", conn)

许可协议:MIT

相关链接

  • 模型:https://huggingface.co/allenai/tmax-2b
  • Atlas 代码:https://github.com/JuiceB0xC0de/qwip_atlas
  • 作者主页:https://huggingface.co/juiceb0xc0de
搜集汇总
数据集介绍
tmax-2b-atlas 数据集图片
构建方式
本数据集针对allenai/tmax-2b这一混合SSM/Mamba/Transformer架构的语言模型,构建了一套详尽的内部机制图谱。研究者选取了8,965条多样化提示语作为语料库,对模型全部24层进行激活普查,其中6层为注意力层,其余为混合层。通过激活采集、特征分类、逐头分析、OV电路奇异值分解、对数透镜、共激活模式、代码分析、合规行为对比以及Sub-Zero手术与能力围栏等多项流程,系统性地提取了每层、每组件、每头及每个特征方向的功能信息,最终以SQLite数据库形式存储,包含12张核心数据表。
特点
该数据集的核心特点在于其多维度的精细刻画与功能定位能力。features表记录了超过68万条特征分类与激活统计信息,per_head表揭示了6个注意力层的选择性偏好,ov_circuits表通过SVD分解展现了注意力回路的光谱特性。尤为独特的是,数据集引入了合规行为对比分析,能够区分模型在“真实”与“企业化”两种风格下的特征差异,并通过Sub-Zero手术评估特定方向对代码、数学、推理、事实和多语言等能力的损伤程度。研究发现注意力呈分布式特性而非记忆化,MLP/SSM门控单元主导了对数透镜输出。
使用方法
使用该数据集时,用户可直接通过SQLite接口进行查询与分析。例如,利用Python的sqlite3库连接数据库文件后,可使用标准SQL语句检索特定层与组件的高F统计量特征,如筛选第15层门控单元中排名前20的特征。数据集支持跨表联合查询,便于将特征激活信息与共激活模式、日志透镜结果或合规行为对比数据进行关联分析。用户亦可借助任意SQLite浏览器直观浏览各表内容,探索模型不同层级的内部运作机制。
背景与挑战
背景概述
tmax-2b-atlas数据集由研究者juiceb0xc0de于近期创建,旨在为Allen AI团队开发的混合SSM/Mamba/Transformer语言模型tmax-2b提供一份内部机制图谱。该数据集并非传统的对话或基准评测集,而是一份详尽的神经机制地图,通过将大量提示语输入模型并记录各层、组件、注意力头及特征方向的激活状态,揭示了模型内部的信息处理逻辑。作为机械可解释性(Mechanistic Interpretability)领域的重要资源,tmax-2b-atlas推动了我们对混合架构语言模型内部运作的理解,特别是在注意力分布、门控机制以及模型行为调控等方面提供了量化依据,对后续模型编辑、安全对齐和可解释性研究具有深远影响。
当前挑战
tmax-2b-atlas所解决的领域核心挑战在于,混合SSM/Mamba/Transformer架构的语言模型内部工作机制高度复杂,传统的黑箱分析方法难以揭示其组件级别的功能分工与协同模式。构建过程中,研究者面临双重挑战:一是混合层中部分组件不处理语言信息,直接探测仅产生噪声,因此不得不有选择性地仅分析语言分词组件;二是需要设计一套涵盖激活普查、特征分类、注意力头分析、OV电路奇异值分解、对数透镜、共激活分析以及行为合规性对比等多个维度的系统性探测流程,并借助Sub-Zero手术和能力围栏来识别可编辑方向而不破坏模型核心能力,最终在681,984个特征和365个候选轴中实现了91.8%的编辑通过率。
常用场景
经典使用场景
在机械可解释性(Mechanistic Interpretability)研究领域,tmax-2b-atlas 数据集为剖析混合SSM/Mamba/Transformer语言模型的内部运作机制提供了系统化的解剖图谱。研究者可借助其丰富的逐层、逐组件特征分类(feature taxonomy)、激活统计(activation stats)和注意力头选择性(per-head selectivity)数据,深入探索模型如何组织语言知识。该数据集最经典的使用方式是作为稀疏自编码器(SAE)分析、网络归因和电路发现的基础,通过SQL查询迅速定位特定层或组件中激活模式突出的特征,进而推断它们在文本生成中的功能角色。
解决学术问题
该数据集直面大型语言模型内部机制模糊性的核心难题,特别针对混合架构中不同子模块(如Mamba状态空间模型与注意力层)的功能分工和交互机制缺乏清晰解释的现状。通过提供OV电路的奇异值分解(SVD)谱度量、特征共激活(coactivation)相关性和logit透镜(logit lens)输出,它使得研究者能够量化注意力分布特性、定位认知加工的关键节点,并判断哪些方向对维持推理能力至关重要。这一资源显著推动了机械可解释性从定性描述向定量分析的转变,为实现更可控、更安全的语言模型提供了实证基础。
衍生相关工作
tmax-2b-atlas 数据集衍生了一系列促进可解释性研究标准化的工作脉络。其ATLAS(Activation Taxonomy and Latent Assessment Schema)方法学框架启发了对多架构模型(如Phi-3、Gemma等)进行类似解剖分析的项目,推动了跨模型内部机制的对比研究。此外,数据集中的Sub-Zero手术范式直接促进了DAS(Distributed Alignment Search)在能力边界检测领域的应用拓展,催生了更多探索语言模型核心能力和附属风格之间分离性的实证研究。这些工作共同深化了对大规模神经模型泛化机制的理解,并为发展更具透明度的AI系统奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务