遇见数据集

activations-and-barcodes

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

该数据集是tda-for-llms管线(通过Hugging Face后端支持)生成的工件,包含从大语言模型中提取的原始激活矩阵(activations)以及基于这些激活矩阵计算出的持续同调输出(barcodes)。激活矩阵部分按模型slug、语料库和激活流名称分层组织,每个数据点包含元数据文件(如cloud_id、版本、层、注意力头、提示数量等)和对应的激活矩阵(NPZ格式)。条形码部分按模型slug、语料库、激活流、拓扑模式(persistence或zigzag)和度量组织,包含持续同调摘要(CSV格式)、原始条形图(NPZ格式,按cloud_id和维度索引)以及完整的运行来源信息(manifest.json)。该数据集适用于研究LLM内部表示的拓扑结构,支持多种拓扑度量,为理解模型激活的空间结构提供数据基础。

This dataset is an artifact generated by the tda-for-llms pipeline (backed by Hugging Face). It contains raw activation matrices extracted from large language models and the persistent homology outputs (barcodes) computed from these activation matrices. The activation matrices are organized hierarchically by model slug, corpus, and activation flow name. Each data point includes metadata files (such as cloud_id, version, layer, attention head, number of prompts, etc.) and the corresponding activation matrix in NPZ format. The barcodes part is organized by model slug, corpus, activation flow, topological mode (persistence or zigzag), and metric. It includes persistent homology summaries in CSV format, raw barcode plots in NPZ format (indexed by cloud_id and dimension), and complete run provenance information (manifest.json). This dataset is suitable for studying the topological structure of LLM internal representations, supports multiple topological metrics, and provides a data foundation for understanding the spatial structure of model activations.

创建时间:
2026-08-12
原始信息汇总

数据集概述:sveneziale/activations-and-barcodes

基本信息

  • 许可证:Apache-2.0
  • 数据集地址:https://huggingface.co/datasets/sveneziale/activations-and-barcodes
  • 来源:由 tda-for-llms 的 Hugging Face 后端流水线自动生成的计算产物(在 experiment.yaml 中启用 hf.enabled: true

数据集结构

数据集包含两个顶层文件夹:

1. activations/{model_slug}/{corpus}/{act_name}/

存储从模型中提取的原始逐云(per-cloud)激活矩阵,与拓扑度量(topology.metric)无关,同一模型、语料和激活流对应的激活数据只提取一次,可被所有度量或拓扑配置复用。

包含文件:

  • activation_metadata.csv:每行对应一个云(cloud),包含 cloud_id、修订版本、层、头、提示数量等元数据。
  • activations.npz:原始矩阵,键为 act_{cloud_id},与上述 CSV 中的 cloud_id 列对应。

2. barcodes/{model_slug}/{corpus}/{act_name}/{persistence|zigzag}/{metric}/

基于上述激活数据计算得到的持久同调(Persistent Homology)输出结果。每个拓扑度量/模式对应一份拷贝,因为条形码依赖于度量设置。

包含文件:

  • persistence_summaries.csv:每行对应一个云,包含标量拓扑特征摘要。
  • persistence_diagrams.npz:原始条形码,键为 cloud_{cloud_id}_h{dim}
  • manifest.json:完整的运行溯源信息,包括模型、修订版本、激活流、语料、拓扑参数等。

设计特点

数据集按模型、语料、激活名称、拓扑模式(持久/锯齿)和度量进行层级组织,便于按需检索特定配置下的激活数据或拓扑分析结果。激活数据与拓扑计算解耦,提高了计算资源利用率。

搜集汇总
数据集介绍
activations-and-barcodes 数据集图片
构建方式
该数据集由tda-for-llms项目的Hugging Face支持管道生成,通过实验配置(experiment.yaml)中启用hf.enabled标记来自动化产出。其构建流程分为两个核心阶段:首先,从指定的语言模型中抽取不同层、头部的原始激活矩阵,存储于'activations/{model_slug}/{corpus}/{act_name}/'路径下,每个数据云(cloud)对应一份激活元数据(activation_metadata.csv)和原始矩阵(activations.npz),这些激活数据与后续拓扑度量无关,仅依赖模型、语料库和激活流,因此可被复用。其次,基于这些激活矩阵计算持续同调(persistent homology)输出,包括持久性图(persistence_diagrams.npz)和标量拓扑特征摘要(persistence_summaries.csv),存储于'barcodes/{model_slug}/{corpus}/{act_name}/{persistence|zigzag}/{metric}/'路径下,每个拓扑度量模式独立生成,并附有完整的运行来源清单(manifest.json)。
特点
该数据集的结构设计体现了模块化与高效性的特点。激活数据与拓扑计算分离存储,使得同一批激活可服务于多种拓扑度量或配置,避免了重复的GPU提取开销。持久性同调输出则针对不同的拓扑度量(如持久性、之字形)分别保存,确保了每个分析路径的独立性。数据以CSV和NPZ格式组织,便于处理和读取,同时'cloud_id'作为关键标识符,在激活元数据与激活矩阵之间建立了清晰映射。此外,manifest.json提供了详尽的运行来源信息,涵盖模型版本、激活流、语料库及拓扑参数,极大提升了实验的可追溯性和可复现性,为大型语言模型内部结构的拓扑分析提供了可靠的数据基础。
使用方法
使用时,研究者可根据研究目标选择性地加载所需层级数据。对于激活分析,可直接从'activations'目录中读取目标模型和语料库对应的activation_metadata.csv以获取云ID和元信息,然后通过activations.npz中的'act_{cloud_id}'键提取对应的激活矩阵。对于拓扑特征分析,则需进入'barcodes'目录,依据所选模型、语料库、激活名称及拓扑度量(如持久性或之字形)定位到具体子目录,加载persistence_diagrams.npz以获取原始条形码,并利用persistence_summaries.csv获取各云的标量摘要。此外,manifest.json可辅助理解每个条形码的计算参数,便于在不同拓扑配置间进行比较研究。该数据集特别适用于研究LLM内部表征的拓扑结构及其与语义、任务性能的关联,同时也支持可复现的科研工作流。
背景与挑战
背景概述
在深度学习与拓扑数据分析交叉领域,研究者日益关注如何利用持久同调等工具揭示神经网络内部表征的几何与拓扑结构。该数据集由tda-for-llms项目于近期创建,由相关研究团队通过Hugging Face平台发布,核心研究问题在于为大型语言模型(LLM)的激活流提供标准化的持久同调计算产物,以支持跨模型、跨语料库、跨度量方式的系统比较。数据集精细区分了原始激活矩阵与基于不同拓扑度量(如持久性、之字形)的条形码输出,并附有完整的溯源信息,极大地促进了可复现的拓扑分析研究,对理解LLM的表示学习机制及推动可解释人工智能发展具有重要影响力。
当前挑战
该数据集面临的挑战首先源于领域问题:如何从高维、非线性的神经网络激活中提取稳定且有意义的拓扑特征,并确保不同模型、不同语料下的特征具有可比性,这要求持久同调参数的选择具备鲁棒性。其次,构建过程中需应对计算与存储的双重压力——激活提取依赖高成本GPU资源,而持久同调计算对内存和算力要求苛刻,同时需精细管理多模型、多配置下的数据组织与版本追溯,确保每个条形码文件与相应激活矩阵及实验配置严格对应,避免数据碎片化与信息丢失,这为数据管道的设计带来了显著的技术挑战。
常用场景
经典使用场景
在深度学习可解释性研究领域,'activations-and-barcodes'数据集为探究神经网络内部表征结构提供了不可或缺的数据基础。其核心应用场景在于,研究者能够利用该数据集中的原始激活矩阵与对应的持续同调条码,系统性地分析不同层级、不同注意力头在各类语料上的拓扑特征。通过对比不同模型规模或训练阶段的激活模式,可以揭示模型从低级语法特征到高级语义概念的涌现过程,从而深化对Transformer架构信息处理机制的理解。
解决学术问题
该数据集为解决神经网络黑箱问题提供了量化分析路径。传统方法仅依赖最终输出的可视化或探针任务,难以捕捉模型内部的动态拓扑变化。此数据集通过持久同调等拓扑数据分析手段,将高维激活空间中的形状特征(如环、空洞)转化为可比较的条码摘要,使研究者能够客观度量模型在训练或微调过程中的结构性演变。这一创新视角解决了如何从全局几何形状上刻画模型行为、识别不同组件功能分工的难题,极大地推动了可解释AI从静态分析向动态拓扑理解的范式转移。
衍生相关工作
该数据集的发布衍生了一系列围绕拓扑数据分析与深度学习交叉的前沿工作。受其启发,研究者开发了专门的可视化工具,用于动态交互式地探索激活空间中的拓扑洞结构。更关键的是,该数据集支持了基于持续同调的距离度量研究,使得不同模型或不同训练阶段之间的相似性比较成为可能,进而催生了模型蒸馏中的拓扑蒸馏新方法。此外,其结构化的元数据记录(如manifest.json)也推动了机器学习实验可复现性标准的完善,成为后续许多实验追踪系统的参考蓝本。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务