遇见数据集

activations_and_barcodes_3108

收藏
Hugging Face2026-09-02 更新2026-09-03 收录
官方服务:

资源简介:

该数据集由 sveneziale 创建,采用 Apache-2.0 许可证。数据集包含从大型语言模型(LLM)中提取的激活矩阵,以及基于这些激活矩阵计算的持续性同调(persistent homology)输出(条形码)。数据组织为两个顶级文件夹:activations 和 barcodes。activations 文件夹按模型、语料库、检查点和激活名称组织,包含每个云的原始激活矩阵(.npz格式)和元数据(.csv文件)。barcodes 文件夹按模型、语料库、检查点、激活名称和拓扑度量组织,包含持久性摘要(.csv文件)、原始条形码(.npz格式)和运行清单(manifest.json)。该数据集适用于解释性分析和拓扑数据分析,用于研究 LLM 的内部表示和拓扑结构。

This dataset was created by sveneziale and is licensed under Apache-2.0. It contains activation matrices extracted from large language models (LLMs) and persistent homology outputs (barcodes) computed from these activation matrices. The data is organized into two top-level folders: activations and barcodes. The activations folder is organized by model, corpus, checkpoint, and activation name, and contains raw activation matrices (.npz format) and metadata (.csv files) for each cloud. The barcodes folder is organized by model, corpus, checkpoint, activation name, and topological metric, and contains persistence summaries (.csv files), raw barcodes (.npz format), and a run manifest (manifest.json). This dataset is suitable for interpretability analysis and topological data analysis to study the internal representations and topological structures of LLMs.

创建时间:
2026-09-01
原始信息汇总

数据集概述:activations_and_barcodes_3108

基本信息

  • 许可证:Apache 2.0
  • 数据集名称:sveneziale/activations_and_barcodes_3108
  • 来源:由 tda-for-llms 的 Hugging Face 后端流水线自动生成的计算产物(experiment.yaml 中设置 hf.enabled: true

数据目录结构

数据集包含两个顶层文件夹,分别存放激活矩阵和拓扑条形码数据:

1. activations/{model_slug}/{corpus}/{revision}/{act_name}/

该目录存放从模型中提取的原始逐云(per-cloud)激活矩阵。每个检查点(revision)对应一份独立的副本。

关键特性:该数据与 topology.metric 无关,同一模型、语料库、检查点和激活流下的激活数据可被所有度量或拓扑配置复用,因此每个组合仅需 GPU 提取一次。

包含的文件

  • activation_metadata.csv:每个云(cloud)一行,包含 cloud_id、revision、layer、head、n_prompts 等元数据
  • activations.npz:原始激活矩阵,以 act_{cloud_id} 为键,与上述 CSV 中的 cloud_id 对应

2. barcodes/{model_slug}/{corpus}/{revision}/{act_name}/{persistence|zigzag}/{metric}/

该目录存放基于上述激活数据计算得到的持续同调(persistent homology)输出。由于条形码依赖于拓扑度量/模式,每种拓扑度量/模式对应一份独立副本。

包含的文件

  • persistence_summaries.csv:每个云一行,包含标量拓扑特征摘要
  • persistence_diagrams.npz:原始条形码数据,以 cloud_{cloud_id}_h{dim} 为键
  • manifest.json:完整的运行溯源信息(模型、修订版本、激活流、语料库、拓扑参数)

数据分层关系

激活数据(activations)与条形码数据(barcodes)构成上下游关系:激活数据是底层输入,同一份激活数据可被多种拓扑度量配置计算产生不同的条形码输出;条形码数据按 persistence(持续同调)或 zigzag(之字形同调)两种模式及具体度量(metric)进一步细分。

搜集汇总
数据集介绍
activations_and_barcodes_3108 数据集图片
构建方式
该数据集由tda-for-llms项目通过Hugging Face流水线自动生成,其构建过程深度融合了神经网络的激活提取与拓扑数据分析。数据集采用两级目录架构组织数据,顶层包含activations与barcodes两类核心内容。在activations目录下,针对每个模型、语料库及检查点版本,独立存储原始激活矩阵及对应的元数据,确保数据提取的原子性与可复用性。barcodes目录则进一步依据拓扑度量方式(如持久性同调或之字形同调)对持续同调输出进行分类,每个云点均附有标量拓扑特征摘要、原始条形码及完整的运行溯源信息,从而构建出一条从模型内部表示到拓扑结构特征的系统性数据链路。
特点
该数据集的首要特点在于其架构的层级化与解耦性,激活数据与条形码数据分开存储,使得同一激活集合可被多种拓扑配置复用,极大提升了计算效率。其次,数据集拥有详尽的元数据注释,从激活矩阵的维度信息到条形码的维数标注,均以标准化CSV与NPZ格式存储,便于自动化解析与集成。此外,manifest.json文件提供了无懈可击的实验溯源,涵盖模型选择、语料库版本、激活流及拓扑参数等关键信息,确保了研究结果的可复现性。这种设计不仅适用于大语言模型的内部机制探究,还能为拓扑数据分析在自然语言处理领域的应用提供可靠的数据基础。
使用方法
使用时,研究者可根据研究需求选取相应模型、语料库及检查点版本,从activations目录加载激活矩阵,或直接采用barcodes目录中预计算的持续同调结果。对于希望探索不同拓扑度量的用户,可依据manifest.json提供的参数配置,利用同一激活数据运行自定义拓扑分析,从而避免重复的GPU计算。数据集中的CSV文件易于用pandas导入,而NPZ文件则可通过numpy便捷读取,配合persistence_summaries.csv中的标量特征及persistence_diagrams.npz中的完整条形码,研究者能够灵活进行聚类分析、特征可视化或作为下游机器学习任务的输入,充分挖掘语言模型中的拓扑规律。
背景与挑战
背景概述
该数据集由tda-for-llms项目于2024年创建,旨在服务于大规模语言模型(LLM)的拓扑数据分析研究。它由sveneziale等研究人员发布,通过Hugging Face平台托管,核心研究问题在于如何系统性存储和复现LLM内部激活模式及其对应的持续同调(persistent homology)条形码,以支持对模型可解释性和结构特征的分析。数据集构建于一个自动化的计算管线之上,整合了模型激活提取与拓扑特征计算两个层面,为后续研究提供了标准化的数据基础设施。其影响力体现在其设计理念上:将激活数据与拓扑度量解耦,实现了GPU资源的优化利用,为LLM拓扑分析领域树立了新的数据共享范式,促进了跨机构、跨模型的对比研究。
当前挑战
该领域面临的挑战首先在于LLM内部激活数据的高维性和异构性,需将非结构化的激活矩阵转化为稳定的拓扑特征,且对噪声和参数选择敏感。其次,持续同调计算复杂度高,尤其是对长序列和深层模型,导致存储和计算开销巨大。在构建过程中,需解决多模型、多语料、多检查点的庞大组合下的数据版本管理问题,以及如何确保不同拓扑度量(如持续性或之字形)跨配置的独立性和可追溯性。此外,激活数据与条形码数据的分层存储策略虽优化了资源复用,却增加了元数据管理的复杂性,需要严密的清单系统(manifest)来记录完整的运行来源,以保证科学可复现性和数据互操作性。
常用场景
经典使用场景
该数据集是拓扑数据分析(TDA)与大型语言模型(LLMs)交叉领域的产物,它封装了从LLMs中提取的中间层激活矩阵及其对应的持续同调条形码。其经典使用场景在于利用持续同调与扎斯加格(zigzag)同调揭示语言模型内部表征的拓扑结构,从而探究模型在各类语料上处理信息时形成的几何形状与空洞。研究者常借助这些数据探讨模型维度间的依赖关系,并分析不同层、不同头、不同修订版在拓扑特征上的演变规律。
衍生相关工作
此数据集衍生了多个方向的研究工作,包括但不限于:基于拓扑签名设计动态的激活裁剪策略,以提升推理效率;通过条形码特征的时序分析追踪模型在持续训练过程中的概念漂移;利用跨检查点的同调演算比较预训练与微调阶段的表征变化。众多相关研究依托于该数据集提供的标准化格式,进而推动了LLMs内部结构理解与优化方法的革新。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型内部表征的拓扑结构分析,通过存储跨检查点的激活矩阵与持久同调条形码,支持对模型语义空间的动态演化进行前沿研究。近期研究热点在于利用拓扑数据分析(TDA)揭示模型在处理复杂语境时的高阶几何特征,探索不同层、头及激活流对模型可解释性与鲁棒性的影响。数据集设计上的模块化与解耦特性(激活独立于拓扑度量)促进了多配置复用的效率,为跨模型、跨语料的比较研究提供了坚实基础,进而推动对大模型泛化机制与潜在偏差的深层理解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务