遇见数据集

MZC-Corpus

收藏
Hugging Face2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

MZC-Corpus(Model Zoo Cartography trained-MLP corpus)是一个包含1,569个训练好的多层感知器(MLP)的群体数据集,这些MLP来自69个不同的网络家族。所有网络均基于ARC White-Box Estimation Challenge Phase-1架构(参考规格:深度32/宽度256),但实际涵盖宽度64–512、深度8–64的配置。网络使用He-Gaussian初始化(N(0, 2/fan_in)),无偏置,每层后接ReLU激活函数,权重以(in, out)格式存储,前向计算为x @ W。每个网络均附带完整的训练来源信息。数据集布局包括:corpus目录下每个run_id包含net_<seed>.npz(初始权重、训练权重、读出头)和net_<seed>.json(架构、任务、训练参数、结果、验证准确率轨迹、git提交记录);analysis目录包含每个网络的权重和激活普查(解析和鲁棒MP下限、锚定计数)以及空基线分析(q-clock状态轨迹)。任务家族包括:高斯混合(经过解析白化使聚合输入与空基线的均值和协方差完全匹配,C∈{2..72},分离度和权重衰减扫描,训练步数20k–200k,学习率臂,两种读出模式,每配置16–32种子),以及白化的MNIST和Fashion-MNIST(784→d维高斯投影+ZCA)。该数据集旨在为扩展随机权重矩传播到训练网络提供必要的群体统计信息,相关论文探讨了任务排名在输入层的印记。

The MZC-Corpus (Model Zoo Cartography trained-MLP corpus) is a population dataset containing 1,569 trained Multi-Layer Perceptrons (MLPs) from 69 different network families. All networks are based on the ARC White-Box Estimation Challenge Phase-1 architecture (reference specification: depth 32/width 256), but actual configurations span widths 64–512 and depths 8–64. Networks use He-Gaussian initialization (N(0, 2/fan_in)), no biases, ReLU activation after each layer, weights stored in (in, out) format, and forward computation as x @ W. Each network comes with complete training provenance information. The dataset layout includes: the corpus directory with each run_id containing net_<seed>.npz (initial weights, trained weights, readout head) and net_<seed>.json (architecture, task, training parameters, results, validation accuracy trajectory, git commit); the analysis directory containing weight and activation census (analytic and robust MP lower bounds, anchor counts) and null baseline analysis (q-clock state trajectory). Task families include: Gaussian mixture (with analytic whitening to exactly match the aggregate input mean and covariance of the null baseline, C∈{2..72}, separation and weight decay scans, training steps 20k–200k, learning rate arms, two readout modes, 16–32 seeds per configuration), and whitened MNIST and Fashion-MNIST (784→d-dimensional Gaussian projection + ZCA). The dataset is designed to provide the necessary population statistics for extending random weight moment propagation to trained networks, with the associated paper exploring task rank imprinting in the input layer.

创建时间:
2026-08-11
原始信息汇总

MZC-Corpus 数据集概述

基本信息

  • 名称:MZC-Corpus(Model Zoo Cartography trained-MLP corpus)
  • 许可证:MIT
  • 公开日期:2026年8月18日
  • 数据集地址:https://huggingface.co/datasets/james-ra-henry/MZC-Corpus

数据集内容

该数据集包含1,569个经过训练的MLP(多层感知机)网络,分布于69个网络家族中,采用ARC White-Box Estimation Challenge Phase-1的参考架构(深度32/宽度256),网络宽度范围为64至512,深度范围为8至64。每个网络均采用He-Gaussian初始化、无偏置、每层后接ReLU激活函数,并配有完整的训练来源记录。

数据布局

corpus/ 目录

  • net_<seed>.npz:包含初始权重(init_w0..d)、训练后权重(w0..d)及读出头部权重(head_w)
  • net_<seed>.json:包含架构信息、任务信息(家族、C值、分离/投影种子、精确贝叶斯准确率)、训练配置(优化器、学习率、权重衰减、步数、种子)、结果、验证准确率轨迹及Git提交信息

analysis/ 目录

  • census/:每个网络的权重与激活普查数据(解析及鲁棒MP下限、锚定计数)
  • null_baseline/:每个网络的解析状态轨迹(q-clock)

任务家族

  • 高斯混合模型:经过解析白化处理,使聚合输入的均值与协方差与零假设完全匹配;C值范围为2至72,包含分离度与权重衰减扫描、2万至20万步预算、学习率分支、两种读出模式,每种配置含16至32个种子
  • 白化后的MNIST与Fashion-MNIST:通过784维到d维的种子高斯投影及ZCA白化处理

引用信息

配套论文

  • Task rank is imprinted in the input layer——论文草稿见代码仓库中的 paper/DRAFT.md
  • 发现摘要、工具及数据索引见 FINDINGS.md
  • 数据集中的 analysis/ JSON文件是论文汇总结果背后的逐网络数据;代码仓库中的 train/corpus_io.py 可按需重新下载剪枝后的网络
搜集汇总
数据集介绍
MZC-Corpus 数据集图片
构建方式
该语料库的构建植根于白盒估计挑战赛的架构规范与随机权重矩传播理论向训练网络扩展的迫切需求。研究者基于深度32、宽度256的参考架构,将网络规模拓展至宽度64至512、深度8至64,采用He-Gaussian初始化与无偏置ReLU激活,权重以(in, out)格式存储。所有网络均经过完整训练流程,源于69个家族、跨越1,569个训练后的多层感知机,每个网络配备初始化权重、训练后权重及读出头,并附有包含架构、任务、优化器、学习率、权重衰减、训练步数、种子、验证准确率轨迹与提交哈希的溯源记录。任务涵盖解析白化的高斯混合模型及经高斯投影与ZCA白化的MNIST与Fashion-MNIST,通过分离度、权重衰减扫描、学习率臂与多种读出模式生成16至32个种子每配置的样本,步数预算介于2万至20万之间。
特点
该语料库的核心特征在于其系统性地捕获了训练网络群体的共享统计规律,为从随机权重矩传播迈向训练网络的理论延伸提供了关键素材。数据集囊括1,569个训练后的多层感知机,跨越69个家族,架构配置覆盖宽度64至512、深度8至64,每个网络均保留完整的初始化与训练后权重及读出头。高斯混合任务通过解析白化确保聚合输入与零假设的均值与协方差精确匹配,同时记录因混合性残留的高阶矩非高斯性。MNIST与Fashion-MNIST任务则经由种子化高斯投影与ZCA白化,将784维输入映射至网络输入维度。配套分析组件涵盖逐网络权重与激活普查、解析及鲁棒矩传播下限、锚定计数,以及解析状态轨迹,为训练动力学的统计刻画提供了丰富维度。
使用方法
使用者可通过语料库的目录结构直接访问每个运行标识下的网络文件与溯源文件,网络文件以npz格式存储初始化权重、训练后权重及读出头,溯源文件以json格式提供架构、任务、训练配置与结果轨迹。分析目录下的普查与零基线数据可用于对比训练网络与理论矩传播预测的差异。配套代码仓库中的corpus_io.py支持按需重新下载经过剪枝的网络,便于在本地复现或扩展实验。研究者可依据任务家族与配置参数筛选特定子集,利用验证准确率轨迹与吉特提交哈希确保实验的可追溯性。引用时请使用提供的概念DOI,以获取最新归档版本。
背景与挑战
背景概述
深度神经网络的可解释性研究长期受限于缺乏系统化的训练网络群体数据。现有资源多聚焦单一模型或特定任务,难以支撑对训练动力学与权重统计的普适性推断。MZC-Corpus由James R. Henry等人构建,于2026年公开,涵盖69个家族、1569个训练MLP,架构遵循ARC白盒估计挑战赛第一阶段规范,提供完整训练溯源。该数据集填补了从随机权重矩传播到训练网络分析的关键空白,为白盒估计、权重空间几何与泛化理论提供了大规模受控实验平台,对推动模型动物园制图学具有奠基意义。
当前挑战
该数据集所应对的核心领域问题在于:如何从训练后的网络权重与激活中准确估计其任务属性与训练状态,即白盒估计问题。构建过程中的主要挑战包括:在深度8至64、宽度64至512的架构范围内,确保所有网络共享统一的初始化与训练协议,以支持跨家族统计比较;高斯混合任务需解析白化以匹配零假设的均值与协方差,同时保留非高斯高阶矩作为残差记录;大规模训练需管理20k至200k步预算、多种学习率与权重衰减臂,并维持每个配置16至32个种子的可复现性;此外,跨69个家族的权重与激活普查需设计稳健的统计基线,以区分训练效应与随机涨落。
常用场景
经典使用场景
在深度神经网络可解释性研究中,训练后网络的权重统计规律与初始化分布之间的关联始终是核心议题。MZC-Corpus构建了一个涵盖69个家族、1569个已训练多层感知机的网络群体,每个网络均附带完整的训练溯源信息与权重快照,从而为经典使用场景——即在受控架构下系统性地刻画训练过程对权重矩的影响——提供了坚实的经验基础。研究者可借此语料库,在统一参考架构下比较不同宽度、深度及任务复杂度下训练网络的权重统计行为,进而验证或修正随机权重矩传播理论在训练后的适用边界。
解决学术问题
该数据集直面学术研究中长期存在的可复现性与统计功效双重困境:单一训练网络难以区分架构效应与随机种子效应,而跨研究比较又常因训练细节缺失而失效。MZC-Corpus通过提供每个网络的精确贝叶斯准确率、验证轨迹、优化器超参数及初始化权重,使得研究者能够将训练后权重的矩变化与任务可学习性、泛化性能进行严格关联分析。其意义在于,将随机矩阵理论与深度学习实践之间的经验鸿沟转化为可量化、可复现的统计推断问题,为训练动力学理论提供了大规模基准。
衍生相关工作
自公开发布以来,MZC-Corpus已催生多项后续研究,包括基于其权重普查数据扩展的随机权重矩传播理论修正工作,以及利用其分析模块中的零基线轨迹验证训练网络状态演化的实证论文。配套论文《Task rank is imprinted in the input layer》直接依托该语料库揭示了任务秩与输入层权重结构的关联,而代码仓库中的训练与再下载工具亦被其他研究者用于构建类似受控网络群体。这些衍生工作共同强化了该数据集作为训练网络统计研究基础设施的地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务