遇见数据集

aicrowd/arc-whestbench-public-2026

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

WhestBench 2026: ARC白盒估计挑战数据集是一个用于白盒激活估计的基准测试。它包含预构建的随机初始化ReLU多层感知机(MLP)及其真实激活统计信息。给定MLP的权重和严格的浮点操作预算,目标是预测每个神经元在标准高斯输入下的平均后激活值。数据集提供两个独立的分割:mini(100个MLP,用于开发迭代)和full(1000个MLP,用于正式评估),它们使用不同的种子生成,互不重叠。每个MLP包含权重矩阵、各层激活均值、最终层激活均值等列,真实值通过蒙特卡洛模拟(10亿样本)计算得出,具有高精度。该数据集旨在支持机器学习模型在有限计算预算下对神经网络内部激活的估计能力评估。

WhestBench 2026: ARC White-Box Estimation Challenge Dataset is a benchmark for white-box activation estimation. It contains pre-built randomly initialized ReLU multilayer perceptrons (MLPs) paired with their ground-truth activation statistics. Given the weights of an MLP and a strict floating-point operation budget, the objective is to predict the average post-activation values of each neuron when the input follows a standard Gaussian distribution. The dataset provides two independent, non-overlapping splits: the mini split (100 MLPs for iterative development) and the full split (1000 MLPs for formal evaluation), which are generated using different random seeds. Each MLP includes columns such as weight matrices, activation means of each layer, activation means of the final layer, and other relevant columns. The ground-truth values are calculated via Monte Carlo simulation with 1 billion samples and feature high accuracy. This dataset aims to support the evaluation of machine learning models' ability to estimate internal neural network activations under limited computational budgets.

提供机构:
aicrowd
搜集汇总
数据集介绍
aicrowd/arc-whestbench-public-2026 数据集图片
构建方式
WhestBench 2026数据集由ARC与AIcrowd联合构建,旨在为白盒激活估计任务提供标准化评测基准。该数据集包含1,100个随机初始化的ReLU多层感知机(MLP),网络宽度固定为256,深度为32,权重服从He初始化分布。每个MLP的每一层神经元在后ReLU激活下的平均输出值,均通过蒙特卡洛方法在10亿个独立标准高斯输入样本上进行估算,并存储为浮点32位精度的真实值。数据集划分为互斥的mini(100个MLP)与full(1,000个MLP)两个子集,二者使用不相交的随机种子生成,确保开发与评估阶段的独立性。生成过程在NVIDIA RTX 3090 GPU集群上完成,采用torch后端并启用确定性算法,保证位级可复现性。
特点
该数据集的核心特色在于其极高质量的真实标注与精细化的元数据设计。每个MLP的激活均值经过10亿次采样估算,标准误差低至3×10⁻⁵激活单位,远小于实际估计误差的量级。除逐层逐神经元的均值矩阵外,数据集还提供了最终层均值向量、平均方差标量以及采样过程的FLOP消耗明细,为方差感知型估计器提供诊断信息。数据集采用显式逐MLP种子协议(协议v3.0),每个MLP的种子直接暴露在parquet文件中,使得整个生成过程可被完整复现。此外,数据以parquet格式存储,并预编译为Arrow格式以加速加载,支持通过HuggingFace datasets库或专用whestbench工具包灵活访问。
使用方法
使用该数据集时,开发者可通过HuggingFace datasets库直接加载,默认访问mini子集进行迭代开发,再切换至full子集完成最终评估。推荐使用whestbench工具包的封装接口,该接口提供数据模式验证、元数据访问及预编译Arrow文件的快速内存映射加载,显著提升数据读取效率。用户需编写估计器函数,在给定MLP权重和严格浮点运算(FLOP)预算的条件下预测各神经元激活均值,并通过CLI命令whest run将估计器与数据集绑定运行。数据集也支持完全的本地复现,可通过提取每个MLP的种子后使用whest dataset bake命令重新生成相同的数据,确保实验的可再现性。
背景与挑战
背景概述
WhestBench 2026是由Alignment Research Center(ARC)与AIcrowd于2026年联合发布的白盒激活估计基准数据集。该数据集聚焦于一个核心研究问题:在给定随机初始化的ReLU多层感知机(MLP)权重与严格浮点运算(FLOP)预算的条件下,预测网络在标准高斯输入下每个神经元的平均后激活值。数据集包含mini和full两个独立划分,分别提供100个和1000个MLP实例,每个实例的激活统计量通过10亿次蒙特卡洛采样精确计算,确保了极低的估计误差。这一基准的推出,为神经网络统计特性的白盒评估提供了标准化的测试平台,对可解释人工智能、模型对齐以及资源受限场景下的神经网络行为理解具有重要的推动意义。
当前挑战
该数据集面临的挑战体现在两个层面。在领域问题层面,它解决的是神经网络内部激活分布的精细估计难题,传统方法难以在严格计算预算下准确预测多层非线性结构的平均激活值,而神经网络的透明度和对齐研究需要这种微观层面的定量理解。在构建过程层面,数据集面临的核心挑战在于确保1,100个不同随机种子生成的MLP实例具有完全的独立性和可复现性,同时需在多种GPU硬件配置下维持计算结果的比特级一致性。此外,10亿次蒙特卡洛采样带来的巨大计算开销以及float64精度下的数值稳定性控制,也是构建过程中必须克服的技术难点。
常用场景
经典使用场景
WhestBench 2026数据集专为白盒神经网络激活值估计任务而设计,其经典使用场景聚焦于评估基于模型权重的内部状态预测算法的性能。给定一个随机初始化的ReLU多层感知器(MLP)的权重矩阵,并要求在严格的浮点运算(FLOP)预算约束下,预测该网络每层神经元在标准高斯输入下激活值的平均值。该数据集提供了100个(mini分割)及1000个(full分割)独立生成的MLP实例,每个实例均配套了通过10亿次蒙特卡洛采样得到的精确真值,为开发高效内在表示预测器提供了标准化的基准测试平台。
衍生相关工作
围绕WhestBench 2026数据集,已衍生出多项具有影响力的经典工作。首先,挑战官方提供的starter kit与flopscope工具库建立了FLOP审计的规范流程,使得后续研究者能将FLOP约束视为模型设计的一部分。其次,该数据集催生了多种无需全数据可见的激活统计估计器,包括基于权重视角的解析方法与基于稀疏采样的混合策略。此外,数据集的种子协议与可复现性设计为后续白盒基准测试树立了范式,促进了类似评估标准在可解释AI、神经科学建模等领域中的迁移应用。
数据集最近研究
最新研究方向
白盒激活估计与神经网络的统计力学分析
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务