遇见数据集

aicrowd/whestbench-smoke-mlp

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

WhestBench 2026: ARC White-Box Estimation Challenge数据集是一个用于白盒激活估计的基准测试。具体来说,给定一个小型ReLU多层感知机(MLP)的权重和严格的浮点操作(FLOP)预算,目标是预测当网络输入为标准高斯分布时,每个神经元的平均后激活值。该数据集是WhestBench 2026的训练集,包含预构建的MLP及其通过蒙特卡洛方法计算的真实激活统计信息。每个数据行代表一个MLP,包括权重、每层真实均值(基于1,024个独立高斯输入样本计算)、最终层方差标量(作为诊断来源)和每个MLP的种子(用于确保可重复性)。数据集用于挑战赛,参与者需实现预测方法以估计所有层的均值,并在严格的计算预算下优化最终层的均方误差。数据集还包括模式详细信息、生成方法(使用蒙特卡洛模拟,生产版本使用10^9个样本以确保低误差)、数据集摘要(如1个MLP、宽度256、深度8)以及可重复性和引用信息。

WhestBench 2026: ARC White-Box Estimation Challenge Dataset is a benchmark dataset for white-box activation estimation. Specifically, given the weights of a small ReLU-based multi-layer perceptron (MLP) and a strict floating-point operations (FLOP) budget, the task is to predict the average post-activation value of each neuron when the network input follows a standard Gaussian distribution. This dataset is the training set of WhestBench 2026, which contains pre-built MLPs and their ground-truth activation statistics calculated via the Monte Carlo method. Each data row represents an MLP, including its weights, the ground-truth mean of each layer (calculated based on 1,024 independent Gaussian input samples), the final-layer variance scalar for diagnostic purposes, and the random seed of each MLP to ensure reproducibility. This dataset is designed for the challenge, where participants are required to implement prediction methods to estimate the mean values of all layers, and optimize the mean squared error (MSE) of the final layer under the strict computational budget. The dataset also includes detailed information on data patterns, generation method (utilizing Monte Carlo simulation, with 10^9 samples used in the production version to ensure low estimation error), dataset summaries (e.g., an MLP with width 256 and depth 8), as well as reproducibility and citation information.

提供机构:
aicrowd
搜集汇总
数据集介绍
aicrowd/whestbench-smoke-mlp 数据集图片
构建方式
WhestBench-Smoke-MLP数据集专为ARC白盒估计挑战赛设计,聚焦于小规模ReLU多层感知器(MLP)的激活值估计任务。数据集通过蒙特卡洛方法构建,对每个MLP独立采样1,024个标准高斯输入,前向传播后计算每层神经元的平均后激活值作为真实标签。每个样本包含网络权重、逐层均值、最终层均值、方差标量及随机种子,权重采用He初始化从正态分布中抽取,网络无偏置项且无独立线性输出层,每层权重矩阵后均接ReLU激活函数。数据集仅包含一个训练样本,网络宽度为256,深度为8层,旨在为参赛者提供轻量级验证环境。
特点
该数据集的核心特点在于其严谨的统计设计与可复现性。所有真实标签通过双精度浮点数累加计算,确保数值稳定性,最终降为单精度存储,蒙特卡洛采样步长控制在内存安全范围内。数据集配套了详细的FLOP预算跟踪机制,参赛者需在严格的计算预算内(初始预算为6.8×10¹⁰ FLOPs)完成估计,评分函数融合最终层均方误差与预算使用效率,鼓励高效算法设计。此外,数据集提供了种子协议版本3.0,支持通过种子列表精确复现数据生成过程,双后端(flopscope与torch)在特定配置下可达到比特级精确一致性。
使用方法
用户可通过HuggingFace Datasets库直接加载数据集,调用load_dataset函数指定仓库名称与版本号即可获取训练拆分。更推荐的方式是使用WhestBench工具包,该包提供了架构验证与元数据访问功能,支持按行遍历MLP对象并获取权重、种子等核心属性。参赛者需实现一个包含predict方法的估计器类,输入MLP对象与预算值,返回维度为[depth, width]的估计均值数组,系统通过flopscope工具追踪计算开销,超预算或输出异常时该MLP的预测将被置零且不享受计算折扣。详细示例与提交流程可参考官方Starter Kit仓库。
背景与挑战
背景概述
WhestBench-Smoke-MLP数据集由Alignment Research Center(ARC)与AIcrowd于2026年联合创建,旨在解决神经网络白盒激活估计这一前沿研究问题。该基准测试聚焦于通过给定的ReLU多层感知器(MLP)权重,在严格的浮点运算(FLOP)预算约束下,预测每个神经元在标准高斯输入下的平均后激活值。作为WhestBench 2026挑战的训练数据集,它提供了与蒙特卡洛计算出的真实激活统计数据配对的MLP实例,为评估各类估计器的性能提供了标准化平台。该数据集的发布推动了神经网络可解释性与资源受限环境下的模型分析研究,在机器学习社区中具有重要影响力。
当前挑战
该数据集所解决的核心领域挑战在于,如何在极低的计算预算下(每个MLP仅约6.8×10¹⁰ FLOPs)准确估计深层神经元的激活统计量,这要求参与者开发超越简单蒙特卡洛采样的高效分析方法。数据集构建过程中面临的挑战包括:需要在有限采样次数(N=1024)下获得足够精确的真实值,确保不同批次的MLP权重初始化具有统计一致性,以及实现跨后端(flopscope与torch)的比特级可复现性。此外,设计能够严格追踪计算消耗的机制,并建立统一的评分规则来平衡预测精度与计算效率,也是构建过程中的重要技术挑战。
常用场景
经典使用场景
WhestBench Smoke MLP数据集专为白盒神经网络激活值估计任务而设计,其核心场景是评估和开发能够在给定网络权重和严格浮点运算预算条件下,准确预测多层感知机各神经元平均后激活值的算法。该数据集包含一个宽度为256、深度为8的ReLU MLP,其权重遵循He初始化,输入服从标准高斯分布,并提供通过蒙特卡洛方法计算得到的真实后激活均值作为基准。研究者可在此框架下,基于精确的FLOP计数机制,测试各类估计器在有限计算资源下的预测精度与效率,从而推动对神经网络内部计算过程的理解与建模。
实际应用
在实际应用中,该数据集的估计方法可广泛服务于需要快速表征神经网络行为但计算资源有限的场景,例如边缘设备上的模型部署前验证,通过在低FLOP预算内预测激活均值来估计模型的稳定性与泛化边界。此外,该方法可用于高效监控大规模训练过程中的神经元激活模式,辅助识别异常或退化单元,从而优化模型架构。在自动化机器学习领域,白盒估计器可作为轻量级代理,在不运行完整前向传播的前提下评估候选网络的统计特性,加速架构搜索与超参数调优过程。
衍生相关工作
围绕该数据集已衍生出一系列代表性工作,包括基于蒙特卡洛直接采样的基线估计器、利用均值传播假设的确定性近似方法,以及结合协方差传播的高阶分析技术。更进一步的组合估计器策略则通过预算分配在低层与高层之间权衡计算资源,展示了在固定FLOP约束下提升整体精度的可能性。这些工作不仅构成了竞赛的标准基线,也为后续研究提供了可比较的出发点,催生了如FLOP追踪工具flopscope、交互式MLP探索器等辅助工具,促进了白盒神经网络分析工具生态的繁荣。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务