遇见数据集

aicrowd/whestbench-ci-fixture

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

WhestBench是一个用于白盒激活估计的基准测试数据集。具体任务是在给定小型ReLU多层感知机(MLP)的权重和严格的浮点操作(FLOP)预算下,预测当网络输入标准高斯分布时每个神经元的平均后激活值。这是WhestBench 2026评估数据集,包含100个MLP,分为两个分割:公开分割(50个MLP)用于公共排行榜实时评分,保留分割(50个MLP)用于私有/最终排行榜,分数仅在轮次结束时公布。每个MLP数据包括权重、真实激活均值、最终层均值、平均方差等列,用于评估估计器的性能。数据集宽度为256,深度为8,每个MLP使用1,024个蒙特卡洛样本计算真实值。

WhestBench is a benchmark for white-box activation estimation: given the weights of a small ReLU multi-layer perceptron (MLP) and a strict floating-point-operation (FLOP) budget, predict the average post-activation value of every neuron when the network is fed standard Gaussian inputs. This is the WhestBench 2026 Evaluation Dataset, containing 100 MLPs with two disjoint splits: public split (50 MLPs) for real-time scoring on the public leaderboard, and holdout split (50 MLPs) for the private/final leaderboard revealed at the conclusion of the round. Each MLP includes columns such as weights, ground-truth activation means, final-layer means, average variance, etc., for evaluating estimator performance. The dataset has a width of 256, depth of 8, and uses 1,024 Monte Carlo samples per MLP for ground truth computation.

提供机构:
aicrowd
搜集汇总
数据集介绍
构建方式
WhestBench 2026 评估数据集以白盒激活估计为核心任务,通过精心设计的蒙特卡洛模拟方式构建。每个多层感知器(MLP)包含宽度为 256、深度为 8 的无偏置全连接层,权重按 He 初始化从正态分布中独立采样。对于每一组权重,数据集利用 1,024 个独立标准高斯输入样本进行前向传播,计算每个神经元在 ReLU 激活后的经验均值作为真实标签。计算过程采用 float64 累加以保证数值稳定性,最终降采样至 float32 存储。全部 MLP 被划分为公共(public)和保留(holdout)两个互斥子集,分别用于实时排行榜和最终评估,确保了评估的公平性与竞赛的完整性。
特点
该数据集的核心特色在于其白盒设定与精细化的多层信息记录。每一行对应一个完整 MLP,包含权重矩阵、逐层神经元激活均值、最终层输出均值以及最终层平均方差等八列信息,其中真实标签由高精度蒙特卡洛方法直接计算得出。数据集设计了明确的 FLOP 预算约束,并提供了详细的 FLOP 使用记录作为溯源信息。通过显式种子协议(seed_protocol v3.0)确保了每个 MLP 的可复现性,训练与评估协议向后兼容,同时支持基于 Hugging Face Datasets 或专用 whestbench 库的灵活加载方式。
使用方法
研究人员可通过多种途径接入本数据集。利用 Hugging Face Datasets 库可直接加载公共或保留子集的 parquet 格式文件,在 Python 环境中便捷获取 MLP 的各项指标。对于更严格的应用场景,可安装 whestbench 库以获取 schema 验证及元数据访问等增强功能,并通过迭代器逐一处理各 MLP 的结构化数据。命令行工具 whest run 支持将自定义估计器与数据集直接对接,自动化执行评估流程。此外,数据集提供了种子导出与重烘焙脚本,允许用户在本地精确复现原始数据,这对算法调试与复现研究至关重要。
背景与挑战
背景概述
WhestBench 2026是由Alignment Research Center(ARC)与AIcrowd于2026年联合创建的基准数据集,旨在推动白盒神经网络激活估计研究。其核心研究问题聚焦于:在给定小型ReLU多层感知器(MLP)权重与严格浮点运算(FLOP)预算的条件下,精确预测网络在标准高斯输入下每一神经元的平均后激活值。该数据集包含100个MLP实例,划分为public与holdout两个子集,分别为实时排行榜与最终排名提供评估依据。作为白盒估计领域的开创性基准,WhestBench 2026为理解神经网络内部表征、优化计算资源分配及提升可解释性提供了标准化测试平台,对人工智能安全、模型审计与高效推理等方向具有深远影响。
当前挑战
该数据集解决的领域问题在于神经网络激活分布的高效精确估计,这一任务传统上依赖耗时的蒙特卡洛模拟,而白盒估计要求在不访问原始输入的情况下,仅凭权重与计算预算完成预测,对算法的统计效率与计算鲁棒性构成严峻考验。构建过程中面临多重挑战:一是需在10^9次蒙特卡洛采样量级上确保均值估计的标准误差远低于可分辨阈值(约3×10⁻⁵),同时维持计算资源可控;二是权重初始化采用He分布,网络无偏置且仅含ReLU激活,结构虽简却需严格消除随机性对可重复性的干扰;三是需设计多协议种子管理(如显式逐MLP种子)以保证跨平台、跨后端的位精确性,并记录完整的FLOP核算以支持公平评估。
常用场景
经典使用场景
WhestBench 2026数据集专为白盒激活估计这一前沿研究领域而精心设计。在深度神经网络的解释性与可预测性探索中,该数据集提供了一个标准化的评估框架:给定一个小型ReLU多层感知机(MLP)的权重参数,以及一个严格的浮点运算(FLOP)预算,研究者需要预测每个神经元在标准高斯输入下的平均后激活值。这一设定完美地模拟了在资源受限条件下对神经网络内部状态进行精确推断的挑战,成为衡量各种估计器性能的黄金标杆。
解决学术问题
该数据集直击神经网络统计特性估计中的核心学术难题——如何在有限计算预算下,从权重出发准确预测网络的激活统计量。它解决了传统蒙特卡洛方法计算成本过高的问题,推动了白盒分析与可解释性研究的前沿发展。通过提供包含公共与保留两个分片的标准测试集,该数据集确保了评估的公平性与可复现性,其深远意义在于为开发高效、低误差的神经网络激活估计器奠定了坚实基础,进而深化了我们对深度网络正向传播行为本质的理解。
衍生相关工作
围绕WhestBench 2026数据集已衍生出一系列典范性的研究工作。其中,结合计算图剖析和线性化理论的估计方法,利用权重矩阵的谱特性来逼近激活均值,展现了理论驱动型解决方案的优雅之处。另一类代表性工作则借鉴了时序信号处理中的算法,如基于确定性采样的低差异序列方法,在极低的FLOP预算下实现了令人瞩目的估计精度。这些工作不仅验证了数据集的挑战价值,更共同勾勒出神经网络统计估计领域的最新进展图景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务