遇见数据集

fnbm-current-cocktail-dc-capacity-20260726

收藏
Hugging Face2026-07-28 更新2026-07-29 收录
官方服务:

资源简介:

该数据集名为fnbm-current-cocktail-dc-capacity-20260726,记录了FactorizedNBM(因子化神经基础模型)在容量、正则化与随机种子影响下的实验研究结果。实验重点关注模型在纯一阶合成数据上产生虚假二阶归因(即泄漏)的问题。通过系统扫描超参数组合,包括交互特征L2惩罚(取值1e-4和1e-2)、交互上下文直流惩罚(取值0、1e-4、1e-3、1e-2)、滤波器变换层容量(配置为1x32、2x64、2x128)以及4个随机种子(0-3)。模型在ten-motif纯一阶无噪声数据上训练101个周期,并在第50周期激活二阶组件。数据集包含71行(覆盖72种可能组合中的71种)和20列,分为实验配置参数(如seed, ifl2, dc, hn, hs, cap)和性能评估指标。关键指标包括周期49和100的验证集均方误差(val_mse)和皮尔逊相关系数(val_r)、一阶归因与真实值的相关性(z1corr)、泄漏度量(leak_100)、上下文直流分量(dc_raw_max, dc_raw_100)、二阶贡献幅度(o2_raw_100)、移位重复核对数(n_red)、恢复的真实模体数量(n_rec)以及功能滤波器数量(n_func)。该数据集适用于分析神经网络容量对训练稳定性(种子鲁棒性)的影响、正则化方法在控制虚假高阶交互识别上的有效性与代价,以及模型内部表示随容量变化的规律。

The dataset, named fnbm-current-cocktail-dc-capacity-20260726, documents experimental results investigating the behavior of FactorizedNBM (Factorized Neural Basis Model) under the influence of capacity, regularization, and random seeds. The study specifically addresses the issue of spurious second-order attribution (i.e., leakage) when the model is trained on pure first-order (no second-order signals) synthetic data. It systematically scans hyperparameter combinations, including interaction feature L2 penalty (values: 1e-4 and 1e-2), interaction context DC penalty (values: 0, 1e-4, 1e-3, 1e-2), filter transformation layer capacity (configurations: 1x32, 2x64, 2x128), and four random seeds (0-3). The model is trained for 101 epochs on ten-motif pure first-order noiseless data, with second-order components activated at epoch 50. The dataset comprises 71 rows (covering 71 out of 72 possible combinations) and 20 columns, categorized into experimental configuration parameters (e.g., seed, ifl2, dc, hn, hs, cap) and performance evaluation metrics. Key metrics include validation mean squared error (val_mse) and Pearson correlation coefficient (val_r) at epochs 49 and 100, correlation of first-order attribution with ground truth (z1corr), leakage measure at epoch 100 (leak_100, with ground truth gt_leak_100 always 0), peak and final values of context DC components (dc_raw_max, dc_raw_100), raw magnitude of second-order contributions (o2_raw_100), logarithm of shifted repeated kernels (n_red), number of recovered true motifs (n_rec), and number of functional filters (n_func). This dataset is suitable for analyzing how neural network capacity affects training stability (seed robustness), the effectiveness and cost of regularization methods (L2 penalty and DC penalty) in controlling spurious high-order interaction identification, and the patterns of model internal representations (such as filter redundancy and motif recovery) as capacity varies.

创建时间:
2026-07-27
原始信息汇总

数据集概述

该数据集名为 fnbm-current-cocktail-dc-capacity-20260726,是一个关于因子化神经瓶颈模型(Factorized NBM,FNBM)中二阶泄漏、上下文直流(DC)惩罚与模型容量之间关系的仿真实验评估结果。

数据集基本信息

  • 许可协议: MIT
  • 行数: 71
  • 列数: 20
  • 实验任务: 在一阶十基序无噪声数据上(真实二阶质量严格为0)训练FNBM,在50个epoch后激活二阶,检验模型产生的虚假二阶吸收(泄漏)。
  • 实验配置: 71/72组合的“鸡尾酒”扫描,涉及 interaction_context_dc_penaltyinteraction_feature_l2filter_transform 容量以及训练种子(0-3)的网格搜索。

主要数据列说明

列名 类型 描述
seed int64 训练种子(0-3)。泄漏模式与种子高度相关:1x32/2x64下仅种子1泄漏,2x128下种子1无泄漏但种子0和2泄漏。
ifl2 float64 交互特征L2惩罚(interaction_feature_l2_penalty),扫描值 {1e-4, 1e-2}。1e-4为敏感水平,1e-2为特异性锚点。
dc float64 交互上下文DC惩罚(interaction_context_dc_penalty),扫描值 {0, 1e-4, 1e-3, 1e-2},具体取决于容量。惩罚上下文的常数分量(DC分量),该分量会将二阶伪装成一阶。
hn / hs / cap int64 / large_string 模型容量描述:每滤波器组MLP的隐藏层数(hn)和隐藏宽度(hs)。容量标签组合为1x32、2x64、2x128。
val_mse_49 / val_mse_100 float64 第49 epoch(二阶激活前纯一阶拟合)和第100 epoch(最终)的验证MSE。
z1corr_49 / z1corr_100 float64 第49和第100 epoch的一阶归因与真实值的序列级相关性。从z1corr_49到z1corr_100的下降表示一阶质量被二阶吸收。
leak_100 float64 泄漏度量sim_mean_model_z_abs_ratio):模型在二阶放置的归因质量比例。真实值严格为0(见gt_leak_100列),因此所有泄漏都是虚假的。
gt_leak_100 float64 真实二阶质量,所有行均为0.0,证明leak_100是纯泄漏。
dc_raw_max / dc_raw_100 float64 上下文DC原始分量在epoch 50-100间的最大值和最终值。未惩罚时可达~1013,dc=1e-3时抑制至~0.07。
n_red int64 第100 epoch的位移重复核对数量(归一化互相关>0.8)。中位数从1x32的8.0降至2x128的0.5,表明容量无需去相关惩罚即可抑制重复。
n_rec int64 第100 epoch的每基序一阶恢复数(10个真实基序中有多少个与某滤波器的一阶归因
n_func int64 第100 epoch的功能滤波器计数(序列级一阶贡献方差超过最活跃滤波器1%的滤波器数量)。

六大关键发现

  1. 容量是种子鲁棒性杠杆,而非拟合杠杆:大容量(2x128)不降低最优拟合,但大幅缩小种子间方差(0.00084 vs 0.016),将最差种子提升4倍。
  2. 容量重新洗牌了哪些种子泄漏: 在敏感ifl2水平下,不同容量条件下泄漏的种子不同;净特异性无增益。
  3. interaction_feature_l2=1e-2 实现全域零泄漏:在所有容量、种子和dc水平下,35/35组合均无泄漏。
  4. DC惩罚攻击正确机制但不足够:可抑制DC分量14000倍,但残留泄漏仍存在;在2x128下DC与泄漏解耦,证明存在第二条非DC吸收路径。
  5. DC惩罚不影响拟合,ifl2则显著影响: dc=1e-2的MSE几乎无变化(0.0041 vs 0.0047),而ifl2=1e-2导致MSE增加30-64%。
  6. 容量替代去相关惩罚实现重复控制: 位移重复核对数量从1x32的8.0降至2x128的0.5,且拟合质量改善;每基序恢复在1x32和2x128下均为10.00/10。

模型与超参数(生成参数)

  • 模型: FactorizedNBM,32个11长度卷积滤波器,阶数[1,2],二阶在epoch 50激活
  • 优化: lr 0.001,plateau调度,batch size 128,损失函数MSE
  • 固定惩罚: 特征NN权重L2 1e-4,卷积核L2 1e-4,输出L2 1e-3,交互核平滑惩罚1e-4,交互dropout 0.1
  • 扫描超参数: interaction_feature_l2_penalty(2个值)、interaction_context_dc_penalty(3-4个值)、filter_transform容量(3种组合)、种子(4个)
  • 输入数据: 20260713_fo_no_noise(十基序,纯一阶,无噪声)

数据加载方式

python from datasets import load_dataset dataset = load_dataset("arushram/fnbm-current-cocktail-dc-capacity-20260726", split="train")

搜集汇总
数据集介绍
fnbm-current-cocktail-dc-capacity-20260726 数据集图片
构建方式
该数据集源于对因子化神经瓶颈模型(Factorized NBM)中高阶交互可识别性的系统性探究,聚焦于模型容量、特征L2正则与上下文直流惩罚对虚假二阶归因泄漏的调控机制。实验采用纯净的一阶十基序合成数据,确保真实二阶质量严格为零。通过构建交互特征L2惩罚(1e-4与1e-2)、上下文直流惩罚(0至1e-2)及滤波器变换容量(1×32、2×64与2×128)的完全组合网格,并配合四个随机种子进行遍历,共生成71个有效配置行,每个配置记录20个维度的评估指标。
特点
该数据集以精细的归因泄漏量化为核心特点,每行提供验证集MSE、归因相关性、泄漏度量及上下文直流分量等完整指标,其中真实二阶质量始终为零,确保所有泄漏值均为模型伪迹。关键发现揭示了容量并非提升拟合精度的杠杆,而是压榨种子方差的工具;唯一的绝对安全区域存在于交互特征L2为1e-2时,在全部容量与直流惩罚下实现零泄漏。此外,数据集证明了直流惩罚虽然靶向正确机制,却无法完全消除泄漏,表明存在第二条非直流吸收路径。
使用方法
数据集可通过HuggingFace Datasets库直接加载:使用`load_dataset("arushram/fnbm-current-cocktail-dc-capacity-20260726", split="train")`即可获取全部71行记录。每行包含20个字段,涵盖训练种子、正则超参数、容量标识、验证MSE、归因相关性、泄漏量及滤波器冗余度等指标。研究者可依据`ifl2`、`dc`和`cap`列筛选特定配置,或利用`seed`列分析同一超参数组合下不同初始化的变异性,从而探索容量与正则化在控制模型虚假高阶交互中的协同与取舍关系。
背景与挑战
背景概述
该数据集创建于2026年7月26日,由研究者Arush Ram等人基于因子化神经瓶颈模型(Factorized Neural Bottleneck Model, FNBM)构建,聚焦于可解释性深度学习中的序间吸收(absorption)与泄漏(leakage)问题。核心研究问题在于探究模型容量(capacity)、交互特征L2惩罚(interaction_feature_l2_penalty)以及上下文直流分量惩罚(interaction_context_dc_penalty)如何影响高阶特征归因的虚假性。数据集通过十基序(ten-motif)、纯一阶无噪声模拟数据,在无真实二阶信号背景下系统评估模型二阶归因的泄漏行为。该成果为理解可解释性模型中的归因特异性提供了关键经验基准,推动了归因机制分析与正则化策略的发展。
当前挑战
领域层面的核心挑战在于序间吸收导致的归因泄漏:当FNBM模型在训练后期激活二阶特征时,一阶归因质量骤降,模型将本应属于一阶的归因质量分配给虚假的二阶路径,破坏了归因的可信性。构建过程中,数据集系统揭示了容量膨胀虽能压平种子间的拟合方差,却无法保证泄漏抑制的泛化性,反而重新分配哪些种子会发生泄漏;仅当交互特征L2惩罚设定至1e-2时,才能在所有容量下消除泄漏。此外,直流惩罚虽能强力抑制上下文直流分量(压缩达14000倍),却无法根除泄漏,证实存在第二条非直流的吸收路径,且容量在抑制冗余卷积核方面无需额外去相关惩罚即可发挥作用。
常用场景
经典使用场景
该数据集专为探究因子化神经瓶颈模型(FactorizedNBM)在高阶交互识别中的吸收现象而设计,其核心应用场景在于系统性剖析模型容量、直流通分量惩罚与特征L2正则化对二阶交互泄漏的协同调控机制。通过在纯一阶十基序无噪声仿真数据上引入容量尺度(1x32、2x64、2x128)与正则化超参数的网格化扫描,研究者得以精确量化模型在二阶通道路径激活后产生的虚假归因质量,并分离容量扩展对拟合性能与种子鲁棒性的差异化影响。
实际应用
在生物序列基序发现、药物分子相互作用预测及时间序列因果推断等需要精准归因的领域,该数据集所揭示的泄漏调控规律可直接指导模型架构选择与正则化策略的工程实践。例如,在转录因子结合位点识别任务中,采用2x128容量配合1e-2特征L2惩罚可同时获得低泄漏、高基序恢复率(10.00/10)与极小的移重复核对(0.5),而无需依赖解相关惩罚。这为实际部署时平衡模型表现力与解释可信度提供了量化依据。
衍生相关工作
该数据集的研究发现直接催生了多条后续探索路径:基于直流惩罚与容量联合调控的最优吸收抑制策略已被应用于后续的噪声背景与多阶交互叠加实验;证实存在的非直流吸收路径激发了设计新型结构正则化项(如上下文均值正则化与路径解耦约束)的理论工作;容量作为种子鲁棒性杠杆的发现推动了自适应容量调度算法的开发,使得模型在训练过程中能够根据泄漏检测信号动态调整参数规模,从而在无监督条件下维持归因可靠性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务