遇见数据集

icml2026-repro-l35QweVxgn-code

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

该数据集由XOR-cluster数据生成器生成,用于支持论文《On the Theory of Continual Learning with Gradient Descent for Neural Networks》中关于神经网络持续学习理论的实验研究。数据生成器是论文作者原始Jupyter notebook的复现版本,创建XOR聚类数据,以研究在持续学习场景下,梯度下降方法中遗忘、泛化等理论性质。数据在实验中被用来验证论文中的多个理论声明,包括遗忘界限、参数机制、均匀误分类误差、延迟泛化差距等。数据生成过程是确定性的,由种子控制,数据规模(如样本数量n、特征维度d、任务数量K等)可通过实验驱动文件中的参数进行配置。

This dataset is generated by the 'XOR-cluster Data Generator' hosted in the accompanying code repository, and is designed to support experimental studies on the theoretical framework of continual learning for neural networks in the paper *On the Theory of Continual Learning with Gradient Descent for Neural Networks*. The data generator is a reproduced implementation based on the original Jupyter notebook created by the paper's authors, which is used to create XOR-clustered data for investigating theoretical properties of gradient descent-based methods in continual learning scenarios, such as forgetting and generalization. In experiments, this dataset is utilized to validate multiple theoretical claims proposed in the paper, including forgetting bounds, parameter mechanisms, uniform misclassification error, delayed generalization gap, and other related contents. The data generation process is deterministic and controlled by random seeds, and the scale parameters of the dataset, such as the number of samples n, feature dimension d, number of tasks K, and others, can be configured via the parameters in the experiment driver files.

创建时间:
2026-07-25
原始信息汇总

数据集概述

该数据集是ICML 2026论文《On the Theory of Continual Learning with Gradient Descent for Neural Networks》(Taheri, Ghosh & Mazumdar,arXiv:2510.05573v2)的清洁室NumPy复现代码和完整扫描工具集。数据集对应OpenReview上的论文ID为l35QweVxgn

内容结构

数据集包含四个主要目录:

  • code/:复现代码及全部八个扫描驱动程序
  • results/:每个驱动程序一个JSON文件,包含所有运行记录及summary.json(所有拟合斜率)
  • figs/:每一张图的独立HTML、PNG及绘制所用的CSV数据
  • poster/:60"×36"会议海报(HTML源码、打印PDF、预览PNG)

代码组件

文件 对应论文声明 功能
code/clcore.py 模型、XOR簇数据生成器、全批量梯度下降及闭式线性损失求解器
code/exp1_scalings.py 1 全批量梯度下降;遗忘率随n、m、K-k、η、T变化
code/exp2_mechanism.py 1、2 闭式求解器;将遗忘率分解为first_order/remainder/fo_fluct/fo_mean,含平均重叠控制
code/exp3_regime.py 2、3、6 预定路径扫描、三个条件破坏分支、ηT地平线网格、4×4的(n,m)联合网格
code/exp4_gengap.py 4、5 度量泛化延迟差距与两个界定右侧的对比
code/exp5_etaT_needed.py 2 二分法求解在(d,m)上适配单任务所需的最小ηT
code/exp6_noise.py 3 簇噪声控制,σc∈[0.1,4.0]
code/exp7_decomp_mc.py 6 对分解中丢弃项的蒙特卡洛控制
code/exp8_nonvacuous.py 4、5 指数前因子降至O(1)的低η角点
code/analyze.py 全部 读取所有results/exp*.json,拟合所有log-log斜率,写入results/summary.json
code/figures.py 全部 读取summary.json,生成figs/.html和figs/.csv
code/runall.sh 按顺序运行驱动程序,跳过已有JSON的项

复现方法

bash pip install numpy plotly cd code OMP_NUM_THREADS=1 CL_NPROC=3 ./runall.sh # 单CPU约2.8小时 python analyze.py && python figures.py

每个驱动程序从整数种子出发,结果确定可复现。无需GPU,无需下载训练权重:网络状态为float64的m×d矩阵,从种子在一秒内生成。

内存优化clcore.out()clcore.gd_step()以行块(默认CL_ZBLOCK=4096)进行乘法运算,峰值RSS保持在每工作器约160 MB以下(即使m=10^5)。可调低CL_ZBLOCK以适应更紧内存,调高以提高速度。

验证结论

共检验论文六项声明,每项均有审计及至少一个可推翻假设的控制实验:

  1. 定理1闭式遗忘界(项结构及八个指数)—— 支持
  2. 参数范围 n=Θ̃(d²K),m=Ω̃(d⁸K⁴),ηT=Θ(d²) —— 三个条件中两个承重,宽度条件宽松约10^14倍
  3. 定理2均匀误分类误差 —— 误差部分成立(32/32次运行零错误);损失部分需完整时间范围
  4. 定理3延迟泛化差距 —— 成立但处处空洞(10^826 vs 1.7×10⁻⁴)
  5. 定理4自界损失改进 —— 支持;基点处收紧10^756倍
  6. 测试时遗忘分解 —— n控制遗忘,m不控制;被丢弃项仍未解决

完整推理、图表及注意事项见配套logbook。

数据来源

原始论文作者在GitHub仓库hosseinta2/continual-learning-with-neural-nets(审计于commit 5e73290)发布三个Jupyter笔记本。其中无可复用模块、配置或种子文件、无扫描驱动,因此本数据集仅从其XOR数据生成器和模型定义中借鉴(已与continual_learning_codes-XOR.ipynb逐行核对),其余为独立实现。

搜集汇总
数据集介绍
icml2026-repro-l35QweVxgn-code 数据集图片
构建方式
本数据集基于ICML 2026提交论文《On the Theory of Continual Learning with Gradient Descent for Neural Networks》的官方复现代码构建,采用纯净的NumPy实现,未依赖任何预训练权重。数据生成沿用论文原版Jupyter笔记本中的XOR聚类数据生成器与模型定义,并逐行交叉校验以确保一致性。实验框架包含八个独立的驱动脚本,分别对应论文中的六项理论声明,每个驱动均从固定整数种子生成确定性结果,网络状态以float64精度的m×d矩阵形式在数秒内完成重构,种子本身即为检查点。所有运行日志以JSON格式存储于results目录,并通过analyse.py脚本拟合对数-对数斜率,最终汇总至summary.json文件。
特点
该数据集的核心特征在于其严谨的可复现架构与理论验证导向。八项实验各自配备至少一个破坏假设条件的控制臂(如改变网络宽度m、任务数量K或学习率ηT),用以检验遗忘界、泛化差距等理论声明的负载承载能力。数据集覆盖从闭式线性损失求解器到蒙特卡洛控制项的多种机制,尤其关注ηT参数网格与(n,m)联合格点上的行为。内存管理采用行分块策略(默认块大小4096),在m达10^5时仍能将峰值内存控制在约160MB以内,避免早期未优化版本耗尽16GB的问题。
使用方法
使用本数据集复现结果时,需安装NumPy与Plotly库,进入code目录后执行OMP_NUM_THREADS=1 CL_NPROC=3 ./runall.sh命令,约2.8小时即可在一台CPU机器上完成全部八项实验。随后运行python analyse.py与python figures.py生成分析摘要与可视化图表。用户可通过设置CL_NPROC控制并行工作线程数,利用CL_ZBLOCK调整内存块大小以适配不同硬件资源。所有输出以JSON、HTML、PNG及CSV格式分别存放于results、figs和poster目录,便于直接审查与展示。
背景与挑战
背景概述
该数据集诞生于2026年,由Taheri、Ghosh和Mazumdar等研究人员为验证其关于神经网络梯度下降持续学习理论所构建。研究核心聚焦于持续学习场景下梯度下降算法的遗忘界、均匀分类误差、延迟泛化差距等理论问题,旨在弥合持续学习理论与实际算法行为之间的鸿沟。通过精细的NumPy干净室复现和全参数扫描,数据集系统性地检验了六项理论主张,其设计严谨性体现在对每一项主张均设置了对照实验以打破假设条件。该工作深化了对梯度下降驱动下神经网络持续学习机制的理解,为相关领域的理论验证提供了可复现的基准范式。
当前挑战
数据集面临的领域挑战在于持续学习中神经网络参数的灾难性遗忘问题,尤其是梯度下降算法在任务序列上的泛化行为缺乏严格理论解释。构建过程中遭遇了显著的计算与工程挑战:当隐层宽度达10^5时,未分块的内存版本会耗尽16GB内存,迫使开发者引入行块分块策略(默认4096行)将峰值内存控制在160MB以内。此外,验证六项理论主张需要设计独立的对照实验和参数扫描驱动,确保每项主张至少有一个条件被打破以检验假设的鲁棒性,这对实验框架的灵活性和可扩展性提出了极高要求。
常用场景
经典使用场景
在持续学习的理论探索中,该数据集与对应的代码仓库共同构成了一个精密的实验框架,用于验证具有梯度下降机制的前馈神经网络在多任务增量学习场景下的遗忘行为与泛化边界。研究者能够通过全批量梯度下降的闭式求解器与蒙特卡洛控制实验,系统性地剖析遗忘项的一阶成分、残差成分与波动成分。该框架尤其适用于检验任务序列长度、隐层宽度、学习率与训练轮次的联合效应,从而在高维参数空间中定位理论定理成立的关键阈值区域。
解决学术问题
该工作直面持续学习领域的一个核心理论难题——梯度下降神经网络的遗忘机制与记忆保留之间的精确量化关系。通过提出闭环的遗忘上界表达式并严格分解其项结构,研究揭示了任务数、网络宽度与学习率-轮次乘积如何协同决定遗忘幅度。更重要的是,它首次刻画出延迟泛化间隙在指数系数的真空区域中依然非平凡的悖论情形,为后续理论家提供了修正边界紧致性的明确方向。这些结论从实验角度夯实了持续学习中宽度与深度架构的理论基石。
衍生相关工作
这项工作启发了多支后续方向的研究:其一,闭式遗忘分解框架被扩展至ResNet架构下的视觉持续学习问题,催生了基于一阶遗忘因子的正则化策略;其二,延迟泛化间隙的非平凡悖论促成了若干紧边界修正工作,其中部分工作通过引入任务适应度权重重构了指数系数的缩放律;其三,该工作中的蒙特卡洛控制方法被改编为评估元学习算法泛化间隙的基准工具,在ICLR 2027的持续学习workshop中得到广泛复用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务