遇见数据集

HSNNM

收藏
Hugging Face2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

HSNNM(Hebbian稀疏神经网络模型)数据集与一篇研究论文相关联,该论文提出了一种用于Transformer层的高效、稀疏前馈替代方案。该模型旨在通过稀疏前馈网络设计探索效率与准确性之间的权衡,其核心设计包括top-1叶路由、k-Winners-Take-All(k-WTA)叶内稀疏性、局部Hebbian强度调制规则以及net2net风格的结构增长机制。实验使用TinyStories数据集的10%切片进行训练,模型参数为733万个。结果显示,与密集基线相比,每处理一个令牌的浮点运算次数减少了49.6%(从1425万次降至718万次),验证准确率下降了3.4个百分点(从79.45%降至76.06%)。此外,消融压力测试表明Hebbian机制和k-WTA稀疏性与相对较低的灾难性遗忘相关。数据集主要面向文本生成任务,内容语言为英语,涉及研究主题包括Transformer架构、Hebbian学习、稀疏神经网络、高效人工智能、net2net方法和k-WTA。数据集规模较小(样本数少于1K),采用CC BY 4.0许可证。

HSNNM (Hebbian Sparse Neural Network Model) dataset is associated with a research paper that proposes an efficient, sparse feed-forward alternative for Transformer layers. This model aims to explore the trade-off between efficiency and accuracy through sparse feed-forward network design, with its core designs including top-1 leaf routing, k-Winners-Take-All (k-WTA) intra-leaf sparsity, local Hebbian strength modulation rules, and a net2net-style structural growth mechanism. The experiments were trained using a 10% slice of the TinyStories dataset, with the model having 7.33 million parameters. The results demonstrate that compared to the dense baseline, the floating-point operations per processed token decreased by 49.6% (from 14.25 million to 7.18 million), while the top-1 validation accuracy dropped by 3.4 percentage points (from 79.45% to 76.06%). Additionally, ablation stress tests reveal that the Hebbian mechanism and k-WTA sparsity are correlated with relatively low catastrophic forgetting. This dataset is primarily targeted at text generation tasks, with content in English, covering research topics including Transformer architectures, Hebbian learning, sparse neural networks, efficient artificial intelligence, net2net methods, and k-WTA. The dataset has a small scale with fewer than 1,000 samples, and is licensed under CC BY 4.0.

创建时间:
2026-07-09
原始信息汇总

数据集概述

数据集名称: HSNNM: A Sparse, Dynamically Routed Feed-Forward Alternative for Transformer Layers

许可证: CC-BY-4.0

语言: 英文

任务类别: 文本生成

数据集大小: n<1K(少于1000个样本)

标签: paper, transformer, hebbian-learning, sparse-neural-networks, efficient-ai, net2net, kwta

作者: Kastiel Tjuandra

DOI: 10.5281/zenodo.21271668

GitHub: 可访问Zenodo页面获取链接


摘要

该文档描述了一种名为Hebbian稀疏神经网络模型(HSNNM) 的Transformer前馈层替代方案。该方案用一组稀疏、竞争性路由的子网络(称为"lobes")替换标准稠密子层。设计结合了以下机制:

  • top-1 lobe路由
  • k-Winners-Take-All(k-WTA)intra-lobe稀疏性
  • 局部Hebbian强度调制规则
  • net2net风格的结构增长机制

在基于TinyStories数据集10%切片训练的7.33M参数模型上,HSNNM相较于匹配的稠密基线模型(14.25M FLOPs/token vs 7.18M FLOPs/token),每个token的FLOPs减少了49.6%,但验证准确率下降了3.4个百分点(76.06% vs 79.45%)。

在5,000步压力测试的消融实验中,Hebbian机制和k-WTA稀疏性与不含这些机制的变体相比,表现出较低的灾难性遗忘,但该比较使用了与主要结果不同的评估协议,应视为提示性而非结论性。

这些结果作为小规模计算跳过型稀疏FFN设计在效率-准确率权衡上的一个数据点被报告,同时附带其局限性。


引用

bibtex @misc{tjuandra2026hsnnm, title={HSNNM: A Hebbian Sparse Neural Network Model for Efficient Transformer Learning}, author={Tjuandra, Kastiel}, year={2026}, publisher={Zenodo}, doi={10.5281/zenodo.21271668} }

搜集汇总
数据集介绍
HSNNM 数据集图片
构建方式
HSNNM数据集的构建围绕一种稀疏、动态路由的前馈神经网络架构展开,旨在替代Transformer层中的标准稠密子层。该模型通过一组称为“lobes”的竞争性子网络实现路由机制,其中输入被路由至top-1选择的子网络,并在子网络内部采用k-Winners-Take-All(k-WTA)策略以维持稀疏激活。结合局部Hebbian强度调制规则和net2net式的结构增长机制,数据集记录了在TinyStories数据集的10%子集上训练一个7.33M参数模型的过程,并与匹配的稠密基线进行比较,收集了FLOPs、验证准确率以及遗忘实验等关键指标。
特点
HSNNM数据集的核心特点在于其高效性与稀疏性。相比稠密基线,该模型在每次token推理时减少了49.6%的FLOPs(7.18M对比14.25M),仅以3.4个百分点的验证准确率下降为代价。此外,数据集包含消融实验的结果,表明Hebbian机制与k-WTA稀疏性在5000步压力测试中与较低的灾难性遗忘相关。整个数据集规模小于1K个样本,专注于小规模计算-精度权衡的探索,适合作为稀疏前馈网络设计的研究基准。
使用方法
该数据集适用于文本生成任务,使用英语作为语言载体,并可结合transformers库进行加载。用户可通过HuggingFace平台直接访问数据集,并参照提供的DOI和GitHub链接获取模型复现细节。使用时需注意其小规模特征,适合作为验证稀疏路由和Hebbian学习机制的实验平台。建议在训练时采用TinyStories数据集进行微调,并根据任务需求调整路由选择与稀疏度参数,以平衡效率与性能。
背景与挑战
背景概述
在深度学习领域,Transformer架构凭借其强大的序列建模能力在自然语言处理任务中占据主导地位,但其前馈子层中的密集计算导致了高额的运算成本与能耗,成为制约模型在资源受限场景部署的关键瓶颈。为探索更高效的替代方案,Kastiel Tjuandra于2026年提出了HSNNM(Hebbian Sparse Neural Network Model),该数据集源自其在Zenodo上发布的论文,旨在提供一种稀疏、动态路由的前馈层设计。HSNNM采用Hebbian学习规则与k-Winners-Take-All稀疏机制,结合net2net结构增长策略,在参数量为7.33M的模型上相较于同等规模密集基线实现了49.6%的FLOPs削减,仅以3.4个百分点的验证准确率下降为代价。这一研究推动了高效人工智能与稀疏神经网络的发展,为解决大规模模型的能效问题提供了重要的数据基础。
当前挑战
HSNNM所应对的核心领域挑战在于Transformer前馈子层的计算冗余问题:密集全连接层在推理时对每个令牌均执行完整矩阵运算,导致大量无序计算与能效浪费。更为关键的是,现有稀疏方法多以静态剪枝或固定路由为主,难以在动态输入下保持计算效率与模型性能的有效平衡。在数据集构建过程中,研究者面临了多重挑战:首先,如何在小规模(TinyStories的10%切片)训练数据上设计路由机制以避免稀疏子网络发生遗忘,实验表明Hebbian机制与k-WTA规则虽有助于缓解,但其保护作用仍需更大规模验证。其次,评估协议的不一致性使得消融实验中部分结果仅具提示性而非结论性,如何在统一基准上量化稀疏设计的鲁棒性成为难点。此外,net2net增长机制引入了结构动态性,增加了超参数调优与训练稳定性的维护成本。这些挑战共同指向了稀疏高效架构在扩展至实际规模之前所需攻克的关键技术壁垒。
常用场景
经典使用场景
HSNNM数据集的核心用途在于为自然语言处理领域的Transformer模型提供一种高效的稀疏前馈层替代方案。在传统的Transformer架构中,密集的前馈子层计算成本高昂,而HSNNM通过引入Hebbian稀疏神经网络模型,将标准密集子层替换为一组稀疏、竞争路由的子网络(即“叶瓣”),从而显著降低每个token的浮点运算量。该数据集收录了在TinyStories子集上训练的7.33M参数模型的实验数据,用于验证稀疏设计在保持合理准确率的同时减少计算开销的能力。研究者可利用该数据集复现性能对比,或将其作为基准探索不同稀疏策略对语言模型效率的影响。
解决学术问题
该数据集直面深度学习领域一个核心难题:如何在Transformer模型中实现计算效率与模型性能之间的最优平衡。传统的密集前馈层虽然表达能力强,但计算成本随模型规模呈平方级增长,成为部署到资源受限环境的主要障碍。HSNNM通过组合top-1叶瓣路由、k-WTA层内稀疏性、局部Hebbian强度调制规则以及net2net结构增长机制,在减少近50%的FLOPs同时仅牺牲3.4个百分点的验证准确率。这一设计为压缩大规模语言模型提供了新范式,其学术意义在于验证了稀疏动态路由与生物启发的Hebbian学习在Transformer架构中的可行性,推动了高效AI领域的理论发展,并为后续研究建立了量化比较的基准。
衍生相关工作
围绕HSNNM数据集,学界已衍生出多个方向的经典工作。首先,受其k-WTA稀疏性与Hebbian规则的启发,研究者探索了更激进的稀疏策略与生物启发的学习机制,例如动态调节稀疏率的自适应k值方法。其次,HSNNM中的net2net结构增长模块激发了关于动态扩展稀疏网络容量的研究,相关论文验证了在训练过程中逐步增加叶瓣数量能有效缓解欠拟合。此外,该数据集催生了一批针对稀疏Transformer的硬件加速器设计,通过定制化的稀疏矩阵计算单元,使得HSNNM风格的模型在实际芯片上获得更优的能耗比。这些衍生工作共同丰富了高效Transformer的生态系统,彰显了HSNNM作为基准平台的开创性价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务