遇见数据集

quantum-like-attention-framework-1.3b-untuned-validation

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

该数据集为量子类注意力框架(QLAF)1.3b未调优版本的验证结果集合。数据集记录了5个不同随机种子下的预训练验证指标,包括最终损失、最终困惑度、MMLU评分、HumanEval评分以及长上下文(65k)Needle-in-a-Haystack准确率。此外,还提供了模型架构细节(4层、循环维度128、状态维度16、RMSNorm归一化、绑定嵌入、总参数量405,401,600)、预训练数据分布(FineWeb-Edu 33.25%、SlimPajama Books 28.50%、QLAF合成检索注入5.00%、通用合成预训练33.25%)以及优化器配置(AdamW、峰值学习率5e-5、余弦衰减至5e-6、1000步预热、全局批量大小65536 tokens、每种子10000步)。该数据集适用于文本生成任务的模型验证与比较,特别是评估QLAF架构在长上下文检索和下游任务上的表现。

This dataset is a collection of validation results for the untuned version of the Quantum-Like Attention Framework (QLAF) 1.3b. It records pre-training validation metrics under 5 different random seeds, including final loss, final perplexity, MMLU score, HumanEval score, and long-context (65k) Needle-in-a-Haystack accuracy. Additionally, it provides model architecture details (4 layers, recurrent dimension 128, state dimension 16, RMSNorm normalization, tied embeddings, total parameters 405,401,600), pre-training data distribution (FineWeb-Edu 33.25%, SlimPajama Books 28.50%, QLAF synthetic retrieval injection 5.00%, general synthetic pre-training 33.25%), and optimizer configuration (AdamW, peak learning rate 5e-5, cosine decay to 5e-6, 1000 steps warm-up, global batch size 65536 tokens, 10000 steps per seed). This dataset is suitable for model validation and comparison in text generation tasks, especially for evaluating the performance of the QLAF architecture on long-context retrieval and downstream tasks.

创建时间:
2026-07-29
原始信息汇总

量子类注意力框架 1.3b(未调优)验证数据集

数据集概述

本数据集为 Quantum-Like Attention Framework (QLAF) 1.3b 未调优版本的验证数据集,属于文本生成任务类别,使用英文,并带有量子类注意力、QLAF、验证等相关标签。

模型架构规格

  • 激活模型层数:4 层
  • 循环维度(R):128
  • 状态维度(S):16
  • 归一化方式:在 QLAF 状态更新方程中集成了无参数的循环 RMSNorm,以保证长上下文稳定性
  • 嵌入绑定:是
  • 总参数量:405,401,600

预训练课程与数据集比例

预训练流由以下精确 token 分布组成:

数据来源 比例
FineWeb-Edu 33.25%
SlimPajama Books 28.50%
QLAF 合成检索注入 5.00%
通用合成预训练/回退 33.25%

序列长度课程:从 4,096 tokens 开始,逐步扩展至 65,536 tokens。

优化器与训练配置

  • 优化器:AdamW
  • 峰值学习率:5e-5
  • 预热步数:1,000 步
  • 学习率调度:余弦衰减至 5e-6
  • 全局批大小:65,536 tokens
  • 总步数:每个种子实验 10,000 步

下游评估与针海测试结果

以下为 5 个预训练验证实验的结果:

验证实验(种子) 预训练最终损失 预训练最终困惑度 MMLU 得分(%) HumanEval(%) 针海测试(65k 上下文准确率)
种子 42 0.8804 2.41 28.40% 46.95% 100.0%
种子 100 1.4556 4.29 24.60% 0.00% 0.0%
种子 2026 进行中 进行中 待定 待定 待定
种子 777 待定 待定 待定 待定 待定
种子 999 待定 待定 待定 待定 待定

(注:剩余实验的结果将在种子完成后自动更新)

许可信息

  • 许可证:自定义个人非商业许可证,具体条款请参阅 LICENSE_SUMMARY.md 和 LICENSE.md 文件。

联系信息

  • 作者:Michael Ast
  • 邮箱:IgnisLabsReachouts@gmail.com
  • Instagram:@interestingnights
搜集汇总
数据集介绍
quantum-like-attention-framework-1.3b-untuned-validation 数据集图片
构建方式
该数据集是Quantum-Like Attention Framework (QLAF) 1.3b未调优模型的验证集,旨在评估模型在预训练后的泛化能力。构建方式基于五组不同随机种子的预训练验证活动,每组种子对应一次完整的预训练实验,涵盖特定的模型架构和优化配置。模型包含4层主动层、128维循环维度、16维状态维度,并采用参数无关的RMSNorm以保障长上下文稳定性。预训练数据流由FineWeb-Edu(33.25%)、SlimPajama Books(28.50%)、QLAF合成检索注入(5.00%)及通用合成预训练备用数据(33.25%)组成,序列长度从4096令牌逐步扩展至65536令牌。优化器采用AdamW,峰值学习率5e-5,预热1000步,余弦衰减至5e-6,全局批大小65536令牌,每种子运行10000步。验证结果包含预训练损失、困惑度、MMLU、HumanEval以及65k上下文检索准确率等指标,为模型性能提供多维评估。
特点
该数据集的核心特点在于其专项验证性质,聚焦于QLAF框架在长上下文处理与检索能力上的表现。数据集中设置了Needle-in-a-Haystack测试,用于衡量模型在65k令牌上下文中的信息检索精确度,这体现了对长序列记忆与定位能力的严苛检验。同时,数据集涵盖多种下游任务评测,如MMLU和HumanEval,覆盖知识理解与代码生成领域,确保模型能力的全面评估。不同种子实验的对比揭示了训练稳定性的差异,例如Seed 42达到100%检索准确率而Seed 100为0,凸显了随机初始化对模型性能的显著影响。此外,数据集采用定制非商业许可,强调其研发用途,并包含专利待批声明,体现了其学术与创新价值。
使用方法
使用该数据集时,研究者可基于其验证结果分析QLAF模型的性能特征,特别适用于长上下文场景下的检索能力测试。建议对照各种子实验的评估指标,识别训练稳定性和泛化瓶颈。由于数据集与模型紧密耦合,使用者需遵循其许可条款,仅限于非商业研究。操作上,可依据README中提供的模型规格与超参数复现实验,或直接利用已有验证结果进行后续分析。对于需要扩展研究的场景,可参考其预训练数据配比,调整合成数据比例以优化特定任务表现。数据集持续更新中的种子结果(如Seed 2026等)为纵向追踪模型进展提供了窗口,适合用于验证训练策略的长期影响。
背景与挑战
背景概述
量子类注意力框架(QLAF)1.3b未调优验证数据集由IgnisLabs的Michael Ast于近期构建,旨在评估一种融合量子启发式注意力机制的新型语言模型架构。该架构通过引入递归维度和状态维度,在长上下文处理上展现出独特优势,其预训练课程融合了FineWeb-Edu、SlimPajama Books、QLAF合成检索注入及通用合成数据,序列长度从4,096逐步扩展至65,536个令牌,体现了对长序列建模能力的深入探索。数据集记录了多种子验证战役的预训练损失、困惑度及下游任务(如MMLU、HumanEval)性能,尤其以Needle-in-a-Haystack测试衡量65k上下文中的检索精度,突显了该框架在长上下文推理中的潜力。此番工作为量子认知与深度学习交叉领域提供了实证基础,对发展高效、可扩展的语言模型具有参考价值。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两方面。在领域层面,长上下文建模中,模型需在多达65,536令牌的序列中稳定检索关键信息,但实验显示不同种子下性能波动剧烈(如Seed 42实现100%检索准确率,而Seed 100为0%),反映出量子启发式注意力机制对初始化高度敏感,亟需提升其鲁棒性。构建过程中,预训练课程混合多种数据源(如FineWeb-Edu与SlimPajama Books),平衡其比例(33.25%与28.50%)并确保各源在长序列下的分布一致性是一大挑战。此外,训练稳定性受超参数影响显著,例如峰值学习率5e-5及余弦退火至5e-6,而全局批次大小仅65,536令牌,在小批量下保持梯度稳定尤为困难。数据集的验证战役跨五个随机种子,部分执行未完成,为全面评估带来不确定性。
常用场景
经典使用场景
该数据集作为量子类注意力框架(QLAF)1.3B未调优模型的验证集,其经典使用场景聚焦于评估模型在长上下文任务中的检索与推理能力。由于数据集融入了合成检索注入样本,并涵盖从4,096至65,536 tokens的序列长度课程,研究者可借此检验模型在‘大海捞针’式测试中的精准度,同时兼顾语言建模质量与知识密集型基准的表现,成为验证量子启发式注意力机制有效性的关键试金石。
实际应用
在实际应用中,该数据集主要用于模型开发流程中的质量把关和迭代优化。工程师可依据验证集上的困惑度、MMLU及HumanEval等指标,筛选出性能稳健的模型实例,或定位训练失效的种子条件进而调整超参数。其长上下文检索测试亦为文档问答、代码生成等需处理长文本场景的落地部署提供可靠性参考,加速从研究原型到产品应用的转化。
衍生相关工作
围绕该数据集及其关联模型,衍生了若干关键方向:其一,针对验证集中不同种子间性能差异(如Seed 42与Seed 100)的分析,催生了关于训练稳定性与随机性影响的系统性研究;其二,基于QLAF架构的改进模型(如调优版本或更大规模参数)多以此数据集为基线进行对比评估;其三,‘大海捞针’测试的完整记录促进了长上下文评估标准化协议的建立,为后续更多量子启发模型提供了可复用的评测范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务