quantum-like-attention-framework-1.3b-untuned-validation
收藏资源简介:
该数据集为量子类注意力框架(QLAF)1.3b未调优版本的验证结果集合。数据集记录了5个不同随机种子下的预训练验证指标,包括最终损失、最终困惑度、MMLU评分、HumanEval评分以及长上下文(65k)Needle-in-a-Haystack准确率。此外,还提供了模型架构细节(4层、循环维度128、状态维度16、RMSNorm归一化、绑定嵌入、总参数量405,401,600)、预训练数据分布(FineWeb-Edu 33.25%、SlimPajama Books 28.50%、QLAF合成检索注入5.00%、通用合成预训练33.25%)以及优化器配置(AdamW、峰值学习率5e-5、余弦衰减至5e-6、1000步预热、全局批量大小65536 tokens、每种子10000步)。该数据集适用于文本生成任务的模型验证与比较,特别是评估QLAF架构在长上下文检索和下游任务上的表现。
This dataset is a collection of validation results for the untuned version of the Quantum-Like Attention Framework (QLAF) 1.3b. It records pre-training validation metrics under 5 different random seeds, including final loss, final perplexity, MMLU score, HumanEval score, and long-context (65k) Needle-in-a-Haystack accuracy. Additionally, it provides model architecture details (4 layers, recurrent dimension 128, state dimension 16, RMSNorm normalization, tied embeddings, total parameters 405,401,600), pre-training data distribution (FineWeb-Edu 33.25%, SlimPajama Books 28.50%, QLAF synthetic retrieval injection 5.00%, general synthetic pre-training 33.25%), and optimizer configuration (AdamW, peak learning rate 5e-5, cosine decay to 5e-6, 1000 steps warm-up, global batch size 65536 tokens, 10000 steps per seed). This dataset is suitable for model validation and comparison in text generation tasks, especially for evaluating the performance of the QLAF architecture on long-context retrieval and downstream tasks.
量子类注意力框架 1.3b(未调优)验证数据集
数据集概述
本数据集为 Quantum-Like Attention Framework (QLAF) 1.3b 未调优版本的验证数据集,属于文本生成任务类别,使用英文,并带有量子类注意力、QLAF、验证等相关标签。
模型架构规格
- 激活模型层数:4 层
- 循环维度(R):128
- 状态维度(S):16
- 归一化方式:在 QLAF 状态更新方程中集成了无参数的循环 RMSNorm,以保证长上下文稳定性
- 嵌入绑定:是
- 总参数量:405,401,600
预训练课程与数据集比例
预训练流由以下精确 token 分布组成:
| 数据来源 | 比例 |
|---|---|
| FineWeb-Edu | 33.25% |
| SlimPajama Books | 28.50% |
| QLAF 合成检索注入 | 5.00% |
| 通用合成预训练/回退 | 33.25% |
序列长度课程:从 4,096 tokens 开始,逐步扩展至 65,536 tokens。
优化器与训练配置
- 优化器:AdamW
- 峰值学习率:5e-5
- 预热步数:1,000 步
- 学习率调度:余弦衰减至 5e-6
- 全局批大小:65,536 tokens
- 总步数:每个种子实验 10,000 步
下游评估与针海测试结果
以下为 5 个预训练验证实验的结果:
| 验证实验(种子) | 预训练最终损失 | 预训练最终困惑度 | MMLU 得分(%) | HumanEval(%) | 针海测试(65k 上下文准确率) |
|---|---|---|---|---|---|
| 种子 42 | 0.8804 | 2.41 | 28.40% | 46.95% | 100.0% |
| 种子 100 | 1.4556 | 4.29 | 24.60% | 0.00% | 0.0% |
| 种子 2026 | 进行中 | 进行中 | 待定 | 待定 | 待定 |
| 种子 777 | 待定 | 待定 | 待定 | 待定 | 待定 |
| 种子 999 | 待定 | 待定 | 待定 | 待定 | 待定 |
(注:剩余实验的结果将在种子完成后自动更新)
许可信息
- 许可证:自定义个人非商业许可证,具体条款请参阅 LICENSE_SUMMARY.md 和 LICENSE.md 文件。
联系信息
- 作者:Michael Ast
- 邮箱:IgnisLabsReachouts@gmail.com
- Instagram:@interestingnights




