mah-quantum/domain-adaptive-corpus
收藏资源简介:
MQ-Cognitive-Data是一个领域自适应预训练语料库,由MAH Quantum Research Scholars团队精心策划。该数据集包含领域特定的文本语料和指令调优分割,专门设计用于词汇扩展和领域适应,旨在加速量子模拟和高级认知逻辑结构的研究。数据集包括三个主要分割:train_pretrain(用于领域词汇适应,约12亿词元)、train_instruct(用于多轮认知指令分割,约45万高质量对)和validation_eval(用于零样本架构基准测试,约5万测试矩阵)。数据内容涵盖重型工业计算机科学、经典张量网络数学和硬件加速日志,经过过滤、去重和词元化处理。数据集支持英语,适用于预训练、指令调优、认知计算、量子物理和计算机科学等领域。
MQ-Cognitive-Data is a domain-adaptive pre-training corpus carefully curated by the MAH Quantum Research Scholars team. This dataset comprises domain-specific text corpora and instruction-tuning splits, specifically designed for vocabulary expansion and domain adaptation, aiming to accelerate research in quantum simulation and advanced cognitive logical structures. The dataset includes three primary splits: train_pretrain (for domain vocabulary adaptation, with approximately 1.2 billion tokens), train_instruct (for multi-turn cognitive instruction splits, containing around 450,000 high-quality pairs), and validation_eval (for zero-shot architecture benchmarking, with roughly 50,000 test matrices). The dataset covers content including heavy-duty industrial computer science, classical tensor network mathematics, and hardware acceleration logs, and has undergone filtering, deduplication, and tokenization processing. The dataset supports English and is applicable to fields such as pre-training, instruction tuning, cognitive computing, quantum physics, and computer science.




