CPT-Data-Pool
收藏资源简介:
CPT-Data-Pool是一个大规模混合领域文本语料库,专为领域特定大型语言模型的持续预训练(CPT)设计。该数据池整合了涵盖通用知识、科学文献、编程代码、数学推理和其他专业领域的多样化高质量文本资源,旨在保持基础模型的通用能力,同时通过持续预训练提升其推理能力、编码能力、科学知识和领域适应性。数据集包含约2710亿个标记,存储为具有统一模式的jsonl文件,并标注了质量分数标签。
CPT-Data-Pool is a large-scale multi-domain text corpus specifically designed for continued pre-training (CPT) of domain-specific large language models. It integrates diverse high-quality text resources covering general knowledge, scientific literature, programming code, mathematical reasoning, and other professional fields, aiming to preserve the general capabilities of the base model while enhancing its reasoning ability, coding capability, scientific knowledge, and domain adaptability via continued pre-training. The dataset contains approximately 271 billion tokens, stored as JSON Lines (jsonl) files with a unified schema, and is annotated with quality score labels.
CPT-Data-Pool 数据池概述
1. 总体介绍
CPT-Data-Pool 是一个大型文本语料库,专为大语言模型的领域持续预训练(CPT)设计。该数据池整合了来自通用知识、科学文献、编程代码、数学推理及其他专业领域的高质量文本资源,旨在保持基础模型通用能力的同时,通过持续预训练提升其推理、编码、科学知识及领域适应能力。
2. 数据集构建
数据集通过可复现的多阶段处理流程构建,包括数据获取、清洗、质量评估、混合比例优化及语料生成。该流程的具体实现位于 Foundation2Domain-LLM-Training 项目中。
数据集公开发布于 🤗Hugging Face 和 ModelScope,包含约 271B tokens,以统一 schema 的 jsonl 格式存储。所有数据源均带有质量评分标签,下表中的采样比例已通过实验验证为有效混合方案。
3. 数据组成与比例
| 类别 | 规模(Tokens) | 类别占比 | 数据源 | 来源占比 | 来源许可 | 质量标签 |
|---|---|---|---|---|---|---|
| 数学推理 | 34B | 35% | Dolma 1.7-AlgebraicStack | 12% | ODC‑BY | math-score |
| Dolma 1.7-OpenWebMath | 11% | ODC‑BY | math-score |
|||
| MegaMath-Web-Pro | 12% | ODC‑BY | math-score |
|||
| 编程代码 | 100B | 20% | StarCoder | 20% | 原始仓库许可协议 | code-score |
| 学术知识 | 77B | 15% | Dolma 1.7-RedPajama-arXiv | 10% | ODC‑BY | edu-score |
| Pes2o | 5% | ODC‑BY | edu-score |
|||
| 通用知识 | 60B | 30% | Dolma 1.7-CC News | 4% | ODC‑BY | edu-score |
| Dolma 1.7-Wiki | 6% | ODC‑BY | edu-score |
|||
| Dolma 1.7-Books | 4% | ODC‑BY | edu-score |
|||
| Dolma 1.7-MegaWika | 5% | ODC‑BY | edu-score |
|||
| Dolma 1.7-Reddit | 1% | ODC‑BY | edu-score |
|||
| Dolma 1.7-Flan | 10% | ODC‑BY | edu-score |
|||
| 总计 | 271B | 100% | - | 100% | - | - |
4. 许可与使用说明
数据池由多个公开来源聚合而成,每个来源均遵循其自身许可协议。数据预处理脚本和工作流采用 Apache License 2.0 许可,但数据集重新分发时必须遵守各原始数据源的许可条款。用户有责任在使用或重新分发源数据时遵守每个数据源的具体条款。



