遇见数据集

CPT-Data-Pool

收藏
github2026-07-13 更新2026-07-15 收录
官方服务:

资源简介:

CPT-Data-Pool是一个大规模混合领域文本语料库,专为领域特定大型语言模型的持续预训练(CPT)设计。该数据池整合了涵盖通用知识、科学文献、编程代码、数学推理和其他专业领域的多样化高质量文本资源,旨在保持基础模型的通用能力,同时通过持续预训练提升其推理能力、编码能力、科学知识和领域适应性。数据集包含约2710亿个标记,存储为具有统一模式的jsonl文件,并标注了质量分数标签。

CPT-Data-Pool is a large-scale multi-domain text corpus specifically designed for continued pre-training (CPT) of domain-specific large language models. It integrates diverse high-quality text resources covering general knowledge, scientific literature, programming code, mathematical reasoning, and other professional fields, aiming to preserve the general capabilities of the base model while enhancing its reasoning ability, coding capability, scientific knowledge, and domain adaptability via continued pre-training. The dataset contains approximately 271 billion tokens, stored as JSON Lines (jsonl) files with a unified schema, and is annotated with quality score labels.

创建时间:
2026-07-13
原始信息汇总

CPT-Data-Pool 数据池概述

1. 总体介绍

CPT-Data-Pool 是一个大型文本语料库,专为大语言模型的领域持续预训练(CPT)设计。该数据池整合了来自通用知识、科学文献、编程代码、数学推理及其他专业领域的高质量文本资源,旨在保持基础模型通用能力的同时,通过持续预训练提升其推理、编码、科学知识及领域适应能力。

2. 数据集构建

数据集通过可复现的多阶段处理流程构建,包括数据获取、清洗、质量评估、混合比例优化及语料生成。该流程的具体实现位于 Foundation2Domain-LLM-Training 项目中。

数据集公开发布于 🤗Hugging FaceModelScope,包含约 271B tokens,以统一 schema 的 jsonl 格式存储。所有数据源均带有质量评分标签,下表中的采样比例已通过实验验证为有效混合方案。

3. 数据组成与比例

类别 规模(Tokens) 类别占比 数据源 来源占比 来源许可 质量标签
数学推理 34B 35% Dolma 1.7-AlgebraicStack 12% ODC‑BY math-score
Dolma 1.7-OpenWebMath 11% ODC‑BY math-score
MegaMath-Web-Pro 12% ODC‑BY math-score
编程代码 100B 20% StarCoder 20% 原始仓库许可协议 code-score
学术知识 77B 15% Dolma 1.7-RedPajama-arXiv 10% ODC‑BY edu-score
Pes2o 5% ODC‑BY edu-score
通用知识 60B 30% Dolma 1.7-CC News 4% ODC‑BY edu-score
Dolma 1.7-Wiki 6% ODC‑BY edu-score
Dolma 1.7-Books 4% ODC‑BY edu-score
Dolma 1.7-MegaWika 5% ODC‑BY edu-score
Dolma 1.7-Reddit 1% ODC‑BY edu-score
Dolma 1.7-Flan 10% ODC‑BY edu-score
总计 271B 100% - 100% - -

4. 许可与使用说明

数据池由多个公开来源聚合而成,每个来源均遵循其自身许可协议。数据预处理脚本和工作流采用 Apache License 2.0 许可,但数据集重新分发时必须遵守各原始数据源的许可条款。用户有责任在使用或重新分发源数据时遵守每个数据源的具体条款。

搜集汇总
数据集介绍
构建方式
CPT-Data-Pool的构建依托于一套可复现的多阶段数据处理流水线,涵盖数据采集、清洗、质量评估、混合比例优化与语料生成等环节。该语料池整合了来自Dolma 1.7、StarCoder、MegaMath、Pes2o等多个公开高质量数据源的文本资源,涵盖通用知识、科学文献、编程代码与数学推理等专门领域。所有数据均以统一的jsonl格式存储,并通过质量评分标签(如math-score、code-score、edu-score)进行注释,便于后续筛选与使用。经过实验验证的采样比例确保了各领域数据的有效混合,总规模约为271B tokens。
特点
CPT-Data-Pool的核心特点在于其精心设计的混合比例与多领域覆盖能力,能够在保持基座模型通用能力的同时,显著增强模型的推理、编程、科学知识与领域适应能力。该语料池为数学推理、编程代码、学术知识与通用知识四大类别分别设定了35%、20%、15%与30%的占比,其中数学推理类占比最高,反映出对提升模型逻辑推理能力的侧重。每个数据源均附带质量评分标签,为用户提供灵活的筛选依据,而数据混合比例已通过实验验证为有效配置。
使用方法
CPT-Data-Pool的使用方法极为便捷,用户可直接从Hugging Face或ModelScope平台下载以jsonl格式存储的完整语料。该数据集适用于对大规模语言模型进行领域特定的继续预训练(CPT),以提升其在特定垂直任务上的表现。用户可根据数据源附带的质量评分标签,按需筛选高质量子集进行训练。此外,数据集构建的完整流水线代码已在GitHub上公开,用户可参考其数据处理与混合比例优化流程,自行定制或扩展适用于自身场景的语料池。
背景与挑战
背景概述
大型语言模型(LLMs)的持续预训练(CPT)技术旨在通过领域特定语料增强基础模型的推理、编码及科学知识能力,同时保持其通用性能。然而,现有公开语料库多聚焦单一领域,缺乏涵盖数学、编程、学术与常识知识的规模化混合语料。CPT-Data-Pool由之江实验室研究团队于2024年构建,整合自Dolma、StarCoder、MegaMath等高质量来源,包含约271B tokens,并设计了可复现的流水线来处理数据获取、清洗、质量评估与混合比例优化。该语料池直接支撑了GeoGPT等领域专用基础模型的开发,为领域自适应持续预训练树立了实践标杆。
当前挑战
该数据集面临的核心挑战包括:1) **领域任务的异构性**:数学推理、代码生成与学术知识等任务对模型能力要求迥异,如何在持续预训练中平衡各子集的贡献而不引发灾难性遗忘是关键难题;2) **数据质量与版权合规**:多源语料存在噪声、重复及许可条款冲突,需设计统一的质量评估标签体系(如math-score、edu-score),并确保对ODC-BY、Apache 2.0等不同开源协议的严格遵循,增加了数据整合的复杂度;3) **混合比例的实验验证**:为获得最优性能,最优混合策略需通过大量消融实验确认,这对计算资源和评估标杆构成显著挑战。
常用场景
经典使用场景
CPT-Data-Pool最经典的使用场景在于为大语言模型的领域持续预训练提供高质量、多源融合的语料支撑。研究者常借助该数据集,在基础模型之上通过继续预训练方法,使模型在保持通用能力的同时,显著增强其在数学推理、编程代码、学术知识与通用知识等专业领域的表现。该数据池覆盖约271B tokens,各领域语料经过精心配比与质量标注,可直接用于训练领域专用基础模型,例如GeoGPT的构建便充分依托于此。
解决学术问题
该数据集系统性地解决了领域大语言模型在持续预训练中面临的语料稀缺与分布失衡问题。传统预训练语料往往难以兼顾通用性与专业性,导致领域模型在特定任务上表现欠佳。CPT-Data-Pool通过整合多样化高质量资源并优化混合比例,为学术研究提供了可复现的标准化训练语料,支撑了模型在推理能力、代码生成、科学知识理解等维度上的定向增强,对推动领域自适应、知识迁移与多任务学习等研究方向具有重要价值。
衍生相关工作
围绕CPT-Data-Pool已衍生出一系列经典工作,最具代表性的是GeoGPT——一个面向地理科学领域的大语言模型。此外,该数据集还被用于训练和评估多种持续预训练策略与混合比例优化算法,相关流程已封装于Foundation2Domain-LLM-Training工具包中。这些工作不仅验证了数据池的有效性,还推动了跨领域知识融合、领域模型评测基准构建等研究方向,为后续多领域持续预训练研究奠定了坚实的语料基础与范式参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务