遇见数据集

ZhejiangLab/CPT_Data_Pool

收藏
Hugging Face2026-07-03 更新2026-07-22 收录
官方服务:

资源简介:

CPT Data Pool是一个用于领域特定大语言模型持续预训练的大规模CPT语料库数据集。它作为F2D-LLM框架(一个端到端的领域特定LLM训练流程)的数据组件。数据集总规模约为2710亿个token,以jsonl文件格式存储,采用统一模式,涵盖数学推理、编程代码、学术知识和通用知识四大类别。所有数据源均标注了质量分数标签(如math-score、code-score、edu-score),并且采样比例经过实验验证以确保有效混合。具体构成包括:数学推理类340亿token(占35%),主要来源于Dolma 1.7-AlgebraicStack、Dolma 1.7-OpenWebMath和MegaMath-Web-Pro;编程代码类1000亿token(占20%),来源于StarCoder;学术知识类770亿token(占15%),来源于Dolma 1.7-RedPajama-arXiv和Pes2o;通用知识类600亿token(占30%),来源于Dolma 1.7-CC News、Dolma 1.7-Wiki、Dolma 1.7-Books、Dolma 1.7-MegaWika、Dolma 1.7-Reddit和Dolma 1.7-Flan。数据集聚合了多个公开可用的数据源,用户在使用或重新分发时必须遵守各原始数据源的许可协议。

CPT Data Pool is a large-scale CPT corpus dataset for continuous pre-training of domain-specific large language models (LLMs). It serves as the data component of the F2D-LLM framework, an end-to-end domain-specific LLM training pipeline. The total scale of the dataset is approximately 271 billion tokens, stored in JSONL file format with a unified schema, covering four major categories: mathematical reasoning, programming code, academic knowledge, and general knowledge. All data sources are annotated with quality score labels (e.g., math-score, code-score, edu-score), and the sampling ratio has been experimentally validated to ensure effective mixture. Its specific composition is as follows: 34 billion tokens (accounting for 35%) of mathematical reasoning data, mainly sourced from Dolma 1.7-AlgebraicStack, Dolma 1.7-OpenWebMath and MegaMath-Web-Pro; 100 billion tokens (accounting for 20%) of programming code data, sourced from StarCoder; 77 billion tokens (accounting for 15%) of academic knowledge data, sourced from Dolma 1.7-RedPajama-arXiv and Pes2o; 60 billion tokens (accounting for 30%) of general knowledge data, sourced from Dolma 1.7-CC News, Dolma 1.7-Wiki, Dolma 1.7-Books, Dolma 1.7-MegaWika, Dolma 1.7-Reddit and Dolma 1.7-Flan. The dataset aggregates multiple publicly available data sources, and users must comply with the license agreements of each original data source when using or redistributing it.

提供机构:
ZhejiangLab
搜集汇总
数据集介绍
ZhejiangLab/CPT_Data_Pool 数据集图片
构建方式
CPT_Data_Pool是一个专为领域大语言模型持续预训练而设计的大规模语料库,作为F2D-LLM框架的数据组件。该数据集汇聚了来自多个公开来源的高质量文本,涵盖数学推理、编程代码、学术知识与通用知识四大领域。数学推理部分从Dolma 1.7的AlgebraicStack与OpenWebMath子集及MegaMath-Web-Pro中提取,编程代码源自StarCoder,学术知识来自Dolma 1.7的RedPajama-arXiv子集与Pes2o,通用知识则整合了Dolma 1.7的CC News、Wiki、Books、MegaWika、Reddit及Flan子集。每个数据源均标注了质量评分标签,并通过实验验证的采样比例进行混合,最终形成约271B tokens的语料集合,以统一的jsonl格式存储。
特点
该数据集最显著的特点在于其规模与结构化设计。总容量约271B tokens,覆盖数学推理(34B tokens,占比35%)、编程代码(100B tokens,占比20%)、学术知识(77B tokens,占比15%)与通用知识(60B tokens,占比30%)四大类别,实现了领域知识与通用能力的均衡覆盖。每个数据源都附有专属的质量评分标签(如math-score、code-score、edu-score),便于后续依据质量进行过滤或重采样。这些比例经过实验验证,可有效提升模型在下游任务上的表现。此外,数据集采用Apache-2.0许可证,但需注意各原始数据源有其独立的许可条款,用户需自行确保合规。
使用方法
使用CPT_Data_Pool时,可直接加载jsonl格式的文件,依据统一的数据模式进行解析。用户可根据自身模型的需求,利用数据源标注的质量评分标签(如math-score、code-score、edu-score)进行过滤或调整采样比例,以优化持续预训练效果。该数据集作为F2D-LLM框架的一部分,建议配合该框架的完整数据处理与训练流程使用。如需详细的数据处理方法、评分算法及采样策略,可参考官方GitHub仓库中的技术文档。使用时务必遵守各原始数据源的许可条款,特别是涉及数据再分发的场景。
背景与挑战
背景概述
CPT_Data_Pool是一个面向领域特定大型语言模型持续预训练的大规模语料库,隶属于F2D-LLM框架,由GeoGPT-Research-Project团队创建。该数据集整合了数学推理、编程代码、学术知识及通用知识四大类数据源,总计约271B tokens,旨在为领域模型的持续预训练提供高质量、多样化的数据支撑。通过引入质量评分标签与实验验证的混合采样策略,CPT_Data_Pool有效提升了模型在专业领域的适应能力,为推动通用模型向垂直领域迁移提供了关键数据基础设施,对领域大模型的训练范式具有重要影响。
当前挑战
CPT_Data_Pool所应对的核心挑战在于缓解通用预训练模型在专业领域中的知识匮乏与分布偏移问题,确保模型在数学、编程、学术等特定场景下具备高效知识迁移与持续学习能力。在数据集构建过程中,面临多重技术难题:需从多源异构数据中统一抽取、清洗与去重,保证数据一致性与完整性;设计合理的质量评分机制与采样比例,以平衡各领域知识的贡献度,避免数据失衡导致的模型偏差;此外,各数据源遵循不同许可协议,合规整合与重新发布亦是构建过程中不可忽视的法律与伦理挑战。
常用场景
经典使用场景
在自然语言处理与大型语言模型的研究版图中,持续预训练(Continual Pre-training)已成为提升模型在特定领域专精能力的关键范式。CPT_Data_Pool作为专为此任务设计的超大规模语料库,其经典使用场景聚焦于对领域通用大模型进行第二阶段的增量训练。研究人员通常将CC、Wiki、Books等通用知识语料与数学推理、编程代码、学术文献等结构化数据按特定配比混合,利用该数据集内含的质量评分标签(如math-score、code-score、edu-score)进行高效的数据筛选与采样,从而在保证模型通用能力不遗忘的前提下,显著增强其在数学推导、代码生成和科学问答等专业任务上的表现。这一过程完美契合了从通用到专精的模型演进路径,为领域大模型的低成本高效构建提供了坚实的数据基础。
衍生相关工作
CPT_Data_Pool作为F2D-LLM框架的核心数据组件,已衍生出一系列富有影响力的学术探索。其中,最引人瞩目的研究聚焦于数据混合比例的自动化寻优,研究者基于该数据集的评分标签与来源粒度,提出了动态采样策略与课程学习范式,显著提升了持续预训练的收敛速度与最终性能。此外,围绕质量评分标签的校准与统一,涌现出多项关于无监督质量评估方法的改进工作,使得域内数据筛选不再依赖于人工标注。更有工作将CPT_Data_Pool的配比经验迁移至多模态、多语言场景的预训练调度中,验证了其跨领域迁移的有效性。这些衍生成果不仅深化了对持续预训练数据工程的理解,也为后续更大规模、更精细化的领域语料池构建奠定了理论与实践的基石。
数据集最近研究
最新研究方向
CPT_Data_Pool作为面向领域大语言模型持续预训练的大规模语料库,其研究方向紧密围绕如何通过精细化的数据配比与质量评分策略,提升模型在数学推理、编程代码、学术知识与通用知识等多维度上的能力。当前前沿探索聚焦于动态采样比率优化、跨域知识融合机制以及基于质量标签的课程学习范式,这些工作为构建高效、低成本的领域专用模型奠定了基础。该数据集的出现加剧了开源社区对高质量预训练语料标准化与混合策略的研究热潮,其破千亿token的规模与结构化标签体系,为后续研究提供了可复现的基准,并推动了大模型从通用向专业领域的低成本迁移范式变革。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务