c2
收藏资源简介:
Common Crawl WET数据集 - c2是一个从Common Crawl项目的WET文件派生出来的大规模过滤数据集。数据经过清洗和汇总,以支持大规模的自然语言处理任务,尤其是大型语言模型(LLM)的预训练。数据集来源于2025年9月的Common Crawl CC-MAIN-2025-38抓取。数据类型是从网络抓取的WET文件中提取的纯文本,经过了激进的元数据和模板内容的过滤。每个组合文件大约15GB,以平衡上传大小和存储限制。预处理包括流式提取、元数据移除、过滤掉模板内容和重复内容。该数据集主要用于预训练基础模型和需要多样化、大规模自然语言语料库的大型语言模型。
Common Crawl WET Dataset - c2
数据集描述
- 来源: Common Crawl CC-MAIN-2025-38,2025年9月爬取。
- 数据类型: 从网页爬取WET文件中提取的纯文本,经过激进的元数据和样板内容过滤。
- 文件大小: 大型合并文件(每个约15GB),以平衡上传大小和存储限制。
- 预处理: 流式提取、元数据移除、过滤样板内容和重复内容。
- 用途: 主要为预训练基础模型和需要多样化、大规模自然语言语料库的大型语言模型设计。
特性
-
预训练优化:
数据集经过筛选和过滤,适用于训练大型语言模型。包含干净、高质量的文本数据,适合无监督预训练任务,如掩码语言建模或自回归建模。 -
大规模:
包含处理后的数据量达数TB,允许在广泛、多样化的文本语料库上进行训练,涵盖多个领域。 -
流式处理:
数据以内存高效的流式方式处理,支持大规模数据处理而无需过多资源。 -
元数据清理:
广泛移除WARC、HTTP头和其他元数据,确保训练用文本中的噪声最小。 -
恢复和验证:
处理过程设置检查点以实现容错。上传到Hugging Face的文件经过验证以避免重复。 -
即时上传:
文件在达到15GB大小限制后立即上传到Hugging Face,以遵守有限的存储限制。
使用方法
使用Hugging Face的datasets库加载数据集:
python from datasets import load_dataset
dataset = load_dataset("blue-blue/c2")
加载后,可以迭代文本样本,用于预训练模型如GPT、BERT或其他大型语言架构。
预训练应用
-
基础模型开发:
提供多样化、大规模的文本数据,对训练高质量基础大型语言模型至关重要。 -
语言建模任务:
由于规模庞大且质量高,适用于自回归或掩码语言模型预训练。 -
下游适应:
可与其他专业数据集结合,用于微调或适应任务。 -
研究与基准测试:
作为标准大规模语料库,用于基准测试NLP算法和分析语言模型行为。
联系方式
如有问题、支持或合作需求:




