fineweb-edu-2013-qwen2-7b
收藏资源简介:
FineWeb-Edu 2013 with Qwen2-7B token counts 是 FineWeb-Edu 数据集中 2013 年部分的重新处理版本,用于继续预训练。该数据集保留了 2013 年所有原始文档,未进行洗牌或子集选择,并使用固定的 Qwen2-7B 分词器(检查点 Qwen/Qwen2-7B,修订版 453ed1575b739b5b03ce3758b23befdb0967f40e)计算每个文档的 token 数量。数据集包含两个网络爬取批次(CC-MAIN-2013-20 和 CC-MAIN-2013-48),共 21,800,204 个文档,22,693,600,656 个 Qwen2-7B token,平均每个文档 1,040.98 token。数据以 zstd 压缩的 Parquet 格式存储,共 89 个分片(每个分片 250,000 行,最后一个分片除外),总大小约 40.58 GiB。每个样本包含三个字段:date(int32,固定为 2013)、text(string,未经修改的原始文本)和 token_count(int32,由指定分词器计算得到的 token ID 数量)。数据集通过严格的验证流程确保结构、上传完整性、计数准确性和文本 fidelity。提供了 Python 使用示例(支持流式加载),并遵循 ODC-By 1.0 许可证和 Common Crawl 使用条款。
FineWeb-Edu 2013 with Qwen2-7B token counts is a reprocessed version of the 2013 portion of the FineWeb-Edu dataset, intended for continued pre-training. This dataset retains all original documents from 2013, without shuffling or subset selection, and uses a fixed Qwen2-7B tokenizer (checkpoint Qwen/Qwen2-7B, revision 453ed1575b739b5b03ce3758b23befdb0967f40e) to compute the token count for each document. It contains two web crawl batches (CC-MAIN-2013-20 and CC-MAIN-2013-48), with a total of 21,800,204 documents and 22,693,600,656 Qwen2-7B tokens, averaging 1,040.98 tokens per document. Data is stored in zstd-compressed Parquet format across 89 shards (each shard has 250,000 rows except the last), with a total size of approximately 40.58 GiB. Each sample includes three fields: date (int32, fixed as 2013), text (string, original unmodified text), and token_count (int32, number of token IDs computed by the specified tokenizer). The dataset undergoes a rigorous verification process to ensure structure, upload integrity, count accuracy, and text fidelity. Python usage examples (supporting streaming loading) are provided, and it follows the ODC-By 1.0 license and Common Crawl terms of use.
FineWeb-Edu 2013 with Qwen2-7B token counts 数据集总结
基本信息
- 数据集名称: FineWeb-Edu 2013 with Qwen2-7B token counts
- 许可证: ODC-By 1.0
- 语言: 英语 (en)
- 任务类别: 文本生成 (text-generation)
- 数据集规模: 10M<n<100M 条样本
- 发布者: stevenyuan666
数据内容与规模
该数据集包含2013年FineWeb-Edu的全部文档,专为持续预训练设计,并使用固定的Qwen2-7B分词器计算token数量。
| 爬取批次 | 文档数 | Qwen2-7B tokens | 分片数 |
|---|---|---|---|
| CC-MAIN-2013-20 | 11,002,672 | 11,441,832,889 | 45 |
| CC-MAIN-2013-48 | 10,797,532 | 11,251,767,767 | 44 |
| 总计 | 21,800,204 | 22,693,600,656 | 89 |
- 平均每文档token数: 1,040.98
- 最短文档: 32 tokens;最长文档: 181,911 tokens
- 总大小: 40.58 GiB (43,571,452,514 字节) zstd压缩的Parquet格式
- 每个分片包含250,000行,除每次爬取的最后一个分片外
数据结构 (Schema)
date: int32类型,值始终为2013text: string类型,直接复制源文档未作修改token_count: int32类型,文本的Qwen2-7B token ID数量
参考格式中的source和category字段被有意省略。
精确计数规则
- 分词器检查点:
Qwen/Qwen2-7B - 分词器版本:
453ed1575b739b5b03ce3758b23befdb0967f40e - 启用快速分词器
add_special_tokens=Falsetruncation=Falsepadding=False- 预分词语文本规范化: 无
- 计数定义:
len(input_ids) - 不设长度上限,超过Qwen2上下文窗口的文档保留真实token数量
数据来源与选择方法
- 源数据集: HuggingFaceFW/fineweb-edu,固定版本
87f09149ef4734204d70ed1d046ddc9ca3f2b8f9 - 选择方法: 保留全部文档,不进行洗牌或子集选取。2013年数据量约为目标的22.7%(目标约1000亿tokens/年),因此保留所有文档并保持源顺序。
- FineWeb的
token_count列基于GPT-2,未被复用;所有计数均使用固定的Qwen2-7B分词器从头计算。
验证结果
- 结构验证: 从Parquet分片重新推导行数、token总数、schema及空值计数。89个分片均携带完全一致的schema。
- 上传完整性: 所有89个分片均通过SHA-256与Hub记录的LFS哈希比对验证,无缺失或多余分片。
- 计数正确性: 从15个随机分片中随机抽取900个文档重新分词,与存储的
token_count零不匹配。 - 文本保真度: 每次爬取输出的头部与已批准样本在
text和token_count上逐字节一致。
另外,100个样本文档在Transformers 5.0.0下重新计数与4.44.2版本完全匹配,token ID序列的SHA-256哈希均为5219cad4b1384275488249b12cfb80019bed8feebbf28658aaba5ba383fdd8c5。
环境与版本
完整运行使用Python 3.11.15(Linux),主要包版本:transformers 5.0.0、tokenizers 0.22.2、datasets 4.0.0、huggingface-hub 1.30.0、pyarrow 17.0.0、numpy 1.26.4。验证样本最初使用旧版本生成,但计数结果完全一致。
使用方式
python from datasets import load_dataset
完整年份,使用流式加载避免41 GiB下载
dataset = load_dataset( "stevenyuan666/fineweb-edu-2013-qwen2-7b", split="train", streaming=True, )
100文档验证样本
sample = load_dataset( "stevenyuan666/fineweb-edu-2013-qwen2-7b", "sample", split="train", )
配置说明
数据集提供两个配置:
default: 完整训练数据,位于data/train/*.parquetsample: 100文档验证样本,位于sample/train/*.parquet
引用与许可
源数据集遵循ODC-By 1.0许可,并受Common Crawl使用条款约束。更多策展细节、局限性和引用信息请参阅源数据集卡片。




