遇见数据集

fineweb-edu-2013-qwen2-7b

收藏
Hugging Face2026-09-09 更新2026-09-10 收录
官方服务:

资源简介:

FineWeb-Edu 2013 with Qwen2-7B token counts 是 FineWeb-Edu 数据集中 2013 年部分的重新处理版本,用于继续预训练。该数据集保留了 2013 年所有原始文档,未进行洗牌或子集选择,并使用固定的 Qwen2-7B 分词器(检查点 Qwen/Qwen2-7B,修订版 453ed1575b739b5b03ce3758b23befdb0967f40e)计算每个文档的 token 数量。数据集包含两个网络爬取批次(CC-MAIN-2013-20 和 CC-MAIN-2013-48),共 21,800,204 个文档,22,693,600,656 个 Qwen2-7B token,平均每个文档 1,040.98 token。数据以 zstd 压缩的 Parquet 格式存储,共 89 个分片(每个分片 250,000 行,最后一个分片除外),总大小约 40.58 GiB。每个样本包含三个字段:date(int32,固定为 2013)、text(string,未经修改的原始文本)和 token_count(int32,由指定分词器计算得到的 token ID 数量)。数据集通过严格的验证流程确保结构、上传完整性、计数准确性和文本 fidelity。提供了 Python 使用示例(支持流式加载),并遵循 ODC-By 1.0 许可证和 Common Crawl 使用条款。

FineWeb-Edu 2013 with Qwen2-7B token counts is a reprocessed version of the 2013 portion of the FineWeb-Edu dataset, intended for continued pre-training. This dataset retains all original documents from 2013, without shuffling or subset selection, and uses a fixed Qwen2-7B tokenizer (checkpoint Qwen/Qwen2-7B, revision 453ed1575b739b5b03ce3758b23befdb0967f40e) to compute the token count for each document. It contains two web crawl batches (CC-MAIN-2013-20 and CC-MAIN-2013-48), with a total of 21,800,204 documents and 22,693,600,656 Qwen2-7B tokens, averaging 1,040.98 tokens per document. Data is stored in zstd-compressed Parquet format across 89 shards (each shard has 250,000 rows except the last), with a total size of approximately 40.58 GiB. Each sample includes three fields: date (int32, fixed as 2013), text (string, original unmodified text), and token_count (int32, number of token IDs computed by the specified tokenizer). The dataset undergoes a rigorous verification process to ensure structure, upload integrity, count accuracy, and text fidelity. Python usage examples (supporting streaming loading) are provided, and it follows the ODC-By 1.0 license and Common Crawl terms of use.

创建时间:
2026-09-08
原始信息汇总

FineWeb-Edu 2013 with Qwen2-7B token counts 数据集总结

基本信息

  • 数据集名称: FineWeb-Edu 2013 with Qwen2-7B token counts
  • 许可证: ODC-By 1.0
  • 语言: 英语 (en)
  • 任务类别: 文本生成 (text-generation)
  • 数据集规模: 10M<n<100M 条样本
  • 发布者: stevenyuan666

数据内容与规模

该数据集包含2013年FineWeb-Edu的全部文档,专为持续预训练设计,并使用固定的Qwen2-7B分词器计算token数量。

爬取批次 文档数 Qwen2-7B tokens 分片数
CC-MAIN-2013-20 11,002,672 11,441,832,889 45
CC-MAIN-2013-48 10,797,532 11,251,767,767 44
总计 21,800,204 22,693,600,656 89
  • 平均每文档token数: 1,040.98
  • 最短文档: 32 tokens;最长文档: 181,911 tokens
  • 总大小: 40.58 GiB (43,571,452,514 字节) zstd压缩的Parquet格式
  • 每个分片包含250,000行,除每次爬取的最后一个分片外

数据结构 (Schema)

  • date: int32类型,值始终为2013
  • text: string类型,直接复制源文档未作修改
  • token_count: int32类型,文本的Qwen2-7B token ID数量

参考格式中的sourcecategory字段被有意省略。

精确计数规则

  • 分词器检查点: Qwen/Qwen2-7B
  • 分词器版本: 453ed1575b739b5b03ce3758b23befdb0967f40e
  • 启用快速分词器
  • add_special_tokens=False
  • truncation=False
  • padding=False
  • 预分词语文本规范化: 无
  • 计数定义: len(input_ids)
  • 不设长度上限,超过Qwen2上下文窗口的文档保留真实token数量

数据来源与选择方法

  • 源数据集: HuggingFaceFW/fineweb-edu,固定版本87f09149ef4734204d70ed1d046ddc9ca3f2b8f9
  • 选择方法: 保留全部文档,不进行洗牌或子集选取。2013年数据量约为目标的22.7%(目标约1000亿tokens/年),因此保留所有文档并保持源顺序。
  • FineWeb的token_count列基于GPT-2,未被复用;所有计数均使用固定的Qwen2-7B分词器从头计算。

验证结果

  1. 结构验证: 从Parquet分片重新推导行数、token总数、schema及空值计数。89个分片均携带完全一致的schema。
  2. 上传完整性: 所有89个分片均通过SHA-256与Hub记录的LFS哈希比对验证,无缺失或多余分片。
  3. 计数正确性: 从15个随机分片中随机抽取900个文档重新分词,与存储的token_count零不匹配。
  4. 文本保真度: 每次爬取输出的头部与已批准样本在texttoken_count上逐字节一致。

另外,100个样本文档在Transformers 5.0.0下重新计数与4.44.2版本完全匹配,token ID序列的SHA-256哈希均为5219cad4b1384275488249b12cfb80019bed8feebbf28658aaba5ba383fdd8c5

环境与版本

完整运行使用Python 3.11.15(Linux),主要包版本:transformers 5.0.0、tokenizers 0.22.2、datasets 4.0.0、huggingface-hub 1.30.0、pyarrow 17.0.0、numpy 1.26.4。验证样本最初使用旧版本生成,但计数结果完全一致。

使用方式

python from datasets import load_dataset

完整年份,使用流式加载避免41 GiB下载

dataset = load_dataset( "stevenyuan666/fineweb-edu-2013-qwen2-7b", split="train", streaming=True, )

100文档验证样本

sample = load_dataset( "stevenyuan666/fineweb-edu-2013-qwen2-7b", "sample", split="train", )

配置说明

数据集提供两个配置:

  • default: 完整训练数据,位于data/train/*.parquet
  • sample: 100文档验证样本,位于sample/train/*.parquet

引用与许可

源数据集遵循ODC-By 1.0许可,并受Common Crawl使用条款约束。更多策展细节、局限性和引用信息请参阅源数据集卡片。

搜集汇总
数据集介绍
fineweb-edu-2013-qwen2-7b 数据集图片
构建方式
本数据集源自HuggingFaceFW/fineweb-edu,精选2013年度Common Crawl两个爬取批次(CC-MAIN-2013-20与CC-MAIN-2013-48)的全部文档,采用保留全部数据的策略,未做任何洗牌或子集抽样,以维持原始流顺序。每一文档均经固定版本的Qwen2-7B分词器重新计数,严格遵循既定的计数合约,包括禁用特殊标记、无截断与填充,不进行文本规范化,并以分词后的token序列长度作为计数标准。数据处理流程由配置文件驱动,确保跨版本可复现性,并完整记录于处理报告中。
特点
该数据集规模宏大,包含21,800,204篇文档,总计22,693,600,656个Qwen2-7B token,数据存储于89个zstd压缩Parquet分片中,总容量达40.58 GiB。每条记录包含年份、原始文本及精确token计数三项字段,省略了来源与类别元数据。数据集经过严格的跨版本验证与发布后审计,包括结构完整性、上传哈希匹配、随机抽样重计数零误差以及文本字节级一致性校验,确保数据质量与可靠性。
使用方法
数据集可直接通过HuggingFace datasets库加载,支持流式读取以应对大体积数据,亦提供精简的100文档验证样本。用户可基于此数据集进行语言模型的持续预训练或微调,利用预计算的token计数简化数据准备流程。数据集schema简洁,包含原始文本与token数量,便于集成至自定义训练管线。此外,数据集附有完整复现指令与验证脚本,研究者可依据说明重现整个处理流程或执行审计抽查,确保研究的可重复性与数据的可信度。
背景与挑战
背景概述
FineWeb-Edu 2013 with Qwen2-7B token counts 数据集由研究者 stevenyuan666 于近年创建,旨在为大规模语言模型的持续预训练提供高质量、结构化且可复现的训练语料。该数据集基于 HuggingFaceFW/fineweb-edu 的 2013 年度子集,涵盖 CC-MAIN-2013-20 与 CC-MAIN-2013-48 两次网络爬取,共包含约 2180 万篇文档,并以 Qwen2-7B 分词器精确计算每个文档的 token 数,为模型继续预训练提供了标准化的数据资源。其核心研究问题在于解决教育类网络文本的筛选与高效利用,通过保留全部文档而非采样的策略,确保了数据的完整性和原始性。该数据集的发布为后续年份(如 2017)提供了可扩展的处理范式,对持续预训练领域的数据工程实践具有重要参考价值。
当前挑战
该数据集面临的挑战多维且深刻。领域层面,如何从海量、异构的网络文本中精准筛选出教育价值高且内容多样的语料,是提升语言模型知识密度与推理能力的核心难题;同时,需确保数据版权合规与来源可追溯。构建过程中,挑战体现在精确复现分词计数的复杂性上,包括不同版本 Transformers 与 tokenizers 库间的兼容性管理,需通过严格的跨版本验证确保计数一致性;大规模数据处理时,需权衡吞吐量与资源占用,通过优化批处理和并行策略提升效率,并防止因原生线程导致的进程异常退出;此外,数据上传的完整性与可复现性要求严苛的哈希校验与抽样审计,确保最终发布的数据集准确无误,为后续研究提供可靠基石。
常用场景
经典使用场景
该数据集是面向2013年度FineWeb-Edu文档的持续预训练语料,由Qwen2-7B分词器精确标记,每篇文档附带token计数。在语言模型研究领域,它常作为持续预训练(continued pretraining)的基准数据,用于评估模型在特定时间切片上的知识更新能力。研究者利用其时序特性,分析模型在2013年知识上的表现,或将其注入预训练流程以增强模型对历史语料的记忆与泛化。其严格的token计数合约和可复现性设计,使之成为测试不同分词器或tokenization策略对训练效果影响的理想平台。
实际应用
在实际应用中,该数据集适用于需要针对性历史知识增强的文本生成系统。例如,开发2013年时间点问答或事件回顾应用时,可将其作为检索增强生成(RAG)的语料源,利用精确的token计数优化索引存储与检索上下文窗口。企业亦可将其用于微调行业专用模型,注入特定年份的术语与文档风格。其流式加载接口支持大规模分布式处理,便于工程团队在有限资源下快速融入预训练流水线,而样本配置则可供小规模测试与性能基准测定,加速模型迭代周期。
衍生相关工作
该数据集衍生工作聚焦于分词器一致性验证与高效计数实现。基于其跨版本token ID序列哈希比对的方法,后续研究可推广至其他分词器(如GPT-2、Llama)的兼容性审计,形成标准化的语料计数协议。其多后端计数路径(encode_batch_fast、transformers等)的性能对比,启发了优化大规模tokenization吞吐量的研究。样例文档的字节级校验策略,被后续数据管道的质量审计工作借鉴,用于保障大规模语料构建的可信度,推动了数据工程与预训练流程的科学化管理。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务