遇见数据集

fineweb-edu-2015-qwen2

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

FineWeb-Edu 2015 是 FineWeb-Edu 数据集的一个子集,专为 FinMoE 项目的继续预训练而准备。该数据集包含 93,077,934 个文档,共计约 1000 亿 Qwen2-7B tokens。每个文档包含三个字段:date(int32 类型,固定为 2015 年)、text(字符串类型,未修改的原始文档文本)、token_count(int32 类型,使用 Qwen2-7B 分词器在原始文本上计数得到的 token 数,未添加特殊 token 且不截断)。数据来源于 HuggingFaceFW/fineweb-edu 数据集在 2015 年的全部 10 个 CommonCrawl 转储(共 134 个分片)。为了达到 100B token 的目标,采用了可复现的随机 shuffle:为每个文档分配一个基于随机种子的均匀采样 u(种子为 20150101 + 分片索引),按 u 排序后依次选取文档,累积 Qwen2-7B token 数,在首个超过目标值的文档之前停止,只保留完整文档。最终的截止条件为 u < 0.919854179101843。处理详情(包括软件包版本)记录在 processing_metadata.json 文件中。

FineWeb-Edu 2015 is a subset of the FineWeb-Edu dataset, prepared for the continued pretraining of the FinMoE project. It contains 93,077,934 documents, totaling approximately 100 billion Qwen2-7B tokens. Each document consists of three fields: date (int32 type, fixed as 2015), text (string type, unmodified original document text), and token_count (int32 type, counted using the Qwen2-7B tokenizer on the original text, without adding special tokens or truncation). The data comes from all 10 CommonCrawl dumps (134 shards) of 2015 from the HuggingFaceFW/fineweb-edu dataset. To achieve the target of 100B tokens, a reproducible random shuffle was used: assign a uniform sample u based on a random seed (seed = 20150101 + shard index) to each document, sort by u, select documents sequentially, accumulate Qwen2-7B token count, stop before the first document that exceeds the target, keeping only complete documents. The final cutoff condition is u < 0.919854179101843. Processing details (including software package versions) are recorded in the processing_metadata.json file.

创建时间:
2026-09-08
原始信息汇总

数据集概述

基本信息

  • 数据集名称:FineWeb-Edu 2015, Qwen2-7B token counts
  • 许可证:odc-by
  • 文档数量:93,077,934
  • Token 数量:99,999,999,500 Qwen2-7B tokens
  • 用途:作为 FinMoE 项目的一部分,用于持续预训练(continued pretraining)

数据列结构

列名 类型 含义
date int32 FineWeb 年份,即 2015
text string 文档文本,未做修改
token_count int32 text 中的 Qwen2-7B token 数量

数据来源

  • 来源数据集:HuggingFaceFW/fineweb-edu,revision 为 87f09149ef4734204d70ed1d046ddc9ca3f2b8f9
  • 覆盖 2015 年全部 10 个 CommonCrawl dumps(134 个分片)

Token 计数方式

  • 使用模型:Qwen/Qwen2-7B,revision 为 453ed1575b739b5b03ce3758b23befdb0967f40e
  • 计数参数:add_special_tokens=Falsetruncation=False
  • 在原始文本上进行计数
  • FineWeb-Edu 自带的 token_count 列基于 GPT-2,已被丢弃,未复制使用

选择方法

  • 2015 年的数据量超过 100B token 的目标
  • 每个文档被分配一个 u 值,取自 random.Random(20150101 + shard_index) 的均匀抽样,按行顺序取得
  • u 排序可实现可复现的文档级随机打乱
  • 按该顺序累积实际 Qwen2 token 计数,在第一个会使总数超过目标的文档之前停止,仅保留完整文档
  • 最终截止值为 u < 0.919854179101842

补充说明

  • 完整细节(包括包版本信息)记录于 processing_metadata.json
搜集汇总
数据集介绍
fineweb-edu-2015-qwen2 数据集图片
构建方式
该数据集根植于大规模语言模型持续预训练对高质量语料的需求,以HuggingFaceFW/fineweb-edu为源,锁定2015年全部10个CommonCrawl转储(共134个分片)。构建时,将原始文档通过Qwen/Qwen2-7B分词器重新计数,禁用特殊标记与截断,从而得到与目标模型对齐的token统计。为达成千亿token目标,采用基于随机种子20150101与分片索引的均匀抽样,按行序赋予每篇文档随机数u并排序,形成可复现的文档级混洗;依序累积实际token数,在超出目标前停止,仅保留完整文档,最终得到93,077,934篇文档和99,999,999,500个Qwen2-7B token。
使用方法
在使用层面,该数据集主要服务于以Qwen2-7B为基座的持续预训练任务,尤其适合作为FinMoE项目等混合专家模型训练的高质量语料。加载后,可直接利用text字段作为模型输入,并借助token_count字段进行批次token预算控制、课程学习排序或数据配比调整。由于抽样过程完全可复现,研究者可依据processing_metadata.json中的版本与参数复现相同子集,或调整截断阈值以获取不同规模的数据。需注意,该数据集遵循odc-by许可,使用时需遵守相应归属要求,并避免将文本内容用于违反CommonCrawl使用条款的场景。
背景与挑战
背景概述
随着大语言模型对高质量预训练语料的需求日益迫切,FineWeb-Edu作为从CommonCrawl中精炼出的教育价值文本集合,已成为诸多语言模型训练流程中的重要数据来源。在此背景下,FineWeb-Edu 2015, Qwen2-7B token counts数据集于2025年前后由FinMoE项目团队构建,旨在为持续预训练提供精确的Qwen2-7B词元计数与可复现的文档级采样。该数据集聚焦于2015年全部10个CommonCrawl转储,涵盖逾9300万篇文档,不仅为模型训练提供了精准的词元统计基础,也推动了语料筛选与课程学习策略的精细化发展。
当前挑战
该数据集所面对的领域挑战,在于如何从海量、异构且含噪的网页文本中筛选出真正具备教育价值的语料,以满足大语言模型对高质量预训练数据的严苛要求。构建过程中,挑战体现于多个层面:需对原始FineWeb-Edu中基于GPT-2的词元统计进行彻底重构,以Qwen2-7B分词器逐文档重新计数,确保词元数量与目标模型严格对齐;同时,为在超过1000亿词元规模的年份中精确获取1000亿词元子集,必须设计可复现的随机洗牌与截断机制,并保证仅以完整文档为单位进行采样,避免引入不实或不可控的语料片段。
常用场景
经典使用场景
在大规模语言模型持续预训练与领域自适应微调的实践中,该数据集凭借其面向教育语料的精准筛选与Qwen2-7B分词计数特性,成为构建高质量训练语料的经典选择。研究者通常将其作为继续预训练阶段的核心语料来源,以提升模型在知识密集型任务中的表现。
解决学术问题
该数据集有效缓解了教育领域高质量语料稀缺与分词器适配困难两大问题。通过提供经过去重、质量过滤且以Qwen2-7B分词计数的语料,它使得模型在保持通用能力的同时,显著增强对教育内容的建模能力,为课程学习、知识蒸馏等研究提供了可复现的数据基础。
实际应用
在实际应用中,该数据集广泛用于教育问答系统、智能辅导平台以及学科知识库的构建。其精确的token计数与文档级筛选机制,使开发者能够高效规划训练预算,并直接用于Qwen2系列模型的继续预训练,从而提升模型在数学、科学等学科任务上的推理与生成质量。
数据集最近研究
最新研究方向
在教育数据与模型自适应领域,fineweb-edu-2015-qwen2数据集为持续预训练研究提供了关键资源。该数据集通过Qwen2-7B词元计数进行精确控制,支持FinMoE项目等前沿探索,旨在平衡通用能力与领域知识。其可复现的文档级采样策略不仅推动了数据高效利用的热点议题,也为教育内容理解、多任务学习及语言模型持续适应提供了实证基础。此类工作对提升模型在专业场景下的泛化性具有深远影响,并促进了开放数据与模型协同发展的生态建设。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务