dclm-pool-400m-1x-student-cleaned-rescued
收藏资源简介:
DCLM 400M-1x 池的清洗与救援版数据集。该数据集源自 DCLM 项目的 dclm-pool-400m-1x 池(10% 分片样本),使用 EleutherAI/gpt-neox-20b 分词器进行分词,可直接用于 DCLM 的训练流程。构建过程包含三个步骤:1) 提取:通过 MinerU-HTML / Dripper(一个 0.6B 参数的块分类器)对每个原始 HTML 页面进行块级标注,区分主内容和样板内容,然后渲染为纯文本(每块一行,无空行,保留列表标记,表格展平)。2) 清洗:使用从 27B 教师模型蒸馏得到的 Qwen3-0.6B 学生模型,对每个页面的提取文本做出三种决策:保留原页面、应用行级编辑(移除噪声行或片段)、或删除页面。该步骤删除了约 46% 的页面。3) 救援:针对被删除的页面,使用 FineWeb-Edu 分类器进行评分,得分 ≥ 1(占删除页面的 37%,约 300 万页)的页面由 cx-cmu/repro-rephraser-4B 模型进行释义改写并重新合并回数据集中,增加了约 0.9B tokens 的原本被丢弃的内容。数据集提供 tokenized 目录下的 webdataset shards 以及 manifest.jsonl 清单文件,并附带训练脚本(如 411M 4x Chinchilla 和 1B 1x Chinchilla)和评估脚本。参考性能(未救援前)显示,在相同池上,411M 模型 1x 预算下 Core 得分为 0.1391,4x 预算下为 0.2019,1B 模型 1x 预算下为 0.2636。文本内容来源于 Common Crawl,通过 DCLM 池获取,继承 ODC-By 许可证及 Common Crawl 使用条款。改写部分由模型生成。该数据集适用于预训练语言模型的文本生成任务。





