遇见数据集

dclm-pool-400m-1x-student-cleaned-rescued

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

DCLM 400M-1x 池的清洗与救援版数据集。该数据集源自 DCLM 项目的 dclm-pool-400m-1x 池(10% 分片样本),使用 EleutherAI/gpt-neox-20b 分词器进行分词,可直接用于 DCLM 的训练流程。构建过程包含三个步骤:1) 提取:通过 MinerU-HTML / Dripper(一个 0.6B 参数的块分类器)对每个原始 HTML 页面进行块级标注,区分主内容和样板内容,然后渲染为纯文本(每块一行,无空行,保留列表标记,表格展平)。2) 清洗:使用从 27B 教师模型蒸馏得到的 Qwen3-0.6B 学生模型,对每个页面的提取文本做出三种决策:保留原页面、应用行级编辑(移除噪声行或片段)、或删除页面。该步骤删除了约 46% 的页面。3) 救援:针对被删除的页面,使用 FineWeb-Edu 分类器进行评分,得分 ≥ 1(占删除页面的 37%,约 300 万页)的页面由 cx-cmu/repro-rephraser-4B 模型进行释义改写并重新合并回数据集中,增加了约 0.9B tokens 的原本被丢弃的内容。数据集提供 tokenized 目录下的 webdataset shards 以及 manifest.jsonl 清单文件,并附带训练脚本(如 411M 4x Chinchilla 和 1B 1x Chinchilla)和评估脚本。参考性能(未救援前)显示,在相同池上,411M 模型 1x 预算下 Core 得分为 0.1391,4x 预算下为 0.2019,1B 模型 1x 预算下为 0.2636。文本内容来源于 Common Crawl,通过 DCLM 池获取,继承 ODC-By 许可证及 Common Crawl 使用条款。改写部分由模型生成。该数据集适用于预训练语言模型的文本生成任务。

创建时间:
2026-09-10
搜集汇总
数据集介绍
dclm-pool-400m-1x-student-cleaned-rescued 数据集图片
构建方式
该数据集源自DCLM项目发布的dclm-pool-400m-1x池(10%分片样本),以EleutherAI/gpt-neox-20b分词器进行分词,采用三阶段流水线构建:抽取阶段借助MinerU-HTML/Dripper的0.6B块分类器将每个HTML块标注为主体内容或模板噪声,并渲染为纯文本(每块一行,无空行,保留列表标记,表格扁平化);清洗阶段由Qwen3-0.6B学生模型(蒸馏自27B教师,在15万页上训练)对每页文本做出保留、行级编辑或删除的决策,约删除46%的页面;拯救阶段对删除页面经FineWeb-Edu分类器评分,得分不低于1的页面(占删除量37%,约300万页)由cx-cmu/repro-rephraser-4B改写后合并回语料,新增约9亿token。
特点
该数据集以GPT-NeoX-20B token id形式存储于webdataset分片,并附带open_lm清单文件(manifest.jsonl),总规模介于10亿至100亿token之间,语言为英语,任务类别为文本生成,采用ODC-By许可协议(继承Common Crawl使用条款)。其核心特点在于通过蒸馏学生模型实现高效网页清洗,并创新性地引入“拯救”机制,将原本被删除但具有教育价值的页面经改写后重新纳入,从而减少数据浪费,提升预训练语料的质量与多样性。
使用方法
使用者可先克隆DCLM仓库并安装依赖,通过huggingface-cli下载数据集至本地,随后在dclm/exp_data/datasets/tokenized/下创建数据集配置文件(指定uuid、名称、本地路径、清单路径、分词器为EleutherAI/gpt-neox-20b),即可调用提供的训练脚本(如train_411m_4x.sh或train_1b_1x.sh)进行预训练。训练时可通过调整NNODES、NPROC、ACCUM等参数适配硬件资源,确保全局批大小为512序列。评估阶段需先下载外部评估数据,再运行evaluate.sh脚本,并务必使用eval_sheet.py从原始指标json中提取Core分数,以保证结果与DCLM基准可比。
背景与挑战
背景概述
大规模预训练语料的质量直接决定语言模型的性能上限,而网络爬取文本充斥噪声与冗余,促使学界持续探索自动化清洗方案。DCLM项目由ML Foundations等机构于2024年前后发起,旨在构建开放、可复现的预训练数据生态。本数据集基于DCLM的dclm-pool-400m-1x子集,采用0.6B学生模型蒸馏清洗并结合改写救援策略,核心研究问题是如何在剔除低质内容的同时挽回被误删的高教育价值文本。其影响力在于为数据清洗与模型预训练之间的协同优化提供了可复用的流水线范例。
当前挑战
在领域问题上,网络预训练语料的清洗面临去噪与保真之间的根本性权衡:过度过滤会丢失稀有但有益的知识,而过滤不足则引入有害噪声。具体挑战包括:HTML块级分类器需精准区分正文与模板,误判将级联影响后续清洗;学生模型蒸馏过程中决策边界模糊,删除约46%的页面可能包含潜在高质文本;改写救援环节则需保证生成文本的语义一致性与事实准确性,避免引入幻觉。构建过程中,流水线需协调多个模型(分类器、学生模型、教育分类器、改写模型)的推理效率与存储开销,并确保分词格式与上游训练框架兼容。
常用场景
经典使用场景
在大规模语言模型预训练语料构建的学术脉络中,该数据集以DCLM池为基底,经由MinerU-HTML/Dripper进行区块级正文与模板甄别,再借助由27B教师蒸馏而来的Qwen3-0.6B学生模型执行页面保留、行级编辑或删除的细粒度清洗,最终对删除页面施以FineWeb-Edu分类器评分与4B改写模型复述的挽救策略,形成可直接馈入DCLM训练管线的GPT-NeoX-20B分词语料。其经典用法在于以严格清洗与创造性挽救的双重机制,为中等规模语言模型的预训练供给兼具纯净度与信息容量的文本资源,并借助配套脚本复现411M与1B参数模型的标准化训练与Core指标评测流程。
解决学术问题
该数据集直面网络爬取语料中普遍存在的正文与导航、广告等模板噪声混杂问题,以及传统启发式清洗易将高教育价值但形式杂乱的页面误删的困境。通过学生模型的行级编辑能力与挽救回译机制,它在保证语料整体质量的同时回收了约0.9B原本被丢弃的token,缓解了预训练数据过滤中质量与规模之间的权衡矛盾。此举为语料清洗研究提供了可复现的蒸馏—清洗—挽救范式,并为低资源学术场景下评估数据工程对模型下游表现的实际贡献建立了参照基线,其意义在于推动数据-centric的语言模型研究向更精细、更少信息损耗的方向演进。
衍生相关工作
该数据集衍生的工作主要围绕DCLM生态展开,包括对MinerU-HTML/Dripper区块分类器的进一步验证与改进,以及基于Qwen3-0.6B蒸馏学生的清洗策略在更多语料上的泛化研究。FineWeb-Edu分类器与repro-rephraser-4B改写模型在该流程中的组合使用,激发了后续关于删除内容挽救与模型生成文本混合比例的探讨。配套的训练与评估脚本亦催生了针对Chinchilla最优配比、Core指标复现及低方差任务集的比较研究,为DCLM系列模型的迭代提供了可对照的基线数据点,并可能推动更高效的语料蒸馏与去噪方法在开源社区中的传播。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务