遇见数据集

m-a-p/FineFineWeb-validation

收藏
Hugging Face2024-12-19 更新2024-12-21 收录
官方服务:

资源简介:

FineFineWeb是一个细粒度领域网络语料库的综合研究数据集,涵盖了多个细粒度领域,如航空航天、农学、艺术、天文学等。数据集通过去重、URL标注、粗粒度召回、细粒度召回等步骤构建,并提供了每个领域的token数量和样本数量。此外,数据集还进行了领域-领域相似性分析、领域-领域重复率分析以及领域-基准测试BPC-Acc相关性分析,以评估不同领域之间的相似性和相关性。

FineFineWeb is a comprehensive study on fine-grained domain web corpus, containing text data from multiple domains. The dataset construction process includes deduplication, URL labeling, coarse recall, fine recall, and iterative recall. The dataset provides detailed statistics on the amount of data and the number of samples in each domain, and evaluates the quality and characteristics of the dataset through domain similarity analysis, domain-domain duplication analysis, and domain-benchmark BPC-Acc correlation analysis.

提供机构:
m-a-p
搜集汇总
数据集介绍
m-a-p/FineFineWeb-validation 数据集图片
构建方式
FineFineWeb-validation数据集基于FineWeb语料库构建,通过精细化的领域筛选流程实现。首先,对FineWeb进行精确去重与MinHash冗余移除。随后,利用GPT-4对排名前100万的根URL进行标注,生成粗粒度兴趣领域与非兴趣领域种子数据。在此基础上,采用Qwen2-7B-Instruct模型对采样数据进行标注,训练二分类FastText模型执行粗粒度召回,产出各领域的候选数据。进而,借助Qwen2-72B-Instruct模型对粗粒度结果进行精细标注,训练BERT模型执行细粒度召回,最终获得高质量领域子集。该粗-细召回流程迭代三轮,每轮使用更新的种子数据重新训练FastText模型,而BERT模型保持冻结,以持续优化数据质量。
特点
该数据集覆盖65个精细领域,包括航空航天、生物学、计算机科学等,总计约4.4万亿词元,展现出极高的领域覆盖广度与粒度。通过TF-IDF分析发现,多数领域间URL重复率较低,表明领域划分具有高度独特性,仅topicality、宠物科学等少数领域存在较高重叠。领域-基准测试相关性分析揭示,STEM类基准(如ARC、MMLU)与数学、物理等科学领域高度相关,而事实知识型基准(如TriviaQA)则与文学、历史等人文学科紧密关联。这些特点使数据集成为研究预训练数据领域分布与模型性能关系的理想资源。
使用方法
该数据集支持文本分类、文本生成及文本到文本生成等多种任务。用户可通过HuggingFace Datasets库直接加载,使用`load_dataset("m-a-p/FineFineWeb-validation", split="train")`命令获取数据。数据集以领域标签为索引,便于按需筛选特定领域的子集进行训练或评估。推荐在预训练或领域适应场景中,结合领域-基准相关性分析结果,选择与目标任务相关的领域组合。此外,数据集提供详细的领域统计信息,用户可据此进行数据采样或权重调整,以优化模型在特定下游任务上的表现。
背景与挑战
背景概述
FineFineWeb数据集由M-A-P团队于2024年12月创建,旨在应对大规模网络语料库中领域粒度不足的挑战。传统网络语料如FineWeb虽规模庞大,但缺乏细粒度的领域分类,难以支撑对特定知识领域(如航空航天、生物学、经济学等)的精准预训练研究。该数据集通过创新的粗-细粒度迭代召回机制,结合GPT-4和Qwen2系列模型进行种子标注,并利用FastText与BERT实现高效分类,最终构建了涵盖65个细粒度领域的4425亿Token语料。其核心研究问题在于如何系统性地划分与提取网络数据中的领域知识,为语言模型的领域特异性能力评估提供了标准化资源。该数据集在自然语言处理领域具有重要影响力,为多领域知识融合与预训练数据优化开辟了新路径。
当前挑战
FineFineWeb面临的挑战首先体现在领域分类的精确性与广泛性平衡上:传统方法难以区分高度重叠的领域(如数学与计算机科学),而该数据集通过实验发现,代码相关基准(如MBPP)与多数领域距离较大,但数学领域与代码数据存在一定重叠,揭示了领域间边界模糊的复杂性。其次,构建过程中需克服标注成本与模型泛化能力的矛盾:依赖GPT-4和Qwen2-72B-Instruct进行大量数据标注,虽保证了质量,但高昂的计算开销限制了迭代次数;同时,FastText与BERT的联合训练需避免过拟合,尤其在低资源领域(如核科学、纺织科学)中,正负样本不平衡导致分类器性能下降。此外,领域间URL重复率分析显示,部分领域(如热门话题、宠物、大气科学)存在较高冗余,需进一步优化去重策略以提升数据独特性。
常用场景
经典使用场景
FineFineWeb-validation 数据集的核心应用场景在于为自然语言处理模型提供精细粒度的领域化预训练语料。该数据集通过多轮粗-细粒度召回流程,从海量通用网络文本中精准提取出涵盖航空航天、农学、艺术、计算机科学等数十个垂直领域的子集,使得研究者能够针对特定知识领域训练语言模型,从而提升模型在专业任务上的表现。其经典使用方式包括领域自适应预训练、多任务学习中的领域对齐,以及作为评估模型跨领域泛化能力的基准资源。
衍生相关工作
围绕FineFineWeb,衍生了一系列探讨领域语料与模型性能关联性的经典工作。例如,研究者利用该数据集分析了领域间URL冗余率与TF-IDF分布,揭示了不同学科内容在语料中的独特性与重叠程度;通过BGE-M3嵌入计算领域与基准测试(如MMLU、GSM8K)之间的MMD距离,量化了预训练数据与下游任务的相关性;此外,基于28个模型进行的BPC-Acc相关性分析,发现STEM领域子集与数学、科学推理类基准高度关联,而文史类子集则更有利于事实性问答任务,这些结论为数据驱动的模型优化提供了理论指导。
数据集最近研究
最新研究方向
FineFineWeb数据集的发布标志着网络语料库构建从粗粒度过滤迈向细粒度领域精炼的前沿方向。该研究针对大规模通用语料FineWeb,创新性地采用GPT-4与Qwen2系列大模型进行多轮迭代的粗-细粒度召回策略,结合FastText与BERT分类器,成功构建了覆盖70余个垂直领域的高质量子集。这一工作紧密关联当前大语言模型预训练数据质量优化的热点,通过领域-基准测试的BPC-Acc相关性分析,揭示了不同领域数据对模型推理能力(如数学、物理)与事实知识(如历史、文学)的差异化贡献,为定制化预训练数据配比提供了量化依据。其影响在于推动了从'数据规模竞赛'向'数据科学精炼'的范式转变,为构建更高效、更可控的领域专用语言模型奠定了坚实的数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务