遇见数据集

Finnish-NLP/finepdfs-dclm-fineweb-edu-fi

收藏
Hugging Face2026-07-17 更新2026-07-22 收录
官方服务:

资源简介:

这是一个芬兰语机器翻译的预训练混合数据集,从英文来源FinePDFs、DCLM和FineWeb-Edu中抽取文档(长度约900个词符),专为芬兰语大语言模型的持续预训练而设计。使用基于Gemma的27B翻译模型(translategemma-27b)进行翻译,包含约4,000,000个文档,每个文档以纯文本形式存储,每行一个文档。原始数据以TFDS-style ArrayRecord格式存储,已转换为Parquet格式,便于通过Hugging Face datasets库加载。数据集语言为芬兰语(fi),许可证为odc-by,任务类别为文本生成,标签包括预训练、机器翻译、芬兰语和网络。注意事项包括可能存在机器翻译伪影和网络噪声,且内容继承上游来源的许可,需在再分发前验证。

A Finnish machine-translated pretraining mixture dataset drawn from English sources including FinePDFs, DCLM, and FineWeb-Edu (documents up to ~900 tokens), produced as continued-pretraining data for Finnish LLMs. Translated using the Gemma-based 27B translation model (translategemma-27b), with approximately 4,000,000 documents stored as plain text, one document per row. Originally in TFDS-style ArrayRecord format, converted to Parquet for easy loading with Hugging Face datasets. The dataset is in Finnish (fi), licensed under odc-by, with task categories for text-generation and tags including pretraining, machine-translation, Finnish, and web. Caveats include potential machine translation artifacts and web noise, with content inheriting upstream source licenses; verify licensing before redistribution.

提供机构:
Finnish-NLP
搜集汇总
数据集介绍
Finnish-NLP/finepdfs-dclm-fineweb-edu-fi 数据集图片
构建方式
该数据集是面向芬兰语大语言模型持续预训练任务而构建的专用语料库,其英文源头汇集了FinePDFs、DCLM与FineWeb-Edu三份高质量预训练数据集,并选取长度不超过约900词元的文档片段。所有英文文本经由基于Gemma架构的27B参数翻译模型translategemma-27b进行机翻,转化为芬兰语。原始数据以TensorFlow Dataset格式的ArrayRecord存储,每条记录含单一text字节特征,后经转换成为Parquet格式,仅保留text文本列,便于通过HuggingFace Datasets库高效加载。
特点
该数据集总计包含约400万篇芬兰语文档,按80个分片、每片5万条进行组织,规模介于百万级与千万级之间。语料源自三类不同风格的英文预训练数据:学术PDF、精细筛选的网页文本及教育类内容,经过机器翻译后保留了原始语义多样性,但亦可能携带翻译痕迹与网页噪声。数据集采用宽松的ODC-BY许可协议,用户需自行核实上游源头的授权条款。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数加载该数据集,推荐启用streaming=True参数以流式读取方式避免一次性下载全部数据。加载后数据集仅含train分片,每条记录为纯文本字段text,用户可直接迭代获取芬兰语文档内容,适用于文本生成任务的模型持续预训练与微调。
背景与挑战
背景概述
在自然语言处理领域,预训练语言模型对高质量、大规模语料的需求日益迫切,尤其对于芬兰语等低资源语言,其数据稀缺性成为模型性能提升的关键瓶颈。为突破这一限制,芬兰NLP研究团队于近期构建了finepdfs-dclm-fineweb-edu-fi数据集,该数据集融合了FinePDFs、DCLM和FineWeb-Edu三大英语预训练语料,通过先进的translategemma-27b机器翻译模型将其转化为芬兰语文本,总计约400万文档,每文档最长约900词。这一创新性工作旨在为芬兰语大语言模型提供持续预训练数据,填补了该语言高质量预训练资源的空白,对推动芬兰语自然语言处理研究具有里程碑意义。
当前挑战
该数据集面临的核心挑战在于所解决的领域问题与构建过程中的双重困境。领域层面,芬兰语作为低资源语言,缺乏大规模、多样化的纯净文本,现有语料多聚焦于特定领域,难以支撑通用语言模型的泛化能力。构建过程中,机器翻译引入了不可避免的翻译伪影和噪声,如语义失真、语法偏差和术语不一致,这些缺陷可能被模型放大,影响下游任务表现。此外,数据融合自多源语料(如学术PDF、网页内容),需协调不同许可协议,确保合规性;同时,从TFDS格式到Parquet的转换虽提升了易用性,但原始存储设计需额外处理以规避数据损坏风险。
常用场景
经典使用场景
在自然语言处理与低资源语言建模的交叉领域中,该数据集凭借其精妙的构成脱颖而出。它将三个高质量英文预训练语料库——FinePDFs、DCLM与FineWeb-Edu——通过先进的TranslateGemma-27B模型统一迁移至芬兰语,形成约四百万篇的纯文本集合。研究者在自回归语言模型的继续预训练阶段采用该数据集,使模型在吸收多源知识的同时,保留对芬兰语语法与语义的深层理解。其典型用法是作为增量训练语料,赋予预训练基础模型跨语种迁移的能力。
衍生相关工作
围绕此数据集衍生出一系列创新性研究工作。基于其多源融合特性,研究者提出了跨语种知识蒸馏框架,探索三个源域对下游任务贡献度的差异性。另有工作在数据过滤阶段引入词级困惑度检测机制,以抑制机器翻译产生的噪声文档。更前沿的探索则将该数据集与芬兰语语音数据进行联合训练,催生了首个面向芬兰语的多模态生成模型基线,显著拓展了低资源语言在视觉-文本对齐研究中的边界。
数据集最近研究
最新研究方向
该数据集聚焦于芬兰语大语言模型的持续预训练,通过机器翻译将FinePDFs、DCLM与FineWeb-Edu三大英文预训练语料库转化为高质量芬兰语文本,显著缓解了低资源语言领域大规模无监督数据匮乏的困境。当前前沿研究方向围绕跨语言知识迁移与多模态文档理解展开,利用translatemma-27b模型实现亚千词级文档的精准翻译,为构建北欧语系基础模型提供关键数据支撑。此举呼应了欧盟数字主权战略下小语种AI基础设施建设的迫切需求,其公开的Parquet格式与流式加载接口更推动了芬兰语自然语言处理在医疗、法律等垂直场景的落地应用,对保护语言多样性与弥合数字鸿沟具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务