遇见数据集

danish-foundation-models/faroese-dynaword

收藏
Hugging Face2026-07-05 更新2026-07-22 收录
官方服务:

资源简介:

法罗语Dynaword是一个收集自多个领域的法罗语自由文本数据集的集合。所有数据集均采用开放许可证,并被认为适用于训练大型语言模型。数据集包含58.89K个样本,总计6.50M个令牌(使用Llama 3分词器),平均文档长度为110.43个令牌(范围从2到28.77K)。数据来源包括维基百科(百科全书领域,5.45M令牌)、Ravnursson ASR语料库的标准化法罗语转录(朗读领域,794.44K令牌)以及POS标注的Sosialurin报纸文本(新闻领域,263.51K令牌)。数据集持续开发,会随着新数据的可用性而更新,并鼓励社区贡献。

The Faroese dynaword is a collection of Faroese free-form text datasets from various domains. All of the datasets in the Faroese Dynaword are openly licensed and deemed permissible for training large language models. The dataset contains 58.89K samples with 6.50M tokens (using the Llama 3 tokenizer), and an average document length of 110.43 tokens (ranging from 2 to 28.77K). Sources include Wikipedia (encyclopedic domain, 5.45M tokens), normalized Faroese transcripts from the Ravnursson ASR corpus (readaloud domain, 794.44K tokens), and POS-tagged Sosialurin newspaper text (news domain, 263.51K tokens). It is continually developed, with updates as new datasets become available, and encourages community contributions.

搜集汇总
数据集介绍
danish-foundation-models/faroese-dynaword 数据集图片
构建方式
Faroese Dynaword 是一个持续构建的法罗语自由文本数据集合集,旨在汇集来自不同领域的公开许可语料,以支持大规模语言模型的训练。其构建过程并非一次性完成,而是采用动态扩展机制:随着新数据源的开放,数据集会持续纳入更新。当前版本整合了四个子集,包括议会演讲转录文本、百科全书条目、有声读物朗读转录以及新闻报纸语料。每个子集均附有独立的来源说明与复现脚本,确保构建过程可追溯。此外,数据集还执行了一系列自动化质量检查,涵盖格式校验、重复与空字符串检测以及文档记录审验,从而在保留原始文本多样性的前提下维持基础质量水准。
特点
该数据集的核心特色在于其持续演进(continually developed)的属性,意味着其内容将随时间推移不断扩充与迭代,避免了传统静态数据集的一次性局限性。数据来源覆盖口语、百科全书、朗读与新闻四大领域,总计包含约2315万词元,展现了法罗语在不同社会语境下的真实使用面貌。所有数据均基于CC-BY 4.0或CC-BY-SA 4.0等开放许可协议发布,便于学术研究与商业应用。每条样本均附带丰富的元数据,包括来源标识、添加日期、原始创作时间范围以及基于Llama 3分词器计算的词元数量,为数据筛选与下游任务提供了细粒度的参考信息。
使用方法
用户可通过HuggingFace Datasets库便捷地加载该数据集。直接调用`load_dataset("danish-foundation-models/faroese-dynaword", split="train")`即可获取完整语料,也支持按子集名称分别加载,例如指定`sosialurin-faroese-pos`或`wikipedia`等配置。对于大规模处理场景,建议启用流式加载模式(streaming=True),以降低内存占用。由于数据集持续更新,为确保实验的可复现性,用户可在加载时指定具体的版本修订标识(revision),从而锁定所使用的数据版本。整个数据集仅提供一个`train`划分,便于直接用于语言模型预训练或文本生成任务的微调。
背景与挑战
背景概述
法罗语作为一门使用人数稀少的北欧语言,在自然语言处理领域长期面临数据资源匮乏的困境,严重制约了其语言技术发展。为弥合这一鸿沟,丹麦基础模型团队于2025年发布了Faroese Dynaword数据集,该数据集由丹麦技术大学、哥本哈根大学等多个机构的研究人员联合构建。该数据集的核心研究问题在于为法罗语大型语言模型训练提供高质量、开放许可的文本语料库,从而推动低资源语言的自然语言处理研究。通过汇聚议会演讲、维基百科、新闻与语音识别转写等多领域文本,该数据集为法罗语的语言建模、文本生成等任务奠定了重要基础,成为该语言数字化进程中的里程碑式资源。
当前挑战
Faroese Dynaword数据集所面临的核心挑战在于解决低资源语言数据稀疏性的领域问题:法罗语仅有约8万母语者,网络文本资源极为有限,导致语言模型训练缺乏足够的数据支撑。在构建过程中,团队遭遇了多重困难:首先,需从极为分散且格式各异的来源(如议会记录与新闻语料)中搜集并标准化数据,部分数据集需处理历史文本中的拼写变异与代码混合现象;其次,数据集采用持续开发模式,要求在数据量随时间递增的同时保持各版本间的兼容性与可复现性,这增加了版本管理与质量控制的复杂度;此外,如何确保所收集数据在CC-BY 4.0等开放性许可下合法使用,并在尊重原著版权的前提下进行再分发,亦是构建过程中的法律与伦理挑战。
常用场景
经典使用场景
法罗语资源稀缺,长期困扰低资源自然语言处理领域的发展。Faroese Dynaword作为首个大规模、多领域、持续更新的法罗语开放文本语料库,汇聚议会演讲转录文本、维基百科条目、有声读物转录及新闻报纸语料,涵盖口语、百科、朗读和新闻四大领域,为法罗语语言模型预训练提供了至关重要的基础数据支撑,尤其适用于因果语言建模与自回归文本生成任务的训练与评估。
解决学术问题
该数据集直面低资源语言NLP研究中数据匮乏与领域单一的瓶颈,解决了法罗语缺乏高质量、多样化且可合法用于模型训练的语料这一根本性难题。通过整合来自议会、维基、新闻等公开许可资源,该语料库使研究者得以开展法罗语的词汇语义演化、跨领域语言变体分析以及语言模型从零训练的学术探索,显著降低了小语种进入大模型时代的研究门槛,推动了语言资源均衡发展的学术理念。
衍生相关工作
围绕该数据集衍生出多项开创性工作,包括基于Dynaword持续开发范式的动态语料构建方法论,以及用于低资源语言评估的领域适配模型基准。该语料激发了对小语种语言模型数据配比策略与训练效率的研究,亦催生了法罗语词性标注与命名实体识别等下游任务的公开排行榜。作为丹麦基础模型项目的组成部分,该数据集还推动了跨斯堪的纳维亚语言的迁移学习与多语言微调工作的深入探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务