遇见数据集

polish-dynaword

收藏
Hugging Face2026-06-27 更新2026-06-29 收录
官方服务:

资源简介:

Polish DynaWord是一个持续开发、开源许可的波兰语人类文本语料库,属于Dynaword家族(Enevoldsen等人,arXiv:2508.02271)的波兰语版本。数据集的核心价值在于其策展工作,而非原始数据本身。当前包含两个版本:v0.2.0稳定版,包含来自11个开放/官方来源的2,490,773个文档,约62.2亿个标记(基于Llama-3计数);以及v0.3.0预览版,正在开发中,计划整合经过质量/多样性重新混合、法律风格降权和过滤的当代波兰网络候选数据。数据来源包括EUR-Lex(欧盟法律文件)、波兰议会语料库、波兰维基百科、波兰维基文库、Dziennik Ustaw(波兰主要立法)、Wolne Lektury(学校读物)、波兰维基语录、ELTeC-pol(欧洲文学文本集)、波兰维基导游、波兰维基教科书和波兰维基新闻。所有来源均经过严格的许可证审查,确保具有开放、可追溯的法律基础。数据集遵循Dynaword方法论,包括:1)按来源进行许可证审查;2)应用最小化、可重复的过滤与标准化(短文档、非波兰语、精确跨源去重、OCR乱码);3)为每个来源提供数据表文档;4)确保可重复性和版本控制。数据模式统一为:id、text、source、added、created、token_count。数据集仅包含人类创作文本,不含合成、机器翻译或自动转录数据。适用于波兰语文本生成和预训练任务,遵循CC-BY-SA-4.0许可证发布,要求下游用户遵守各上游许可证,特别是CC-BY-SA-4.0的署名和相同方式共享要求。

Polish DynaWord is a continuously developed, open-source licensed Polish human text corpus, serving as the Polish version of the Dynaword family (Enevoldsen et al., arXiv:2508.02271). The core value of the dataset lies in its curation efforts rather than the raw data itself. It currently includes two versions: v0.2.0 stable, containing 2,490,773 documents from 11 open/official sources, with approximately 6.22 billion tokens (based on Llama-3 counting); and v0.3.0 preview, under development, planning to integrate contemporary Polish web candidate data with quality/diversity remixing, legal style de-weighting, and filtering. Data sources include EUR-Lex (EU legal documents), Polish parliamentary corpus, Polish Wikipedia, Polish Wikisource, Dziennik Ustaw (primary Polish legislation), Wolne Lektury (school readings), Polish Wikiquote, ELTeC-pol (European literary text collection), Polish Wikivoyage, Polish Wikibooks, and Polish Wikinews. All sources undergo strict license review to ensure an open, traceable legal basis. The dataset follows the Dynaword methodology, including: 1) license review by source; 2) application of minimal, reproducible filtering and standardization (short documents, non-Polish language, exact cross-source deduplication, OCR gibberish); 3) provision of data sheet documents for each source; 4) ensuring reproducibility and version control. The data schema is unified as: id, text, source, added, created, token_count. The dataset contains only human-authored text, with no synthetic, machine-translated, or automatically transcribed data. It is suitable for Polish text generation and pre-training tasks, and is released under the CC-BY-SA-4.0 license, requiring downstream users to comply with upstream licenses, particularly the attribution and share-alike requirements of CC-BY-SA-4.0.

创建时间:
2026-06-15
搜集汇总
数据集介绍
polish-dynaword 数据集图片
构建方式
Polish DynaWord数据集遵循Dynaword家族的开源方法论,致力于构建一个可溯源、可复现的高质量波兰语文本语料库。其构建过程首先对每个候选源进行严格的许可证审查,确保所有纳入文本均具有明确、透明的开放许可法律基础,不符合条件的源被明确记录并排除。随后,统一的过滤与标准化流程被应用于所有数据,包括剔除过短文档、非波兰语文档、跨源精确重复项及OCR噪声文本,最终形成包含文档标识符、原始文本、来源、添加时间、创建时间和词元计数的标准模式。该数据集通过版本化脚本实现完全可复现,每一次新增源或移除操作均记录在变更日志中,确保了数据集的持续演进与审计透明度。
特点
该数据集最显著的特征在于其“策展优先于字节”的理念:它并非简单地汇集原始文本,而是通过精细的源筛选与混配策略,打造一个面向自然语言预训练的高质量波兰语语料。目前稳定版v0.2汇集了来自11个开放或官方来源的约250万份文档,总计62.2亿词元,涵盖议会记录、法律文本、维基媒体项目、文学作品及旅行指南等多元领域。然而,该版本在词元分布上偏向法律与行政语言,因此正在开发的v0.3版本引入训练混配机制,通过源级温度采样将法律类语料的训练占比限制在10%-20%,并积极纳入当代自然波兰语网络文本,以提升语言的多样性和通用性。
使用方法
使用Polish DynaWord数据集进行模型预训练时,用户可直接加载HuggingFace上发布的parquet格式文件,通过标准的数据加载管道获取ID、文本、来源等字段。对于v0.2稳定版,推荐直接作为预训练语料使用,但需注意其法律文本占比偏高的特性,可在下游任务中适当调整混配权重。对于追求更均衡语料的用户,可参考v0.3预览版的混配策略,使用提供的Python脚本从候选源中自行过滤并混配,将法律来源的采样比例控制在15%左右。此外,数据集的词元频率报告工具可帮助分析不同来源的词汇分布特征,便于用户根据具体任务需求进一步定制数据采样方案。
背景与挑战
背景概述
Polish DynaWord是一个面向波兰语的开源自然语言语料库,由丹麦基础模型团队于2024年发起,是Dynaword多语言语料库家族中的波兰语分支,其核心研究问题在于构建一个许可透明、可复现且持续扩展的高质量波兰语预训练数据集。该数据集汇聚了EUR-Lex法律文本、波兰议会记录、维基百科等11个公开资源,在v0.2.0稳定版中已达249万余篇文档与62.2亿词元,为低资源波兰语自然语言处理提供了关键基准。其影响力体现在开创性地构建了基于来源追踪与许可审查的数据集治理范式,推动了面向斯拉夫语系的开源预训练数据生态建设,并已获学界引用。
当前挑战
该数据集面临两大核心挑战。领域层面,波兰语作为形态丰富但数据稀缺的语言,面临预训练语料中法律与议会文本占比过高(合计超60%词元)导致的语言自然度失衡问题,限制了模型在通用场景下的泛化能力。构建层面,挑战包括:1)跨来源许可一致性审查,如TVP新闻因未获明确开源许可被排除;2)从欧洲HPLT网络爬虫中筛选自然波兰语文本时,需并行处理近500万候选文档,并二次过滤机器翻译与样板内容;3)在v0.3版本中设计训练配比策略,将法律来源词元占比限制在10–20%,并引入温度采样与去重,以平衡语料多样性与领域代表性。
常用场景
经典使用场景
Polish DynaWord数据集为波兰语自然语言处理研究提供了一个经过许可审查、来源清晰且可复现的大规模文本语料库。其经典使用场景在于作为预训练语言模型的基础训练数据,尤其在需要高质量、人工撰写而非机器生成的波兰语文本时展现出不可替代的价值。该语料库汇集了来自法律文件、议会记录、百科全书、文学著作、旅行指南等多达十一个公开授权来源的文本,总计超过六十二亿词元,覆盖了从正式官方文档到日常百科知识的广泛语言风格。研究者可将此数据集直接用于训练或微调诸如BERT、GPT等架构的波兰语变体,从而获得在语法、语义及语用层面均具代表性的语言表征能力。
解决学术问题
该数据集着力解决的学术问题核心在于波兰语自然语言处理领域长期存在的数据透明度与可复现性困境。传统波兰语语料库常因授权模糊、来源不透明或混合机器生成文本而饱受质疑,导致研究结果难以验证与比较。Polish DynaWord通过严格的逐来源许可审查、统一的数据清洗与标准化流程,以及完整的构建脚本开源,为学术界提供了一个可审计、可复现、可扩展的研究基石。其意义在于推动了低资源语言预训练语料库构建方法论的规范化,使研究者能够在可控的、经过许可认证的数据基础上开展模型评估、跨语言对比以及领域适应研究,进而提升研究成果的科学严谨性与可迁移性。
衍生相关工作
Polish DynaWord作为DynaWord语料库家族的一员,其方法论与构建哲学直接承袭了丹麦DynaWord的开创性工作(Enevoldsen等,arXiv:2508.02271),该工作首次系统性地提出了基于许可审计、来源透明度与完全可复现性的语料库构建范式。此外,该数据集还引用了SpeakLeash作为中间聚合器,并受益于欧盟HPLT项目在网页文本采集与质量过滤方面的技术路线。在波兰语自然语言处理领域,Polish DynaWord的出现为诸如HerBERT、polBERT等波兰语言模型的评估与迭代提供了标准化数据基础,并可能激发更多围绕低资源语言语料库构建伦理、数据溯源与授权合规性的学术讨论与实践工作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务