GPT-NL/Collection-metadata
收藏资源简介:
GPT-NL语料库是一个用于大语言模型预训练的多源荷兰语文本数据集,由公共语料库和私有语料库两部分组成。公共语料库包含来自知识库、政府机构(如荷兰政府、议会、官方公告)、档案馆(如国家档案馆、地方档案馆)、研究机构(如DANS、Naturalis)和教育资源(如Wikiwijs)的文本;私有语料库则涵盖新闻媒体(如NDP Nieuwsmedia、BNR、ANP)、专业机构(如医疗、法律、金融领域)和教育机构的数据。数据集内容多样,包括新闻文章、政府文件、历史档案、学术文本和口语转录等,覆盖不同时间周期和质量等级,并通过元数据文件提供详细来源、许可、质量、时间覆盖等信息,旨在支持荷兰语NLP任务和模型开发。
The GPT-NL Corpus is a multi-source Dutch text dataset for large language model pretraining, consisting of a public corpus and a private corpus. The public corpus includes texts from sources such as knowledge bases, government agencies (e.g., Dutch government, parliament, official publications), archives (e.g., National Archives, regional archives), research institutions (e.g., DANS, Naturalis), and educational resources (e.g., Wikiwijs). The private corpus covers news media (e.g., NDP Nieuwsmedia, BNR, ANP), professional organizations (e.g., in healthcare, law, finance), and educational institutions. The dataset encompasses diverse content like news articles, government documents, historical archives, academic texts, and speech transcriptions, spanning various time periods and quality levels. Detailed metadata on origin, licensing, quality, and temporal coverage is provided via a metadata file, supporting Dutch NLP tasks and model development.




