遇见数据集

GPT-NL/Collection-metadata

收藏
Hugging Face2026-06-11 更新2026-05-10 收录
官方服务:

资源简介:

GPT-NL语料库是一个用于大语言模型预训练的多源荷兰语文本数据集,由公共语料库和私有语料库两部分组成。公共语料库包含来自知识库、政府机构(如荷兰政府、议会、官方公告)、档案馆(如国家档案馆、地方档案馆)、研究机构(如DANS、Naturalis)和教育资源(如Wikiwijs)的文本;私有语料库则涵盖新闻媒体(如NDP Nieuwsmedia、BNR、ANP)、专业机构(如医疗、法律、金融领域)和教育机构的数据。数据集内容多样,包括新闻文章、政府文件、历史档案、学术文本和口语转录等,覆盖不同时间周期和质量等级,并通过元数据文件提供详细来源、许可、质量、时间覆盖等信息,旨在支持荷兰语NLP任务和模型开发。

The GPT-NL Corpus is a multi-source Dutch text dataset for large language model pretraining, consisting of a public corpus and a private corpus. The public corpus includes texts from sources such as knowledge bases, government agencies (e.g., Dutch government, parliament, official publications), archives (e.g., National Archives, regional archives), research institutions (e.g., DANS, Naturalis), and educational resources (e.g., Wikiwijs). The private corpus covers news media (e.g., NDP Nieuwsmedia, BNR, ANP), professional organizations (e.g., in healthcare, law, finance), and educational institutions. The dataset encompasses diverse content like news articles, government documents, historical archives, academic texts, and speech transcriptions, spanning various time periods and quality levels. Detailed metadata on origin, licensing, quality, and temporal coverage is provided via a metadata file, supporting Dutch NLP tasks and model development.

提供机构:
GPT-NL
搜集汇总
数据集介绍
GPT-NL/Collection-metadata 数据集图片
构建方式
Collection-metadata 数据集是 GPT-NL 语料库的元数据集合,旨在详尽记录用于大语言模型预训练的各类语料来源与特征。该数据集由公共语料库与私有语料库两大部分构成,前者汇集了来自荷兰政府机构、档案馆、研究机构及教育平台等公开渠道的文本资源,后者则囊括了新闻媒体、出版机构、学术组织与法律实体等签署了内容贡献协议的合作方所提供的数据。每一个数据集合均通过结构化的 JSON 文件进行描述,详细阐述了其来源背景、使用权限、数据质量评估、时间覆盖范围以及经由 GPT-NL 处理管线的量化统计指标,从而构建了一个高度透明且可追溯的语料库全景图。
特点
该数据集的核心特点在于其全面性与协作性。它不仅涵盖了从官方公报、议会记录、历史档案到学术出版物和新闻文章的广泛文本模态,还通过精细的元数据字段——包括数据来源的详细说明、许可证类型(如专有许可)、相关性评级、质量等级及其论证理由、时间分布比例以及数据采集与处理流程——为每个子集提供了多维度、高保真的信息刻画。这种精细化的元数据架构使得研究人员能够深入理解每份语料的构成逻辑,例如历史文本与现当代数据的比例,从而支持对模型训练数据的来源、偏差与质量进行严谨的审计与分析。
使用方法
使用 Collection-metadata 数据集时,用户可直接访问其核心文件 GPT-NL-Corpus-metadata.json。该文件以清晰的键值对结构列出了每个集合的详尽信息。研究者可依据描述字段初步了解数据内容,借助许可证信息判定使用合规性,通过质量与相关性评级筛选适合特定训练任务或研究分析的子集,并参考时间覆盖范围规避过时或非目标时段的数据。此外,聚合的量化统计有助于评估各子集的规模与特征,而处理与采集部分的说明则提供了数据来源与清洗史的追溯路径,为用户在负责任地使用语料进行模型预训练、语言分析或数据质量研究时提供了坚实可靠的参考依据。
背景与挑战
背景概述
GPT-NL语料库是荷兰为构建大型语言模型而精心打造的多源文本数据集,其元数据文件Collection-metadata详细记录了组成该语料库的公共与私有两大板块。该数据集创建于2024年,由荷兰应用科学研究组织(TNO)主导,联合国家档案馆、荷兰语研究所等众多公共与文化机构,以及NDP Nieuwsmedia、BNR等私有新闻媒体与金融机构共同贡献。核心研究问题在于汇聚高质量、多领域的荷兰语文本,为预训练提供充分且具代表性的语言资源,从而推动荷兰本土化大语言模型的发展。这一举措对低资源语言的NLP研究具有示范意义,彰显了跨机构协作在构建语言基础设施中的关键作用。
当前挑战
该数据集所解决的领域问题是大语言模型预训练中高质量、多领域语料稀缺的挑战,特别是荷兰语等非英语语种,以打破依赖通用英语语料的局限。构建过程中面临的挑战包括:1) 数据整合的异构性,公共与私有来源涵盖官方文献、历史档案、新闻稿及学术语料库,格式、编码与质量标准差异显著,需统一清洗与规范化;2) 版权与隐私合规,私有数据需逐个签署内容贡献协议,并精细处理个人可识别信息,如历史文献中的古老个人记录;3) 元数据标注的持续性与协作难度,部分集合的元数据仍在完善中,依赖贡献方不断更新,增加了管理复杂性。
常用场景
经典使用场景
该数据集作为GPT-NL语料库的元数据档案,系统性地汇聚了荷兰语大规模语言模型预训练所依赖的多元数据源。其经典使用场景在于为研究者提供一份详尽的“数据地图”,清晰标注了来自公共领域(如荷兰政府公报、议会记录、国家档案馆等)与私有领域(如新闻媒体、医学期刊、法律机构等)的海量语料。用户可通过该元数据索引,快速定位并筛选出符合特定研究需求的高质量、授权明确的荷兰语文本,从而为下游的语言模型训练、语料库语言学分析或跨领域文本挖掘奠定坚实基础。
实际应用
在实际应用层面,该数据集支撑了荷兰语智能服务的全栈式开发。基于其提供的丰富语料,开发者可构建面向政府透明度(如自动摘要荷兰议会辩论)、文化遗产数字化(如中古荷兰语手稿的识别与索引)以及医疗知识库(如荷兰医学期刊的专业术语抽取)的垂直领域模型。同时,新闻媒体与法律事务所利用该数据集训练出的工具,能够高效执行荷兰语新闻的自动分类、合同条款的实体识别等具体任务,显著提升了信息处理效率与决策准确性。
衍生相关工作
该数据集的发布催生了一系列具有里程碑意义的衍生工作,尤其体现在荷兰语大语言模型的构建与评估体系中。例如,GPT-NL团队基于此元数据筛选并处理了公共与私有语料,训练出首个专为荷兰语设计的开源大模型,为低资源语言的大模型研究树立了典范。此外,数据集中标注详尽的“中古荷兰语语料库”与“荷兰议会记录”子集,分别衍生出针对历史语言变化追踪、政治话语分析的特化模型与评测基准,进一步拓展了计算语言学与数字人文的交叉研究疆域。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务