遇见数据集

un-digital-library

收藏
Hugging Face2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

联合国数字图书馆(UNDL)综合主数据集是一个经过系统收集、标准化处理和增强的大规模多语言数据集,源自联合国数字图书馆的官方档案。该图书馆是联合国文件、投票数据、演讲和公共领域地图的核心存储库,涵盖大会、安全理事会、经济及社会理事会、托管理事会和秘书处的资料。数据集通过先进的OAI-PMH收割管道获取原始元数据,并转化为高度结构化的Parquet格式,适用于机器学习任务。数据规模介于1万到10万条记录之间,支持六种联合国官方语言(阿拉伯语、中文、英语、法语、俄语和西班牙语)。数据集包含丰富的字段,如唯一标识符(record_id)、文件符号(doc_symbol)、标题(title)、事件日期(event_date)、年份(year)、主题(subjects)、提及国家(countries_mentioned)、语言(languages)以及PDF链接等。通过数据增强流程,数据集还提取了联合国机构分类(如安全理事会、大会)、文档层级关系、时间精度和国家实体信息,便于进行国际关系分析、多语言自然语言处理、政治科学研究等任务。数据集旨在降低计算社会科学的研究门槛,为训练大语言模型、构建外交关系图网络或执行历史决议的临时查询提供基础设施。

The United Nations Digital Library (UNDL) Comprehensive Main Dataset is a systematically collected, standardized, and enhanced large-scale multilingual dataset derived from the official archives of the United Nations Digital Library. This library serves as the core repository for UN documents, voting data, speeches, and public domain maps, covering materials from the General Assembly, Security Council, Economic and Social Council, Trusteeship Council, and Secretariat. The dataset is acquired through an advanced OAI-PMH harvesting pipeline, converting raw metadata into a highly structured Parquet format suitable for machine learning tasks. It contains between 10,000 and 100,000 records and supports the six official UN languages (Arabic, Chinese, English, French, Russian, and Spanish). The dataset includes rich fields such as unique identifiers (record_id), document symbols (doc_symbol), titles (title), event dates (event_date), years (year), subjects (subjects), mentioned countries (countries_mentioned), languages (languages), and PDF links. Through data enhancement processes, it also extracts UN agency classifications (e.g., Security Council, General Assembly), document hierarchical relationships, temporal precision, and country entity information, facilitating tasks like international relations analysis, multilingual natural language processing, and political science research. The dataset aims to lower the barrier to computational social science research, providing infrastructure for training large language models, constructing diplomatic relationship graph networks, or performing temporal queries on historical resolutions.

创建时间:
2026-07-05
原始信息汇总

数据集概述

基本信息

  • 数据集名称: United Nations Digital Library (UNDL) Comprehensive Master Dataset
  • 语言: 阿拉伯语、中文、英语、法语、俄语、西班牙语
  • 许可证: CC-BY-4.0
  • 数据规模: 10,000 - 100,000 条记录
  • 任务类型: 文本分类、文本生成、标记分类、翻译、问答、摘要、特征提取

数据来源与采集

  • 来源: 联合国数字图书馆,涵盖联合国大会、安全理事会、经济及社会理事会、托管理事会和秘书处的文档、投票数据、演讲和公共领域地图。
  • 采集方式: 通过自定义的 OAI-PMH (开放档案倡议元数据收割协议) 爬取管道实现,脚本为 un_digital_library_harvester.py
  • 管道特性:
    • 断点续传: 使用 harvest_state.json 文件保存状态,支持中断后通过 --resume 标志恢复。
    • 网络弹性: 默认3秒请求延迟,遇到服务器过载(如502、503、504错误)时采用指数退避策略(初始5秒,最大重试5次)。
    • XML解析: 处理多种命名空间,将嵌套 XML 展平为干净字典。
    • PDF链接提取: 识别 .pdf 文件链接并保存至 pdf_links.jsonl

数据处理与富化

  • 处理脚本: jsonl_to_parquet.py,将原始 JSONL 转换为优化的 Parquet 格式。
  • 格式选择理由: Parquet 提供高压缩比(使用 zstd 算法)、列式存储效率、类型安全和分片支持(默认每片1000条记录)。
  • 富化过程:
    • 联合国机构解析: 根据文档符号前缀(A/、S/、E/、T/、ST/)映射至对应机构。
    • 文档层级关系: 通过正则解析 Addendum、Revision、Corrigendum 等后缀,提取父文档符号。
    • 时间富化: 解析多种日期格式(YYYY-MM-DD、YYYY-MM、YYYY),提取年份并标注精度(exact、month-only、year-only)。
    • 地理实体提取: 扫描标题和主题字段,自动识别提及的193个联合国会员国及历史实体。
    • 语言映射: 将 ISO 639-2 三字母语言代码转换为可读名称。
    • 导出链接生成: 根据记录ID动态生成 BibTeX、EndNote、RefWorks、RIS 和 DublinCore 格式的引用导出 URL。

Parquet 模式定义

列名 数据类型 描述 示例
record_id Int64 联合国数字图书馆分配的唯一整数标识符 3849102
doc_symbol String 官方联合国文档符号 S/RES/2585(2021)
un_body String 文档所属的联合国主要机构 Security Council
is_resolution Boolean 是否为正式决议(符号包含 /RES/ true
is_addendum Boolean 是否为增编、修订或更正 false
parent_record_symbol String 若为增编,该字段为父文档符号 A/75/250
title String 文档主标题 Resolution adopted by the General Assembly on 2 March 2022
event_date String 原始日期字符串 2022-03-02
year Int64 提取的4位年份 2022
date_precision String 日期精度(exact、month-only、year-only 或 null) exact
subjects List[String] 联合国图书馆员分配的主题关键词数组 ["PEACEKEEPING OPERATIONS", "MALI", "HUMAN RIGHTS"]
primary_topic String subjects 数组中的第一个主题 PEACEKEEPING OPERATIONS
countries_mentioned List[String] 标题或主题中明确提及的联合国会员国 ["Mali", "France"]
languages List[String] 文档可用的语言列表 ["English", "French", "Arabic", "Russian", "Spanish", "Chinese"]
record_url String 文档的联合国数字图书馆页面 URL https://digitallibrary.un.org/record/3849102
pdf_url String PDF 全文直接下载 URL(如可用) https://digitallibrary.un.org/record/3849102/files/S_RES_2585-EN.pdf
has_pdf Boolean 元数据中是否找到 PDF 链接 true
export_formats_json String JSON 编码的引用导出 URL 字典 {"bibtex": "..."}
oai_datestamp String OAI 服务器上元数据记录的最后修改时间戳 2024-01-15T08:32:11Z

联合国文档符号详解

  • 主要机构前缀: A/(大会)、S/(安全理事会)、E/(经济及社会理事会)、T/(托管理事会)、ST/(秘书处)。
  • 子机构后缀: /C.1/ 至 /C.6/(大会主要委员会)、/CN.(委员会)、/CONF.(会议)、/WG.(工作组)。
  • 文档类型: /RES/(决议)、/PRST/(主席声明)、/DEC/(决定)、/L.(有限分发)、/PV.(逐字记录)、/SR.(简要记录)。
  • 修改类型: /Add.(增编)、/Amend.(修订)、/Corr.(更正)、/Rev.(修订版)。

使用指南

数据集设计为与 HuggingFace datasets 库高度兼容,适用于 NLP 工作流。

搜集汇总
数据集介绍
un-digital-library 数据集图片
构建方式
该数据集源自联合国数字图书馆浩瀚的档案库,通过一套高度容错的OAI-PMH收割管道精心构建而成。管道首先利用`un_digital_library_harvester.py`脚本,与联合国数字图书馆的OAI-PMH端点交互,执行`Identify`、`ListMetadataFormats`等协议动词,以分块方式获取海量记录。为避免网络中断导致数据丢失,系统实现了严格的状态管理,将当前`resumptionToken`、处理进度等关键信息序列化至状态文件,支持断点续传。针对服务器限流,客户端内置指数退避算法与可配置延迟,确保稳定收割。随后,`jsonl_to_parquet.py`脚本作为语义富化层,将原始JSONL数据转换为高度优化的Parquet列式格式,并在此过程中完成结构归一化、联合国机构解析、文档层级关系构建、时间精度提炼、成员国实体提取及语言代码映射等一系列复杂操作,最终产出结构清晰、类型安全的分析型数据集。
使用方法
该数据集设计为与现代Python数据科学生态系统高度兼容,使用方式灵活多样。研究者可直接利用HuggingFace的`datasets`库加载Parquet分片,快速接入文本分类、生成、翻译等自然语言处理工作流。通过熟悉Parquet模式定义中的各字段,如`doc_symbol`进行精准文档符号筛选,利用`un_body`对比不同机构的文件输出,或借助`countries_mentioned`字段分析特定成员国随时间推移的影响力变迁。支持SQL风格的即席查询,便于对决议数量等指标进行年度聚合分析。对于需要原文的研究者,可直接通过`pdf_url`字段触发异步下载任务,获取全文PDF。此外,数据集内置了导出链接生成逻辑,可方便地获取BibTeX、RIS等多种引文格式,便于跨平台引文管理。
背景与挑战
背景概述
联合国数字图书馆综合主数据集(UNDL)由数据科学家于2024年构建,旨在系统化整合联合国自1945年以来的海量档案,涵盖大会、安理会等主要机构的决议、投票记录及演讲材料。该数据集由独立研究团队开发,核心解决全球治理文献碎片化访问难题,通过先进的OAI-PMH收割技术与精细化的数据富集流程,将原始元数据转化为机器学习就绪的Parquet格式,为多语种自然语言处理、时序政治学分析及国际法研究提供了前所未有的结构化基础设施。自发布以来,该数据集显著降低了计算社会科学的研究门槛,成为分析冷战外交、非殖民化进程及21世纪气候变化政策演变的关键资源。
当前挑战
该数据集面对的首要挑战在于领域问题:联合国档案以六种官方语言分布,且涉及复杂多变的实体指代与过时的地缘政治概念,导致多语种对齐与实体消歧极具难度。构建过程中需克服三大技术挑战:其一,OAI-PMH协议执行需应对大规模率限制与网络中断,通过指数退避重试机制及状态持久化保障数据完整性;其二,处理异构的XML命名空间与嵌套元数据结构,需设计鲁棒的解析器以标准化字段如日期精度与文档层级关系;其三,海量PDF链接的提取与下游全文索引任务的并发调度,对系统的容错能力与计算效率提出严苛要求。
常用场景
经典使用场景
联合国数字图书馆(UNDL)综合主数据集为国际关系与计算社会科学研究提供了前所未有的结构化数据基础。研究者可将其广泛用于多语言自然语言处理任务,涵盖文本分类、机器翻译、摘要生成、问答系统及特征提取等经典场景。该数据集以Parquet格式呈现,收录了大会、安理会等六大主要机构的决议、投票记录及演讲全文,并包含精确的元数据字段如文件符号、发布机构、日期精度和提及国家列表。借助这些信息,学术团队能够轻松构建跨语言语料库,训练大型语言模型,或进行纵向主题建模,追踪全球治理话语的演变轨迹。
解决学术问题
在全球治理研究中,学者长期面临UN档案碎片化、元数据庞杂及多语言壁垒等挑战。UNDL数据集通过系统性全量收割、标准化清洗和语义增强,彻底解决了大规模获取和分析UN文档的技术障碍。它使政治学家能够量化分析安理会与大会在不同时期的话语差异,让法律专家能追溯人权规范的演变脉络,并为语言学家提供对齐的多语种平行语料。该数据集还通过国家实体自动抽取、文件谱系解析及时间精度标记,赋予了研究者开展严谨的统计推断和因果分析的能力,显著推动了国际关系领域的量化革命。
实际应用
在实际应用层面,UNDL数据集已成为外交政策分析、国际法研究和全球舆情监测的核心基础设施。政策研究机构可基于安理会决议的文本变化,实时评估成员国立场演变;国际组织可利用主题建模技术,自动归类海量工作报告以提升决策效率;媒体与智库则借助语言情感分析,量化构建全球热点议题的舆论图谱。此外,该数据集的PDF链接流支持全文索引,使得法律事务所或人权团体能够快速检索关键判例与条约依据,极大降低了获取原始档案的人力成本。
数据集最近研究
最新研究方向
在当前国际关系与计算社会科学交叉领域的前沿探索中,un-digital-library数据集正驱动着深具影响力的创新研究。得益于其多语种、多模态的丰富结构,研究者得以突破传统档案分析的桎梏,构建大规模、细粒度的全球治理知识图谱。近期热点方向聚焦于利用该数据集训练领域特定的多语言大语言模型,以捕捉联合国议程中关于和平与安全、可持续发展及人权保护的语义演化轨迹。同时,基于文档符号系统与时间戳的精准字段,学者们能够运用图神经网络还原冷战至今的大国博弈与联盟变迁动态。该数据集还支持高精度的时空主题建模与法律文本溯源,助力剖析气候政策、维和行动等跨议程议题的历史逻辑。作为弥合外交档案与数据科学鸿沟的核心基础设施,它正深刻赋能非传统安全研究与国际法的实证分析,推动形成更具预测性的全球治理科学范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务