遇见数据集

EC Press Corner documents dataset

收藏
github2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

该数据集包含欧洲委员会新闻角自1985年至今(部分档案可追溯至1975年)的所有新闻稿、演讲和声明,涵盖32种文档类型,共130,544份文档,以Parquet格式提供,适用于社会科学研究。

This dataset contains all press releases, speeches and statements from the European Commission's News Corner, spanning from 1985 to the present, with some archives dating back to 1975. It covers 32 document types, totaling 130,544 documents, and is provided in Parquet format for social science research.

创建时间:
2026-07-25
原始信息汇总

数据集概述:presscorner-builder 与 EC Press Corner 数据集

该数据集来源于 欧洲委员会新闻角(European Commission Press Corner),是一个用于社会科学研究的、可随时更新的清洁数据集。presscorner-builder 工具负责构建和维护此数据集。

核心数据规模

  • 文档总数:130,544 篇
  • 时间跨度:1975-03-11 至 2026-07-24
  • 文档类型:32 种
  • 语言版本:英语(English)
  • 数据格式:单个 Parquet 文件(预构建完整数据集约 460 MB)

数据内容与覆盖范围

数据集收录了自 1985 年以来(部分可追溯至 1975 年)的每一份新闻稿、演讲和声明。它不仅包含欧洲委员会当前发布的9种文档类型,还完整收录了其前任数据库 RAPID 的遗留资料,包括来自欧盟理事会、欧洲法院等其他机构的新闻材料,以及自 1975 年 3 月首届欧洲理事会以来的会议结论摘要。

主要文档类型(按数量排序)

代码 说明 数量 时间范围
IP 新闻稿 51,303 1985–2026
SPEECH 演讲 24,886 1985–2026
MEMO 备忘录/背景说明 11,421 1985–2022
BIO 发言人简报(遗留) 8,620 1985–2000
MEX 每日新闻(Midday Express) 6,175 2001–2026
PRES 欧盟理事会新闻稿(遗留) 4,479 1992–2013
STATEMENT 声明 3,944 2014–2026
STAT 欧统局发布(遗留) 3,409 2001–2019
PESC 共同外交与安全政策声明(遗留) 2,452 1994–2013
BEI 欧洲投资银行(遗留) 2,106 2001–2014
CES 欧洲经济与社会委员会(遗留) 2,059 1995–2014
CJE 欧洲法院新闻稿(遗留) 1,691 1994–2014
COR 地区委员会(遗留) 1,223 1995–2014
P 早期新闻简报(遗留) 960 1985–1995

(其余20种类型为 QANDA, AC, FS, CLDR, AGENDA, ECA, EO, DOC, OLAF, EDPS, WM, INF, READ, DN, EPSO, COUNTRY, ETW, TRANS 等,详见完整列表。)

元数据字段完整性(按年代)

核心字段(参考号、日期、标题、全文)在全部时间段内几乎 100% 可用,但丰富的元数据是近期的现象:

字段 1980年代 1990年代 2000年代 2010年代 2020年代
全文 100% 100% 100% 100% 98%
副标题 0% 0% 0% 27% 89%
摘要 0% 0% 0% 15% 32%
政策领域 0% 0% 0% 27% 100%
发言人 0% 0% 0% 15% 56%
委员 0% 0% 0% 31% 85%
地点 0% 0% 0% 39% 89%

(注:2020年代全文未达100%主要由于可视化PDF文档(如 FS)无正文文本,但提供有效的 pdf_url。)

数据模式(Schema)

数据集中每行代表一篇文档,主要列包括:

  • document_id: 唯一ID(如 ip_26_301
  • reference: 官方参考号(如 IP/26/301
  • doc_type, doc_type_name: 类型代码与标签
  • title, subtitle, summary: 标题字段
  • date: 发布日期(YYYY-MM-DD)
  • publish_datetime: 精确发布时间(仅近期文档)
  • place: 地点(仅近期文档)
  • language, original_language: 语言版本与原始语言
  • commissioners: 归属委员(仅近期)
  • spokespersons: 列出的新闻联系人(仅近期)
  • policy_areas, policy_codes: 政策领域标签与代码(仅近期)
  • full_text: 完整文本,已剥离HTML
  • url, pdf_url: 文档页面与PDF链接
  • detail_ok: 文档完整获取是否成功
  • scraped_at: 检索时间戳

(多值字段以 "; " 分隔。)

使用方式

1. 自定义子语料库构建:通过编写小型 YAML 配置文件定义时间、类型、关键词、委员或政策领域等条件,运行 presscorner build config.yaml 生成特定 Parquet 数据集。

2. 使用预构建完整数据集

  • 下载:presscorner download
  • 更新至最新:presscorner update
  • 生成的文件 data/press-corner.parquet 可通过 R 或 Python 加载。

维护与完整性保障

  • 增量更新机制,中断后可恢复。
  • presscorner audit 命令按月比对 API 报告文档数与本地文档数,发现并修复缺失;--fix 参数自动重新获取缺陷月份。
  • 采集策略礼貌设计:≥1秒请求延迟,诚实 User-Agent,指数退避,无并行请求。

引用与许可

  • 数据集 DOI:10.5281/zenodo.21536427
  • 软件 DOI:10.5281/zenodo.21538765
  • 许可协议:软件 MIT,文档归属欧盟,遵循 CC BY 4.0 再利用政策。
搜集汇总
数据集介绍
EC Press Corner documents dataset 数据集图片
构建方式
EC Press Corner Documents数据集源自欧洲委员会新闻发布室(Press Corner)的官方档案,涵盖了自1975年以来的新闻稿、演讲和声明等文献。该数据集的构建依托于名为presscorner-builder的专用工具,通过自动化爬取与API交互,将原始网页内容转化为结构化的Parquet文件。用户既可以通过YAML配置文件定义子语料库的筛选条件(如日期范围、文档类型、关键词或政策领域),利用presscorner build命令生成定制化数据集,也可直接下载预编译的完整语料库,随后使用presscorner update指令将其增量更新至最新日期。整个流程无需掌握网页抓取技术,且每轮构建均会记录配置哈希值与运行日志,确保语料库具备完全的可复现性。
特点
该数据集的核心特色在于其历史纵深与结构兼容性,不仅是欧洲委员会自身活跃文档类型(如IP、SPEECH、STATEMENT)的持续归档,更完整保留了原RAPID系统中来自理事会、法院及其他欧盟机构的遗留史料,包括1975年首次欧洲理事会会议纪要等珍稀记录。数据集收录超过13万份文档,横跨32种类型,时间跨度达半个世纪;同时提供一致的元数据字段,如唯一标识符、日期、标题和全文,而近期文档还附加了政策领域、发言人、专员归属及地理位置等丰富标签。该语料库以久经考验的Parquet格式存储,兼顾高效压缩与跨平台兼容性,加之内置的完整性审计机制,可自动检测并修复爬取缺漏,赋予研究数据以高度的可信度。
使用方法
使用该数据集极为便捷,用户可借助pip安装presscorner-builder工具包,并通过简洁的命令行界面完成所有操作。对于需要整体语料的场景,执行presscorner download即可获取全部Parquet文件并随时以presscorner update将其补充至当前日期;针对精细化研究需求,则可通过编写小型YAML配置文件来定义子语料库,使用presscorner build命令产出定制化数据集。数据加载时,无论是R语言的arrow包还是Python的pandas库,均能直接读取Parquet文件,实现无缝集成。此外,presscorner audit命令支持按月比对API与本地数据以发现缺失,并为修复提供一键操作;数据集在Zenodo上拥有版本化DOI,引用时既可指向概念DOI获取最新版,亦可锁定特定版本DOI以确保研究复现的精确性。
背景与挑战
背景概述
欧盟委员会新闻角(EC Press Corner)是欧盟委员会官方发布新闻稿、演讲和声明的核心数据库,其历史可追溯至其前身RAPID系统(1985年启动),部分记录甚至延伸至1975年。该数据集由慕尼黑工业大学助理教授Timo Seidl主导创建,并于2025年在Zenodo上首次发布,旨在为社会科学研究提供一个清洁、可引用且持续更新的语料库。数据集涵盖超过13万份文档,包含32种文档类型,横跨1975年至2026年,不仅收录了欧盟委员会的现当代通讯材料,还保留了来自理事会、法院及其他机构的历史档案,如1975年都柏林首届欧洲理事会结论摘要。这一资源的系统化整合,解决了欧盟官方传播史料分散、获取门槛高的问题,为政策分析、话语研究与制度演变追踪提供了前所未有的数据基础。
当前挑战
该数据集面临的核心挑战源于欧盟官方新闻档案的异质性与历史断层。首先,领域问题层面,数据集旨在覆盖从1975年至当下的政治传播全貌,但早期记录(1985年前)仅以数字摘要形式存在,且部分传统文档类型(如BIO、PRES、CES等)因其他机构自建新闻室而于2013至2015年间终止更新,导致历史语料存在结构性断点。其次,构建过程中,元数据的时代不统一构成显著挑战:政策领域、专员归属、地点等丰富字段仅为2000年后文档所具备,1980和1990年代文档仅保留核心字段(参考号、日期、标题与全文),研究者需据此调整研究设计。此外,技术层面,网络爬取面临连接中断与服务器异常的潜在风险,尽管设计了按月窗口分块与审计修复机制,但确保130544份文档的完整性与可重现性仍需持续维护。
常用场景
经典使用场景
EC Press Corner documents dataset 的核心设计理念在于为社会科学研究者提供一份可直接用于计量分析与文本挖掘的、涵盖近半个世纪的欧盟委员会官方沟通档案。其最经典的使用场景是构建特定主题或政策领域的纵向语料库,研究者可通过定义文档类型(如新闻稿、演讲、声明)、时间范围、关键词及责任委员等参数,借助 presscorner-builder 工具一键生成定制化的分析数据集。这一能力使得追踪欧盟在气候变化、数字转型、贸易政策等议题上的话语演变成为可能,为政治沟通、公共政策及欧洲一体化研究提供了标准化的数据基础设施。
解决学术问题
该数据集解决的学术研究问题主要集中在两个长期困扰社会科学领域的痛点:一是欧盟官方沟通数据的零散化与非标准化,研究者此前需自行爬取或依赖过时档案,数据完整性难以保证;二是研究可复现性的缺失,传统手动收集方式无法提供透明的数据构建流程。该数据集通过提供版本化的 Zenodo 存档、可共享的 YAML 配置文件和自动化审计工具,确保了语料构建过程的可追溯性与可复现性,从根本上提升了实证政治沟通研究的科学严谨性。其意义在于降低了欧盟政策话语分析的数据门槛,使得更多学者能够基于统一、可信的数据基础开展比较研究与纵向分析。
衍生相关工作
基于该数据集已经衍生出一系列经典的学术与工具性工作。在方法论层面,presscorner-builder 本身就代表着一种新型的“可复现语料库构建范式”,其通过 YAML 配置驱动、集成 API 审计与增量更新机制的设计,被后续多个欧盟数据获取工具所借鉴。在应用研究方面,已有学者利用该数据集进行欧盟委员会演讲的情感极性分析、政策议程设置的 LDA 主题建模,以及不同委员沟通风格的跨时段比较。数据集的时间纵深(1975 年至今)还催生了关于欧洲一体化早期话语构建的历史研究,尤其是对欧洲理事会结论摘要(DOC 类型)的系统性挖掘,填补了欧盟通讯史研究中前互联网时代的文本空白。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务