EC Press Corner documents dataset
收藏资源简介:
该数据集包含欧洲委员会新闻角自1985年至今(部分档案可追溯至1975年)的所有新闻稿、演讲和声明,涵盖32种文档类型,共130,544份文档,以Parquet格式提供,适用于社会科学研究。
This dataset contains all press releases, speeches and statements from the European Commission's News Corner, spanning from 1985 to the present, with some archives dating back to 1975. It covers 32 document types, totaling 130,544 documents, and is provided in Parquet format for social science research.
数据集概述:presscorner-builder 与 EC Press Corner 数据集
该数据集来源于 欧洲委员会新闻角(European Commission Press Corner),是一个用于社会科学研究的、可随时更新的清洁数据集。presscorner-builder 工具负责构建和维护此数据集。
核心数据规模
- 文档总数:130,544 篇
- 时间跨度:1975-03-11 至 2026-07-24
- 文档类型:32 种
- 语言版本:英语(English)
- 数据格式:单个 Parquet 文件(预构建完整数据集约 460 MB)
数据内容与覆盖范围
数据集收录了自 1985 年以来(部分可追溯至 1975 年)的每一份新闻稿、演讲和声明。它不仅包含欧洲委员会当前发布的9种文档类型,还完整收录了其前任数据库 RAPID 的遗留资料,包括来自欧盟理事会、欧洲法院等其他机构的新闻材料,以及自 1975 年 3 月首届欧洲理事会以来的会议结论摘要。
主要文档类型(按数量排序):
| 代码 | 说明 | 数量 | 时间范围 |
|---|---|---|---|
IP |
新闻稿 | 51,303 | 1985–2026 |
SPEECH |
演讲 | 24,886 | 1985–2026 |
MEMO |
备忘录/背景说明 | 11,421 | 1985–2022 |
BIO |
发言人简报(遗留) | 8,620 | 1985–2000 |
MEX |
每日新闻(Midday Express) | 6,175 | 2001–2026 |
PRES |
欧盟理事会新闻稿(遗留) | 4,479 | 1992–2013 |
STATEMENT |
声明 | 3,944 | 2014–2026 |
STAT |
欧统局发布(遗留) | 3,409 | 2001–2019 |
PESC |
共同外交与安全政策声明(遗留) | 2,452 | 1994–2013 |
BEI |
欧洲投资银行(遗留) | 2,106 | 2001–2014 |
CES |
欧洲经济与社会委员会(遗留) | 2,059 | 1995–2014 |
CJE |
欧洲法院新闻稿(遗留) | 1,691 | 1994–2014 |
COR |
地区委员会(遗留) | 1,223 | 1995–2014 |
P |
早期新闻简报(遗留) | 960 | 1985–1995 |
(其余20种类型为 QANDA, AC, FS, CLDR, AGENDA, ECA, EO, DOC, OLAF, EDPS, WM, INF, READ, DN, EPSO, COUNTRY, ETW, TRANS 等,详见完整列表。)
元数据字段完整性(按年代)
核心字段(参考号、日期、标题、全文)在全部时间段内几乎 100% 可用,但丰富的元数据是近期的现象:
| 字段 | 1980年代 | 1990年代 | 2000年代 | 2010年代 | 2020年代 |
|---|---|---|---|---|---|
| 全文 | 100% | 100% | 100% | 100% | 98% |
| 副标题 | 0% | 0% | 0% | 27% | 89% |
| 摘要 | 0% | 0% | 0% | 15% | 32% |
| 政策领域 | 0% | 0% | 0% | 27% | 100% |
| 发言人 | 0% | 0% | 0% | 15% | 56% |
| 委员 | 0% | 0% | 0% | 31% | 85% |
| 地点 | 0% | 0% | 0% | 39% | 89% |
(注:2020年代全文未达100%主要由于可视化PDF文档(如 FS)无正文文本,但提供有效的 pdf_url。)
数据模式(Schema)
数据集中每行代表一篇文档,主要列包括:
document_id: 唯一ID(如ip_26_301)reference: 官方参考号(如IP/26/301)doc_type,doc_type_name: 类型代码与标签title,subtitle,summary: 标题字段date: 发布日期(YYYY-MM-DD)publish_datetime: 精确发布时间(仅近期文档)place: 地点(仅近期文档)language,original_language: 语言版本与原始语言commissioners: 归属委员(仅近期)spokespersons: 列出的新闻联系人(仅近期)policy_areas,policy_codes: 政策领域标签与代码(仅近期)full_text: 完整文本,已剥离HTMLurl,pdf_url: 文档页面与PDF链接detail_ok: 文档完整获取是否成功scraped_at: 检索时间戳
(多值字段以 "; " 分隔。)
使用方式
1. 自定义子语料库构建:通过编写小型 YAML 配置文件定义时间、类型、关键词、委员或政策领域等条件,运行 presscorner build config.yaml 生成特定 Parquet 数据集。
2. 使用预构建完整数据集:
- 下载:
presscorner download - 更新至最新:
presscorner update - 生成的文件
data/press-corner.parquet可通过 R 或 Python 加载。
维护与完整性保障
- 增量更新机制,中断后可恢复。
presscorner audit命令按月比对 API 报告文档数与本地文档数,发现并修复缺失;--fix参数自动重新获取缺陷月份。- 采集策略礼貌设计:≥1秒请求延迟,诚实 User-Agent,指数退避,无并行请求。
引用与许可
- 数据集 DOI:10.5281/zenodo.21536427
- 软件 DOI:10.5281/zenodo.21538765
- 许可协议:软件 MIT,文档归属欧盟,遵循 CC BY 4.0 再利用政策。




