stortingsverv-parser
收藏资源简介:
该数据集来自挪威议会代表和政府成员职位及经济利益的登记册(Stortingsrepresentantenes verv og økonomiske interesser),涵盖2011年至2026年的记录,通过解析PDF文件生成表格数据,并以多种格式(如Parquet、CSV、JSONL)发布,用于追踪和分析政治代表的经济利益。
This dataset is derived from the registry of positions and economic interests of Members of the Norwegian Parliament and government officials, officially titled *Stortingsrepresentantenes verv og økonomiske interesser*. It covers records spanning from 2011 to 2026, is generated into tabular data by parsing PDF files, and is released in multiple formats including Parquet, CSV, and JSONL. It is designed for tracking and analyzing the economic interests of political representatives.
数据集概述
数据集名称: Stortingsverv-parser
数据来源: 挪威议会代表和政府成员职位与经济利益登记册。
数据时间跨度: 2011年至2026年。
数据格式: 提供以下格式的数据文件:
- Parquet(zstd压缩)
- CSV(gzip压缩)
- JSONL(gzip压缩)
- Markdown表格(可浏览)
数据表结构
数据集包含6张核心数据表,每行对应一个观测值,以发布日期为时间戳,不可修改:
| 表名 | 粒度 | 内容描述 |
|---|---|---|
documents |
出版物 | 日期、源URL、文件哈希值、页数、封面文本、完整的规章文本及解析诊断信息 |
persons |
出版物 × 人员区块 | 章节标题、标题原文、从标题括号中提取的姓名/政党/选区、空记录说明 |
sections |
出版物 × 人员 × 段落 | 段落标记(§2至§11、§9a、§15)及标签、区块文本原文、区块哈希值 |
transactions |
交易表格行 | 第9条股份交易网格,单元格值按表格打印标题标签(如Dato、Kjøp/Salg、Selskapsnavn等)存储在cells_json中 |
roster |
出版物 × 人员 | 通过唯一性保护名称匹配映射的议会API身份:api_person_id、出生日期、性别、匹配方法,出生日期覆盖率达99.0% |
items |
LLM衍生项 | 从区块中拆分出的每条登记项:原文item_text及组织、角色、报酬、金额(挪威克朗)、股份数量、股份百分比、组织编号、起始日期、结束日期、国家 |
此外,qa_report.json 提供每快照的人员计数、剩余行数和富集覆盖率统计。
数据访问方式
- 浏览方式: 访问
data-md/目录查看最新出版物的Markdown表格。 - 下载方式: 通过滚动发布标签
data-latest下载完整历史数据。示例Python代码:
python import pyarrow.parquet as pq, urllib.request base = "https://github.com/sondreskarsten/stortingsverv-parser/releases/download/data-latest/" urllib.request.urlretrieve(base + "sections.parquet", "sections.parquet") pq.read_table("sections.parquet")
数据溯源与PDF存档
- 每条数据行可追溯到其源PDF二进制文件,通过
file_hash(SHA256)和documents表中的议会网站URL确认。 - 发布
pdf-archive存储所有PDF及人口快照的SHA256校验版本,文件按日期命名(pr-YYYY-MM-DD.pdf),首次观测不被覆盖。 archive_manifest.json映射每对 (日期, SHA256) 到其资产,并标记镜像清单哈希与归档字节之间的任何不一致。
数据管道
管道在GitHub Actions上运行,主要包括以下步骤:
- 同步: 发现并镜像议会网站的PDF文件,回填2011年至2022年间的47份遗失出版物。
- 解析: 通过字体粗细、字号和x坐标等结构特征对PDF文本层进行坐标分类,提取人员头部、段落标记、股份交易网格等信息。
- 富集: 使用GitHub Models API(默认
openai/gpt-4o-mini)将区块文本拆分为结构化项,按区块哈希缓存以避免重复请求。 - 构建: 拼接快照、连接缓存、生成质量报告并输出数据集。
- 发布: 更新
data-latest发布和data-md/目录。
解析层支持本地运行,依赖uv工具。





