遇见数据集

stortingsverv-parser

收藏
github2026-07-22 更新2026-07-23 收录
官方服务:

资源简介:

该数据集来自挪威议会代表和政府成员职位及经济利益的登记册(Stortingsrepresentantenes verv og økonomiske interesser),涵盖2011年至2026年的记录,通过解析PDF文件生成表格数据,并以多种格式(如Parquet、CSV、JSONL)发布,用于追踪和分析政治代表的经济利益。

This dataset is derived from the registry of positions and economic interests of Members of the Norwegian Parliament and government officials, officially titled *Stortingsrepresentantenes verv og økonomiske interesser*. It covers records spanning from 2011 to 2026, is generated into tabular data by parsing PDF files, and is released in multiple formats including Parquet, CSV, and JSONL. It is designed for tracking and analyzing the economic interests of political representatives.

创建时间:
2026-07-21
原始信息汇总

数据集概述

数据集名称: Stortingsverv-parser

数据来源: 挪威议会代表和政府成员职位与经济利益登记册。

数据时间跨度: 2011年至2026年。

数据格式: 提供以下格式的数据文件:

  • Parquet(zstd压缩)
  • CSV(gzip压缩)
  • JSONL(gzip压缩)
  • Markdown表格(可浏览)

数据表结构

数据集包含6张核心数据表,每行对应一个观测值,以发布日期为时间戳,不可修改:

表名 粒度 内容描述
documents 出版物 日期、源URL、文件哈希值、页数、封面文本、完整的规章文本及解析诊断信息
persons 出版物 × 人员区块 章节标题、标题原文、从标题括号中提取的姓名/政党/选区、空记录说明
sections 出版物 × 人员 × 段落 段落标记(§2§11§9a§15)及标签、区块文本原文、区块哈希值
transactions 交易表格行 第9条股份交易网格,单元格值按表格打印标题标签(如DatoKjøp/SalgSelskapsnavn等)存储在cells_json
roster 出版物 × 人员 通过唯一性保护名称匹配映射的议会API身份:api_person_id、出生日期、性别、匹配方法,出生日期覆盖率达99.0%
items LLM衍生项 从区块中拆分出的每条登记项:原文item_text及组织、角色、报酬、金额(挪威克朗)、股份数量、股份百分比、组织编号、起始日期、结束日期、国家

此外,qa_report.json 提供每快照的人员计数、剩余行数和富集覆盖率统计。

数据访问方式

  1. 浏览方式: 访问 data-md/ 目录查看最新出版物的Markdown表格。
  2. 下载方式: 通过滚动发布标签 data-latest 下载完整历史数据。示例Python代码:

python import pyarrow.parquet as pq, urllib.request base = "https://github.com/sondreskarsten/stortingsverv-parser/releases/download/data-latest/" urllib.request.urlretrieve(base + "sections.parquet", "sections.parquet") pq.read_table("sections.parquet")

数据溯源与PDF存档

  • 每条数据行可追溯到其源PDF二进制文件,通过file_hash(SHA256)和documents表中的议会网站URL确认。
  • 发布 pdf-archive 存储所有PDF及人口快照的SHA256校验版本,文件按日期命名(pr-YYYY-MM-DD.pdf),首次观测不被覆盖。
  • archive_manifest.json 映射每对 (日期, SHA256) 到其资产,并标记镜像清单哈希与归档字节之间的任何不一致。

数据管道

管道在GitHub Actions上运行,主要包括以下步骤:

  1. 同步: 发现并镜像议会网站的PDF文件,回填2011年至2022年间的47份遗失出版物。
  2. 解析: 通过字体粗细、字号和x坐标等结构特征对PDF文本层进行坐标分类,提取人员头部、段落标记、股份交易网格等信息。
  3. 富集: 使用GitHub Models API(默认openai/gpt-4o-mini)将区块文本拆分为结构化项,按区块哈希缓存以避免重复请求。
  4. 构建: 拼接快照、连接缓存、生成质量报告并输出数据集。
  5. 发布: 更新data-latest发布和data-md/目录。

解析层支持本地运行,依赖uv工具。

搜集汇总
数据集介绍
stortingsverv-parser 数据集图片
构建方式
在挪威议会公开的议员及政府成员职位与经济利益登记册的背景下,stortingsverv-parser 数据集通过一套自动化的流水线构建而成。该流水线从PDF源文件出发,首先利用GitHub Actions定时同步与回溯填充策略,从2022年10月至今的双周登记册及2011年以来的历史档案中获取PDF,并通过SHA-256校验实现不可变归档。随后,解析器依据字体重量、字号和x位置等排版特征,将PDF文本层分类为人员标题、段落标记、内容文本及交易表格,从而提取出结构化的表格数据。最终,这些快照被串联并结合GitHub Models(如openai/gpt-4o-mini)的推导层,将段落拆分为具体条目,由此形成覆盖2011年至2026年的完整数据集。
特点
该数据集的核心特色在于其严格的不可变性与可追溯性。每一行数据均对应特定出版物日期,新追加仅增加行而不修改既有记录,从而保留了跨快照的语义变更。数据集中包含九张核心表格,涵盖了文档、人员、章节、交易记录及LLM推导条目等丰富维度,同时通过qa_report.json提供逐快照的人口统计与富集覆盖质量报告。此外,所有原始PDF与人口快照均经SHA-256验证后归档于pdf-archive发布中,即使上游源文件变更,首次观测内容永不覆盖,确保了数据集的可复现性与长期可用性。
使用方法
使用者可通过访问GitHub仓库中的data-md/目录直接浏览最新出版物的Markdown表格,内容涉及人员信息、注册利益、股票交易及模型推导条目。若需完整历史数据,建议下载data-latest滚动发布中的文件,这些数据以Parquet(zstd压缩)、CSV.gz及JSONL.gz格式提供,便于集成到分析流程中。通过Python等工具,可便捷地读取Parquet文件进行查询。对于希望本地运行的进阶用户,可以使用uv工具依次执行同步、解析、富集及构建命令,从而自定义处理流程并复现数据集的生成过程。
背景与挑战
背景概述
该数据集由挪威研究者 Sondre Skarsten 开发,自 2022 年起系统性地收集并解析挪威议会官方网站发布的《议员及政府成员职务与经济利益登记册》PDF 文件。通过回溯互联网档案馆的存档,数据集覆盖了从 2011 年至 2026 年的完整时间跨度,成为研究挪威政治人物经济利益披露与透明度的核心资源。该数据集的核心研究问题在于如何将非结构化的官方 PDF 文件转化为结构化、可查询、可追溯的公开数据,以支持政治学、公共管理及反腐败研究。其影响力体现在它为挪威政治透明度提供了首个机器可读的长期数据集,并借助 GitHub 自动化的数据发布流程,实现了开放科学与可复现的研究范式。
当前挑战
该数据集面临的挑战首先来自于领域问题的复杂性:挪威议会的登记册采用双栏 Word 布局,线性文本提取会破坏段落标记与内容的对应关系,因此研发了基于字体粗细、字号与 x 坐标的结构化分类器来解析标题、段落标记及交易表格。其次,构建过程中需应对 PDF 源文件的碎片化与缺失问题,如早期文件依赖互联网档案馆的存档,且存在封面日期与内容不一致的陷阱。此外,将自由文本中的职务、薪酬、组织编号等字段自动提取为结构化条目,需要借助大语言模型进行后处理,但免费 API 的速率限制导致冷启动收敛缓慢,且需构建基于哈希的缓存机制避免重复请求。数据版本管理上采用只追加、永不修改行的原则,维系跨快照的语义一致性也是一项持续的技术挑战。
常用场景
经典使用场景
stortingsverv-parser数据集专为挪威议会代表与政府成员的职位及经济利益登记信息而设计,其核心使用场景在于系统化解析和结构化存储来自挪威议会官方网站每两周发布的PDF登记册。该数据集以不可变快照方式记录每次发布的原始文本,通过精细的坐标分类解析方法(基于字体粗细、字号和X坐标位置)将双栏Word排版中的段落标记、人员标题、交易表格等元素精准提取为规范化表格,特别适用于对议员经济利益申报、职务变动及股权交易等登记信息进行时序分析与交叉验证的研究场景。
实际应用
在实际应用层面,该数据集为挪威媒体监督机构、反腐败非政府组织及议会内部合规审查部门提供了自动化监测议员经济利益的可靠基础设施。新闻调查记者可借助结构化数据快速识别特定议员的异常交易或未申报职务,非营利组织能系统追踪利益登记制度的执行漏洞,而议会自身则可利用版本化档案进行历史回溯审计,所有应用场景均受益于数据集通过GitHub Actions的自动化发布流程和多种格式(Parquet、CSV、JSON)的便捷访问方式。
衍生相关工作
基于该数据集衍生的相关工作包括对其解析管道的优化与拓展:其姊妹仓库专注于PDF镜像的持续抓取与归档,而本数据集则通过GitHub Models集成的大语言模型(默认使用GPT-4o-mini)实现了从原始文本块到结构化利益记录(如组织名称、职务、报酬数额、股权比例等字段)的智能抽取,这一混合架构已成为议会文件自动化解析领域的参考范例。此外,数据集的不可变存储策略和逐快照质量管理报告(qa_report.json)机制为构建可信政治数据基础设施提供了可复用的方法论框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务