遇见数据集

oppna-statsliggaren

收藏
Hugging Face2026-06-07 更新2026-06-08 收录
官方服务:

资源简介:

Öppna Statsliggaren 是一个包含瑞典政府向其下属政府机构下达的任务指令信(regleringsbrev)的数据集。这些指令信以原始HTML格式从瑞典国家行政署(Statskontoret)的官方网站Statsliggaren页面抓取而来,并通过托管在Github上的爬虫工具每日自动更新。数据集提供了每封信件的元数据列表以及相关附件的列表。在数据处理方面,原始HTML内容首先被清理并转换为更统一、精简且尽可能保持原意的XHTML版本,随后进一步转换为(存在信息损失的)Markdown版本。因此,该数据集最终包含了每封信件的三种格式版本(原始HTML、XHTML和Markdown)及其对应的元数据。数据集规模在1万到10万条记录之间,适用于自然语言处理、政府文件分析、信息公开研究等任务。用户可以通过HuggingFace工具灵活地下载和加载数据子集,例如仅选择ID和Markdown内容字段,而无需将整个数据集载入内存。

Öppna Statsliggaren is a dataset consisting of official mandate letters (regleringsbrev) issued by the Government of Sweden to its subordinate government agencies. These letters were scraped from the official Statsliggaren page of the Swedish National Administrative Agency (Statskontoret) in their raw HTML format, and are automatically updated daily via a crawler tool hosted on GitHub. The dataset provides a list of metadata and associated attachments for each letter. In terms of data processing, the raw HTML content is first cleaned and converted into a unified, streamlined XHTML version that preserves the original intent as much as possible, then further converted to a Markdown version with some information loss. Consequently, the dataset ultimately includes three format variants (raw HTML, XHTML, and Markdown) for each letter alongside their corresponding metadata. The dataset contains between 10,000 and 100,000 records, and is suitable for tasks including natural language processing (NLP), government document analysis, and information disclosure research. Users can flexibly download and load data subsets via Hugging Face tools; for example, they can select only the ID and Markdown content fields without loading the entire dataset into memory.

创建时间:
2026-06-01
原始信息汇总

Öppna Statsliggaren 数据集概述

数据集基本信息

  • 许可证: CC0-1.0(公共领域)
  • 语言: 瑞典语
  • 数据集大小: 10,000 到 100,000 条记录
  • 数据集名称: Öppna Statsliggaren

数据集内容

该数据集包含瑞典政府向其政府机构发出的任务信函(letters of missions)。这些信函以原始HTML格式从Statskontoret的网站获取,数据通过每晚在GitHub上运行的爬虫程序收集。

数据格式与版本

数据集中包含同一内容的三种版本及其元数据:

  1. 原始HTML版本:从网站直接获取的原始格式
  2. XHTML版本:经过清洗,转为更一致、最小化的XHTML格式(力求无损转换)
  3. Markdown版本:从XHTML转换而来(有损转换)

附加资源

GitHub仓库中发布了所有信函和附件的列表及其元数据:

  • 信函列表: https://flatgithub.com/civictechsweden/oppna-statsliggaren?filename=letters.csv
  • 附件列表: https://flatgithub.com/civictechsweden/oppna-statsliggaren?filename=attachments.csv

使用说明

由于需要下载完整数据集,即使只需部分列或行也无法按需选择。但可以使用HuggingFace的Python库加载指定列的子集,避免将所有数据加载到内存中。示例代码如下:

python path = hf_hub_download( repo_id="PierreMesure/oppna-statsliggaren", repo_type="dataset", filename="letters.parquet", table = pq.read_table(path, columns=["id", "md"] )

df = table.to_pandas()

搜集汇总
数据集介绍
oppna-statsliggaren 数据集图片
构建方式
Öppna Statsliggaren数据集汇聚了瑞典政府向各政府机构下达的任务授权书。这些原始HTML格式的文本依托于Statskontoret官方网站的“Statsliggaren”页面,通过部署于Github平台的爬虫程序每日自动抓取获取。数据集在构建过程中,首先将原始文档清洗转换为高度一致且尽可能无损的简易XHTML版本,继而进一步转化为有损的Markdown格式。最终纳入数据集的版本囊括了上述三种文本形态及其对应的元数据,并以Parquet文件格式存储,便于高效处理。
特点
该数据集的核心特色在于其三重文本表示形式:原始HTML、无损XHTML及有损Markdown,兼顾了信息完整性与下游应用的便捷性。其覆盖规模介于10K至100K条记录之间,语种限定为瑞典语,且采用CC0-1.0公共领域许可协议,为学术研究与商业应用提供了极高的开放度。此外,数据集通过含有详尽元数据的CSV索引文件清单,为每封授权书及其附件提供了结构化的检索入口,显著提升了数据探索的灵活性。
使用方法
用户可通过HuggingFace的Python库,利用hf_hub_download函数精准下载数据集中的letters.parquet文件。鉴于数据集需整体下载,推荐采用PyArrow的Parquet读取接口,按需选择目标列(如id与md字段)进行部分读取,避免了将全量数据加载至内存的冗余操作。随后可将结果转化为Pandas DataFrame,以便进行后续的数据清洗、文本分析或机器学习任务的实施。
背景与挑战
背景概述
Öppna Statsliggaren数据集创建于持续运行的政务数据开放项目中,由瑞典公民科技组织Civic Tech Sweden主导开发,旨在系统化收集并整理瑞典政府向其下属机构发布的授权函(regleringsbrev)。这些授权函作为瑞典公共行政管理的核心文书,详细规定了政府机构的年度目标、预算分配与绩效要求,是理解北欧国家治理模式与政策执行机制的关键文本资源。数据集通过每日自动抓取Statskontoret官方网站的原始HTML内容,经过清洗与标准化处理,形成XHTML、Markdown及元数据三种版本,为政治学、公共管理与自然语言处理研究提供了高质量、可复用的语料基础。该数据集不仅填补了瑞典政务文本数字化开放的空白,更推动了透明政府与数据驱动政策分析的发展。
当前挑战
Öppna Statsliggaren数据集所解决的领域问题主要是政务文本的结构化解析与可访问性挑战——瑞典政府授权函长期分散于不同机构网站,格式不一且缺乏统一索引,导致研究者难以高效获取与分析。构建过程中面临的技术挑战包括:原始HTML文档的异构性需通过复杂的清洗规则转化为一致性XHTML;从非结构化文本中提取元数据(如机构名称、预算编号)存在精度与覆盖率的平衡难题;大规模每日爬取需设计稳定的增量更新机制以避免数据重复或缺失。此外,数据集仅提供完整下载选项,未支持按列或行的灵活查询,增加了用户端的存储与计算负担。
常用场景
经典使用场景
Öppna Statsliggaren数据集收录了瑞典政府向其下属机构发布的官方任务函件,涵盖原始HTML、清洗后的XHTML及Markdown三种格式,并附带元数据。该数据集最经典的用途在于支持对瑞典公共行政指令的自动化解析与结构化分析,研究者可利用其进行任务指令内容的主题建模、政策优先级的时序演变追踪,以及政府机构间任务分配模式的网络分析。通过机器学习方法,该数据集还常被用于训练瑞典语特定领域的文本分类与信息抽取模型,以揭示行政语言中的语义特征与隐含逻辑。
衍生相关工作
基于该数据集衍生的经典工作包括:开发针对瑞典语政府文档的命名实体识别(NER)工具,自动提取任务目标、负责机构与时间节点;构建时序主题模型以揭示政策重心随政治周期的演变规律;以及建立行政指令网络,量化机构间任务协同度与权力分散指数。同时,该数据集还催生了面向低资源语言的政策文本分类基准,推动跨语言迁移学习在公共管理领域的应用,为其他北欧国家类似数据集的构建提供了方法论参考。
数据集最近研究
最新研究方向
该数据集聚焦于瑞典政府向其下属机构发布的监管指令信函(regleringsbrev)的结构化采集与多格式转换,为公共行政透明度与数字治理研究提供了宝贵的原始语料。在当前前沿方向上,研究者正利用此类政府公开数据,结合自然语言处理技术自动化分析政策指令的语义演变、部门间任务分配模式及监管强度变化趋势。伴随全球对政府开放数据与问责机制的日益重视,这一资源可支撑跨学科探索,如通过指令文本挖掘揭示行政资源配置的演进逻辑,或构建预测模型评估政策执行效果,从而推动基于证据的公共管理优化与透明决策体系建设。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务