遇见数据集

glossAPI/diavgeia

收藏
Hugging Face2026-06-16 更新2026-06-14 收录
官方服务:

资源简介:

该数据集包含希腊政府透明度门户网站Diavgeia上发布的公共部门决策(例如预算承诺、支出批准、合同、任命、法规等)的全文和元数据。自2010年起,希腊公共实体依法必须在Diavgeia上发布其行政法案,每个决策由唯一的ADA标识。每个记录对应一个决策,原始PDF文档与其结构化元数据一起收集,文档正文被提取并转换为干净的Markdown文本。该数据集是glossAPI项目的一部分,由EELLAK(开放技术联盟)创建,旨在为AI/NLP研究、语言分析和开放数据重用构建高质量、开放许可的希腊语文本语料库。

This dataset contains the full text and metadata of public-sector decisions published on Diavgeia, the Greek governments transparency portal. Each record corresponds to a single decision. The original PDF document was collected together with its structured metadata, and the document body was extracted and converted to clean Markdown text. This dataset was produced as part of the glossAPI project of EELLAK, which builds high-quality, openly licensed Greek-language text corpora for AI/NLP research.

提供机构:
glossAPI
搜集汇总
数据集介绍
glossAPI/diavgeia 数据集图片
构建方式
Diavgeia数据集的构建根植于希腊政府的“透明度倡议”(Diavgeia项目),该强制性要求所有公共行政机构在网上发布其决策与开支。研究者通过自动化抓取Diavgeia官方网站的公开数据,汇集了自2010年以来涵盖中央与地方政府机构发布的海量行政文件。这些文件包括合同、采购订单、薪酬决定及拨款等类别,经过结构化提取与元数据标注,最终形成大规模的多领域文本集合。
特点
该数据集的核心特色在于其权威性与跨部门覆盖性,它囊括了希腊公共部门透明化进程中的真实记录,横跨财政、人事、采购等多个行政领域。数据以希腊语为主体,兼具长文本与短条目,且附有时间戳、机构标识及文档类别标签,为研究公共行政透明度、财政问责制及政策分析提供了独特的纵向与横断面素材。
使用方法
Diavgeia数据集可直接通过Hugging Face数据集库进行加载与使用,其结构遵循标准的parquet或JSONL格式,便于与Python工具链如Pandas和Transformers库集成。研究人员可将其用于自然语言处理任务,如希腊语文本分类、主题建模或序列标注,亦可结合元数据过滤进行特定行政领域的深度分析。此外,在学术机构中,该数据通常作为政府透明度和腐败检测研究的基准语料库。
背景与挑战
背景概述
Diavgeia数据集诞生于希腊透明倡议(Greek Transparency Initiative)的框架下,由希腊数字治理部(Ministry of Digital Governance)主导创建,旨在系统化收集与公开政府行政决策信息。该数据集自2010年起通过国家透明门户网站(Diavgeia Program)持续积累,核心研究问题聚焦于如何利用开放政府数据(Open Government Data)提升公共行政透明度、强化问责机制,并促进公民监督。作为欧洲乃至全球开放数据运动的重要实践案例,Diavgeia数据集为政治学、公共管理及数据科学领域的研究者提供了大规模、细粒度的政策执行与资源配置分析依据,显著推动了基于证据的治理效能评估研究。
当前挑战
该数据集面临的挑战涵盖多维度。在领域问题层面,需解决从海量非结构化行政文本中高效提取关键决策要素(如预算额度、签约方身份)的难题,同时应对希腊语特有的形态复杂性对自然语言处理模型构成的障碍。在构建过程中,面临跨机构数据格式异构、元数据标准缺失引发的整合困难,以及历史数据数字化过程中的质量衰减问题。此外,如何平衡数据透明度与个人隐私保护(如涉及自然人敏感信息的去标识化)成为持续推进开放数据时需要审慎处理的伦理挑战。
常用场景
经典使用场景
Diavgeia数据集源于希腊政府的透明度倡议,汇聚了公共行政决策的官方记录与元数据。该数据集在自然语言处理与计算社会科学领域,常被用于构建文本分类与主题建模基准,以分析政府公开文档的语义结构。研究者通过该数据集训练模型,自动识别政策领域的分配、预算类型与决策层级,从而推动公共治理的数字化解析。其经典用法在于作为评估多标签分类算法在长尾分布下的表现平台,尤其适合测试模型对稀有决策类别的泛化能力。
实际应用
在实际应用中,Diavgeia支撑着希腊及欧盟公共采购与预算监督系统的自动化升级。开发团队利用该数据集训练分类器,对政府支出报告进行实时解析,辅助审计机构快速定位异常决策。媒体与公民社会组织借助其衍生的语义搜索工具,追踪特定政策领域的资金流向,提升公众参与监督的效率。此外,该数据集还被集成至开放政府数据门户,作为验证数据质量与互操作性的基准案例。
衍生相关工作
Diavgeia激发了若干经典后续工作,如基于该数据集构建的‘希腊政府决策分类体系’成为多语言行政文本分析的参考框架。研究者衍生出针对低资源场景下的零样本分类基线,并开发了融合知识图谱的预算分配预测模型。此外,该数据集直接催生了‘公共支出透明度指数’的计算方法,被欧盟机构采纳用于成员国开放数据成熟度评估,相关论文在数字政府与信息科学顶会中形成持续引用脉络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务