遇见数据集

hellenic-parliament-legislative-work

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是一个希腊立法文件的集合,来源于希腊议会的官方立法门户网站。它主要包含法案和立法提案,以及相应的监管影响评估(Ανάλυση Συνεπειών Ρύθμισης)和相关的议会元数据。语料库涵盖了2020年10月至2026年4月期间的立法活动,包含489条立法记录。每条记录都包含描述法案的元数据,如官方标题、指向官方议会文档的URL、希腊议会门户分配的唯一标识符、立法类型(例如法案、国际公约)、提交日期、议会投票日期、负责部委、议会处理阶段、法律条款部分、监管影响评估指标以及完整的Markdown格式立法文档。数据集统计显示包含23,907,535个单词和70,452,890个标记。源文档通过希腊议会网站公开提供,用户应查阅官方网站了解有关议会材料重新分发的具体重用条件或法律限制。该数据集适用于法律文本分析、自然语言处理、立法过程研究、监管影响评估分析等任务。

This dataset is a collection of Greek legislative documents sourced from the official legislative portal of the Hellenic Parliament. It primarily includes bills and legislative proposals, along with corresponding Regulatory Impact Assessments (Ανάλυση Συνεπειών Ρύθμισης) and related parliamentary metadata. The corpus covers legislative activities from October 2020 to April 2026, containing 489 legislative records. Each record includes metadata describing the bill, such as the official title, URL to the official parliamentary document, a unique identifier assigned by the Hellenic Parliament portal, legislative type (e.g., bill, international convention), submission date, parliamentary voting date, responsible ministry, parliamentary processing stage, legal provisions section, regulatory impact assessment indicators, and the full Markdown-formatted legislative document. The dataset statistics show it contains 23,907,535 words and 70,452,890 tokens. The source documents are publicly available through the Hellenic Parliament website, and users should consult the official website for specific reuse conditions or legal restrictions regarding the redistribution of parliamentary materials. This dataset is suitable for tasks such as legal text analysis, natural language processing, legislative process research, and regulatory impact assessment analysis.

创建时间:
2026-07-07
原始信息汇总

数据集概述

数据集名称:hellenic-parliament-legislative-work
语言:希腊语 (el)
数据来源:希腊议会官方立法门户网站(https://www.hellenicparliament.gr/nomothetiko-ergo/anazitisi-nomothetikou-ergou)
时间范围:2020年10月至2026年4月
记录数量:489条立法记录


数据集内容

该数据集收集了希腊议会官网发布的希腊立法文件,涵盖法案、立法提案及其附带的监管影响评估和相关议会元数据。每条记录包含法案的元数据、议会处理状态、提交和投票日期、负责部委信息,以及立法文件的Markdown表示。


数据结构

字段名称 类型 描述
Τίτλος string 法案或立法提案的官方标题
Σύνδεσμος_νομοσχεδίου string 指向官方议会文档的URL
law_id string 希腊议会门户网站分配的唯一标识符
Τύπος string 立法类型(如法案、国际公约)
Ημερομηνία_κατάθεσης date 提交日期
Ημερομηνία_ψήφισης date 议会投票日期
Υπουργείο string 负责部委
Φάση_επεξεργασίας string 议会处理阶段
Διατάξεις_Σχεδίου_ή_Πρότασης_Νόμου string 立法条款部分
Ανάλυση_Συνεπειών_Ρύθμισης string 监管影响评估指示
Ανακοίνωση_Υπουργού null 部长公告字段(当前为空)
Ημερομηνία_κατάθεσης (parsed) date 解析后的提交日期
Ημερομηνία_ψήφισης (parsed) date 解析后的投票日期
md_text string 完整的立法文档(Markdown格式)

数据集统计

  • 总字数:23,907,535
  • 总Token数:70,452,890

许可协议

源文档通过希腊议会网站公开提供,用户应查阅官方网站(https://www.hellenicparliament.gr/termsOfUse)了解具体的重新使用条件和法律限制。


访问方式

该数据集通过Hugging Face的门控访问机制分发。请求访问时需提供项目简要描述,以及项目/仓库/公司URL(如适用)。数据集维护者可能会根据访问请求联系您,涉及数据集的行政管理、维护、安全、负责任使用及许可等事宜。

联系方式:glossapi.team@eellak.gr

搜集汇总
数据集介绍
hellenic-parliament-legislative-work 数据集图片
构建方式
该数据集的构建源自私希腊议会官方立法门户网站,系统性地爬取了自2020年10月至2026年4月期间的立法活动记录。数据集共收录489份立法档案,每份档案不仅包含法案的官方标题、唯一标识符、提交与投票日期等元数据,还整合了对应的规制影响评估报告,并以Markdown格式保留了完整的立法文件文本。整个构建过程注重结构化存储,通过解析得到标准化的日期字段,确保时间信息的统一性与可计算性。
使用方法
该数据集通过Hugging Face的受限访问机制分发,用户需提交项目描述及可选的存储库或公司网址以申请权限。获批后,可直接利用Hugging Face的datasets库加载数据,每条记录以字典形式呈现,包含元数据与Markdown文本字段。研究人员可基于日期范围或法案类型进行筛选,亦可将md_text字段用于文本分类、摘要生成或立法语言模型微调等下游任务。
背景与挑战
背景概述
在自然语言处理与法律文本分析交叉领域中,高质量的立法语料库对于推动多语言法律智能系统的发展至关重要。hellenic-parliament-legislative-work数据集由希腊议会官方立法门户网站于2020年10月至2026年4月间收集整理,由希腊研究机构(如Eellak团队)主导构建,包含489项立法记录及超过2300万词的希腊语法律文本,涵盖法案、立法提案及相关监管影响评估。该数据集旨在解决非英语法律语料稀缺的问题,为希腊语法律文档的自动摘要、实体识别、法规一致性分析等研究提供标准化基准,对推动南欧语言法律AI研究具有里程碑意义。
当前挑战
该数据集面临的挑战主要体现在三方面:领域问题层面,希腊语法律文本具有复杂的句法结构和专业术语,涉及大量跨法域引用与历史修订,传统NLP模型难以准确捕获立法意图与法规演化关系;构建过程层面,原始文档源自多来源异构网页,需处理PDF与HTML格式混排、表格与段落边界模糊等问题,且监管影响评估文本字段存在大量缺失(如部长声明列全部为空),导致信息不完整;此外,数据许可条款模糊(仅指向议会服务条款),限制了模型训练后的开源发布与商业应用,需通过门控访问机制平衡学术研究与合规风险。
常用场景
经典使用场景
该数据集汇聚了希腊议会自2020年10月至2026年4月期间的489项立法记录,涵盖法案、立法提案及其监管影响评估(RIA)与议会元数据,是研究现代希腊立法过程的宝贵资源。其经典使用场景集中于自然语言处理与法律文本分析领域,研究者可利用其中包含的完整立法文档(Markdown格式)与结构化元数据(如提交日期、投票日期、负责部委及审议阶段),构建针对希腊语的立法文本分类模型、议会流程预测系统或监管影响评估的自动化抽取工具,为跨语言的立法信息学提供基准数据支撑。
解决学术问题
该数据集有效解决了希腊语法律资源稀缺的学术困境,为计算法学和数字人文学科提供了首个大规模、多字段的希腊议会立法语料库。研究团队可基于此数据集开展系列探索:立法文本的语义相似度计算与聚类分析、议会审议时间序列的模式识别、监管影响评估的语言学特征挖掘,以及希腊政治体制中各部委立法活动的量化比较。这些研究不仅填补了非英语法律自然语言处理的数据空白,更推动了对南欧议会制度运作机制的深入理解。
实际应用
在实践层面,该数据集支持希腊议会及政府机构的数字化转型与透明化治理。通过训练立法文本的自动摘要与关键条款提取模型,可协助立法起草人员快速审查法案结构;构建的监管影响评估分类系统能够辅助政策制定者预判法规的经济社会效应。此外,面向法律专业人士的知识检索系统与面向公众的议会活动可视化平台均可基于此数据集开发,切实提升立法信息的可及性与政策制定的循证水平。
数据集最近研究
最新研究方向
当前,hellenic-parliament-legislative-work数据集在自然语言处理与计算社会科学交叉领域引发广泛关注,成为研究古希腊法律文本自动分析与政策影响评估的前沿资源。该数据集囊括了2020年10月至2026年4月间希腊议会的489项立法记录,包含完整的法案、监管影响评估及元数据,为训练大语言模型以理解法律语篇的语义结构、时序演变和跨部门协作提供了高价值语料。其亮点在于将立法文本与议会处理阶段、投票日期等结构化信息相结合,推动了立法过程数字化建模与监管质量预测的实证研究。随着欧盟对算法监管透明度的强调,该数据集亦成为探索多语言法律知识迁移与可解释人工智能在公共治理中应用的标杆,对增强民主决策的数据驱动分析具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务