遇见数据集

ipfs_malta_laws

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

马耳他法律数据集(legislation.mt ELI)是一个研究快照,收录了来自legislation.mt ELI、SearchFinal和官方getpdf渠道的马耳他官方国家立法文本。数据集包含两大部分:laws.parquet(每个法律文书一行)和articles.parquet(每个条款/章节行)。共计19,675个法律文书和27,654个条款,覆盖马耳他语和英语双语文本。数据快照日期为2026年9月7日,覆盖面为目录支持的不完整快照(从Hub 655宪法及第1-649章扩展至完整ELI/Search目录,包括附属立法和法律通知,第650-659章已包含)。数据集适用于文本检索、法律NLP、多语言法律分析等任务,但需注意:该数据集不是法律建议,官方公报/权威来源优先。许可证为mt-legislation-mt-psi,允许公共部门信息重用。数据集中还存在已知缺口:部分Chrome/SPA壳体和缺失的目录ID未被收录。

The Malta Legal Dataset (legislation.mt ELI) is a research snapshot containing official national legislative texts from Malta, sourced from legislation.mt ELI, SearchFinal, and the official getpdf channels. The dataset consists of two main parts: laws.parquet (one row per legal instrument) and articles.parquet (one row per article/section). It includes 19,675 legal instruments and 27,654 articles, covering bilingual texts in Maltese and English. The data snapshot date is September 7, 2026, and the coverage is an incomplete snapshot supported by the directory (extended from Hub 655 Constitution and Chapters 1-649 to the full ELI/Search directory, including subsidiary legislation and legal notices, with Chapters 650-659 already included). The dataset is suitable for tasks such as text retrieval, legal NLP, and multilingual legal analysis, but it should be noted that it is not legal advice; official gazettes and authoritative sources take precedence. The license is mt-legislation-mt-psi, allowing reuse of public sector information. There are known gaps in the dataset: some Chrome/SPA shells and missing directory IDs are not included.

创建时间:
2026-09-03
原始信息汇总

数据集概述

该数据集为马耳他国家立法的研究快照,来源于 legislation.mt 的 ELI(欧洲立法标识符)注册系统、SearchFinal 搜索界面及官方 getpdf 全文服务。数据集并非法律建议,官方公报或权威来源的文本优先于本语料。

基本信息

字段 内容
数据集名称 Laws of Malta (legislation.mt ELI)
快照日期 2026-09-07
辖区 马耳他
语言 英语(en)、马耳他语(mt)
许可证 mt-legislation-mt-psi(其他)
任务类别 文本检索
标签 法律、立法、马耳他、官方文本等
数据规模 10K < n < 100K

数据规模

  • 法律/文书数量:19,675 条
  • 条款数量:27,654 条

数据集配置

数据集包含两个配置,均为 Parquet 格式文件:

  1. laws(默认配置):data/laws.parquet — 每行对应一个法律文书。
  2. articlesdata/articles.parquet — 对应同一快照下的条款/章节行数据。

内容与文件结构

  • data/laws.parquet:法律文书级别数据。
  • data/articles.parquet:条款/章节级别数据。
  • scrapers/collect_mt.py:用于构建该快照的研究收集脚本。

许可与复用说明

马耳他立法在 legislation.mt 上为官方文本,允许对公共部门信息进行再利用。ELI 注册机构为马耳他。数据集明确声明不构成法律建议,应以官方来源为准。

数据来源

  • https://legislation.mt/eli/
  • https://legislation.mt/Search
  • https://legislation.mt/Legislation
  • https://legislation.mt/LegalNotices
  • https://legislation.mt/Acts
  • https://eur-lex.europa.eu/eli-register/malta.html

已知缺口

数据基于官方 legislation.mt SearchFinal 目录及 /getpdf 全文(经 pdftotext 处理)。覆盖范围相比此前 Hub 上仅含宪法及第 1–649 章的 655 条数据有大幅扩展,现已包含全部 ELI/Search 目录采集结果,涵盖次立法(S.L.)和法律通告。第 650–659 章亦已收录。目录支持下的采集仍不完整:残余的网页框架/单页应用外壳及缺失的目录 ID 依然存在。

搜集汇总
数据集介绍
ipfs_malta_laws 数据集图片
构建方式
该数据集源于对马耳他官方立法门户legislation.mt的深度采集,整合了ELI(欧洲立法标识符)注册表、SearchFinal检索系统及官方PDF全文下载服务,通过自研的collect_mt.py脚本系统化抓取,构建了覆盖法律、附属法规及法律通告的全面语料库。数据以Parquet格式存储,细分为laws与articles两个配置,分别对应法律文书层面与条款层面的结构化记录,共纳入19,675项法律文书及27,654个条款,采集快照定格于2026年9月7日,确保时间维度上的明确界定。数据文档包含完整的元数据,便于追溯与验证,体现了严谨的学术研究取向。
使用方法
数据集可通过HuggingFace平台加载,利用datasets库直接获取laws及articles配置项,即可将对应Parquet文件读入为标准化数据结构,无缝对接至文本检索、主题分类或语言模型微调等下游任务。开发者可依据ELI标识符或法律条文编号进行精准索引,整合至法律问答系统、法规一致性审查或跨语言信息检索等实际场景。数据发布时间快照与源站对应页面的显式引用,使用户能回溯校验,确保研究可复现性。鉴于法律文本的特殊性,使用时应恪守数据集所附声明,不得作为正式法律意见援引,官方刊宪版本始终为权威依据。
背景与挑战
背景概述
随着数字政务与法律信息化的深度融合,马耳他作为欧盟成员国,其法律文本的数字化与开放获取已成为法治透明化的重要一环。ipfs_malta_laws数据集应运而生,由研究团队于2026年9月7日通过自动化采集工具对legislation.mt官网的ELI(European Legislation Identifier)系统进行全面抓取,构建了一个涵盖19,675部法律文书与27,654个条款的结构化语料库。该数据集的核心研究问题在于突破传统法律数据库的检索局限,为法律文本挖掘、跨语言信息检索(英语与马耳他语)及司法智能应用提供高质量的数据基础。其影响力不仅辐射至法律科技领域,更为欧盟法律体系的比较研究及马耳他公共部门信息再利用提供了宝贵的开放资源。
当前挑战
该数据集所面临的挑战多维而深刻。在领域问题层面,法律文本的复杂性对信息检索提出了严苛要求:法律语言的高度结构化与术语特异性,使得基于语义的文本匹配远难于通用文本,尤其当语料涉及英语与马耳他语双语时,跨语言的语义对齐与检索优化成为重大技术瓶颈。此外,法律文本的版本时效性与法律效力关联,要求数据必须精确映射到官方立法状态,任何偏差都可能导致误读。在构建层面,legislation.mt网站的动态渲染(SPA)与残留的交互式界面(chrome壳)为爬虫的完整性采集设置了障碍,导致部分目录条目缺失,数据覆盖虽较先前版本显著跃升,但仍未达到绝对完备;同时,从PDF格式中提取全文需应对版式多样与文本切割的技术难题,采集器需持续迭代以应对网站结构变动,确保快照的可靠性与可复现性。
常用场景
经典使用场景
该数据集汇聚了马耳他官方立法的研究快照,涵盖法律、附属立法及法律通告,并提供英语与马耳他语双语文本。其核心用途在于为法律文本检索、跨语言信息检索和自然语言处理研究提供真实、结构化的语料库。研究者可基于ELI标识符进行法律文件的精确索引与比对,亦能利用篇章级与条款级的分层结构,开展法律文书的语义分析、摘要生成或机器翻译等经典任务,是推动多语言法律信息学发展的宝贵资源。
解决学术问题
该数据集有效回应了法律人工智能领域对小规模司法管辖区多语言立法数据稀缺的问题。它为法律文本的自动分类、条款关联性挖掘以及法律推理系统提供了标准化的测试床,有助于跨语言法律本体对齐和法规一致性检验的研究。其结构化的ELI元数据促进了与欧盟法律体系的互操作研究,为评估法律检索算法在双语环境下的鲁棒性提供了关键基准,从而深化了对法律语言模型可迁移性的理解。
实际应用
在实际应用中,该数据集可作为法律科技产品的开发基石,支撑马耳他及欧盟层面的法律信息服务平台建设。它能够赋能智能法律助手,实现法规的快速查找、条款的动态更新监控以及司法裁决与现行法条的自动关联。此外,该语料库还可服务于法律翻译工具的训练,增强英-马双语法律文本的翻译一致性,并为跨境法律服务、合规审查以及公民法律援助系统提供数据支持,从而提升法律服务的效率与可及性。
数据集最近研究
最新研究方向
该数据集聚焦于马耳他国家立法的数字化与结构化,标志着法律文本挖掘领域的一次重要跃升。其收录规模从先前仅涵盖宪法及1至649章的655部法律,扩展至包含附属立法和法律通告在内的完整ELI/Search目录,共计19,675项法律文书与27,654个条款,实现了覆盖率的历史性突破。数据集以英文和马耳他语双语呈现,并提供机器可读的parquet格式,为跨语言法律信息检索、法规演变分析及法律知识图谱构建提供了宝贵资源。尤其在欧洲ELI(欧洲立法标识符)框架下,该数据集支持对法律文书进行精细化的篇、章、条层级解析,有望推动自然语言处理在法律领域的应用深化,以及跨境法律比较研究的开展,其官方来源与明确的再利用许可亦为学术与公共政策研究构筑了可信基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务