遇见数据集

ipfs_marshallislands_laws

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

这是一个关于马绍尔群岛 Nitijela 法案(来自 rmiparliament.org)的研究快照数据集。数据集包含从官方 Nitijela 法案网站(rmiparliament.org/cms)收集的立法文本,快照日期为 2026-09-10。数据主要分为两部分:`laws.parquet` 文件包含每部法律/文书的一行记录,共 884 部法律/文书;`articles.parquet` 文件包含每个条款/章节的一行记录,共 3,119 个条款。所有文本为英文,法域为马绍尔群岛。许可证为 `mh-rmiparliament-official-texts`,但数据集明确声明不是法律建议,官方来源(官方公报)具有优先效力。此外,数据集存在已知缺口:由于官方站点实施了 SiteGround 的 sgcaptcha 保护,收集时未进行验证码破解,仅使用了官方 URL 的归档回退。本数据集适用于文本检索、法律领域研究等任务。

This is a research snapshot dataset of the Nitijela Acts of the Marshall Islands (from rmiparliament.org). It contains legislative texts collected from the official Nitijela Acts website (rmiparliament.org/cms), snapshot date 2026-09-10. The data is divided into two parts: `laws.parquet` file with one row per act/instrument, totaling 884 acts/instruments; `articles.parquet` file with one row per article/section, totaling 3,119 articles. All text is in English, jurisdiction is the Marshall Islands. License is `mh-rmiparliament-official-texts`, but the dataset explicitly states it is not legal advice and official sources (official gazette) take precedence. Known gaps: due to SiteGrounds sgcaptcha protection on the official site, no CAPTCHA cracking was performed during collection, only archive fallback of official URLs was used. The dataset is suitable for tasks such as text retrieval and legal domain research.

创建时间:
2026-09-10
原始信息汇总

Marshall Islands Nitijela Acts (rmiparliament.org) 数据集总结

基本信息

字段 内容
数据集名称 Marshall Islands Nitijela Acts (rmiparliament.org)
数据集地址 https://huggingface.co/datasets/endomorphosis/ipfs_marshallislands_laws
语言 en(英语)
任务类别 text-retrieval(文本检索)
许可证 other
许可证名称 mh-rmiparliament-official-texts
数据规模 1K<n<10K

标签

  • legal
  • law
  • marshall-islands
  • nitijela
  • rmiparliament
  • official-texts

数据快照

字段
快照日期 2026-09-10
覆盖范围 rmiparliament-acts-archive-backed
来源 Nitijela Acts (rmiparliament.org/cms)
采集工具 scrapers/collect_mh.py
法律/文书数量 884
文章数量 3,119
语言 en
司法管辖区 Marshall Islands(马绍尔群岛)
许可证 mh-rmiparliament-official-texts

数据配置

配置名称 数据文件 是否默认
laws data/laws.parquet
articles data/articles.parquet

数据集内容

  • data/laws.parquet — 每行代表一项法律文书。
  • data/articles.parquet — 同一快照下的文章/章节行。
  • scrapers/collect_mh.py — 用于构建此快照的研究采集器。

来源

  • https://rmiparliament.org/cms/legislation/acts-of-nitijela/by-alphabetical-order.html

许可证与重用

马绍尔群岛 Nitijela Acts 官方文本;以 rmiparliament.org / 权威文本为准;不构成法律建议。

本数据集不构成法律建议。以官方来源为准。

已知缺口

  • 官方 rmiparliament.org Nitijela Acts 位于 /cms/images/LEGISLATION/ 下。
  • 存在实时 SiteGround sgcaptcha — 未进行验证码破解;仅使用官方 rmiparliament.org URL 的 archive_fallbacks。
  • 不包含 PacLII。
  • 不构成法律建议。
搜集汇总
数据集介绍
ipfs_marshallislands_laws 数据集图片
构建方式
该数据集源自马绍尔群岛议会(Nitijela)官方立法文本,通过专用采集脚本scrapers/collect_mh.py,对rmiparliament.org/cms上的成文法进行系统化抓取与结构化解析。受限于站点部署的sgcaptcha验证机制,采集过程仅依托官方URL的存档回退资源,未借助第三方法律数据库如PacLII。快照于2026年9月10日完成,共收录884部法律文书及3119条条款记录,分别以laws.parquet和articles.parquet文件形式存储,每部法律对应一行,条款按节独立成行,形成粒度化的层次化语料。
特点
数据集聚焦马绍尔群岛国家立法,属英语法律文本,涵盖成文法与条款级条目,规模介于一千至一万条之间。其核心特征在于以官方文本为唯一来源,标注许可为mh-rmiparliament-official-texts,强调官方公报的优先效力,并明确声明不构成法律意见。数据集同时提供法律层级与条款层级两种视图,便于检索与引用,已知缺口在于原始网站图像目录下的立法文件受验证码限制未能完整获取,仅通过存档回退覆盖官方URL内容。
使用方法
使用者可借助HuggingFace数据集加载工具直接读取laws配置或articles配置,分别获取法律文书或条款条目。数据适用于文本检索任务,如基于关键词或语义的法律条文查询、立法沿革分析或跨条款关联研究。由于许可条款限定为官方文本,再利用时须尊重rmiparliament.org的权威来源,不得将其视为法律建议。研究者在引用时应核对官方公报,确保内容准确性与时效性,并注意数据集快照日期与覆盖范围的局限性。
背景与挑战
背景概述
在马绍尔群岛法律体系日益数字化的背景下,官方立法文本的可获取性对学术研究与公众知情权具有关键意义。2026年9月,研究人员依托rmiparliament.org官方渠道,构建了涵盖884部法律文书与3119条条款的尼提杰拉法案数据集,旨在为文本检索与法律资讯研究提供结构化语料。该数据集聚焦于马绍尔群岛成文法的一手采集与留存,回应了太平洋岛国法律资源在公开语料库中长期边缘化的困境,为比较法学、法律信息学及低资源语言处理领域提供了不可替代的官方文本基准。
当前挑战
该数据集所面对的核心领域难题在于,马绍尔群岛立法文本长期分散于官方静态页面与归档副本之间,缺乏统一的结构化索引与稳定的获取接口,致使检索效率与引用可靠性受到严重制约。构建过程中,采集脚本需应对站点实时验证机制的拦截,仅能依赖官方URL的归档回退路径,且原始法律文书在层级划分与条款编号上存在非标准化现象,需在保持文本原貌与实现段落对齐之间取得平衡。上述因素共同导致数据覆盖范围受限于可归档的官方页面,且部分法律文书的条款切分尚存歧义,对下游检索任务的召回精度构成挑战。
常用场景
经典使用场景
在比较法学与法律信息学的交叉领域,对特定法域成文法的系统化梳理始终是开展实证研究的前提。马绍尔群岛尼蒂杰拉法案数据集以884部法律文书与3119条条款的细粒度结构化快照,为法律文本检索任务提供了高质量语料基础。其经典使用场景集中于法律条文检索、跨法案条款关联与立法演变追踪,研究者可依托articles级别的段落切分,实现从整部法律到具体条款的精准定位,进而构建面向小岛屿发展中国家法律体系的检索增强生成系统与条文相似度分析流程。
实际应用
在实际应用层面,该数据集可服务于法律从业者、政策制定者与国际发展机构的多重需求。律师与公益法律组织可借助条款级检索快速定位涉及土地、渔业、环境保护等领域的现行规定;政府机构能够利用结构化文本比对不同年份法案的修订轨迹,辅助立法规划与合规审查;国际组织与学术团队则可将其嵌入法律问答系统、机器翻译管道与法律知识图谱构建流程。鉴于数据明确声明不构成法律建议且以官方文本为准,其定位更适合作为研究性索引与辅助检索工具,而非权威裁判依据。
衍生相关工作
围绕该数据集已逐步衍生出一系列与低资源法域法律文本处理相关的经典工作方向。研究者基于其条款切分结构开展了法律段落检索与长文本摘要实验,亦有工作将其与太平洋地区其他司法管辖区语料进行跨法域对比,探索法律术语对齐与条文相似性度量方法。部分自然语言处理项目将该数据集作为检索增强生成系统的外部知识库,用于评估小语种法律问答的召回率与忠实度。这些衍生实践共同推动了官方法律文本的可计算化进程,并为后续区域性法律语料库的构建提供了可借鉴的采集与封装范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务