遇见数据集

ipfs_srilanka_laws

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

Laws of Sri Lanka 是一个从斯里兰卡官方政府网站(documents.gov.lk 和 parliament.lk)收集的法律法规研究数据集。数据集包含1298部法律/法规和282个条款,均为英文文本,管辖区域为斯里兰卡。数据以两个Parquet文件形式提供:laws.parquet 包含每部法律文书的详细信息(如ID、标题、全文、日期、状态、标识符、条款数量、来源URL);articles.parquet 包含每个条款/章节的详细信息(如所属法律ID、条款编号、标题、文本、来源URL)。该数据集适用于文本检索、法律信息提取、法律文本分析等任务。注意:本数据集为研究快照,非官方整合版本,不构成法律建议,官方来源(政府公报/政府门户网站)应优先作为权威依据。

Laws of Sri Lanka is a research dataset of laws and regulations collected from the official Sri Lankan government websites (documents.gov.lk and parliament.lk). The dataset contains 1298 laws/regulations and 282 articles, all in English text, with jurisdiction over Sri Lanka. The data is provided in two Parquet files: laws.parquet contains detailed information for each legal document (e.g., ID, title, full text, dates, status, identifier, number of articles, source URL); articles.parquet contains detailed information for each article/section (e.g., parent law ID, article number, title, text, source URL). This dataset is suitable for tasks such as text retrieval, legal information extraction, and legal text analysis. Note: This dataset is a research snapshot, not an official consolidated version, and does not constitute legal advice; official sources (government gazettes/government portals) should be prioritized as authoritative references.

创建时间:
2026-09-05
原始信息汇总

数据集概述:斯里兰卡法律(Laws of Sri Lanka)

基本信息

  • 数据集名称:Laws of Sri Lanka
  • 语言:英语(en)
  • 司法辖区:斯里兰卡
  • 许可证lk-documents-gov(其他/自定义许可)
  • 任务类别:文本检索(text-retrieval)
  • 标签:法律、斯里兰卡、官方文本

数据规模

  • 数据量级:1K < n < 10K
  • 法律/文书数量:1,368 部
  • 条款数量:291 条

数据来源与采集

  • 主要来源:documents.gov.lk 和 parliament.lk
  • 采集脚本scrapers/collect_lk.py
  • 快照日期:2026-09-07
  • 覆盖范围:基于目录索引,不完整(catalog-backed incomplete)

数据内容与文件结构

数据集包含两个配置(config):

配置名 文件路径 说明
laws data/laws.parquet 每行对应一部法律文书,包含ID、标题、全文、日期、状态、标识符、条款数量及来源URL
articles data/articles.parquet 每行对应一个条款/章节,包含法律ID、条款编号、标题、文本及来源URL

此外,仓库还包含辅助采集脚本(common.pyworld_lib.pyarchive_fallbacks.py)用于抓取与回退支持。

重要声明与使用限制

  • 非官方整合版本:本数据集并非官方法律合并文本,仅供研究使用。
  • 非法律建议:数据集明确声明不构成法律建议,官方公报或政府门户网站内容优先于本语料库。
  • 复用条款:官方政府/公报文本的复用需遵循来源门户的公共部门条款,数据集的打包、元数据及采集脚本仅用于研究目的。
搜集汇总
数据集介绍
ipfs_srilanka_laws 数据集图片
构建方式
本数据集基于斯里兰卡官方立法门户网站documents.gov.lk与parliament.lk的公开法律文本,通过定制的网络爬虫脚本collect_lk.py实施系统性采集与快照归档。数据集以Parquet文件格式存储,依据法规层级构建两个核心子集:一是laws配置,每条记录对应一部单一法律文书,涵盖其唯一标识、完整标题、全文本、生效日期、法律状态、官方识别符、条款计数及来源链接;二是articles配置,独立存储每条法律条文或章节的细粒度内容,关联至所属法律标识、条款编号、标题、文本及源地址。采集流程集成实时抓取与Wayback Machine及Common Crawl等归档的回退机制,确保数据完整性。该快照捕获于2026年9月7日,共收录1490部法律文书及295条独立条款,全部以英文呈现,并附带详尽的元数据与溯源信息。
特点
该数据集呈现多维度的独特属性。在法律内容层面,数据集忠实转录官方文档,但明确声明不构成官方合编版本或法律建议,强调源文件的权威优先性,这一设计体现了对法律文本严肃性的尊重与使用边界。数据架构上,双层次、双配置结构(laws与articles)支持从宏观法律全貌到微观条文细节的不同粒度的检索与分析,既满足整体性研究需求,也利于条款级比较。采集工程完整开放,附带的爬虫脚本与共享工具模块提供了高度可复现的构建过程,配合Wayback回退机制保障了来源的稳定性。数据集规模适中(1K-10K),语言统一为英语,并遵循特定的公共部门再利用许可,为法律文本挖掘、自然语言处理与司法智能研究提供了规整且可追踪的语料基础。
使用方法
该数据集面向法律文本检索与人工智能研究场景设计,可通过HuggingFace datasets库便捷加载。使用者能够根据研究或应用需求,选择加载laws配置以获取整部法律文书的综合信息,包括标题、全文及状态,适用于法律体系概览或文本分类;或选择articles配置逐条获取条款内容,支撑细粒度的语义分析、条款检索或司法知识图谱构建。数据中的结构化字段(如law_id、日期、状态及来源URL)支持多条件筛选与关联整合,便于追溯法律原旨。鉴于数据集的非官方性质,使用者在任何下游任务或应用中,须明确声明来源为研究快照,不替代官方法律文本,并对其输出的法律解释或建议严格免责,同时注意许可证的适用范围,合理引用官方portal作为最终权威。
背景与挑战
背景概述
该数据集由研究团队于2026年9月7日构建,旨在系统性地整合斯里兰卡官方立法文本,主要来源于documents.gov.lk和parliament.lk两大权威门户。核心研究问题在于为法律文本检索、自然语言处理及司法数据分析提供结构化、机器可读的语料库。数据集包含1490项法律文书及295个条款,覆盖斯里兰卡司法管辖区的英文法律文献。其影响力体现在为法律科技研究、跨语言法律信息检索及政府开放数据再利用提供了基准资源,同时通过存有元数据与全文的结构化格式,促进了法律文本挖掘与比较法研究。
当前挑战
该数据集面对的领域挑战包括法律文本检索中的语义复杂性与长文档处理难题,以及法律语料的领域适应性、多源异构数据的整合与版本一致性维护。在构建过程中,面临官方源网站的动态变化、历史文档的稀缺性及访问限制等困难,为此采集器采用Wayback Machine及Common Crawl的CDX索引作为回退方案,确保数据完整性。此外,法律术语的准确解析、条款间交叉引用关系的建模,以及非官方整合与官方文本间差异的消除,亦是构建中的关键挑战。最终,数据集的非官方性质要求清晰标注法律免责声明,避免误导性使用。
常用场景
经典使用场景
此数据集汇集了斯里兰卡官方法律文献的科研快照,涵盖1490部法律文书及295项条款,源自documents.gov.lk和parliament.lk。其典型的应用场景在于法律信息检索与自然语言处理研究,学者可借此构建法律文本的语义索引、开发基于检索的问答系统,或是进行法律文本的自动分类与聚类,以提升法律信息获取的效率与准确性。
解决学术问题
该数据集致力于化解法律文本数字化领域两大核心难题:数据稀缺与来源分散。它将零散发布于政府官网的法律条文系统化整合,形成统一格式、结构化的语料库,为计算法学研究铺平了道路。此举助力研究者深入探索法律文本的结构特征、语言风格及法规间的关联性,推动法律计量学与法律知识图谱等交叉学科发展,具有奠基性贡献。
衍生相关工作
由该数据集可衍生诸多经典研究课题,例如构建斯里兰卡法律文本的词嵌入模型,以量化法条语义相似性;或开发法律条文自动摘要工具,提炼关键信息供快速审阅。此外,它可以作为基准测试集,用于评估法律文本检索系统在低资源语言环境下的性能,进而启发跨司法辖区法律文本迁移学习等前沿探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务