遇见数据集

ipfs_malawi_laws

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

Laws of Malawi 是一个面向法律文本检索的研究数据集,包含从 MalawiLII / 马拉维议会收集的官方立法快照。数据集涵盖1004项法律/法规和1044个条款/章节,全部为英文。数据以两个Parquet文件组织:laws.parquet 每行对应一项法律,包含ID、标题、全文、日期、状态、标识符、条款数量和来源URL;articles.parquet 每行对应一个条款,包含法律ID、条款编号、标题、文本和来源URL。该数据集专为文本检索任务设计,标签包括法律、马拉维、官方文本。请注意:数据集并非官方整合版本,不构成法律建议,应以官方公报和政府门户网站为准。许可证为自定义的 mw-malawilii,允许研究用途。

Laws of Malawi is a research dataset for legal text retrieval, containing official legislative snapshots collected from MalawiLII / Malawi Parliament. The dataset covers 1004 laws/regulations and 1044 articles/sections, all in English. Data is organized in two Parquet files: laws.parquet (each row corresponds to a law with ID, title, full text, date, status, identifier, number of articles, source URL) and articles.parquet (each row corresponds to an article with law ID, article number, title, text, source URL). The dataset is designed for text retrieval tasks, with tags including law, Malawi, official text. Note: The dataset is not an official consolidated version and does not constitute legal advice; the official gazette and government portal should be consulted. License is custom mw-malawilii, allowing research use.

创建时间:
2026-09-06
原始信息汇总

数据集概述:马拉维法律(Laws of Malawi)

该数据集是马拉维官方立法文本的研究快照,收集自 MalawiLII / 马拉维议会 网站,并非官方整合版本,不构成法律建议,一切以官方公报或政府门户网站为准。

基本信息

项目 内容
数据集名称 Laws of Malawi
语言 英语(en)
司法辖区 马拉维(Malawi)
许可证 mw-malawilii(其他)
任务类别 文本检索(text-retrieval)
标签 法律、立法、马拉维、官方文本
数据规模 1K < n < 10K

数据快照

字段
快照日期 2026-09-07
覆盖范围 基于目录索引,不完整
数据来源 MalawiLII / 马拉维议会
采集脚本 scrapers/collect_mw.py
法律/文书数量 1064
条款数量 1776

数据内容与文件结构

数据集包含两个配置(config),均提供 Parquet 格式文件:

  • laws 配置data/laws.parquet):每个法律文书一行,字段包括 ID、标题、全文、日期、状态、标识符、条款数量和来源 URL。
  • articles 配置data/articles.parquet):每个条款/章节一行,字段包括 law_id、条款编号、标题、正文和来源 URL。

同时仓库附带采集相关脚本:

  • scrapers/collect_mw.py — 构建此快照的研究型采集器
  • scrapers/common.py — 共享采集辅助函数
  • scrapers/world_lib.py — 共享抓取函数(优先实时官方 URL,回退至 Wayback 存档)
  • scrapers/archive_fallbacks.py — Wayback / Common Crawl CDX 辅助函数

许可与重用说明

官方政府/公报文本,重用需遵循来源门户网站的公共部门条款。该数据集的打包、元数据和采集脚本仅用于研究目的。数据集不是官方整合版本,不构成法律建议,一切以官方来源为准。

搜集汇总
数据集介绍
ipfs_malawi_laws 数据集图片
构建方式
该数据集是对马拉维共和国官方立法文本的一次系统性采集与整理,其内容源自MalawiLII及马拉维议会官方网站,通过定制化的网络爬虫脚本(如collect_mw.py)进行数据获取,并辅以Wayback Machine等网络档案作为回退保障,以确保数据的完整性与可追溯性。采集过程涵盖立法文书及其条款两个层级,记录法律文件的标题、全文、颁布日期、状态、标识符及来源链接等元数据,最终以Parquet格式存储,形成结构化的法律语料库。
使用方法
该数据集适用于法律文本检索、自然语言处理及法学研究等多种场景。使用者可通过加载laws.parquet或articles.parquet文件,获得结构化数据以进行法律条文的全文检索、文档分类、信息抽取等任务。由于数据包含官方来源URL及回退档案链接,研究者可借此进行数据溯源与交叉验证。需要注意的是,该数据集并非官方文件,不构成法律建议,使用时应当以官方议会或政府公报为准,并遵循数据集的许可条款进行合理引用。
背景与挑战
背景概述
马拉维法律数据集(ipfs_malawi_laws)由研究团队于2026年9月8日创建,旨在系统化地收集和整理马拉维的官方立法文本。该数据集通过马拉维法律信息研究所(MalawiLII)和马拉维议会等官方渠道,采集了1344部法律文书及1810个条文,构建了一个结构化的法律文本语料库。其核心研究问题在于为法律文本检索、自然语言处理及司法智能应用提供高质量的基准数据。该数据集的创建填补了马拉维法律数字化资源匮乏的空白,为法律科技、比较法学及非洲法律研究等领域提供了宝贵的数据基础,推动了法律信息学在发展中国家的发展。
当前挑战
该数据集面临的挑战主要集中在领域问题和构建过程两个方面。在领域层面,法律文本具有高度专业性、结构复杂性和语义精确性要求,传统文本检索方法难以满足法律条文间交叉引用、时效性更新及多版本整合的需求,这对检索算法的语义理解能力提出了严峻考验。在构建过程中,挑战包括来源多样性导致的格式不一致,需从官方公报及政府门户等不同源进行整合;数据的不完整性,覆盖范围标注为“catalog-backed incomplete”,说明部分法律文书可能缺失;法律文本的更新频繁,需要定期重新抓取以确保数据时效性;以及版权和许可问题,虽然注明为公共部门使用条款,但仍需仔细遵循。此外,数据采集依赖网络爬虫技术,需应对网页结构变化和反爬虫机制,并利用Wayback Machine等回退策略确保数据的完整获取。
常用场景
经典使用场景
作为马拉维成文法的数字化快照,该数据集为法律文本挖掘与比较法研究提供了结构化语料库。其双层级结构(laws.parquet收录完整法律文书,articles.parquet细分为条款)支持从宏观法规概览到微观条文解析的多粒度分析,适用于法律条文检索、主题建模、法律时效性追踪及多司法辖区横向对比等经典研究场景。
解决学术问题
该数据集直面非洲法域数字化资源稀缺、官方文本分散且格式不统一的长期困境。通过系统性整合官方发布渠道并保留元数据(如生效日期、状态、来源标识),它解决了法律信息可获取性与可验证性的基础矛盾,为法律实证研究、立法质量评估及法律变迁计量分析提供了可靠数据支撑,推动撒哈拉以南非洲法律研究的可重复性与可计算化进程。
实际应用
在实际应用中,该数据集可驱动法律科技产品的原型开发,例如基于机器学习的关键词检索系统、法律条款相似度匹配工具或立法动态监测平台。对于跨国企业与非政府组织,其支撑合规性审查与法律风险评估;对于马拉维本地的法律工作者,它成为快速查找现行法规的便捷入口,尤其适用于偏远地区缺乏实体法库的场景。
数据集最近研究
最新研究方向
在非洲法律数字化与开放获取运动的浪潮中,马拉维法律数据集作为司法透明化的重要基石,正引领着自然语言处理与法律信息学的前沿探索。该数据集汇集了1344部法律文书与1810个条款,覆盖官方公报与议会原始文本,为构建法律检索系统、自动摘要生成及判例预测模型提供了稀缺的语料资源。其快照日期为2026年9月8日,反映了当前法律体系的动态演进,尤其与马拉维司法改革和电子政务建设紧密相关。研究者正利用此类结构化法律语料开发多语言法律问答系统,并对非洲习惯法与成文法的交叉领域进行语义分析,以期推动区域法律数据标准的统一。该数据集的非官方整合特性也催生了关于法律文本权威性、版本追踪及追溯时效性的方法论讨论,为法律人工智能的伦理部署设置了重要参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务