遇见数据集

ipfs_angola_laws

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

该数据集是安哥拉官方立法的研究快照,数据来源于安哥拉共和国日报(Diário da República)、政府门户网站(GUE / Portal do Governo)。数据集包含两个子集:laws 和 articles。laws 子集以每行一项法律/文书的形式存储,包含ID、标题、全文、日期、状态、标识符、条款数量和来源URL,共1436条记录。articles 子集以每行一条条款/章节的形式存储,包含法律ID、条款编号、标题、文本和来源URL,共19603条记录。数据语言为葡萄牙语,覆盖安哥拉司法管辖区。数据集提供收集器脚本(scrapers/collect_ao.py)用于构建此快照。注意:本数据集不是官方整合版本,不构成法律建议,官方公报或政府门户网站应作为权威来源。许可证为 ao-diario-republica,适用于研究用途。

This dataset is a research snapshot of Angolas official legislation, sourced from the Diário da República and the government portal (GUE / Portal do Governo). It contains two subsets: laws and articles. The laws subset stores each law/document as a row, including ID, title, full text, date, status, identifier, number of articles, and source URL, with 1,436 records. The articles subset stores each article/section as a row, including law ID, article number, title, text, and source URL, with 19,603 records. The data language is Portuguese, covering the jurisdiction of Angola. The dataset provides a collector script (scrapers/collect_ao.py) for building this snapshot. Note: This dataset is not an official consolidated version and does not constitute legal advice; official gazettes or government portals should be used as authoritative sources. The license is ao-diario-republica, suitable for research purposes.

创建时间:
2026-09-05
原始信息汇总

数据集概述

安哥拉法律数据集(Laws of Angola) 是一个以葡萄牙语收录安哥拉官方立法文本的研究型快照数据集,内容采集自安哥拉共和国日报(Diario da Republica)、GUE 及政府门户网站(Portal do Governo)。

基本信息

项目 内容
数据集名称 Laws of Angola
语言 葡萄牙语(pt)
司法辖区 安哥拉
任务类别 文本检索
标签 法律、安哥拉、官方文本
许可证 ao-diario-republica(其他)
快照日期 2026-09-07
数据规模 1K < n < 10K

数据内容

数据集包含两个配置,均为 Parquet 格式:

  • lawsdata/laws.parquet):每行对应一份法律文书,包含编号、标题、全文、日期、状态、标识符、条款数量及来源 URL。
  • articlesdata/articles.parquet):每行对应一个条款或章节,包含法律编号、条款序号、标题、正文及来源 URL。

规模统计:

  • 法律文书/工具:1556 份
  • 条款:20001 条

附带资源

数据集中还包含研究采集器脚本:

  • scrapers/collect_ao.py — 构建此快照的研究采集器
  • scrapers/common.py — 共享采集辅助工具
  • scrapers/world_lib.py — 共享抓取功能(实时官方 URL、Wayback 回退)
  • scrapers/archive_fallbacks.py — Wayback / Common Crawl CDX 辅助功能

使用与许可说明

  • 数据来源为官方政府/公报文本,复用需遵守源门户的公共部门条款。
  • 该数据集不是官方整合版本,不构成法律建议,官方来源具有优先效力。
  • 采集覆盖范围标注为“catalog-backed incomplete”,即基于目录支持的不完整覆盖。
搜集汇总
数据集介绍
ipfs_angola_laws 数据集图片
构建方式
本数据集以安哥拉共和国官方公报、政府门户网站及GUE平台为数据源,利用自主开发的爬虫脚本(scrapers/collect_ao.py)进行系统采集,并通过共享工具模块(如common.py、world_lib.py)确保对官方URL的实时抓取与Internet Archive回溯备用机制,从而构建了截至2026年9月7日的研究快照。数据集整合了1,556部法律文书与20,001个条文,分别存储于laws.parquet与articles.parquet两个数据文件中,以表格形式呈现每项文书的元数据、全文及每一条文的具体内容,并附有来源URL,为法律文本提供了严谨的归档结构。
使用方法
适用场景包括法律文本挖掘、法规检索系统开发及安哥拉法律体系的社会科学研究。研究者可通过读取laws.parquet获取法律全文及其元数据,或借助articles.parquet进行条文级别的细粒度分析。数据集中的source URL字段支持溯源验证,配合Wayback回退链接,保障在网络资源变动下的可追溯性。使用时务必注意其非官方整合属性,正式引用或法律判断须核对官方来源。该数据集免费提供,遵循安哥拉公共部门条款,为学术研究提供了便捷可靠的数据基础。
背景与挑战
背景概述
安哥拉法律数据集(ipfs_angola_laws)于2026年9月创建,由研究者通过定制爬虫脚本从安哥拉官方渠道(共和国日报、政府门户)采集,汇编了1556项法律文书及20001条条款,形成结构化法律文本资源。该数据集服务于法律文本检索任务,旨在为自然语言处理与法律信息学领域提供高质量、覆盖官方来源的安哥拉葡萄牙语法律语料,填补了非洲葡语国家法律资源数字化与开源化的空白,对推动低资源语言法律智能研究具有重要基础性作用。
当前挑战
该数据集面临多重挑战:在法律文本处理领域,安哥拉法律体系复杂,法律文书结构多变、术语专业,需精准解析条款层级,而官方语料分散且格式不一,增加了构建难度;同时,官方来源网络不稳定,需借助互联网存档回退机制确保数据完整。此外,数据集明确标注为非官方整合,非法律建议,存在时效性与权威性风险,法律更新频繁可能导致版本滞后,且版权与再利用条款需谨慎处理。这些挑战制约了其在实际法律应用中的可靠性,并提示后续维护需持续同步官方源,并完善质量校验机制。
常用场景
经典使用场景
在法律自然语言处理与比较法研究领域,安哥拉法律数据集(ipfs_angola_laws)作为首个系统化整理的葡语非洲国家成文法语料,为法律文本挖掘提供了稀缺的基础资源。其经典使用场景聚焦于法律条款的语义检索与结构解析,研究者可基于该数据集的1556项法律文书与20001条条款,构建面向法律领域的预训练语言模型或专用检索系统。通过分析法条间的引用网络与主题分布,能够有效支撑法律知识图谱的自动构建,进而推动跨司法管辖区法律体系的对比研究。
解决学术问题
该数据集精准解决了安哥拉法律文本分散且缺乏结构化整理的核心学术难题。既往研究受限于官方公报获取的不便,难以开展大规模量化实证分析。此数据集以一致的Schema收录法律全文,并标注日期、状态与来源URL,填补了葡语非洲法律语料的空白。其不仅为测试多语言法律NLP模型在低资源语种上的泛化能力提供了基线,还助力探究殖民法系与本土习惯法的融合路径,对法律移植理论及信息检索评估具有方法论启示。
实际应用
在实际应用中,此数据集可作为法律科技产品研发的高质量语料库,例如用于构建安哥拉本土智能法律顾问系统,实现法律法规的快速定位与问答交互。政府部门及非政府组织可借此监控法律文件的更新动态,辅助立法影响评估。对跨国公司而言,基于该语料的合规检索工具能显著降低在安哥拉投资中的法律风险识别成本。此外,数据中附带的官方来源链接与抓取脚本,为法律文献的持续更新与档案保全提供了可复现的技术路径。
数据集最近研究
最新研究方向
当前,非洲葡语国家法律数据资源稀缺,安哥拉法律数据集(ipfs_angola_laws)的推出为法律科技与计算法学研究提供了宝贵语料。该数据集整合自官方公报、政府门户等权威来源,涵盖1556项法律文书及20001条条文,其细粒度结构(法律与条款分离)支持文本检索、法律知识图谱构建及多语言法律信息处理等前沿探索。尤其在法律人工智能领域,该语料助力于判决预测、法律问答系统及合规分析模型的训练与评估,推动法律数据标准化与开放获取进程。此外,其以研究快照形式发布,并强调非官方整合属性,引发对法律数据可信度、版本控制及伦理使用的深入讨论,为构建透明、可复现的法律计算研究范式奠定基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务