遇见数据集

ipfs_ethiopia_laws

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

Laws of Ethiopia 数据集是一个从埃塞俄比亚联邦 Negarit 公报收集的官方立法研究快照。该数据集包含两个配置:laws(法律文书)和 articles(条款)。laws 配置包含 1,122 个法律文书,每个条目包括唯一标识符、标题、全文、日期、状态、法律标识符、条款数量和来源 URL。articles 配置包含 4,780 个条款,每个条目包括所属法律 ID、条款编号、标题、文本和来源 URL。数据集语言为阿姆哈拉语(am),适用于法律文本检索、分析、自然语言处理(NLP)等任务。快照日期为 2026-09-07,覆盖范围不完整。注意:该数据集不是官方整合,不能替代官方公报或政府门户网站,不构成法律建议,官方来源应优先使用。

The Laws of Ethiopia dataset is a snapshot of official legislative research collected from the Federal Negarit Gazette of Ethiopia. It contains two configurations: laws and articles. The laws configuration includes 1,122 legal documents, each with a unique identifier, title, full text, date, status, legal identifier, number of articles, and source URL. The articles configuration includes 4,780 articles, each with the associated law ID, article number, title, text, and source URL. The dataset language is Amharic (am), suitable for tasks such as legal text retrieval, analysis, and natural language processing (NLP). The snapshot date is 2026-09-07, with incomplete coverage. Note: This dataset is not an official compilation and should not replace the official gazette or government portal. It does not constitute legal advice; official sources should be preferred.

创建时间:
2026-09-05
原始信息汇总

数据集概述:埃塞俄比亚法律(Laws of Ethiopia)

基本信息

  • 数据集名称:Laws of Ethiopia
  • 语言:阿姆哈拉语(am)
  • 司法辖区:埃塞俄比亚
  • 许可证et-negarit(其他)
  • 任务类别:文本检索(text-retrieval)
  • 标签:法律、埃塞俄比亚、官方文本
  • 数据规模:1K < n < 10K

数据来源与覆盖

  • 来源:联邦《尼加里特公报》(Federal Negarit Gazette)
  • 快照日期:2026年9月7日
  • 覆盖状态:基于目录索引,不完整
  • 采集工具scrapers/collect_et.py(研究用途采集脚本)
  • 重要声明:该数据集非官方汇编,不构成法律建议,一切以官方公报或政府门户为准

数据内容与规模

数据类型 数量
法律/文书(laws) 1242 条
条款(articles) 4780 条

文件结构与格式

该数据集包含两个可配置的子集,均为 Parquet 格式:

  1. laws(默认配置)data/laws.parquet

    • 每行对应一份法律文书,字段包括:ID、标题、全文、日期、状态、标识符、条款数量、来源 URL。
  2. articlesdata/articles.parquet

    • 每行对应一个条款/章节,字段包括:law_id、条款编号、标题、正文、来源 URL。

附带脚本

  • scrapers/collect_et.py:用于构建该快照的研究采集器
  • scrapers/common.py:共享采集辅助函数
  • scrapers/world_lib.py:共享抓取工具(优先获取官方实时 URL,备选 Wayback)
  • scrapers/archive_fallbacks.py:Wayback / Common Crawl CDX 备用方案

许可与复用说明

  • 官方政府/公报文本,复用需遵守来源门户的公共部门条款
  • 该数据集的打包、元数据及采集脚本仅用于研究目的
  • 官方来源文本具有优先效力
搜集汇总
数据集介绍
ipfs_ethiopia_laws 数据集图片
构建方式
该数据集源自埃塞俄比亚联邦Negarit公报的官方立法文献,通过定制的网络爬虫工具系统性地采集而成。构建流程涵盖了从官方门户及网络档案中抓取法律文本,并辅以Wayback Machine作为数据回退机制,确保资料的完整性与可获取性。数据以Parquet格式存储,细分为法律文书(laws)与条文(articles)两个层级,分别记录了每项法律文书的元数据及其具体条款内容,构建了一个结构化的法律文本语料库。
特点
此数据集聚焦于埃塞俄比亚的官方法律文本,涵盖1242部法律文书与4780项条文,全部采用阿姆哈拉语,具有鲜明的司法管辖属性。其独到之处在于双层级的数据组织方式,便于使用者按法律整体或个别条文进行精细检索与研究。数据集清晰标注了快照日期与覆盖范围,并强调官方文本的权威性,适用于法律文本挖掘与信息检索领域的深度应用。
使用方法
适用于法律文本检索与分析任务,可通过加载laws或articles两种配置来获取所需粒度的数据。使用者能够利用数据集的Python接口轻松读取Parquet文件,以进行语义搜索、文本比对或统计分析。同时,数据集内置了采集脚本,便于研究者追溯原始资料或更新数据,其开放许可鼓励在遵循官方来源优先的前提下,开展广泛的学术研究与技术开发。
背景与挑战
背景概述
该数据集名为“Laws of Ethiopia”,创建于2026年9月7日,由研究团队通过爬虫脚本从埃塞俄比亚联邦Negarit公报收集而成,旨在提供埃塞俄比亚官方立法的研究快照。该数据集涵盖1242部法律文书和4780个条款,全部为阿姆哈拉语,属于法律与文本检索领域。其核心研究问题在于为法律文本分析、信息检索及自然语言处理任务提供结构化的官方法律语料。该数据集的发布对埃塞俄比亚法律数字化研究具有开创性意义,为跨语言法律信息检索、法律知识图谱构建及低资源语言的法律文本处理提供了宝贵资源,推动了非洲法律语料库的建设与发展。
当前挑战
该数据集面临的挑战首要在于法律文本的复杂性与非结构化特性,如法律条款间的交叉引用、术语一致性及历史版本差异,为文本解析与语义理解带来困难。构建过程中,爬虫采集需应对官方公报网站的动态结构、访问限制及内容不完整,必须依赖Wayback Machine等备份机制确保数据完整性,但覆盖范围仍受官方数字化进程制约,导致部分法律缺失。此外,阿姆哈拉语的低资源属性使得词法分析、命名实体识别等预处理任务缺乏现成工具,需人工介入,增加了构建成本与误差风险。数据集的非官方整合性质也要求用户警惕潜在偏差,官方文本的权威性对其合法性构成持续挑战。
常用场景
经典使用场景
该数据集作为埃塞俄比亚联邦法律文书的系统性研究快照,广泛应用于法律文本挖掘、司法判决预测及法律信息检索等领域。其细粒度结构包含1242部法律及4780条条款,为自然语言处理模型提供了丰富的阿姆哈拉语法律语料,支持立法脉络分析、法律条文相似度计算以及跨法域比较研究。研究者可借此构建法律知识图谱,探索埃塞俄比亚法律体系的演进逻辑。
解决学术问题
此数据集弥合了埃塞俄比亚法律数字化研究中的关键空白,解决了官方法律文本分散、难以获取及缺乏统一结构化索引的难题。其系统化整理与条文化分割,为法律信息学、计算法学提供了可复现的实验基础,尤其推动了低资源语言下的法律自然语言处理研究。此外,它促进了法律实证分析,使得法律时效性评估、立法趋势量化研究成为可能。
衍生相关工作
衍生工作层面,该数据集激发了多项后续学术工作,包括面向阿姆哈拉语的法律预训练语言模型研发、法律文本分类与摘要生成任务的数据增强,以及基于条款引用的法律关联网络分析等。其还可作为基线语料,用于开发多语言法律检索跨语言迁移方法,或为法律问答系统、实体识别等提供训练与评估素材,进一步延伸至非洲法律信息学方向的研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务