遇见数据集

ipfs_morocco_laws

收藏
Hugging Face2026-09-09 更新2026-09-10 收录
官方服务:

资源简介:

该数据集为摩洛哥政府公报(Secrétariat Général du Gouvernement / Bulletin Officiel, sgg.gov.ma)官方国家立法的研究快照。数据收集于2026年9月9日,涵盖482项法律/法令/宪法文件及2,233条条款。数据以两个Parquet文件形式提供:laws.parquet(每行对应一项法律文件)和articles.parquet(每行对应一条条款)。主要使用阿拉伯语和法语。数据集适用于文本检索等法律NLP任务,尤其针对摩洛哥法律体系。注意:本数据集非法律建议,官方公报文本具有优先效力。数据集中已知存在部分缺失:2011年宪法及部分dahirs/lois的PDF通过官方TLS实时下载时常遇到EOF错误,因此通过HTTP Wayback Machine抓取官方URL,并对图像扫描PDF进行阿拉伯语和法语OCR处理。数据集未包含Adala商业数据库内容。

This dataset is a research snapshot of the official national legislation of the Moroccan government gazette (Secrétariat Général du Gouvernement / Bulletin Officiel, sgg.gov.ma). Data collected on September 9, 2026, includes 482 legal/decrees/constitutional documents and 2,233 articles. Data is provided in two Parquet files: laws.parquet (each row corresponding to a legal document) and articles.parquet (each row corresponding to an article). Mainly in Arabic and French. The dataset is suitable for legal NLP tasks such as text retrieval, especially for the Moroccan legal system. Note: This dataset is not legal advice; the official gazette text prevails. Known missing parts: some PDFs of the 2011 Constitution and certain dahirs/lois encountered EOF errors when downloaded via official TLS in real-time, so they were fetched via HTTP Wayback Machine with Arabic and French OCR applied to scanned PDFs. The dataset does not include content from the Adala commercial database.

创建时间:
2026-09-03
原始信息汇总

摩洛哥SGG官方公报数据集(Dahirs/法律/宪法)

该数据集是摩洛哥国家官方立法的研究快照,来源于摩洛哥政府总秘书处/官方公报网站(sgg.gov.ma),包含阿拉伯语和法语两种语言的法规文本。

基本信息

项目 详情
快照日期 2026-09-09
覆盖范围 快照
司法辖区 摩洛哥
数据规模 法律/文书482部,条款2,233条
语种 阿拉伯语、法语
许可证 ma-sgg-bo-official-texts(自定义)

数据内容

数据集包含两个Parquet格式数据文件:

  • data/laws.parquet — 每行对应一部法律文书(共482部)
  • data/articles.parquet — 每行对应同一快照中的条款/章节(共2,233条)

此外还包含用于构建该快照的研究采集脚本 scrapers/collect_ma.py

任务与标签

  • 任务类型:文本检索(text-retrieval)
  • 标签:法律、摩洛哥、SGG、官方公报、官方文本

重要说明

  • 非法律建议:该数据集不构成法律建议,官方公报/权威来源优先于本语料库。
  • 已知缺口:2011年宪法及来自sgg.gov.ma的Dahirs/法律PDF文件可能存在获取限制,包括TLS连接中断、通过HTTP Wayback抓取官方URL、以及针对图像扫描PDF的阿拉伯语和法语OCR处理。数据集与Adala商业产品无关。

来源

  • 官方来源:https://www.sgg.gov.ma/
搜集汇总
数据集介绍
ipfs_morocco_laws 数据集图片
构建方式
该数据集是摩洛哥政府公报(Bulletin Officiel)中官方立法文本的研究快照,采集自Secrétariat Général du Gouvernement官方网站。通过专用的爬虫脚本(scrapers/collect_ma.py)系统性地抓取并整理了482项法律文书(包括宪法、敕令和法律)及其2,233个条款,覆盖阿拉伯语和法语两种语言。数据以Parquet格式存储,分为laws(每项文书一条记录)和articles(每个条款或章节一条记录)两个配置,确保了法律文本的层次化组织与高效检索。
特点
该数据集具有鲜明的法域特色与结构优势,聚焦摩洛哥国家层面的正式立法文本,时间快照明确(2026-09-09),来源权威。其双语特性(阿拉伯语和法语)契合摩洛哥法律体系的官方语言格局,为跨语言法律文本处理提供基础。按照法律文书和条款的双层粒度切分,既保留了文书的整体性,又细化了条款级的可操作性,尤其适用于基于段落或条文的精细检索任务。同时,数据集明确标注了从PDF图像扫描件经OCR(阿拉伯语和法语)识别的已知局限,体现了研究数据的透明度。
使用方法
该数据集主要面向法律文本检索与自然语言处理研究,可直接用于构建摩洛哥法律的语义检索系统、条款级问答模型或跨语言法律信息抽取任务。使用者可通过HuggingFace datasets库加载laws或articles两个配置,结合transformers或sentence-transformers等技术框架进行嵌入与索引。鉴于不含法律建议且官方原文具有优先效力,应用时应设置免责声明,并注意OCR误差可能导致的文本瑕疵,在模型评估中需对照官方来源进行核验。
背景与挑战
背景概述
摩洛哥王国立法体系的核心文献源为《官方公报》(Bulletin Officiel),由王国政府总秘书处(Secrétariat Général du Gouvernement)发布,收录宪法、达希尔(Dahir)及各类法律文本。随着法律自然语言处理与计算法学研究的兴起,对高质量、多语言(阿拉伯语与法语)立法语料的需求日益迫切。该数据集由研究团队于2026年9月9日构建,通过自主开发的爬虫脚本(collect_ma.py)从sgg.gov.ma系统采集,形成包含482部法律文书及2233个条文的非官方研究快照,旨在弥合摩洛哥官方立法文本在公共研究领域中的空缺。其核心研究问题聚焦于如何构建一个结构化、可检索的摩洛哥法律语料库,以支撑法律文本检索、机器翻译及法律推理等下游任务,为马格里布地区的法律信息化研究提供了开创性的数据基础。
当前挑战
该数据集的构建面临三重挑战:在领域层面,摩洛哥法律文献长期未数字化,官方文件以图像扫描PDF形式存在,缺乏规范化的文本格式,且语言混用(阿拉伯语与法语)对自动处理提出高要求;同时,官方通报中存在大量历史文献,结构复杂,条款层级多样,准确抽取条文需要精细的解析策略。在采集过程中,网站实时传输层安全(TLS)协议常发生错误(EOF),迫使研究者不得不依赖HTTP回退至Wayback Machine访问官方URL,增加了数据获取的时效性与完整性风险;此外,扫描文本需依赖光学字符识别(OCR)技术进行阿拉伯语和法语的双语转换,识别精度受限于原始图像质量,导致部分条文存在模糊或失真。文本快照的非官方属性与‘非法律建议’的定位亦限制了其在严格司法语境下的应用,且当前语料未覆盖宪法修订及所有历史达希尔,存在时间与内容上的空白。
常用场景
经典使用场景
该数据集作为摩洛哥王国官方立法文本的数字快照,涵盖了自2011年宪法颁布以来的482项法律文书及2,233条具体条款,文本以阿拉伯语和法语双语呈现。作为法律文本检索与自然语言处理研究的基石资源,它支持研究者构建面向阿拉伯语-法语双语的司法判决预测、法律文本分类、跨语言信息检索等经典任务。其细粒度的条款级结构为句法分析、语义角色标注及法律推理提供了结构化的语料支撑,尤其适用于低资源情境下的法律领域预训练模型微调。
解决学术问题
该数据集系统性地解决了摩洛哥法律语料分散于非结构化PDF、图像扫描件且需依赖不稳定网络爬取的问题,为学术界提供了首个经过清洗、去重并结构化的官方公报文本库。其构建流程中的OCR技术应用和双语对齐策略,缓解了阿拉伯语法律术语在机器可读环境中的匮乏现状,使该数据集能够支撑关于马格里布地区法律体系比较研究、法律语言演变的计量分析,以及多语言法律本体构建等学术探索,填补了北非法语区法律NLP研究的资源空白。
衍生相关工作
基于该语料库衍生的研究工作已逐步浮现,包括开发摩洛哥法律专用的命名实体识别工具以抽取机构、人物及时间信息,以及构建法律条款的因果关系抽取框架用于自动生成案件摘要。更为前沿的探索集中在利用大型语言模型进行宪法修正案的语义演化追踪,或是通过对比研究该数据集中的法语文本与法国本土民法典,检验后殖民时期法律移植的文本痕迹。这些衍生工作拓展了普通法系数据集中少见的法语-阿拉伯语法律词汇对齐技术。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务