遇见数据集

ipfs_lebanon_laws

收藏
Hugging Face2026-09-09 更新2026-09-10 收录
官方服务:

资源简介:

该数据集是黎巴嫩官方公报(jo.pcm.gov.lb)和部长会议主席官网(pcm.gov.lb)上官方国家立法的研究快照。数据集包含两个部分:laws(法律/文书)和articles(文章/条款),分别存储在data/laws.parquet和data/articles.parquet文件中。数据集共有33条法律/文书和54个文章/条款,语言为阿拉伯语,管辖区域为黎巴嫩。数据收集日期为2026年9月9日(来源文本如此),覆盖范围不完整(catalog-backed incomplete),且仅涵盖指定网站,不包含其他法律数据库(如Adala/Qistas)。请注意:本数据集不构成法律建议,官方来源(官方公报)具有优先效力。适用任务为文本检索,特别适用于法律文本的检索与分析。许可证为lb-official-gazette-pcm-terms。已知局限性包括:仅限特定网站,且阿拉伯语OCR质量可能不佳。

This dataset is a research snapshot of official national legislation from the Lebanese Official Gazette (jo.pcm.gov.lb) and the website of the Presidency of the Council of Ministers (pcm.gov.lb). It contains two parts: laws (instruments) and articles (clauses), stored in data/laws.parquet and data/articles.parquet respectively. The dataset includes 33 laws/instruments and 54 articles/clauses, in Arabic language, with jurisdiction over Lebanon. The data collection date is September 9, 2026 (as per source text), coverage is incomplete (catalog-backed incomplete), and only covers specified websites, excluding other legal databases (e.g., Adala/Qistas). Note: This dataset does not constitute legal advice; official sources (Official Gazette) take precedence. Applicable task is text retrieval, particularly suitable for legal text retrieval and analysis. License: lb-official-gazette-pcm-terms. Known limitations include: restricted to specific websites and potentially poor Arabic OCR quality.

创建时间:
2026-09-05
原始信息汇总

数据集概述

名称与基本信息

  • 数据集名称:Lebanon Official Gazette / PCM (jo.pcm.gov.lb)
  • 语言:阿拉伯语(ar)
  • 领域:法律、黎巴嫩、官方公报、部长会议主席府
  • 许可lb-official-gazette-pcm-terms(非标准许可,标注为“other”)
  • 数据规模:少于1K条记录
  • 司法管辖区:黎巴嫩

数据来源与时间

  • 来源机构:黎巴嫩官方公报(jo.pcm.gov.lb)与部长会议主席府(pcm.gov.lb)
  • 快照日期:2026-09-09
  • 覆盖范围:基于目录备份,不完整
  • 采集方式:通过自定义脚本 scrapers/collect_lb.py 抓取

数据内容与配置

数据集包含两个配置(config):

配置名 文件路径 说明
laws data/laws.parquet 每条记录对应一份法律/文书(共33条)
articles data/articles.parquet 每条记录对应一个条款/章节(共54条)

任务与标签

  • 任务类别:文本检索(text-retrieval)
  • 标签:法律、黎巴嫩、官方公报、PCM、官方文本等

已知局限

  • 数据仅覆盖jo.pcm.gov.lb / pcm.gov.lb官方网站,不包含Adala/Qistas等第三方法律数据库。
  • 当官方实时页面失效时,使用Wayback Machine备份,但官方公报(egazette)的完整期刊内容常受登录墙限制,导致数据不全。
  • 阿拉伯语OCR文本质量可能较薄弱。

使用与免责声明

  • 非法律建议:数据集仅为研究快照,不构成法律意见。
  • 版权与复用:使用须遵守黎巴嫩官方公报/PCM的相关条款;官方正式公报文本优先于本数据集内容。

相关链接

  • 原始数据来源:https://jo.pcm.gov.lb/
搜集汇总
数据集介绍
ipfs_lebanon_laws 数据集图片
构建方式
该数据集以黎巴嫩官方公报(jo.pcm.gov.lb)与部长会议主席团(pcm.gov.lb)发布的官方法律文本为信息源,通过专用采集脚本scrapers/collect_lb.py进行系统性抓取与结构化整理。采集过程以目录索引为线索,将每项法律文书逐条解析,分别生成以单项法规为单位的laws.parquet和以条款为单位的articles.parquet两类数据文件,快照日期为2026年9月9日。对于实时链接失效的情形,采集流程借助官方网址的Wayback存档进行补充,以尽可能维系文本的连续性,并明确标注覆盖范围为目录支持下的非完整收录。
特点
数据集聚焦黎巴嫩国家层面的官方法律文本,语种为阿拉伯语,涵盖33项法律文书与54条条款,体量虽小却具备明确的司法辖区指向。其特点在于以官方公报和部长会议主席团为双重来源,保留了法规与条款两个层级的独立配置,便于不同粒度的检索与研究。数据以Parquet列式格式存储,利于高效读取与批量处理。许可证遵循黎巴嫩官方公报与部长会议主席团条款,且明确声明官方文本具有优先效力,不构成法律意见,同时提示阿拉伯语OCR可能存在文本稀薄之处。
使用方法
使用者可通过Hugging Face数据集接口加载默认的laws配置,亦可切换至articles配置以获取条款级数据,两个配置文件分别指向data/laws.parquet与data/articles.parquet。加载后可借助文本检索任务对阿拉伯语法律条文进行查询、比对或语料分析。由于数据集为研究性快照且覆盖不完整,使用时应将其视为辅助性索引,任何法律适用均须回溯官方公报或部长会议主席团的原件加以核验。采集脚本scrapers/collect_lb.py亦可作为复现或扩展采集流程的参考。
背景与挑战
背景概述
黎巴嫩官方法律文本的数字化整理长期面临碎片化与可及性不足的困境。在此语境下,ipfs_lebanon_laws数据集于2026年9月9日构建,由研究团队依托黎巴嫩官方公报(jo.pcm.gov.lb)与部长会议主席团(pcm.gov.lb)的公开信息采集而成。该数据集聚焦于黎巴嫩管辖范围内的官方法律文书及其条款,以阿拉伯语为语言载体,旨在为法律文本检索与计算法学研究提供经过整理的基准快照。其核心研究问题在于如何从权威官方来源中系统性地提取并结构化法律条文,以支撑后续的文本检索与法律信息学分析。作为一项研究快照,它为黎巴嫩法律文本的可计算化利用提供了初步基础,对阿拉伯语法律自然语言处理及区域法律信息检索领域具有参考价值。
当前挑战
该数据集所应对的领域问题在于官方法律文本的机器可读化与检索效率,即如何将非结构化的官方公报内容转化为可供文本检索任务使用的结构化语料。在构建过程中,所面临的挑战尤为显著:其一,官方来源仅限jo.pcm.gov.lb与pcm.gov.lb,且动态文件与印刷版描述存在访问壁垒,实时抓取常因登录限制而失败,不得不依赖官方URL的存档回退,导致覆盖范围呈目录支持下的不完整状态;其二,数据规模有限,仅涵盖33项法律文书与54条条款,难以全面反映黎巴嫩法律体系的全貌;其三,阿拉伯语光学字符识别质量参差不齐,可能影响文本的准确性与可用性。这些因素共同构成了该数据集在完整性与可靠性方面的核心挑战。
常用场景
经典使用场景
在法律文本挖掘与信息检索领域,针对阿拉伯语法律文献的资源长期匮乏,该数据集以黎巴嫩官方公报与总理府发布的规范性文件为来源,构建了涵盖33部法律文书与54条条款的细粒度语料快照。其最经典的使用场景在于支撑阿拉伯语法律文本检索系统的开发与评测,研究者可借助法律与条款两个层级的结构化配置,开展条款级检索、法条溯源与跨文书关联分析,为低资源语言法律信息抽取提供基准性语料支撑。
解决学术问题
该数据集着力缓解阿拉伯语法律研究中长期存在的语料稀缺与来源碎片化问题,为法律文本检索、法律条款分割以及官方文书结构解析等任务提供可复现的数据基础。其意义在于将原本分散于官方门户且部分受登录限制的立法文本整合为可机读的标准化快照,使研究者能够在统一框架下比较不同检索模型对法律语义单元的捕捉能力,进而推动低资源法律自然语言处理方法的验证与迭代。
衍生相关工作
围绕该数据集衍生的经典工作主要集中于阿拉伯语法律文本检索基准的构建与评估,包括面向条款级粒度的稀疏与稠密检索方法对比研究,以及法律文书结构解析与元数据抽取的技术探索。相关研究亦将其作为低资源法律领域迁移学习的验证语料,与Adala、Qistas等区域法律平台形成互补性参照,推动黎巴嫩及更广泛阿拉伯语法律信息处理研究的持续积累。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务