遇见数据集

ipfs_laos_laws

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

该数据集为“老挝法律”数据集,是来自老挝官方公报(Lao Official Gazette)的官方立法研究快照。数据集包含两个子集:laws(法律文件级)和articles(条款级)。laws子集包含1130个法律文件,每个文件包含id、标题、全文、日期、状态、标识符、文章数量和来源URL;articles子集包含15682个条款,每个条款包含所属法律ID、条款编号、标题、文本和来源URL。数据集语言为老挝语,适用于法律文本检索、法律信息抽取等任务。数据收集日期为2026年9月7日,覆盖范围不完整(catalog-backed incomplete)。请注意:该数据集并非官方整合版,不构成法律建议,官方来源优于本数据集。

This dataset is the Lao Law dataset, a snapshot of official legislative research from the Lao Official Gazette. It contains two subsets: laws (document-level) and articles (article-level). The laws subset includes 1,130 legal documents, each with fields: id, title, full text, date, status, identifier, number of articles, and source URL. The articles subset includes 15,682 articles, each with fields: associated law ID, article number, title, text, and source URL. The dataset language is Lao, suitable for tasks such as legal text retrieval and legal information extraction. The data collection date is September 7, 2026, with incomplete coverage (catalog-backed incomplete). Note: This dataset is not an official consolidated version, does not constitute legal advice, and official sources take precedence over this dataset.

创建时间:
2026-09-05
原始信息汇总

数据集概述:老挝法律(Laws of Laos)

该数据集是老挝官方法律文本的研究快照,由endomorphosis在Hugging Face上发布。数据来源于老挝官方公报(Lao Official Gazette),属于法律、文本检索类数据集,语言为老挝语(lo),管辖区域为老挝。

基本信息

  • 数据集名称:Laws of Laos
  • 许可协议la-official-gazette(非标准许可,属于其他类型)
  • 语言:老挝语(lo
  • 任务类别:文本检索(text-retrieval)
  • 标签:法律(legal)、法律条文(law)、老挝(laos)、官方文本(official-texts)
  • 数据规模:1K < n < 10K(按文件数计,实际法律文件数与条款数见下)

快照信息

  • 快照日期:2026-09-07
  • 覆盖范围:基于目录索引,但不完整(catalog-backed incomplete)
  • 数据来源:老挝官方公报
  • 采集工具scrapers/collect_la.py
  • 法律法规/文书数量:1190件
  • 条款数量:16211条
  • 数据类型:每行对应一份文书或条款,包含完整的元数据

数据内容与文件结构

数据集包含两个主要的数据文件以及用于采集和处理的脚本:

  • data/laws.parquet:每行对应一份法律文书,字段包括ID、标题、全文、日期、状态、标识符、条款数量及来源URL。
  • data/articles.parquet:每行对应一个条款或章节,字段包括law_id、条款编号、标题、正文及来源URL。
  • scrapers/collect_la.py:用于构建该快照的采集脚本。
  • scrapers/common.py:共享的采集辅助函数。
  • scrapers/world_lib.py:网络获取模块,优先访问官方实时URL,必要时回退到Wayback存档。
  • scrapers/archive_fallbacks.py:用于Wayback及Common Crawl CDX的辅助函数。

许可与使用

  • 文本来源为官方政府或公报文本,其复用需遵循来源门户的公共部门条款。
  • 该数据集的打包、元数据及采集脚本仅用于研究目的
  • 该数据集并非官方整合版本,也不构成法律建议;如有出入,以官方来源为准。

其他说明

  • 数据集中包含技术性备注(涉及WARC/WB格式、文本可打包性阈值等),表明该快照经由网络存档与文本质量筛选后生成。
搜集汇总
数据集介绍
ipfs_laos_laws 数据集图片
构建方式
该数据集基于老挝官方公报的立法文本构建,通过自主研发的爬虫脚本对政府门户网站进行系统性采集,辅以网络存档机制确保数据溯源的完整性。构建流程涵盖原始WARC文件的抓取、OCR文本扩充、质量筛选及结构化整理,最终形成包含1310部法律文书与18057条条目的双层级语料,分别存储于laws与articles两个配置文件中,以支持从整部法律到具体条款的颗粒度检索需求。
特点
该数据集聚焦老挝法律文本,具有显著的领域专属性和语言稀缺性。其特色在于双轨结构设计,既可按法律文书整体调用,亦可细至章节条款级检索,兼顾宏观浏览与微观取证。数据标注了丰富的元属性,如公布日期、效力状态、官方标识符来源等,同时嵌入源URL及存档回退链接,保障了引用可溯源性。此外,数据量级适宜,便于开展大规模法律文本分析实验。
使用方法
使用者可直接加载HuggingFace上的parquet格式文件,通过配置名指定所需层级。适用于法律条文语义检索、老挝语自然语言处理模型训练、跨法域比较研究等场景。需注意,该快照仅供研究参考,官方公报文本始终作为权威依据。建议结合爬虫脚本理解采集逻辑,并依据研究目标选用laws或articles配置,以实现从法律实体到条文细粒度的多维分析。
背景与挑战
背景概述
ipfs_laos_laws数据集诞生于2026年9月7日,由致力于法律文本数字化与开放获取的研究团队构建,旨在系统收集老挝官方公报中颁布的法律法规。该数据集囊括1310部法律文件及18057个条款,以老挝语呈现,覆盖老挝全域,为法律信息学、自然语言处理及比较法学研究提供了稀缺的老挝语法律语料。其创建源于对老挝法律体系系统性电子化整理的迫切需求,通过定制化爬虫程序(如collect_la.py)及网络存档回退机制,确保数据来源的权威性与可追溯性。作为非官方整合版本,该数据集在明晰的法律免责声明下发布,对促进东南亚法律数据的开放获取与多语言法律信息检索研究具有里程碑意义,为跨法域文本挖掘与法律知识图谱构建奠定了坚实基础。
当前挑战
该领域面临的核心挑战在于法律文本的获取与整合:老挝官方法律条目分散于公报及政府门户,缺失统一可机读的数据接口,且文本多需OCR与格式清洗,系统性收集障碍重重。构建过程中,团队需应对官方数据覆盖不全、网页结构频变等难题,故设计采用实时抓取与Wayback/CDX多级回退策略以提升数据完整性,并通过文本长度阈值筛选确保语料质量。此外,语言特殊性亦构成挑战:老挝语资源本已稀缺,分词、编码及领域术语标准化处理均需审慎考量。法律条文的权威性验证与免责设计,以及长期版本更新与历史档案归档机制的构建,亦是维持数据集可信度与可持续性的关键瓶颈。
常用场景
经典使用场景
老挝法律文本数据集收集了来自老挝官方公报的1310部法律文书及18057个条款,以老挝语呈现,为法律文本检索、法律信息抽取及低资源语言法律NLP研究提供了珍贵语料。其经典使用场景涵盖法律条款语义匹配、法律文档分类、法律问答系统构建以及跨语言法律信息检索等任务,旨在利用自然语言处理技术对非结构化法律文本进行深度解析与自动化处理。
实际应用
在实际应用中,该数据集可支撑老挝法律咨询自动化工具的研发,辅助律师及公众快速检索相关法条,提高法律服务的可及性。同时,它可服务于法律合规审查系统,帮助企业及时跟踪老挝法规变动,降低跨境经营风险。此外,基于该数据集的文本挖掘技术也能应用于政府立法辅助、司法案例研判以及法律翻译记忆库建设等场景。
衍生相关工作
该数据集的出现催生了针对老挝语法律文本的预训练语言模型微调研究、法律条款相似度计算基准构建以及法律信息抽取系统等衍生工作。研究者可基于其条款级结构,开发法律知识图谱自动构建方法或法律推理数据集,亦可将其纳入多语种法律语料池,用于提升跨语言模型的迁移学习效果,从而促进法律人工智能在东盟区域的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务