遇见数据集

ipfs_azerbaijan_laws

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

该数据集是阿塞拜疆官方立法文本的研究快照,从 e-qanun.az 门户网站收集而来,旨在为法律文本检索、信息提取等自然语言处理任务提供研究用途的数据支持。数据集包含两个子集:laws 和 articles。laws 子集包含 2667 条法律/文书,每条记录包含唯一标识符、标题、全文、日期、状态、其他标识符、条款计数和来源 URL 等字段。articles 子集包含 2460 条条款/章节,每条记录包含对应法律标识符、条款编号、标题、文本和来源 URL。数据语言为阿塞拜疆语,管辖区域为阿塞拜疆。请注意,该数据集并非官方整合版本,不构成法律建议,官方公报或政府门户网站为权威来源。数据集许可证为 az-eqanun,适用于非商业研究用途。

This dataset is a research snapshot of official legislative texts of Azerbaijan, collected from the e-qanun.az portal, aimed at providing data support for research purposes in natural language processing tasks such as legal text retrieval and information extraction. It contains two subsets: laws and articles. The laws subset includes 2,667 laws/documents, each with fields such as unique identifier, title, full text, date, status, other identifiers, article count, and source URL. The articles subset includes 2,460 articles/sections, each with fields such as corresponding law identifier, article number, title, text, and source URL. The data language is Azerbaijani, and the jurisdiction is Azerbaijan. Please note that this dataset is not an official consolidated version, does not constitute legal advice, and the official gazette or government portal is the authoritative source. The dataset is licensed under az-eqanun, suitable for non-commercial research purposes.

创建时间:
2026-09-05
原始信息汇总

数据集概述

阿塞拜疆法律数据集是一个用于文本检索任务的法律文本数据集,语言为阿塞拜疆语(az),涵盖阿塞拜疆司法管辖区的官方立法文本。

基本信息

项目 详情
数据集名称 Laws of Azerbaijan
快照日期 2026-09-07
数据规模 1K-10K 条记录
语言 阿塞拜疆语(az)
许可证 other(自定义许可证:az-eqanun)
任务类别 文本检索(text-retrieval)
标签 法律、阿塞拜疆、官方文本

数据规模与覆盖范围

  • 法律/文书数量: 3027 件
  • 条款数量: 2801 条
  • 覆盖范围: 基于目录支持,属于不完整覆盖
  • 来源: e-qanun.az 网站的 downloadDetailPdf 功能

数据内容

数据集包含两个配置(config):

  1. laws 配置(默认配置,文件:data/laws.parquet

    • 每行对应一件法律文书
    • 包含字段:ID、标题、全文、日期、状态、标识符、条款数量、来源URL
  2. articles 配置(文件:data/articles.parquet

    • 每行对应一个条款或章节
    • 包含字段:法律ID(law_id)、条款编号、标题、文本、来源URL

使用说明与限制

  • 非官方整合版本: 该数据集并非官方整合文本,官方公报/政府门户网站优先于本语料库
  • 不构成法律建议: 数据集的打包、元数据和采集脚本仅供研究使用
  • 采集辅助文件: 包含采集脚本(如 scrapers/collect_az.pyscrapers/common.pyscrapers/world_lib.pyscrapers/archive_fallbacks.py)用于构建快照及获取存档回退(Wayback / Common Crawl CDX)

许可与转载

官方政府/公报文本的使用需遵循来源门户网站的公共部门条款;该数据集的打包、元数据和采集脚本仅供研究使用。

搜集汇总
数据集介绍
ipfs_azerbaijan_laws 数据集图片
构建方式
该数据集的构建以阿塞拜疆官方立法门户e-qanun.az为数据源,通过定制化的爬虫脚本collect_az.py系统性地采集法律文献,并辅以Wayback Machine及Common Crawl的回退机制确保数据的可获取性与完整性。采集过程覆盖了法律文书的多个维度,最终形成两个结构化数据文件:laws.parquet收录每部法律文书的元数据与全文,articles.parquet则细粒度地拆解至条款层级,从而实现双层粒度的法律文本组织。
特点
该数据集的核心特色在于其官方性与研究导向的双重属性。数据源自政府权威门户,保障了文本的原始性与准确性,而快照日期明确了数据的时间边界。其规模约含3327项法律文书及3353个条款,覆盖阿塞拜疆语法律体系,为跨语言法律信息检索提供了稀缺资源。此外,数据集的字段设计兼顾了法律研究的常用维度,如文书状态、日期、标识符等,极大便利了法规演变追踪与法律知识图谱构建。
使用方法
使用该数据集时,研究者可通过HuggingFace数据集加载工具便捷获取,支持文本检索、语义分析及法律条文比对等下游任务。配置文件分别提供laws与articles两种粒度,用户可根据研究需求灵活选择。需注意数据集并非官方合订版本,使用时须参照原始官方文本进行交叉验证。其许可协议az-eqanun规定了合理使用范围,建议在学术研究中遵循相关法律与伦理准则,并注明数据来源。
背景与挑战
背景概述
该数据集名为ipfs_azerbaijan_laws,是一个关于阿塞拜疆共和国法律的文本检索语料库,由研究团队于2026年9月7日通过系统爬取官方立法门户e-qanun.az构建而成。其核心研究问题在于为法律文本挖掘、信息检索及自然语言处理领域提供结构化的阿塞拜疆语法律文档资源,共收录3327部法律文书及3353个条款,覆盖广泛的立法领域。该数据集的出现填补了阿塞拜疆语法律NLP资源匮乏的空白,为跨语言法律研究、法规比较分析及法律智能助手开发提供了重要数据基础,对促进低资源语言法律信息化研究具有积极影响。
当前挑战
该数据集面临的挑战多维且深刻。在领域问题层面,法律文本检索任务需应对法律语言的复杂性、术语的规范性及法规间的交叉引用,同时阿塞拜疆语作为低资源语言,相关语料稀缺,模型训练与评估受限。在数据集构建过程中,爬虫需处理目标网站的结构变化、反爬机制及动态内容加载,确保数据的完整性与时效性;此外,法律条款的嵌套结构、修订历史的标注以及不同文档间的一致性核对均构成构建难点。由于数据集为快照版本,覆盖范围受限于页面可访问性,存在不完整风险,且法律文本的官方权威性要求数据高度准确,任何疏忽都可能导致知识误导,这要求持续的质量监控与更新机制,以维护语料的可靠性和实用性。
常用场景
经典使用场景
在自然语言处理与法律信息学交叉领域中,ipfs_azerbaijan_laws数据集作为阿塞拜疆官方立法的结构化快照,为法律文本的检索、分类与语义分析提供了珍贵的语料资源。其细致的双层级架构——包括法律文书层面的整体元数据与条文层面的细粒度文本,使得研究者能够开展从法规全文的摘要生成到特定条款的关联挖掘等多维度探索。该数据集尤其适用于构建面向低资源语言的法律问答系统、训练法律领域的词嵌入模型,以及验证跨语言法律信息检索算法的鲁棒性,是推动阿塞拜疆语法律自然语言处理技术发展的基石性资源。
实际应用
在实际应用中,该数据集可辅助法律科技企业开发智能法规检索平台,使法律从业者与公众能通过语义而非仅关键词精准查询相关条文,大幅提升法律信息获取效率。对于政府机构与合规部门,它支持构建自动化的法律变更监控系统,以便及时追踪法规修订动态,确保政策与商业操作的合法合规。此外,数据集所涵盖的官方文本与结构化背景,亦可用于训练法律翻译模型或生成法律摘要工具,降低跨语言法律服务的门槛,促进国际商务与学术交流中的法务理解与决策支持。
衍生相关工作
围绕此数据集的衍生工作已初现端倪,引发了构建阿塞拜疆法律专用语言模型、开发法规版本对比工具及生成法律条文语义索引等探索方向。研究者可能基于其条文序号与法律标识的联系,开发自动化法律知识图谱,将零散的法条关联成体系化的法律法规网络。还有工作致力于扩展采集器的功能,以涵盖更多历史档案或邻近管辖区的法律文本,从而构建跨地域的法律体系比较语料库,为区域法律趋同性和差异性的量化研究开辟新途径,也推动了法律数据采集规范与引用格式上的标准化尝试。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务