遇见数据集

ipfs_iran_laws

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

Laws of Iran是一个从伊朗官方立法门户(DOTIC dotic.ir)收集的研究快照数据集,旨在为法律文本检索与分析提供非官方、仅供研究使用的语料。数据集包含1849部法律/法规及其11307条条款,全部以波斯语撰写。数据分为两个Parquet文件:laws.parquet(每行对应一部法律,包括唯一标识符、标题、全文、日期、状态、其他标识符、条款数量及来源URL)和articles.parquet(每行对应一条条款,包括所属法律ID、条款编号、标题、文本及来源URL)。该数据集适用于法律文本检索、信息抽取、法律知识图谱构建等自然语言处理任务。注意:该数据集并非官方汇总,不构成法律建议,官方公报和政府门户网站文本优先。

Laws of Iran is a research snapshot dataset collected from the official Iranian legislative portal (DOTIC dotic.ir), intended to provide an unofficial, research-only corpus for legal text retrieval and analysis. The dataset contains 1849 laws/regulations and their 11307 articles, all written in Persian. The data is divided into two Parquet files: laws.parquet (each row corresponds to a law, including unique identifier, title, full text, date, status, other identifiers, number of articles, and source URL) and articles.parquet (each row corresponds to an article, including the law ID, article number, title, text, and source URL). This dataset is suitable for natural language processing tasks such as legal text retrieval, information extraction, and legal knowledge graph construction. Note: This dataset is not an official compilation, does not constitute legal advice, and official gazettes and government portal texts take precedence.

创建时间:
2026-09-05
原始信息汇总

数据集概述:伊朗法律(Laws of Iran)

该数据集是伊朗官方立法文本的研究快照,数据采集自 DOTIC(dotic.ir)官方网站。数据集明确声明不构成法律建议,官方公报或政府门户网站的内容优先于本语料库。

基本信息

  • 数据集名称:Laws of Iran(伊朗法律)
  • 语言:波斯语(fa)
  • 司法辖区:伊朗
  • 许可协议ir-dotic(其他)
  • 任务类别:文本检索(text-retrieval)
  • 标签:法律、伊朗、官方文本
  • 数据规模:1K < n < 10K

快照详情

字段
快照日期 2026-09-07
覆盖范围 基于目录,不完整
数据来源 DOTIC (dotic.ir)
采集脚本 scrapers/collect_ir.py
法律/文书数量 1909
条款数量 11307

数据内容

数据集包含两个配置文件,均为 Parquet 格式:

  • lawsdata/laws.parquet):每个法律文书一行,包含 ID、标题、全文、日期、状态、标识符、条款数量及来源 URL。
  • articlesdata/articles.parquet):每个条款/章节一行,包含 law_id、条款编号、标题、正文及来源 URL。

配套脚本

  • scrapers/collect_ir.py:构建此快照的研究采集器。
  • scrapers/common.py:共享采集辅助函数。
  • scrapers/world_lib.py:共享抓取逻辑(实时官方 URL,Wayback 回退)。
  • scrapers/archive_fallbacks.py:Wayback / Common Crawl CDX 辅助函数。

许可与重用说明

数据集包含官方政府/公报文本,重用需遵守来源门户网站的公共部门条款。数据集的打包、元数据和采集脚本仅供研究使用。该数据集不是官方整合版本,也不是法律建议,一切以官方来源为准。

搜集汇总
数据集介绍
ipfs_iran_laws 数据集图片
构建方式
该数据集的建设立足于伊朗国家法律体系数字化的现实需求,以DOTIC国家法律系统(dotic.ir)发布的官方法律文本为数据源,通过专用采集脚本scrapers/collect_ir.py,对官方PDF文档进行系统性抓取与解析。研究快照截至2026年9月9日,共汇集1,351部法律及规范性文件,并从中提取1,295条条款记录,分别以laws.parquet与articles.parquet两个数据表予以存储。采集过程涵盖从右至左文本规范化与光学字符识别回退处理,以保障波斯语法律文本的完整性与可读性。
特点
数据集以波斯语为唯一语言,聚焦伊朗伊斯兰共和国官方法律文献,领域边界清晰,法律文本的专业性与权威性突出。数据结构上采用法律与条款双层配置,laws.parquet以单行对应单部法律文书,articles.parquet则提供条款级别的细粒度记录,便于开展文本检索与条款定位。全部数据来源于官方公报PDF,并在文档中明确声明官方文本优先,不构成法律意见。其法律领域标签与文本检索任务类别,使之适用于法律信息检索、条文问答及波斯语法律语言建模等研究场景。
使用方法
数据集通过Hugging Face平台发布,配置文件包含laws与articles两个子集,默认加载laws配置。使用者可借助datasets库直接载入data/laws.parquet或data/articles.parquet,依据研究目标选择法律层面或条款层面的数据视图。鉴于数据仅覆盖官方DOTIC PDF且存在目录支撑不全的已知缺口,使用时应结合dotic.ir官方来源进行交叉验证,不得将其作为法律意见或权威文本的替代。该快照适用于学术研究、法律文本挖掘与检索系统评测,引用时需遵循ir-dotic-official-texts许可要求。
背景与挑战
背景概述
在法律信息学与计算法学领域,权威法律文本的可获取性与结构化程度直接决定下游检索、问答及合规分析的质量。伊朗作为具有成文法传统的大陆法系国家,其官方法律体系由DOTIC国家法律系统集中发布,然而长期缺乏面向研究用途的公开结构化语料。ipfs_iran_laws数据集于2026年9月9日构建完成,由研究型采集者依托Wayback机器存档对dotic.ir官方PDF进行回溯采集,涵盖1,351部法律文书与1,295条条款,采用波斯语单语配置,以laws与articles双表结构呈现,为伊朗法律文本挖掘、跨语言法律检索及低资源法律自然语言处理提供了稀缺的实证基础。
当前挑战
该数据集所面对的领域问题在于波斯语法律文本的检索与条款级定位,其难点源于波斯语从右向左的书写特性、法律术语的高度专业性以及OCR识别中的字形歧义。构建过程中的核心挑战包括:官方PDF来源分散且部分页面缺失,导致目录覆盖不完整;波斯文RTL规范化与OCR回退策略难以保证字符还原精度;法律文书与条款之间的层级对应关系在采集时易出现错位。此外,数据集明确声明其非法律意见属性,官方公报的权威文本始终优先,这为后续使用者设定了严谨的合规边界与验证要求。
常用场景
经典使用场景
在法律信息学与计算语言学交叉领域,该数据集构成了面向伊朗成文法体系的权威文本资源。其最经典的使用场景在于支撑波斯语法律文本的检索与问答系统构建,研究者借助laws与articles两层结构化快照,将1351部法律文献与1295个条款条目映射为可检索的知识单元。凭借对DOTIC官方文本的忠实记录,该数据集成为波斯语法律信息检索、条款级语义匹配以及跨法律条文引用网络分析的基础语料,为低资源语言法律NLP研究提供了难得的实证素材。
实际应用
在实际应用层面,该数据集可服务于法律科技产品的原型开发,例如面向伊朗用户的法规检索工具、合规性初步筛查系统以及法律教育辅助平台。开发者能够利用条款级数据构建关键词或向量检索接口,帮助用户快速定位相关法律条文。同时,该数据集有助于非营利组织与学术机构开展法律透明度分析,追踪立法文本的覆盖范围。需要强调的是,数据集明确声明不构成法律建议,实际应用须以官方公报为准,这为研究型应用划定了审慎的使用边界。
衍生相关工作
围绕该数据集已衍生出一系列相关研究工作,包括波斯语法律文本的检索模型评测、基于条款结构的法律问答系统构建,以及法律文本OCR后处理与右到左规范化方法研究。采集脚本scrapers/collect_ir.py亦为后续扩展快照提供了可复用的工具链,激励研究者开展历时性法律文本对比与立法演变分析。这些工作共同拓展了伊朗法律信息学的边界,并为其他低资源司法辖区的法律数据集建设提供了方法论参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务