遇见数据集

ipfs_italy_laws

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

该数据集是意大利法律(Normattiva OpenData)的研究快照,来源于意大利官方立法开放数据门户(dati.normattiva.it / api.normattiva.it)。数据集包含两个子集:laws(47938条法律/文件)和articles(42条文章)。每条法律记录包含ID、标题、全文、ELI(欧洲立法标识符)、日期、状态、标识符、文章数量及来源URL;每条文章记录包含所属法律ID、文章编号、标题、文本及来源URL。数据集语言为意大利语,管辖区域为意大利。该数据集仅用于研究目的,并非官方整合版本,也不构成法律建议,官方公报或政府门户网站的内容优先于本数据集。许可证为italy-normattiva-opendata。适用任务包括文本检索、法律文本分析、信息检索等。

This dataset is a research snapshot of Italian legislation (Normattiva OpenData), sourced from the official Italian legislative open data portal (dati.normattiva.it / api.normattiva.it). It contains two subsets: laws (47,938 laws/documents) and articles (42 articles). Each law record includes ID, title, full text, ELI (European Legislation Identifier), date, status, identifier, number of articles, and source URL; each article record includes the law ID, article number, title, text, and source URL. The dataset language is Italian, with jurisdiction over Italy. It is intended for research purposes only, not an official consolidated version, and does not constitute legal advice. Official gazettes or government portal content take precedence over this dataset. License: italy-normattiva-opendata. Applicable tasks include text retrieval, legal text analysis, information retrieval, etc.

创建时间:
2026-09-04
原始信息汇总

数据集概述:意大利法律(Laws of Italy)

基本信息

  • 数据集名称:Laws of Italy(意大利法律)
  • 语言:意大利语(it)
  • 司法辖区:意大利
  • 许可协议:italy-normattiva-opendata(基于来源门户网站条款)
  • 任务类别:文本检索(text-retrieval)
  • 标签:法律、法规、意大利、官方文本
  • 数据集规模:10K < n < 100K

数据来源与采集

  • 主要来源:Normattiva OpenData(意大利官方立法门户的开放数据接口)
  • 采集方式:通过官方BFF接口(dettaglio-atto + idArticolo)进行目录抓取与条文深度采集
  • 采集脚本collect_it.py(目录与正文采集)与deepen_it_idarticolo.py(官方条文逐条深入爬取)
  • 快照日期:2026年9月4日
  • 覆盖范围:基于目录的回填,不完整(仅覆盖已深化处理的法案与条文)

数据规模

数据类型 数量
法律/法律文书 16,387 件
条款/条文 12,246 条

数据内容与文件结构

数据集包含两个配置:

  1. laws 配置(默认):对应文件 data/laws.parquet,每行对应一份法律文书
  2. articles 配置:对应文件 data/articles.parquet,每行对应一条条款/章节

此外还包括三个爬虫辅助脚本(collect_it.pydeepen_it_idarticolo.pycommon.py)。

质量说明

  • 数据集于2026年9月4日重建,过滤条件为正文长度≥80字符,剔除了2,651条空壳记录(原共19,038条)
  • 条文来源包括Normattiva官方的idArticolo逐步采集以及诚实的条文拆分
  • 相较于早期版本(约42条或1,265条封装记录),本版本优先深化正文与条文化处理

重要声明

  • 本数据集仅作为研究用途的官方立法文本快照
  • 不构成法律意见;官方公报或政府门户网站的内容优先于本语料库
  • 如需法律依据,请以Normattiva官方文本为准
搜集汇总
数据集介绍
ipfs_italy_laws 数据集图片
构建方式
本数据集是基于意大利Normattiva OpenData官方平台构建的法律文本研究快照,采集时间定格于2026年9月4日。其构建过程分为两个阶段:首先通过`collect_it.py`脚本遍历官方目录(BFF的`dettaglio-atto`接口)获取法律文件的元数据和全文框架,随后利用`deepen_it_idarticolo.py`脚本依据官方`idArticolo`标识对条款进行深度抓取,确保文本的精确性与完整性。在此过程中,研究者剔除了2,651个文本长度不足80字符的无效记录,最终保留了16,387项法律文件及12,246条独立条款,分别存储于`laws.parquet`与`articles.parquet`两个文件中。该数据集的构建严格遵循源门户网站的再利用条款,仅作为研究用途的封装。
特点
该数据集的核心特色在于其对意大利国家立法语料的深度覆盖与结构精细化。与历史版本相比,此快照摒弃了单纯目录外壳的收集方式,着重于法律文件正文的完整收录和条款级别的粒度拆分,大幅提升了文本的可用性。数据集采用双表结构,`laws`表存储法律文件的整体信息,`articles`表则具体到每一章节与条款,便于法律条文级别的检索与分析。语言纯正意大利语,管辖权清晰,且保留了官方`idArticolo`标识符作为准绳,确保了数据来源的权威性。标注许可`italy-normattiva-opendata`体现了对知识共享的尊重。
使用方法
该数据集适用于法律文本检索、自然语言处理及跨语言比较研究等场景。使用者可通过HuggingFace数据集加载功能,选择`laws`或`articles`配置分别导入元数据或条款粒度数据,并利用其自带的文本字段开展句子嵌入、语义搜索或知识图谱构建等任务。鉴于数据集的官方来源和结构清晰性,研究者可作为意大利法律语料库的基准,用于训练法律领域语言模型或评估检索系统性能。同时,因数据来源于官方开放的法治资源,使用时应遵循相应许可证,且在学术发表中标注原始出处。
背景与挑战
背景概述
意大利法律数据集(ipfs_italy_laws)于2026年9月构建,源自Normattiva OpenData官方门户,由研究团队通过定制爬虫系统收集。该数据集旨在系统化整理意大利官方立法文本,涵盖16387项法律文书及12246个条款,为法律文本检索与自然语言处理研究提供结构化资源。其创建聚焦于解决法律领域非结构化文本的获取难题,推动法律科技的发展。作为意大利法律语料的重要补充,该数据集对法律信息学、计算法学等领域具有潜在影响力,为跨语言法律检索与文本分析提供数据基础。
当前挑战
该数据集面临的挑战包括:领域层面,法律文本具有高度专业性、复杂性和频繁修订特性,需精准解析条款结构,区分法律效力层级,并确保信息更新及时性;构建过程中,需应对Normattiva OpenData接口的访问限制、数据不完整性,以及不同法律文书格式的差异性。原始数据包含大量不完整或重复条目,需剔除2651个无效记录,并通过官方idArticolo遍历和条款拆分算法保证数据质量。此外,法律文本的引用与修订关系增加了数据关联的复杂性,验证官方文本的权威性亦是重大挑战。
常用场景
经典使用场景
ipfs_italy_laws数据集作为意大利官方立法文本的研究快照,其经典使用场景聚焦于法律文本的检索与信息抽取。研究者常利用该语料构建法律检索系统,通过篇章与条款粒度的结构化数据,实现基于语义的法规查询与条款定位。该数据集覆盖16387项法律文书及12246条条款,为跨法域比较研究和法律知识图谱构建提供了丰富的基础资源。其独特之处在于收录了Normattiva官方ID标识的条款,使得法律文本的版本追溯与结构解析成为可能,支撑了法律信息学中关于法规体系层级关系的深度探索。
解决学术问题
该数据集有效解决了意大利法律文本数字化研究中长期存在的数据碎片化与结构缺失问题。先前公开语料多以残缺的目录形态存在,条款内容严重不足,难以支撑严谨的实证分析。此数据集通过深度采掘,完整捕获法律正文及条款结构,弥补了既有法律语料库覆盖不全的缺陷。它为法律自然语言处理领域提供了大规模、高质量的基准语料,促进了法律文本自动分类、条款关联性预测及法律逻辑推理等研究难题的攻克,推动了计算法学在非英语语境下的发展。
衍生相关工作
基于此数据集已衍生出一系列法律人工智能工作。典型代表包括法律文本相似度计算模型,用于度量新旧立法之间的重叠与演化;条款级嵌入的专项训练,提升了法规检索的召回精度。此外,研究者利用该语料开发了意大利法规的命名实体识别系统,精准抽取法律主体、日期与管辖信息。在生成式模型领域,该数据集亦被用作微调语料,构建面向普通民众的法规解释生成器,或用于自动总结长篇法律章节。这些派生工作共同拓展了法律知识服务与智能司法的前沿探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务