遇见数据集

ipfs_slovenia_laws

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

该数据集是斯洛文尼亚共和国官方公报(Uradni list Republike Slovenije,网址 uradni-list.si)上发布的官方立法的研究快照。数据集包含两个配置:laws(法律/文书)和 articles(条款/节)。laws 配置包含每个法律/文书一行,字段包括 ID、标题、全文、ELI(欧洲法律标识符)、日期、状态、标识符、条款数量和来源 URL。articles 配置包含每个条款/节一行,字段包括法律 ID、条款编号、标题、文本和来源 URL。数据规模:17406 条法律/文书,4526 条条款。语言为斯洛文尼亚语,司法管辖区为斯洛文尼亚。许可证为 slovenia-ul-official(官方政府/公报文本,可按照来源门户的公共部门条款重用)。该数据集仅供研究使用,并非官方整合,不构成法律建议,官方来源优先。适用任务包括法律文本检索、信息抽取、法律分析等。

This dataset is a research snapshot of official legislation published in the Official Gazette of the Republic of Slovenia (Uradni list Republike Slovenije, website uradni-list.si). The dataset contains two configurations: laws (legal acts/documents) and articles (clauses/sections). The laws configuration contains one row per legal act/document, with fields including ID, title, full text, ELI (European Legislation Identifier), date, status, identifier, number of articles, and source URL. The articles configuration contains one row per clause/section, with fields including law ID, article number, title, text, and source URL. Data size: 17,406 laws/documents, 4,526 articles. The language is Slovenian, and the jurisdiction is Slovenia. The license is slovenia-ul-official (official government/gazette text, reusable under the public sector provisions of the source portal). This dataset is intended for research use only, is not an official compilation, does not constitute legal advice, and official sources take precedence. Applicable tasks include legal text retrieval, information extraction, legal analysis, etc.

创建时间:
2026-09-04
原始信息汇总

斯洛文尼亚法律数据集(Uradni list RS)

数据集概览

该数据集为斯洛文尼亚官方立法研究快照,内容采集自斯洛文尼亚共和国官方公报(Uradni list Republike Slovenije, uradni-list.si)。数据集明确声明不构成法律建议,官方公报或政府门户网站内容优先于本语料库。

基本信息

项目 详情
快照日期 2026-09-03
覆盖范围 基于目录的完整发现UL期号-TOC采集
数据来源 Uradni list Republike Slovenije (uradni-list.si)
采集工具 scrapers/collect_si.py
法律/文书数量 17,406
条款数量 4,526
语言 斯洛文尼亚语(sl)
司法辖区 斯洛文尼亚
许可证 slovenia-ul-official(其他)

数据内容

数据集包含两个配置,均为Parquet格式文件:

  • laws(法律)data/laws.parquet —— 每行对应一份法律文书,包含ID、标题、全文、ELI标识、日期、状态、标识符、条款数量及来源URL。
  • articles(条款)data/articles.parquet —— 每行对应一个条款/章节,包含法律ID(law_id)、条款编号、标题、正文及来源URL。

另附采集脚本 scrapers/collect_si.py(用于构建快照的研究采集器)及共享辅助脚本 scrapers/common.py

许可与重用说明

  • 官方政府/公报文本,可按来源门户网站的公共部门条款重用。
  • 本数据集的打包、元数据及采集脚本仅供研究使用。
  • 数据集不是官方整合版本,不构成法律建议,以官方来源为准。

备注

数据基于官方Uradni list RS的HTML内容,已完整获取发现的目录集。

搜集汇总
数据集介绍
ipfs_slovenia_laws 数据集图片
构建方式
斯洛文尼亚法律数据集依托该国官方公报《Uradni list Republike Slovenije》的HTML页面进行系统性采集,由专用脚本scrapers/collect_si.py实施全量抓取。采集工作以公报各期目录为起点,逐层访问法案正文页面,将每份法律文件及其条款分别抽取为独立记录,最终形成laws.parquet与articles.parquet两个文件。快照日期为2026年9月7日,覆盖公报全部期次,规避了PISRS开发者API的令牌限制,共获取法律文件236,538件、条款43,533条,以研究快照形式完整留存了斯洛文尼亚制定法文本的原始风貌。
使用方法
使用者可通过HuggingFace数据集库加载默认配置laws,或指定articles配置以获取条款级数据。典型用法包括:利用text-retrieval任务进行法律条文检索,基于条款文本开展法律语言建模,或以官方公报时间戳分析立法演进。加载时需注意数据仅作研究用途,不构成法律意见,官方公报及PISRS系统为最终权威来源。使用时应遵守si-uradni-list-terms许可条款,并引用数据集快照日期以确保可复现性。鉴于PISRS合并文本缺失,涉及法律修订整合的研究需另行获取授权数据。
背景与挑战
背景概述
斯洛文尼亚作为欧洲大陆法系国家,其法律体系以《官方公报》(Uradni list Republike Slovenije)为权威发布渠道,法律文本的数字化与可计算化是法律信息学与计算语言学交叉领域的重要议题。该数据集由研究团队于2026年9月构建,旨在提供斯洛文尼亚国家立法的全量研究快照,涵盖236,538部法律文件及43,533条条款,语种为斯洛文尼亚语。其核心研究问题在于如何从官方公报HTML中系统抽取并结构化法律文本,以支持法律检索、文本挖掘及跨语言法律研究。该数据集填补了斯洛文尼亚法律语料库的空白,为法律人工智能及比较法研究提供了大规模、高保真的基础资源,对推动小语种法律自然语言处理具有显著影响力。
当前挑战
该数据集所应对的领域问题在于法律文本检索与结构化解析的复杂性,即从非结构化的官方公报HTML中精准提取法律文件及条款,并保持与权威来源的一致性。构建过程中面临多重挑战:官方公报的目录与正文页面结构异构,需设计鲁棒的爬取与解析流程;PISRS开发者API受令牌限制,无法用于法律整合文本的获取,导致部分数据只能依赖公报HTML;法律文本存在版本更迭与合并需求,但API的访问壁垒限制了整合版本的生成。此外,数据集明确声明不构成法律建议,官方来源优先,这要求使用者在应用时需审慎处理法律效力与时效性问题。
常用场景
经典使用场景
在法律信息学与计算语言学交叉领域,斯洛文尼亚官方法律汇编数据集最经典的使用场景在于构建面向国家法律体系的检索与问答系统。该数据集完整收录了斯洛文尼亚共和国官方公报所发布的法律条文,研究者可借助其进行法律文本的语义索引、条款级检索以及跨法律文件的引用关系挖掘。具体而言,法律从业人员或学术研究者能够以自然语言查询方式定位具体法条,并追溯其在不同法律文本中的修订与关联,从而为法律检索、合规审查及判例分析提供基础数据支撑。
解决学术问题
该数据集有效缓解了法律自然语言处理研究中长期存在的语料稀缺与标准化不足问题。在斯洛文尼亚语等低资源语言的法律文本挖掘任务中,此前缺乏大规模、结构化且来源权威的官方立法语料,致使法律文本分类、命名实体识别与条款相似度计算等研究难以展开。该数据集以条款级粒度的结构化快照形式,为法律文本的跨语言迁移学习、长文档理解以及法律知识图谱构建提供了可复现的实验基准,推动了法律人工智能在非英语语境下的方法论发展。
实际应用
在实际应用层面,该数据集可服务于法律科技产品的研发与公共法律服务的优化。法律信息平台可基于其构建智能法律检索工具,辅助律师与公民快速定位现行有效法条;合规系统可将其作为规则库,用于自动化合规检查与风险提示;政府机构亦可利用其进行立法文本的数字化归档与版本追踪。此外,该数据集对法律文本摘要、机器翻译及问答系统的训练与评测具有直接支撑作用,有助于提升法律信息获取的效率和可及性。
数据集最近研究
最新研究方向
在斯洛文尼亚法律信息学领域,该数据集的最新研究方向聚焦于基于官方公报全量快照的法律文本检索与计算法学分析。研究者利用其23万余条法律文书与4万余条条款的细粒度结构,探索面向斯洛文尼亚语的法律问答、法条引用解析以及跨法条语义相似度计算,并推动法律文本的自动摘要与主题建模。伴随欧盟数据治理法案与开放数据指令的深化实施,该资源为法律可及性、司法预测与合规性审查提供了可复现的基准,弥补了此前Hub子集覆盖不足的缺陷,对低资源法律语言处理及官方文本权威性验证具有显著的学术与公共政策意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务