遇见数据集

ipfs_bulgaria_laws

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

Laws of Bulgaria 是一个从保加利亚官方立法网站 dv.parliament.bg(含归档回退)收集的研究快照数据集。数据集包含两个子集:laws 和 articles。laws 子集包含 297 条法律文书,每条记录包括 ID、标题、全文、ELI(欧洲立法标识符)、日期、状态、标识符、条款数量及来源 URL。articles 子集包含 3576 个条款,每个条款记录包括所属法律 ID、条款编号、标题、文本及来源 URL。数据集语言为保加利亚语,辖区为保加利亚。该数据集适用于法律文本检索、立法分析、文本挖掘等研究任务。许可证为 bulgaria-dv-parliament,允许按公共部门条款重用,但数据集不构成官方合并版本,也不提供法律建议,官方来源优先。

Laws of Bulgaria is a research snapshot dataset collected from the official Bulgarian legislative website dv.parliament.bg (with Wayback Machine fallback). It contains two subsets: laws and articles. The laws subset includes 297 legal documents, each with ID, title, full text, ELI (European Legislation Identifier), date, status, identifier, number of articles, and source URL. The articles subset includes 3,576 articles, each with parent law ID, article number, title, text, and source URL. The dataset language is Bulgarian, and the jurisdiction is Bulgaria. It is suitable for legal text retrieval, legislative analysis, text mining, and other research tasks. The license is bulgaria-dv-parliament, allowing reuse under public sector terms, but the dataset is not an official consolidated version and does not provide legal advice; official sources take precedence.

创建时间:
2026-09-04
原始信息汇总

数据集概述:保加利亚法律(国家公报)

基本信息

  • 数据集名称:Laws of Bulgaria (State Gazette)
  • 语言:保加利亚语(bg)
  • 司法辖区:保加利亚
  • 许可证bulgaria-dv-official(其他)
  • 任务类别:文本检索(text-retrieval)
  • 标签:法律、保加利亚、国家公报、官方文本等
  • 规模:1K<n<10K

数据来源与覆盖范围

  • 来源:保加利亚国家公报(Държавен вестник / State Gazette,网址 dv.parliament.bg)
  • 快照日期:2026-09-04
  • 覆盖方式:基于档案扩展(Wayback CDX)
  • 采集工具scrapers/collect_bg.py

数据规模

  • 法律/文件数量:1669
  • 条款数量:15604

数据内容与结构

数据集包含两种配置:

  • lawsdata/laws.parquet):每行对应一份法律文件,涵盖ID、标题、全文、ELI(欧洲法律标识符)、日期、状态、标识符、条款数量及来源URL等字段。
  • articlesdata/articles.parquet):每行对应一个条款/章节,涵盖法律ID、条款编号、标题、正文及来源URL等字段。

此外,数据集中还包含采集器脚本(scrapers/collect_bg.pyscrapers/common.py),供研究用途。

重要声明

  • 该数据集不是官方整合版本,不构成法律建议
  • 官方公报/政府门户网站的内容优先于该数据集。
  • 数据集的打包、元数据和采集脚本仅用于研究目的。
  • 官方来源的文本可根据来源门户的公营部门条款进行重用。

采集备注

  • 由于现场网站(dv.parliament.bg)存在SSL错误、验证码或503错误,采集时予以跳过。
  • 通过Wayback CDX扩展采集,仅回放官方 showMaterialDV.jsp?idMat=* 页面。
  • 在Hub基线(320条)基础上,通过CDX扩展至更完整的语料库。
搜集汇总
数据集介绍
ipfs_bulgaria_laws 数据集图片
构建方式
该数据集是保加利亚官方立法文本的研究快照,数据源自保加利亚国家公报(Държавен вестник)官方网站,并通过Wayback CDX档案扩展技术收集而成。构建过程涉及定制化的爬虫脚本,首先从官方站点获取基础数据,随后利用Wayback CDX索引对缺失或受限内容进行补充,最终整合为结构化语料库。数据集包含两个子集:laws子集按法律文件条目组织,记录每部法律的标题、全文、ELI标识、日期、状态及来源URL;articles子集则细分为法律条款,关联其所属法律文书,便于细粒度检索。该构建方式保障了数据覆盖面,同时克服了原站访问限制,为法律文本分析提供了系统化素材。
特点
该数据集具有显著的专业性与规范性,聚焦于保加利亚法律领域,涵盖1669部法律文书及15604个条款,规模适中,适用于文本检索研究。内容完全以保加利亚语呈现,并明确标注了管辖区域,数据来源可追溯至官方公报,具备高度权威性。数据集设计上强调结构清晰:每个法律文件及其条款独立成行,便于基于语言模型的检索与推理任务。此外,数据集的元数据丰富(含ELI、日期、状态等),支持多维度的文本分析与法律信息提取,同时遵循非官方整合原则,在许可与使用限制上提供了透明说明,确保研究用途的合规性。
使用方法
该数据集适用于法律文本的多项自然语言处理任务,特别在文本检索领域。用户可加载laws.parquet文件,对法律全文进行语义检索或关键词匹配,而articles.parquet则支持更细粒度的条款级搜索,便于定位特定法律条文。数据集结构设计支持将法律与其条款进行关联分析,可用于构建法律知识图谱或预训练语言模型的领域适配。使用时需注意数据仅为研究快照,不构成法律建议,应结合官方来源进行引用与验证。研究者可借助HuggingFace datasets库便捷加载,并配合爬虫脚本理解数据采集流程,以评估数据质量或扩展研究范围。
背景与挑战
背景概述
保加利亚法律数据集(ipfs_bulgaria_laws)是由研究机构于2026年9月创建的一项学术资源,旨在系统化收集并整理保加利亚官方公报《国家公报》(Държавен вестник)所发布的立法文本。该数据集源自保加利亚议会官方网站,通过Wayback CDX扩展技术获取了更全面的档案内容,包含1669部法律文书及15604个条款,覆盖了保加利亚的官方立法领域。其核心研究问题在于为法律信息检索、自然语言处理及法律文本分析提供结构化的语料库,尤其针对保加利亚语法律文本的独特性和复杂性。作为一项面向研究用途的开放资源,该数据集在法学、计算语言学及公共政策研究领域具有重要影响力,为跨语言法律信息获取和法规比较研究提供了坚实的数据基础。
当前挑战
该数据集在构建与应用中面临多重挑战。在领域问题层面,法律文本的检索与解析因其高度专业化的术语、冗长句式及交叉引用而尤为困难,而保加利亚语作为非主流语言,其法律语言的形态丰富性进一步加剧了文本标准化与语义理解的复杂性,对信息抽取和知识表示提出了严苛要求。在构建过程中,研究者遭遇了原始网站的安全限制(如SSLEOF、验证码及HTTP 503错误),迫使采集流程转向Wayback CDX扩展与受限的ID回放机制,这可能导致语料覆盖不全或时间断层。此外,法律文本的动态更新时间性要求数据集持续维护,而当前快照仅代表特定时点的状态,其时效性有待验证。数据的授权与使用边界也需谨慎考量,尽管明确非官方整合文本,但使用者仍需区分数据集的参考价值与官方文本的权威性,避免法律依据上的误用风险。
常用场景
经典使用场景
在自然语言处理与法律信息学交叉领域,对保加利亚语法律文本的深度解析是构建智能法律检索与语义理解系统的基石。本数据集囊括了来自国家公报的1669部法律文件与15604条条文,为研究者提供了大规模、结构化的保加利亚法律语料。其经典应用场景聚焦于法律文本的机器学习模型预训练与微调,诸如法律条文级语义相似度计算、法律主题分类、以及基于ELI(欧洲立法标识符)的跨文档关联分析。数据集的细粒度组织方式——区分法律整体与独立条款——支持对法律逻辑结构的层次化建模,从而推进面向低资源语言的法律自然语言处理研究。
解决学术问题
本数据集根本性地缓解了保加利亚语法律领域高质量、开源语料稀缺的困境,为学术探究提供了标准化且规模可观的基准。它攻克了自官方政府门户直接采集时遭遇的访问壁垒(如SSL错误、验证码),借助Wayback Machine的CDX扩展技术实现了语料的全面回溯与扩充,为网络存档用于科研的方法学树立了典范。针对法律信息检索领域长期存在的精确查询难题,该语料库凭借其完整的ELI标识符与条文粒度划分,为法律条文级检索、法规版本追踪及立法脉络演进分析等议题提供了关键数据支撑,从而推动了多语种法律信息学与低资源环境下的可复现研究。
衍生相关工作
基于该数据集的架构与收集方法,研究社区已衍生出一系列前沿工作。一方面,其条文级组织结构催生了面向法律语境的图神经网络(GNN)与知识图谱构建研究,用以表征法律条款间的复杂引用与修正关系。另一方面,Wayback CDX档案扩充策略启发了针对其他法律司法辖区或政府门户的存档式数据收集框架,促进了多国法律语料库的联合研究。值得注意的是,该数据集在ELI框架下的运用促进了跨欧洲法律数据集对齐与统一基准的构建,服务于法律AI的可解释性研究与大型语言模型在法律专用领域的领域适配实验。这些后续探索持续巩固法律信息学在理论方法与实证资源上的双重发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务