遇见数据集

ipfs_dominicanrepublic_laws

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

该数据集为多米尼加共和国法律研究快照,从 Consultoria Juridica 官方网站(consultoria.gov.do)收集整理。数据集包含两个子集:laws 和 articles。laws 子集每条记录对应一部法律文书,包含标识符、标题、全文、日期、状态、条款数量及来源 URL 等字段;articles 子集每条记录对应一个条款或章节,包含所属法律标识符、条款编号、标题、正文及来源 URL。数据规模为 1434 部法律和 226886 个条款,语言为西班牙语。数据集仅供研究使用,非官方整合版本,不构成法律建议,官方公报或政府门户网站优先。

This dataset is a snapshot of Dominican Republic legal research, collected from the official website of Consultoria Juridica (consultoria.gov.do). It contains two subsets: laws and articles. The laws subset corresponds to each legal document, including fields such as identifier, title, full text, date, status, number of articles, and source URL. The articles subset corresponds to each article or section, including the legal document identifier, article number, title, body, and source URL. The dataset consists of 1,434 laws and 226,886 articles, in Spanish. It is intended for research purposes only, is not an official consolidated version, does not constitute legal advice, and priority should be given to official gazettes or government portals.

创建时间:
2026-09-05
原始信息汇总

数据集概述

该数据集是多米尼加共和国法律文本的研究快照,数据来源于多米尼加共和国法律咨询机构官方网站(Consultoria Juridica / consultoria.gov.do),由爬虫脚本自动采集整理而成。

基本信息

  • 语言:西班牙语(es)
  • 法律辖区:多米尼加共和国
  • 许可协议do-consultoria(其他)
  • 任务类型:文本检索
  • 标签:法律、官方文本、多米尼加共和国
  • 数据规模:1K < n < 10K

数据规模与覆盖

  • 法律/文书数量:1,554 部
  • 条款数量:227,225 条
  • 快照日期:2026年9月7日
  • 覆盖范围:基于目录索引,覆盖不完整
  • 采集方式scrapers/collect_do.py 脚本

数据内容

数据集包含两个配置,均为Parquet格式文件:

配置名 文件路径 内容说明
laws data/laws.parquet 每行对应一部法律文书,包含ID、标题、全文、日期、状态、标识符、条款数量及来源URL
articles data/articles.parquet 每行对应一个条款/章节,包含所属法律ID、条款编号、标题、正文及来源URL

配套脚本

  • scrapers/collect_do.py:用于构建该快照的研究采集器
  • scrapers/common.py:共享采集辅助函数
  • scrapers/world_lib.py:共享抓取功能(实时官方URL,Wayback备用)
  • scrapers/archive_fallbacks.py:Wayback / Common Crawl CDX辅助函数

许可与使用说明

  • 官方政府/公报文本的再利用需遵循来源门户的公共部门条款。
  • 此打包版本、元数据和采集脚本仅供研究使用。
  • 该数据集并非官方整合版本,不构成法律建议,应以官方来源为准。
搜集汇总
数据集介绍
ipfs_dominicanrepublic_laws 数据集图片
构建方式
该数据集的构建依托于多米尼加共和国官方法律门户Consultoria Juridica,采用自动化采集脚本scrapers/collect_do.py对公开法律法规进行系统性抓取,并以Wayback Machine与Common Crawl作为补充性存档回退来源,从而保障文本获取的连续性与可复现性。所采集的原始数据经结构化处理后,分别形成以法律文书为单位的laws.parquet和以条文为单位的articles.parquet两个配置文件,前者记录每部法律的标识、标题、全文、日期、状态及来源链接,后者则细粒度地保存条文编号、标题与文本内容,最终构建出一个涵盖2234部法律文书与230420条条款的西班牙语法律研究快照。
特点
该数据集聚焦于多米尼加共和国官方法律文本,语种为西班牙语,具有明确的司法管辖属性与法律领域专指性。其规模处于千至万级区间,兼顾了法律文书层面的整体性与条文层面的细粒度,既支持以整部法律为对象的检索,也支持以具体条款为单位的定位。数据来源具有官方性与可追溯性,每条记录均附有来源链接,且采集过程包含存档回退机制,增强了数据获取的稳健性。需要指出的是,该数据集并非官方法律汇编,亦不构成法律意见,其覆盖范围受目录支撑程度限制,属于不完整快照,官方公报与政府门户的文本始终具有优先效力。
使用方法
研究者可通过HuggingFace数据集接口加载laws与articles两个配置,分别获取法律文书级与条文级数据,适用于文本检索、法律信息抽取及条文匹配等任务。在使用过程中,应结合来源链接对文本进行溯源核验,并明确该数据集仅作为研究快照而非官方法律汇编或法律意见。对于涉及法律效力判断的场景,须以多米尼加共和国官方公报或政府门户发布的文本为准。数据集采用do-consultoria许可,复用时应遵循来源门户的公共部门条款,并在研究中说明数据版本与快照日期,以确保结果的可复现性与时效性。
背景与挑战
背景概述
在法律信息学与计算语言学交叉领域,法律文本的可获取性与结构化程度直接制约着法律检索、判例分析与智能法律服务的进展。多米尼加共和国作为加勒比地区的重要法域,其官方法律文本长期散落于政府门户与公报之中,缺乏系统化的机器可读语料。2026年,研究人员依托Consultoria Juridica官方平台构建了ipfs_dominicanrepublic_laws数据集,以研究快照形式收录了2234部法律及230420条条款,覆盖西班牙语法律条文全文、日期、状态与来源标识。该数据集旨在为法律文本检索、跨语言法律信息处理以及低资源法域的立法计量研究提供基础资源,推动了西班牙语法律自然语言处理在加勒比地区的实证探索。
当前挑战
法律信息处理领域长期面临文本异构、术语密集与时效敏感等难题,多米尼加共和国法律数据集所应对的核心挑战在于构建一个覆盖全面且条款级粒度可溯源的西班牙语法律语料。采集过程中,源平台目录本身存在不完整性,官方公报的存档断裂与网页结构变动迫使研究者引入Wayback Machine与Common Crawl的存档回退策略以弥补实时抓取的缺失。法律文本的版本更迭、条款编号的非标准化以及部分文件仅以扫描件形式存在,进一步加剧了结构化解析的难度。与此同时,数据集的非官方整合属性要求使用者始终以政府公报为准,如何在保持研究可用性的同时明确法律效力的边界,构成了该数据集在发布与复用层面的持续性挑战。
常用场景
经典使用场景
在计算法学与法律信息学的交叉领域中,官方立法文本的结构化语料库构成了智能法律检索与文本挖掘研究的基石。该数据集囊括多米尼加共和国2234部法律文书及逾23万条条文,以法条为最小粒度进行结构化封装,天然适配法条级检索、跨法域相似条款匹配以及法律问答系统语料构建等经典任务。研究者可依托其双层Parquet架构,将法律文书全文与条文切片分别映射至文档检索与细粒度文本对齐两个层级,从而在西班牙语法律信息检索基准上开展系统性评测。
衍生相关工作
该数据集所采用的法条级结构化封装与Wayback降级抓取机制,为同类官方文本采集项目提供了可复用的工程范式,其采集脚本已具备向其他拉美法域迁移的潜力。围绕此类法律条文语料,学界相继涌现出法律检索增强生成、法条语义嵌入与跨法域法律文本对齐等研究方向,亦有工作将其用于西班牙语法律语言模型的持续预训练与领域适配。该数据集的公开亦推动了法律信息检索评测资源的多样化,为构建多法域、多语种的法律文本基准贡献了重要的一环。
数据集最近研究
最新研究方向
在法律人工智能与计算法学领域,针对多米尼加共和国法律体系的大规模官方立法文本语料库构建,正推动着低资源司法管辖区法律信息检索与文本挖掘的前沿探索。该数据集涵盖2234部法律文书及逾23万条条款,为西班牙语法律自然语言处理提供了稀缺的实证基础,其研究导向聚焦于法律条款的细粒度检索、跨法律文献的语义关联分析以及基于官方公报的立法动态追踪。伴随全球对法律透明度与可及性的日益重视,此类基于官方来源的立法快照不仅支撑着法律问答系统与判决预测模型的开发,亦为比较法研究与法律知识图谱构建提供了关键数据资源,对促进拉丁美洲地区法律科技基础设施建设具有深远的学术与现实意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务