遇见数据集

jurisprudencias_br

收藏
Hugging Face2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

该数据集为巴西判例(jurisprudência)数据集,由Juriscraper工具从巴西多个法院网站收集,以Parquet格式发布,便于通过Hugging Face Datasets、DuckDB、Polars、Pandas、PyArrow等工具直接使用。数据集包含来自以下法院的判决:jt、stf、stj、tjrj、tst_datajud。数据集的稳定逻辑标识为(tribunal, unique_key)对,用于去重。模式版本为1,包含以下字段:tribunal(法院)、base、unique_key、documento_id、numero_processo(案件号)、orgao_julgador(审判庭)、relator(报告法官)、data_julgamento(判决日期)、data_publicacao(发布日期)、ementa(摘要)、inteiro_teor(全文)、classe(案件类别)、dg_unique、partes(当事人信息,JSON数组)、data_json(原始完整数据)、scraped_at(采集时间戳)、spider_name(爬虫名称)。其中partes字段为UTF-8 JSON数组,包含当事人名称(nome)、法律角色(polo:ativo为原告/上诉人,passivo为被告/被上诉人)、原始角色标签(tipo)。数据集的采集时间戳scraped_at记录本地SQLite数据库存储时间,data_julgamento和data_publicacao为标准化的YYYY-MM-DD字符串,可能为空。不同法院的原始数据可能不同,data_json字段保留了所有未在扁平字段中体现的原始信息。数据集为公开领域政府文件,但建议商业使用前核实。数据集以确定性快照方式发布,当前快照边界(最大本地ID)为233376,发布行数为88004,分片数为2。

This dataset is a Brazilian jurisprudence dataset collected by the Juriscraper tool from multiple Brazilian court websites, published in Parquet format for direct use with Hugging Face Datasets, DuckDB, Polars, Pandas, PyArrow, and other tools. It includes judgments from the following courts: jt, stf, stj, tjrj, tst_datajud. The stable logical identifier for deduplication is the (tribunal, unique_key) pair. Schema version 1 contains fields: tribunal (court), base, unique_key, documento_id, numero_processo (case number), orgao_julgador (chamber), relator (reporting judge), data_julgamento (judgment date), data_publicacao (publication date), ementa (summary), inteiro_teor (full text), classe (case type), dg_unique, partes (parties information as JSON array), data_json (raw complete data), scraped_at (scraping timestamp), spider_name (spider name). The partes field is a UTF-8 JSON array with fields: nome (name), polo (legal role: ativo for plaintiff/appellant, passivo for defendant/appellee), tipo (original role label). The scraped_at timestamp records the storage time in the local SQLite database. data_julgamento and data_publicacao are standardized YYYY-MM-DD strings, possibly empty. Raw data varies by court; the data_json field preserves all original information not captured in flat fields. The dataset consists of public domain government documents, but commercial use verification is recommended. It is published as deterministic snapshots, with current snapshot boundary (max local ID) 233376, 88004 rows, and 2 shards.

创建时间:
2026-08-23
原始信息汇总

数据集概述

celsowm/jurisprudencias_br 是一个巴西法律判决(jurisprudência)数据集,由 Juriscraper 工具收集,以 Parquet 格式发布,可直接用于 Hugging Face Dataset Viewer、datasets、DuckDB、Polars、Pandas 和 PyArrow。

范围

数据集包含来自巴西多个法院的判决,支持的法院(通过 tribunal 字段标识)包括:

  • jt(劳动法院)
  • stf(联邦最高法院)
  • stj(高等法院)
  • tjrj(里约热内卢州法院)
  • tjsp(圣保罗州法院)
  • tst_datajud(高等劳动法院)

时间戳语义

  • scraped_at:记录 Juriscraper 将数据存入本地 SQLite 数据库的时间(ISO-8601 UTC 格式),表示采集时间而非法院发布时间。
  • data_julgamento / data_publicacao:从法院数据中提取的标准化日期(YYYY-MM-DD 格式),可能为 null。

数据结构(Schema 版本 1)

数据集中不包含本地的自增 id 字段,稳定的逻辑文档标识为 (tribunal, unique_key) 组合,这也是去重键。

列名 类型
tribunal string (nullable)
base string (nullable)
unique_key string (nullable)
documento_id string (nullable)
numero_processo string (nullable)
orgao_julgador string (nullable)
relator string (nullable)
data_julgamento string (nullable)
data_publicacao string (nullable)
ementa string (nullable)
inteiro_teor string (nullable)
classe string (nullable)
dg_unique string (nullable)
partes string (nullable)
data_json string (nullable)
scraped_at string (nullable)
spider_name string (nullable)

诉讼当事人(polos)

partes 字段是一个 UTF-8 JSON 数组,每个当事人一个对象,包含:

  • nome:当事人姓名(保留原始大小写和重音符号)。
  • polo:规范立场,ativo(原告/上诉人)或 passivo(被告/被上诉人)。
  • tipo:法院提供的原始角色标签(例如 APELANTEAPELADOAGTEAGDOAUTORRÉURECORRENTERECLAMANTE 等)。对于没有结构化当事人信息的法院(如 TJRJ),会从案件详情页补充;部分法院的 partes 可能为 null。

来源差异

不同法院返回的数据结构不同。扁平结构之外的字段会以原始形式嵌入到 data_json(UTF-8 JSON)中,需要非标准字段时应优先查看 data_json

许可与来源

判决书属于巴西公共领域政府作品,但商业使用前需核实。数据来源为各法院官网,Juriscraper 是非官方收集工具。

更新频率

数据集以完整确定性快照形式发布,来源于本地权威 SQLite 数据库。具体发布流程见项目文档 docs/HUGGINGFACE_DATASET_PUBLISHING_REFACTOR_PLAN.md

使用示例

使用 datasets

python from datasets import load_dataset

ds = load_dataset("celsowm/jurisprudencias_br")

使用 DuckDB / SQL:

sql SELECT tribunal, count() FROM hf://datasets/celsowm/jurisprudencias_br/data/.parquet GROUP BY tribunal;

使用 PyArrow / Pandas:

python import pyarrow.dataset as ds dataset = ds.dataset( f"hf://datasets/celsowm/jurisprudencias_br/data/", format="parquet", )

快照元数据

  • 快照边界(本地最大 id):270636
  • 发布行数:240627
  • 分片数:5

遗留原始快照

如果存在 jurisprudencia.db,这是抓取过程中使用的 SQLite 原始操作快照,不是推荐的机器学习格式。推荐使用 data/ 下的 Parquet 文件进行分析和训练。

搜集汇总
数据集介绍
jurisprudencias_br 数据集图片
构建方式
该数据集由Juriscraper工具从巴西多个法院官方网站系统化采集而成,覆盖联邦最高法院(STF)、高等法院(STJ)、州法院(如TJRJ、TJSP)及劳动法院(TST)等司法主体。采集过程遵循严格的元数据记录规范,原始数据存储于本地SQLite数据库,并依据确定性快照策略定期发布为Parquet格式,以支持直接面向机器学习与数据科学场景的高效访问。数据集逻辑标识采用(法庭, 唯一键)双重键机制,确保文档身份的稳定性和去重准确性,同时保留了完整的原始载荷字段,以便兼容不同法院间的异构数据结构。
特点
该数据集的核心特点在于其结构化与非结构化信息的有机融合。除提供判决书全文、案件编号、法官、审判日期等标准化字段外,还通过'partes'字段以UTF-8 JSON格式记录了诉讼各方的详细归属(如原告、被告),并借助'data_json'字段保留法院原始提交的完整信息,从而有效规避了因法院间数据格式差异导致的信息损失。此外,数据集包含了精确的采集时间戳与规范化的日期字符串,为时间序列分析和法律时效性研究提供了坚实的数据基础,整体设计兼顾了法律文本的语义丰富度与机器学习的便捷性。
使用方法
使用者可通过Hugging Face datasets库便捷加载完整数据集,或利用DuckDB直接对Parquet文件执行SQL查询,以进行跨法院的判例统计与聚合分析。对于偏好分布式或列式操作的环境,PyArrow/Pandas提供了同样高效的接口。鉴于'data_json'字段保留了非标准化的法院特有个性数据,在涉及深度法律实体识别或特定法院规则探索时,建议优先解析该字段。同时,数据集的更新以完整快照形式发布,用户在设计长期追踪或增量学习流程时,应依据快照边界信息进行版本管理,确保分析的时效性与可复现性。
背景与挑战
背景概述
jurisprudencias_br数据集由巴西开发者celsowm于近期创建,旨在系统化汇集巴西各级法院的司法判例。该数据集依托Juriscraper爬虫框架,从巴西联邦最高法院(STF)、高等法院(STJ)等核心审判机构官网采集公开裁判文书,覆盖民事、刑事、劳动等多元法律领域。其核心研究问题在于构建一个结构化的巴西判例语料库,支持法律文本检索、司法判决预测及法律人工智能模型的训练与评估。通过标准化字段设计(如当事人、裁判日期、案件索引)并保留原始JSON数据,该数据集为法律自然语言处理研究提供了高质量、可复现的数据基础,在巴西法律科技领域具有开创性影响力,成为连接司法实务与计算法学研究的桥梁。
当前挑战
该数据集构建面临多重挑战。领域层面,巴西各法院裁判文书格式差异显著,如TJRJ缺乏结构化当事人信息,需从案件详情页二次提取;法律文本的复杂术语、葡萄牙语变体及冗长陈述对文本检索与语义理解模型构成严苛考验,促使研究者需设计鲁棒的规范化 pipeline。构建层面,爬虫运行高度依赖法院网站页面结构的稳定性,任何改版均可能导致数据采集中断;同时,数据去重依赖(tribunal, unique_key)键,但不同法院对同一案件可能采用不同标识,存在隐式重复风险。此外,时间戳语义区分采集时间与公布时间,缺失值处理及跨源数据一致性维护亦是持续挑战,要求数据集维护者定期校验并更新快照,以确保数据时效性与可用性。
常用场景
经典使用场景
该数据集汇聚了巴西多个法院的判例文书,为法律文本挖掘与信息检索领域提供了丰富的语料资源。研究者可借助其结构化字段(如法庭、案件编号、裁判日期、全文等)开展法律判决预测、法律文书分类、案件相似度计算等经典任务。其Parquet格式与Hugging Face生态的无缝集成,简化了数据加载流程,支持大规模批量处理,成为法律人工智能研究中不可或缺的基础数据源。
衍生相关工作
该数据集衍生出一系列相关研究,如基于巴西法律文本的预训练语言模型(如Legal-BERT的葡萄牙语变体),用于法律文本的语义理解与信息抽取。也有工作聚焦于判例引用网络分析,揭示法律先例的传播路径与影响力。更有研究结合该数据集的丰富元数据,开发了法律问答系统与法律知识图谱,推动了法律人工智能的纵深发展。
数据集最近研究
最新研究方向
该数据集聚焦于巴西司法判决文书的自动化抓取与结构化处理,其最新研究方向体现在法学与人工智能的交叉前沿。随着法律科技(Legal Tech)的蓬勃发展,司法大数据已成为法律检索、判决预测及法律文本挖掘的关键基础设施。该数据集通过Juriscraper工具从巴西多个法院(如STF、STJ等)采集海量判例,并以Parquet格式提供高效存储与查询,支持大规模法律文本的分布式分析。其精细的元数据设计(如案件参与方、裁判日期、全文内容)为构建法律领域的问答系统、知识图谱及预训练语言模型提供了高质量语料。当前研究热点包括基于该数据集的司法判决摘要生成、法律要素抽取及类案检索,旨在提升法律工作的智能化水平,推动司法透明与公正。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务