遇见数据集

turk-ictihat-kararlari-fulltext

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

本数据集来源于土耳其司法部 UYAP 系统的 e-Bedesten 公共平台(bedesten.adalet.gov.tr),通过概念关键词搜索收集了土耳其最高法院(Yargıtay)的判决全文。数据规模约为 9,899,589 条唯一判决记录,时间范围覆盖 1993 年至 2026 年。其中约 39,301 条判决包含完整文本(逐步补充中)。数据集包含以下字段:document_id(文档 ID)、karar_no(判决号)、esas_no(案号)、daire(法院部门)、karar_turu(判决类型,通常为“Yargıtay Kararı”)、karar_tarihi(判决日期,格式 dd.mm.yyyy)、esas_no_yil(案号年份)、karar_no_yil(判决年份)、kesinlesme(判決确定状态)、matched_terms(匹配的搜索词列表)、text(判决全文,可能为空)。该数据集适用于文本生成(如法律文本摘要、判决书生成)和文本检索(如法律案例检索)任务。注意:判决文本可能包含当事人姓名等个人数据,使用时需根据土耳其个人数据保护法(KVKK)评估使用目的。

This dataset originates from the e-Bedesten public platform (bedesten.adalet.gov.tr) of the Turkish Ministry of Justices UYAP system, collecting full-text decisions of the Turkish Supreme Court (Yargıtay) through concept keyword search. It contains approximately 9,899,589 unique decision records, spanning from 1993 to 2026. About 39,301 decisions include full text (gradually being supplemented). The dataset includes the following fields: document_id, karar_no (decision number), esas_no (case number), daire (court department), karar_turu (decision type, typically Yargıtay Kararı), karar_tarihi (decision date in dd.mm.yyyy format), esas_no_yil (case year), karar_no_yil (decision year), kesinlesme (finalization status), matched_terms (list of matching search terms), and text (full decision text, may be empty). It is suitable for text generation tasks (e.g., legal text summarization, judgment generation) and text retrieval tasks (e.g., legal case retrieval). Note: The decision texts may contain personal data such as party names; users must evaluate the purpose of use in accordance with the Turkish Personal Data Protection Law (KVKK).

创建时间:
2026-09-08
原始信息汇总

数据集概述

该数据集为土耳其最高法院(Yargıtay)判决全文数据集,内容源自土耳其司法部UYAP法规与判例程序(e-Bedesten)公共平台,通过概念化检索查询收集而成。数据集以土耳其语呈现,属于法律领域文本资源。

基本信息

  • 语言:土耳其语(tr)
  • 任务类型:文本生成、文本检索
  • 标签:法律、土耳其语、最高法院、法院判决、判例
  • 记录规模:9,899,589条唯一判决
  • 许可协议:其他(other)
  • 收集日期:2026年9月7日

数据规模与覆盖范围

  • 记录总数:9,899,589条唯一判决记录
  • 年份跨度:1993年至2026年
  • 全文数量:39,301条(持续增量补充中)
  • 搜索词分布
    • "karar"(判决):9,894,542条
    • "bosanma"(离婚):100,052条
    • "tazminat"(赔偿):100,052条
    • "nafaka"(赡养费):66,241条

数据字段结构

字段名 类型 说明
document_id int64 e-Bedesten文档标识
karar_no string 判决编号(如2026/6738)
esas_no string 主案编号
daire string 最高法院审判庭
karar_turu string 判决类型(最高法院判决)
karar_tarihi string 判决日期(日.月.年格式)
esas_no_yil int32 主案年份
karar_no_yil int32 判决年份
kesinlesme string 终局状态
matched_terms list[string] 匹配的检索词
text string 判决全文(可空,增量填充)

使用方式

通过Hugging Face datasets库加载:

python from datasets import load_dataset ds = load_dataset("muhammedturan/turk-ictihat-kararlari-fulltext")

重要说明

  1. 数据来源:土耳其司法部e-Bedesten公共服务平台(bedesten.adalet.gov.tr)
  2. 构建方法:采集代码存放于该仓库的crawler/目录中,支持可恢复的SQLite状态及按年份分段处理
  3. 隐私考量:判决文本可能包含当事人姓名等个人信息,使用者需依据土耳其《个人数据保护法》(KVKK)评估使用目的
  4. 数据状态:全文判决数量仍在持续增量补充中
搜集汇总
数据集介绍
turk-ictihat-kararlari-fulltext 数据集图片
构建方式
该数据集源自土耳其共和国司法部UYAP法律与判例系统(e-Bedesten)的公开服务,经由爬虫系统依据特定法律概念(如离婚、赡养费、赔偿等)进行定向检索而系统汇聚。构建过程采用基于年份的分段式爬取策略,并辅以可断点续爬的SQLite状态管理,以确保采集的高效性与完整性。每条记录均映射了判决书的核心元数据,包括案件编号、审判庭、判决日期及法律术语命中情况,且全文文本按增量方式逐步补充,形成了迄今为止规模巨大的土耳其最高上诉法院判决文本库。
特点
该数据集囊括了自1993年至2026年间近千万条(9,899,589)独一无二的司法判决记录,体量在同类语料库中堪称翘楚,为法律自然语言处理研究提供了深厚的数据基础。其显著特点在于精细的结构化元数据与全文文本的双轨并行,既便于基于判决编号、法庭、日期等属性的精确查询,又支持对判决正文的深度挖掘。此外,数据集中按法律术语(如‘离婚’、‘赔偿’等)标注的匹配字段,为研究员提供了概念检索的捷径,极大地促进了法律文本的主题归类与分析。
使用方法
使用该数据集极为便捷,研究者通过HuggingFace平台可一键加载:`from datasets import load_dataset; ds = load_dataset("muhammedturan/turk-ictihat-kararlari-fulltext")`。数据集默认适用于土耳其语文本生成与检索任务,亦可针对判决预测、法律文书摘要、法律信息抽取等下游应用开展微调。鉴于部分判决书包含当事人姓名等个人数据,使用者在数据处理与发布环节应严谨评估并遵循土耳其《个人数据保护法》(KVKK)的相关要求,确保合法合规地进行学术或商业应用。
背景与挑战
背景概述
该数据集由土耳其司法部UYAP框架下的e-Bedesten系统收集,由研究者Muhammed Turan于2026年9月创建,包含约990万份土耳其最高法院(Yargıtay)的判决全文,时间跨度从1993年至2026年。其核心研究问题在于提供大规模、结构化的土耳其法律文本语料库,以支持法律信息检索、文本生成及司法决策辅助等自然语言处理任务。该数据集填补了土耳其语法律领域高质量数据资源的空白,为跨学科研究(如法学与人工智能)提供了重要基础,对推动土耳其法律科技的发展具有关键作用。
当前挑战
该数据集面临的挑战包括:1) 法律文本的复杂性:判决书包含专业术语、复杂句式及法律引用,对自然语言处理模型的理解和生成能力提出高要求;2) 数据质量的不平衡:尽管总记录数庞大,但仅约39,301条判决包含全文,数据稀疏问题限制了深度学习的应用;3) 隐私与合规性:判决内容可能包含当事人姓名等个人信息,需符合土耳其《个人数据保护法》(KVKK)的规定,这增加了数据使用的法律风险;4) 数据构建的持续性:由于判决不断更新,需定期爬取并保持数据同步,技术上涉及断点续爬和增量更新,具有一定的工程复杂度。
常用场景
经典使用场景
该数据集汇聚了土耳其共和国司法部UYAP系统下近千万条最高法院(Yargıtay)判决原文,覆盖离婚、抚养费、赔偿等核心民商事争议领域,时间跨度自1993年至2026年,为法律文本挖掘与自然语言处理研究提供了规模宏大、结构化程度高的语料资源。研究者可借此开展判决书要素抽取、法律因果关系推理、裁决结果预测等经典任务,亦可基于其丰富的案件类型与年代分层,进行跨时间维度的法律语义漂移分析或司法实践趋势演化研究。
解决学术问题
该数据集直面法律人工智能领域长期存在的标注语料稀缺与真实验证场景缺失的学术困境,通过大规模非结构化判决文本的系统整理,支撑了法律文本分类、信息检索排序、法律问答系统等基准测试的构建。其多领域覆盖与年份跨度有助于研究者突破小样本泛化瓶颈,探索跨案件类型、跨法域的时间不变法律表示学习,进而为法律实证研究提供量化分析基础,深化对司法决策过程与判例规律的系统性认知。
衍生相关工作
该数据集催生了以法律文本为对象的预训练语言模型微调研究,如面向土耳其语的司法BERT变体开发,以及基于对比学习的判决相似度计算框架。后续衍生工作包括构建结构化法律事件图谱、开发可解释的判决结果预测模型,以及利用时间感知的序列模型追踪法律概念的内涵变迁。部分学者亦将其与知识图谱技术结合,用于法律条款与案件事实的自动关联推理,推动法律人工智能从检索式响应向认知智能评估演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务