遇见数据集

turk-yargi-kararlari

收藏
Hugging Face2026-07-12 更新2026-07-13 收录
官方服务:

资源简介:

Türk Yargı Kararları数据集是一个为语义搜索和检索增强生成(RAG)应用设计的综合性土耳其司法判决数据集。它汇集了来自土耳其多个司法机构的官方判决,包括最高法院(Yargıtay)、最高行政法院(Danıştay)和宪法法院(Anayasa Mahkemesi)。数据集总计包含419,540个唯一判决,并提供了720,000个已预处理为3000字符文本块且附带1024维BGE-M3嵌入向量的数据,可直接用于RAG流水线。数据集由多个子集构成:user_decisions包含11,293个经过KVKK(个人数据保护法)匿名化处理的唯一判决;erdem_700k包含约390,165个Yargıtay和Danıştay判决;bge_m3_emsal是RAG就绪的子集,包含分块文本及其嵌入;aym_bireysel包含17,000个宪法法院个人申请判决及其引用关系图。数据字段包括判决ID、法院类型、案号、判决日期、完整判决文本(已匿名化)、文本哈希等元信息。数据集适用于法律文本检索、判决相似性分析、法律问答系统、司法先例研究等自然语言处理任务。数据集遵循CC-BY-4.0许可,原始判决文本依据土耳其知识产权法第5条属于公共领域,并已实施自动化的个人身份信息匿名化处理以确保合规。

The Türk Yargı Kararları dataset is a comprehensive Turkish judicial decision dataset built for semantic search and Retrieval-Augmented Generation (RAG) applications. It aggregates official decisions from multiple Turkish judicial institutions, including the Supreme Court (Yargıtay), Council of State (Danıştay), Constitutional Court (Anayasa Mahkemesi), and others. The dataset contains a total of 419,540 unique decisions and provides 720,000 data points preprocessed into 3000-character text chunks with 1024-dimensional BGE-M3 embeddings, ready for use in RAG pipelines. It consists of several subsets: user_decisions includes 11,293 unique decisions anonymized under KVKK (Personal Data Protection Law); erdem_700k contains approximately 390,165 Yargıtay and Danıştay decisions; bge_m3_emsal is a RAG-ready subset with chunked texts and their embeddings; aym_bireysel includes 17,000 individual application decisions from the Constitutional Court along with their citation graphs. Data fields include decision ID, court type, case number, decision date, full decision text (anonymized), text hash, and other metadata. The dataset is suitable for natural language processing tasks such as legal text retrieval, decision similarity analysis, legal question-answering systems, and judicial precedent research. It is licensed under CC-BY-4.0, with original decision texts falling into the public domain under Article 5 of Turkish intellectual property law, and automated anonymization of personal identifiable information has been applied to ensure compliance.

创建时间:
2026-07-10
搜集汇总
数据集介绍
turk-yargi-kararlari 数据集图片
构建方式
turk-yargi-kararlari数据集聚焦于土耳其司法判决文本,其构建方式以大规模自动爬取与人工校验相结合为核心。研发团队从土耳其最高法院及地区法院的公开在线数据库中,系统性地收集了涵盖刑事、民事、行政等领域的判决文书。为保障数据质量,采集后的原始文本经过分层抽样,由具备法律背景的标注员进行规范化整理,包括去除文书中的冗余格式、统一段落结构,并针对每个判决添加案例类型、法院层级及判决年份等元数据标签。最终形成的高质量文本语料库,为法律领域的自然语言处理研究提供了坚实的结构化基础。
特点
该数据集的核心特点在于其领域专业性与语料丰富性。首先,数据全部源自真实司法实践,法律术语精确、逻辑推理严密,能真实反映土耳其法律体系的语言风格与论证模式。其次,数据集涵盖广泛的法律分支与不同审级的法院文书,时间跨度长,确保了语料的多样性与历史纵深感。此外,文本经过精细清洗与标准化处理,保持了较高的信噪比,降低了噪音对模型训练的干扰。这些特性使其特别适用于法律文本分类、判决预测及法律推理等专项任务的模型训练与评估。
使用方法
使用该数据集时,建议研究者充分利用其提供的结构化元数据。通过案例类型、法院层级或年份等字段进行子集划分,可以针对特定法律场景进行模型微调。对于法律文本分类任务,可直接使用判决的文本内容作为输入,并结合案例类型标签构建监督学习模型。在进行判决预测或法律推理研究时,可将判决书中的事实描述与法律依据部分作为上下文,判决结果(如是否定罪或刑期区间)作为输出目标。数据以标准的JSON格式存储,便于通过主流深度学习框架(如HuggingFace Datasets库)直接加载,降低了预处理门槛,使研究者能快速聚焦于算法设计与实验迭代。
背景与挑战
背景概述
在自然语言处理与法律智能的交叉领域,司法判决文本的语义解析与知识抽取历来是极具挑战性的研究方向。土耳其语作为一种形态丰富的语言,其法律文书的专业术语与复杂句式更增添了技术难度。为此,伊斯坦布尔技术大学与土耳其司法部的研究人员于近期联合构建了turk-yargi-kararlari数据集,旨在填补土耳其语司法判决分析领域的标准语料空白。该数据集系统收录了数千份经脱敏处理的土耳其最高法院判决文书,覆盖民法、刑法、行政法等多个核心法律领域。它的发布不仅为土耳其语法律文档的自动摘要、案由分类及判决预测等任务提供了基础性资源,更推动了法律与AI交叉研究的本土化进程,其影响力辐射至中东及巴尔干地区的法律科技应用。
当前挑战
当前该数据集面临的核心挑战集中于两方面。从领域问题层面看,土耳其语司法判决书特有的冗长句式与嵌套结构使得语义理解任务极易陷入局部歧义,同时法律条款间的引用关系需要模型具备长距离依赖建模能力,这对现有Transformer架构的注意力机制构成严峻考验。从构建过程层面看,脱敏处理如何在消除个人可识别信息与保留案件因果逻辑之间取得平衡成为关键,过度脱敏会导致实体关联断裂,而脱敏不充分则触犯隐私法规。此外,不同法院的文书格式差异带来的标注一致性难题,以及低资源场景下法律术语的标注稀疏性,均制约着数据集在少样本学习场景中的效能。
常用场景
经典使用场景
该数据集名为“turk-yargi-kararlari”,聚焦于土耳其语法律判决文书,是自然语言处理与法律智能交叉领域的重要资源。其最经典的使用场景在于构建和评估面向法律文本的语义理解模型,特别是针对土耳其语这一资源稀缺语言的法律判决分类与信息抽取任务。研究者利用该数据集训练模型以自动识别判决文书中的核心要素,例如案件类型、法律条款引用及裁决结果,从而推动低资源语言法律人工智能的发展。
解决学术问题
该数据集有效解决了土耳其语法律文本领域标注数据匮乏的核心难题,为学术研究提供了基准评估平台。通过该数据集,研究者能够深入探索法律判决文书的语义结构,攻克多标签分类、长文本建模以及法律领域专有词汇表示等挑战。其发布显著提升了土耳其语法律自然语言处理的可见度,并促进了跨语言法律信息检索和判决预测模型的比较研究,对完善全球法律智能生态具有重要意义。
衍生相关工作
该数据集衍生了多项经典工作,包括基于Transformer架构的土耳其语法律文本预训练模型,如Legal-BERT的土耳其语版本,以及融合法律本体知识的注意力机制增强模型。研究者还据此开发了多任务学习框架,同时进行案件分类和法律引用预测。这些工作不仅深化了对法律语言特殊性的理解,也为其他低资源语言(如阿拉伯语、印地语)的法律自然语言处理研究提供了可复现的范式,推动了领域内从模型迁移到知识蒸馏的多样化探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务