遇见数据集

KanoonGPT/indian-legal-documents

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为印度法律文件,是KanoonGPT开放法律数据倡议的一部分,旨在为AI、搜索和法律研究提供结构化的印度法定和法律文件数据。数据集包含35,851个印度法律文件,涵盖法案、规则、通知、通告、命令、法规、指南、条例等多种文档类型,覆盖中央和多个邦(如马哈拉施特拉邦、北方邦等)的司法管辖区。时间覆盖范围从1970年到2026年,包含解析日期和未解析日期的文件。数据集以AI就绪、表格化格式存储,支持文本生成、问答、特征提取、文本检索、文本排名和摘要等多种NLP任务。数据模式包括稳定文档标识符、文档标题、文档类型、司法管辖区、颁发机构、颁发日期、简短描述和清理后的文本字段。数据集以Apache 2.0许可证发布,适用于法律NLP研究、法规搜索、检索增强生成、文档分类、法律信息提取、法律摘要、法律数据分析和LLM训练与评估等用途。

This dataset, named Indian Legal Documents, is part of the KanoonGPT Open Legal Data Initiative, designed to provide structured Indian statutory and legal-document data for AI, search, and legal research. It contains 35,851 Indian legal documents, including Acts, Rules, Notifications, Circulars, Orders, Regulations, Guidelines, Ordinances, and other legal or quasi-legal government documents, covering jurisdictions such as Central and various states (e.g., Maharashtra, Uttar Pradesh). The time coverage spans from 1970 to 2026, with parsed dates for some documents and others lacking reliably parsed dates. The dataset is stored in an AI-ready, tabular format and supports NLP tasks such as text-generation, question-answering, feature-extraction, text-retrieval, text-ranking, and summarization. The schema includes columns like doc_id, document_title, document_type, document_jurisdiction, issuing_authority, issue_date, short_description, and cleaned text. Released under the Apache License 2.0, it is intended for use in legal NLP research, statutory search, retrieval-augmented generation, document classification, legal information extraction, legal summarization, legal data analytics, and LLM training and evaluation.

提供机构:
KanoonGPT
搜集汇总
数据集介绍
KanoonGPT/indian-legal-documents 数据集图片
构建方式
印度法律文件长期以来散落于各政府门户、公报、扫描件及非结构化的HTML页面之中,给规模化应用带来了巨大挑战。为破解这一困局,KanoonGPT团队发起了开放法律数据倡议,系统性地从多元官方渠道搜集并整理了涵盖法案、规则、通知、通函、命令、条例、指南及法令等在内的法律文档。原始材料历经格式转换、文本清洗与元数据提取等精细化处理流程,最终以分片Parquet文件形式存储在单一数据目录下,总计汇集了35,851份结构清晰的法律文件,构建起一个AI就绪的标准化法律数据集。
特点
该数据集具有鲜明的结构化与多维性特征。每个样本均包含稳定文档标识符、文档标题、类型、管辖区域、发布机构、发布日期、简短描述及经过清洗的全文本内容共八个字段,便于用户按类型、管辖区、时间等维度进行灵活筛选与分析。文本长度跨度极大,中位数长约9,495字符,为下游自然语言处理任务提供了丰富的语义层级。数据时间覆盖1970年至2026年,横跨印度中央与多个邦级辖区,其中中央级文件占比逾四成,充分体现了印度法律体系的多元性与复杂性。
使用方法
用户可以借助Hugging Face Datasets库快速加载数据集,支持一次性加载与流式读取两种模式,后者尤其适合处理大规模长文本场景。亦可直接通过Pandas读取Parquet文件进行轻量化探索。数据集预设了文本生成、问答、特征提取、文本检索与排序、摘要等多种任务场景,特别适合用于法律领域的检索增强生成系统构建、文档分类、信息抽取、法律摘要生成以及大型语言模型的预训练与微调。使用者需注意元数据由机器自动提取,在关键应用场景下应参照官方原文进行复核验证。
背景与挑战
背景概述
印度法律文件数据集(Indian Legal Documents)由KanoonGPT团队于2026年发布,隶属于其推动印度法律数据开放获取的KanoonGPT Open Legal Data Initiative。该数据集聚焦于印度成文法及准法律文件的结构化整理,旨在解决法律文本长期分散于政府门户、公报、扫描件及异构网页中而难以规模化利用的痛点。核心研究问题是如何将公共领域原则下存在但碎片化的法律数据转化为人工智能就绪的格式,以支撑法律检索、判决预测、文档分类及大语言模型训练等下游任务。数据集包含35,851份涵盖法令、规则、通知、通告、指南等十余种类型的法律文档,时间跨度自1970年至2026年,覆盖中央及印度多邦的司法管辖区域。其发布为印度法律科技生态系统提供了可复用的基础数据基础设施,对开源法律研究、法律NLP基准建设及公共利益法律分析具有显著推动作用。
当前挑战
该数据集所应对的核心领域挑战在于印度法律文本数据的固有碎片化与异构性:法律文件分散于不同政府网站与陈旧格式中,缺乏统一的结构化标准,使得自动化检索、知识图谱构建及法律问答系统难以在统一语料上高效运作。构建过程中面临多重困难:元数据完全依赖机器提取,导致文档类型标签可能存在噪声或过于细碎,辖区标签存在不一致或冗长表述,发布日期字段存在缺失、解析错误或离群值等问题;文本源自网页抓取、光学字符识别及PDF衍生标记语言转换,难免残留格式伪影与排版异常;大量早期文件缺乏可靠日期信息,约7,028份文档无法提取有效发布日期。此外,确保数据质量透明与责任使用亦是关键挑战,数据集明确声明不得替代官方法律出处,并强调下游应用需增加验证与人工审核环节,以规避基于自动生成元数据的合规风险。
常用场景
经典使用场景
在印度法律文本分析与自然语言处理领域,Indian Legal Documents数据集凭借其涵盖法规、条例、通知、通告等多元法律文书类型的丰富语料,成为构建法律检索增强生成(RAG)管道的基石资源。研究者可通过该数据集进行法律文档的语义分类、元数据抽取以及生成式摘要等经典任务,例如利用其结构化元数据(如文档类型、管辖区域)训练分类模型,实现自动识别法律文书性质的功能。此外,该数据的文本字段经过清洗与规范化,为大规模语言模型的预训练与指令微调提供了优质语料,尤其适合需要理解印度法律语境的专业化AI系统开发。
实际应用
在实际产业应用中,该数据集赋能了法律科技领域的多项落地场景。法律科技公司可基于此数据构建面向律师与公民的智能法规检索工具,通过语义匹配快速定位相关法令与条文,大幅提升法律调研效率。企业合规部门能够利用训练后的模型自动审核商业合同与政府通知的合规性,例如识别最新发布的劳动法或环境法规对业务的影响。此外,该数据集还支撑了法律助手的开发,使其能够根据用户自然语言提问精准抽取法律定义或程序要求,为印度司法系统的数字化转型提供了关键的语料基础设施。
衍生相关工作
基于该数据集衍生了一系列影响深远的学术与工程成果。在检索增强生成领域,研究者以其作为外部知识源,设计出专门针对印度法律框架的RAG流水线,显著提升了法律问答的准确性与可溯源能力。在法律文本分类方向,后续工作在此基础上开发了多标签分类模型,能够区分法规、通知、通告等近十种文书类型,并在管辖区域与颁布机构维度上实现了细粒度判别。此外,该数据集还催生了法律摘要生成与判决预测等进阶任务,例如与其他案例法数据集联合使用,构建从法条到判决结果的端到端推理系统,推动了印度法律AI领域的开源基准建设。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务