遇见数据集

open-india-law

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

Open India Law 是一个开放、结构化的印度主要法律数据集。它涵盖了印度最高法院和全部25个高等法院的所有判决、15个法庭和监管机构的决定,以及中央、各邦和联邦属地的立法,细化到单独章节。数据全部来自官方政府来源,并统一为单一模式。数据集包含:法院判决12,848,644份(1950-2025年)、法庭和监管事项813,168份(1985-2026年)、法令22,265部(1806-2026年)、立法章节1,098,577条(可单独搜索)。不包括地区法院和初审法院判决。数据以Parquet格式存储,可通过HuggingFace Datasets库加载(支持judgments、legislation、regulations三个配置)。此外,还提供了基于Voyage AI voyage-4系列嵌入的Qdrant向量快照(共约3250万向量),支持混合搜索。数据集适用于文本检索、问答、文本分类等任务,特别适用于法律领域的RAG(检索增强生成)应用。语言为英语,许可证为CC-BY-4.0。

Open India Law is an open, structured dataset of Indian primary legal materials. It covers all judgments of the Supreme Court and all 25 High Courts, decisions of 15 tribunals and regulatory bodies, and legislation from the central government, states, and union territories, down to individual sections. All data is sourced from official government sources and unified into a single schema. The dataset includes: 12,848,644 court judgments (1950-2025), 813,168 tribunal and regulatory matters (1985-2026), 22,265 statutes (1806-2026), and 1,098,577 legislative sections (searchable individually). It does not include district court or trial court judgments. Data is stored in Parquet format and can be loaded via the HuggingFace Datasets library (with three configurations: judgments, legislation, regulations). Additionally, it provides Qdrant vector snapshots based on Voyage AI voyage-4 series embeddings (approximately 32.5 million vectors), supporting hybrid search. The dataset is suitable for tasks such as text retrieval, question answering, and text classification, especially for RAG (Retrieval-Augmented Generation) applications in the legal domain. Language: English. License: CC-BY-4.0.

创建时间:
2026-08-21
原始信息汇总

Open India Law 数据集概述

基本信息

  • 数据集名称: Open India Law
  • 许可证: CC-BY-4.0
  • 语言: 英语
  • 数据规模: 10M < n < 100M
  • 任务类型: 文本检索、问答、文本分类
  • 标签: 法律、印度、判例法、立法、检索增强生成(RAG)

数据内容

数据集包含印度主要法律资料,涵盖以下三类内容:

数据类型 数量 时间跨度
法院判决 12,848,644 条 1950–2025
法庭及监管机构案件 813,168 条 1985–2026
立法法案 22,265 部 1806–2026
立法条款 1,098,577 条(可独立检索)

说明: 不包含地区和初审法院的判决。

数据配置

数据集提供三个配置,分别对应不同的数据文件:

  • judgments: in_*_judgments.parquet
  • legislation: in_*_legislation.parquet
  • regulations: in_*_regulations.parquet

法院判决数据

覆盖印度最高法院和全部 25 个高等法院,主要法院包括:

法院 判决数量 时间跨度
最高法院 34,954 1950–2025
巴特那高等法院 1,615,041 1967–2025
孟买高等法院 1,595,948 1953–2025
阿拉哈巴德高等法院 1,498,250 1992–2025
马德拉斯高等法院 1,494,952 1997–2025
特伦甘纳高等法院 1,004,138 1963–2025
喀拉拉高等法院 916,190 1950–2024
卡纳塔克高等法院 581,276 1998–2025

其余高等法院判决数量从 453 条至 508,791 条不等。

法庭和监管机构数据

涵盖 15 个法庭和监管机构,包括:

  • 中央行政法庭(CAT)
  • 关税、消费税和服务税上诉法庭(CESTAT)
  • 所得税上诉法庭(ITAT)
  • 债务追收法庭(DRT)
  • 国家公司法法庭(NCLT)
  • 国家绿色法庭(NGT)
  • 证券上诉法庭(SAT)
  • 电力上诉法庭(APTEL)
  • 房地产监管机构(RERA)
  • 电信争议解决和上诉法庭(TDSAT)等

重要说明: 法庭材料按案件索引,未提供全文。约 210 万份 PDF 无文本层,其中约 348,516 份为实质性裁定,需要 OCR 和解析处理。

监管机构数据

包含 12 个监管机构发布的法规文件,主要机构包括:

机构 文件数 条款数
公司事务部(MCA) 2,666 46,480
印度储备银行(RBI) 2,640 104,143
环境、森林和气候变化部(MOEFCC) 1,399 116,227
对外贸易总局(DGFT) 1,233 4,252
印度证券交易委员会(SEBI) 1,144 88,310
印度电信监管局(TRAI) 834 22,720

立法数据

数据来源于 India Code,涵盖中央和各邦/地区的立法:

  • 中央立法: 13,720 部法案,628,863 条条款(1834–2026)
  • 邦级立法: 涵盖 37 个司法辖区,从阿萨姆邦(987 部)到拉克沙群岛(1 部)不等
  • 每条立法条款可独立检索,附带 source_url 指向官方 PDF

数据获取方式

python from datasets import load_dataset

judgments = load_dataset("vaquill/open-india-law", "judgments", split="train") acts = load_dataset("vaquill/open-india-law", "legislation", split="train") regs = load_dataset("vaquill/open-india-law", "regulations", split="train")

快照版本 v2026.08: 26 个判决文件(32,572,660 个文本块,53.6 GB)、37 个立法文件和 12 个监管文件(共 1,098,269 条条款)。

向量嵌入

数据集附带了预生成的向量嵌入可供使用:

集合 向量数 分片数 大小
legal_corpus_v1 19,595,718 4 272.8 GB
legal_corpus_v2 11,823,753 4 179.6 GB
acts_india 1,098,577 2 11.2 GB

总计 32,518,048 个向量,463.6 GB。嵌入使用 Voyage AI voyage-4 系列模型,1024 维,余弦距离,支持 BM25 混合检索。

数据来源与溯源

  • 仅使用政府官方来源,不包含商业法律报告或第三方聚合数据
  • 每条记录保留来源 URL,可追溯到法院、法庭或政府发布机构
  • 数据构建过程全部开源,包含爬虫和解析脚本

数据格式

每条立法记录包含字段:act_idtitlechaptersection_numbersection_titletextact_statussection_statusstateyearamendment_countsource_url

每条法庭记录包含字段:case_idcase_numbertitlebenchjudgesdecision_dateyeardoc_typeis_judgmentsource_pdf_url

搜集汇总
数据集介绍
open-india-law 数据集图片
构建方式
Open India Law数据集是一个系统化整合印度基础法律文献的综合性语料库,其构建过程严格遵循官方信源,从印度最高法院、25个高等法院、15个审裁处与监管机构,以及中央、邦和联邦属地立法中提取数据,覆盖1950年至2026年间的判例与法规。数据采集依赖一系列定制化的网络爬虫脚本,分别针对法院判决、审裁处事务、监管规定和立法条文进行抓取,并统一转换为JSONL格式的规范化记录。在文本处理层面,项目采用多阶段流水线,包括PDF解析、文字层提取、OCR回退、章节边界检测、元数据抽取及感知章节的智能分块,最终形成结构清晰、元数据丰富的语料。
特点
该数据集的核心特点在于其规模宏大与结构精细。其包含超过1284万条法院判决、81万条审裁处事项、2.2万余部成文法及逾109万个独立法律条文,均以统一模式归一化,并附有稳定的标识符、效力状态、修正次数及原始官方来源链接。尤为突出的是,数据集提供了预计算的向量嵌入,采用Voyage AI的1024维向量模型,构建了超过3200万个向量点,支持稠密与稀疏向量的混合检索,极大便利了基于语义的法律文本检索与增强生成(RAG)应用。
使用方法
使用者可以通过Hugging Face Datasets库便捷加载不同子集,如judgments、legislation和regulations,并可按需筛选特定司法管辖区或监管机构的数据。数据以Parquet格式存储,每行对应用户的一个块,可通过case_id和chunk_index重新组装成完整判决。对于高级应用,数据集提供了Qdrant向量快照,用户可在本地还原集合,实现低延迟的语义搜索。此外,项目开源了完整的爬虫与解析脚本,支持自定义数据源的扩展,确保数据的可复现性与可审计性,适合用于法律文本分类、信息检索及生成式问答等研究场景。
背景与挑战
背景概述
Open India Law数据集由Vaquill AI团队于2025年构建,旨在系统化整合印度多层次的法律体系,涵盖最高法院、25个高等法院、15个专门法庭与监管机构的裁决,以及中央、各邦和联邦属地的立法条文。该数据集覆盖自1806年至2026年间的逾1200万份判决和百万级法律条款,所有数据均归一化为统一模式,并严格仅来源于官方政府渠道,确保了数据的权威性与可追溯性。其核心研究问题在于为法律文本检索、问答及分类等自然语言处理任务提供大规模、结构化的印度法律语料,填补了印度法律人工智能领域缺乏高质量基准数据的空白。该数据集不仅支持法学研究与司法实践,更对法律科技的发展具有开创性意义,其开源性质和配套的爬虫工具亦促进了可复现研究与社区协作。
当前挑战
该数据集面临的首要挑战是法律文本的异构性与非结构化特征。印度各级法院和监管机构多以无文本层的扫描版PDF形式发布文件,从这些文件中精准提取判决书、法庭令及法规条款的完整内容,需依赖高精度的OCR技术与复杂的版面解析算法,且需应对不同法庭的多样化格式和术语差异。其次,构建过程中需处理跨辖区、跨时间维度的大量数据的归一化,确保不同来源、不同时期的法条在统一模式下的准确映射,同时保持历史修订与效力状态的完整性。此外,语料库规模庞大,包含近3300万条向量化文本块,其存储、索引与高效检索亦构成技术挑战。最终,确保数据来源的官方性与准确性、过滤冗余信息以及持续追踪法规更新,均为维护数据集长期可用性所必须克服的难题。
常用场景
经典使用场景
Open India Law数据集作为印度法律领域的大规模结构化语料库,其经典使用场景集中于法律文本的检索与问答系统构建。研究者可基于其统一的模式(涵盖最高法院、高等法院、审裁处及法律法规),开展语义检索、段落级问答及法律信息抽取等任务。该数据集提供了从1950年至今逾千万份判决书及上百万条法律条款,为训练法律领域专用的密集检索模型或评估生成式问答系统提供了坚实的数据基础。其按司法辖区、法院和法规分类的组织方式,亦便于进行细粒度的法律文本分析。
解决学术问题
在法学与人工智能交叉领域,该数据集有效解决了印度法律文本分散、格式多样且难以机器处理的核心难题。它汇集了来自官方来源的、归一化的判例法与成文法,填补了印度法律NLP研究中缺乏大规模、高质量基准语料的空白。通过提供结构化字段如案件编号、法院、判决日期及法律条文状态,该数据集支持了法律文本分类、判决结果预测、法律条文引用网络分析等前沿学术探索,推动了计算法学在印度语境下的实证研究,并为跨司法辖区法律系统比较提供了宝贵资源。
衍生相关工作
围绕该数据集已衍生出一系列开创性工作,包括法律文本解析管道的优化(如PDF转换为Markdown、法律章节边界检测与感知章节的文本分块),以及元数据提取器的构建。这些工具不仅服务于数据集自身维护,也为其他法律语料库的处理提供了可复用的方法论。此外,基于该语料训练的检索模型和法律问答系统成为后续研究的重要基线。数据集配套的向量嵌入版本(基于Voyage AI)催生了面向法律领域的密集检索与混合搜索(结合BM25)技术探索。这些衍生工作共同推进了法律人工智能从理论模型向实际应用的转化,形成了一个活跃的研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务