遇见数据集

Open India Law

收藏
github2026-08-22 更新2026-08-25 收录
官方服务:

资源简介:

开放、结构化的印度主要法律,包括最高法院和所有25个高等法院的判决、立法条款以及构建这些数据的爬虫。

An open and structured dataset of primary Indian laws, covering judgments from the Supreme Court and all 25 High Courts, legislative provisions, as well as the crawlers utilized to build this dataset.

创建时间:
2026-08-22
原始信息汇总

数据集概述

Open India Law 是一个开放、结构化的印度主要法律数据集,涵盖印度最高法院和全部25个高等法院的判决、15个法庭与监管机构的裁决,以及中央、各邦和中央直辖区的立法(细化到具体条款)。所有数据均来源于官方政府渠道,并统一为单一模式。

数据规模

类别 数量 时间跨度
法院判决 12,848,644 1950年至2025年
法庭与监管机构事项 813,168 1985年至2026年
立法(法案) 22,265 1806年至2026年
法律条款 1,098,577 可单独检索

注意:地区法院和初审法院的判决不包含在本数据集中。

数据构成

法院判决

包含印度最高法院及25个高等法院的判决,具体包括:

  • 最高法院:34,954件(1950-2025年)
  • 数量最多的高等法院:巴特那高等法院(1,615,041件)、孟买高等法院(1,595,948件)、阿拉哈巴德高等法院(1,498,250件)、马德拉斯高等法院(1,494,952件)
  • 时间跨度最长:最高法院、喀拉拉高等法院及北阿坎德高等法院,均始于1950年
  • 数量最少:锡金高等法院(453件,2000-2025年)

法庭与监管机构

包含15个法庭与监管机构的事项记录,例如:

  • 中央行政法庭(CAT):共343,868件(含CIS系统)
  • 关税、消费税和服务税上诉法庭(CESTAT):122,612件
  • 所得税上诉法庭(ITAT):115,074件
  • 债务追收法庭(DRT):108,395件
  • 国家公司法法庭(NCLT):63,487件

注意:法庭材料按案件索引,尚未提供全文,约2.1M份PDF无文本层,需OCR处理。

监管机构法规

包含12个监管机构发布的法规及条款,例如:

  • 公司事务部(MCA):2,666件文书,46,480条条款
  • 印度储备银行(RBI):2,640件文书,104,143条条款
  • 环境、森林与气候变化部(MOEFCC):1,399件文书,116,227条条款
  • 印度证券交易委员会(SEBI):1,144件文书,88,310条条款

立法

覆盖37个司法辖区(中央及36个邦/中央直辖区)的立法,来源为India Code,每条条款均单独保存和索引。

  • 中央立法:13,720部法案,628,863条(1834-2026年)
  • 其他主要辖区:阿萨姆邦(987部)、西孟加拉邦(715部)、拉贾斯坦邦(383部)等

数据格式与获取

  • 输出格式:JSONL(每行一条标准化记录)
  • 下载方式:可通过Hugging Face datasets 库加载,数据文件为Parquet格式
  • 数据快照 v2026.08:26个判决文件(32,572,660个块,53.6 GB),37个立法文件和12个监管文件(共1,098,269条条款)
  • 文档浏览:提供在线浏览界面(oss-data-in.vaquill.ai/browse.html)及法庭裁决浏览站点(tribunals.vaquill.ai

向量嵌入

数据集附带完整的向量嵌入,以Qdrant分片快照形式提供:

集合 向量数量 大小
legal_corpus_v1(高等法院和最高法院判决块) 19,595,718 272.8 GB
legal_corpus_v2(法庭和监管机构裁决块) 11,823,753 179.6 GB
acts_india(立法和监管条款) 1,098,577 11.2 GB

总计:32,518,048个向量,463.6 GB,使用Voyage AI voyage-4系列嵌入模型(1024维,余弦距离),另附BM25混合检索稀疏向量。

来源与溯源

  • 仅采用政府官方来源,不包含商业法律报告或第三方聚合器内容
  • 每条记录保留来源URL,可追溯至权威政府页面
  • 判决原始PDF托管于AWS开放数据注册表(高等法院最高法院),未重新托管
  • 数据集中已移除法定禁止发布的识别性信息(如性犯罪受害者亲属姓名、电话号码、邮箱、PAN、IFSC及Aadhaar号码等),且仅在上下文明确识别为对应号码时才进行遮蔽

主要注意事项

  1. 部分数据源(如India Code)仅向印度境内IP提供服务,境外运行爬虫可能无法获取数据
  2. 爬虫针对实时政府网站开发,网站改版或添加反爬措施可能导致部分脚本失效
搜集汇总
数据集介绍
Open India Law 数据集图片
构建方式
Open India Law数据集以系统化方式构建,整合了印度最高法院、25个高等法院、15个法庭与监管机构以及中央、邦和联邦属地立法的全部判决与法规。其构建过程基于定制化的网络爬虫,从官方政府来源抓取PDF与HTML文档,再经统一解析、章节边界检测、元数据提取等流水线处理,最终将文本标准化为JSONL格式,并按统一模式进行章节感知的切块,确保每条记录附有权威来源链接,实现数据的可追溯性与可复现性。
特点
该数据集具有规模宏大、覆盖全面且规范性强的特点。其收录超过1280万条法院判决、80余万条法庭事务记录及2万余部法规,时间跨度从1806年延伸至2026年,且每个法律条款均可独立检索。数据集附有基于Voyage AI系列的向量嵌入,便于语义搜索;同时,其来源严格限定于政府官方,并执行了特有的隐私去除规则,重点保护性犯罪受害者身份信息,确保合法合规。
使用方法
使用者可通过Hugging Face datasets库便捷加载数据,如使用`load_dataset("vaquill/open-india-law", "judgments")`即可获取判决数据。数据集按领域分为judgments、legislation、regulations等子集,并支持按文件直接读取特定邦或机构的Parquet文件。此外,提供浏览器界面供直接阅读PDF原始文档,并发布Qdrant向量快照以供嵌入检索,便于构建法律科技应用或进行法学研究。
背景与挑战
背景概述
Open India Law数据集由Vaquill.ai团队于2025年创建,旨在系统化整合印度多层次的法律体系。该数据集覆盖最高法院及25个高等法院自1950年以来的1284.8万份判决、15个法庭与监管机构的81.3万件案件,以及中央政府与各邦的2.2万部立法,并将全部内容规范至统一架构。其核心研究问题在于解决印度法律文本碎片化、格式异构且缺乏结构化访问的困境,为法律检索、文本挖掘及司法数据分析提供标准化基础。通过仅采用官方政府来源及AWS开放数据,该数据集已成为印度法律AI研究的关键基础设施,显著降低了司法大数据处理的准入门槛。
当前挑战
该数据集面临多维挑战。首要挑战在于司法判决PDF多为扫描件且缺乏文本层,需依赖大规模OCR和解析技术方可提取可用的结构化文本,这一过程对计算资源与算法精度要求极高。其次,印度法律体系涵盖数十个司法辖区和监管机构,各源网站格式迥异、更新频繁,需持续维护抓取程序以应对网站改版和反爬措施。此外,数据脱敏需在保护性侵犯受害者身份与避免过度掩蔽之间精细平衡,仅凭形态匹配可能导致误伤。最后,原始文本的异构性使得段落切分和元数据提取易出错,影响了数据在语义检索和自动问答等下游任务中的可靠性与可用性。
常用场景
经典使用场景
Open India Law数据集作为印度法律领域迄今最为完备的结构化语料库,其经典使用场景聚焦于法律人工智能与计算法学研究。研究者可借助其覆盖自1950年至今的逾1284万条最高法院及高等法院判决、81万条裁判机构裁决以及2.2万部法律及其章节条款,开展法律文本挖掘、判决预测、法律信息检索等任务。该数据集统一的模式规范,将散乱的非结构化法律文书转化为可机读的段落级数据,为构建大规模法律语言模型、法律知识图谱及智能法律助手提供了坚实的数据基座。
解决学术问题
该数据集直面印度法律数据长期分散、格式异构且难以获取的学术痛点,通过整合官方政府来源的裁判文书、立法文本与监管规定,并采用统一的JSONL架构与段落切分方案,有效解决了跨辖区法律数据可比性差、文本清洗成本高昂等问题。其提供的高质量、带出处标注的语料,使得法律实证研究从个案定性分析跃升至全量定量测度成为可能,显著推动了法律计量学、司法行为分析及法律变迁研究的发展。
衍生相关工作
该数据集已催生一系列具有影响力的衍生研究,包括基于其法律文本微调的法律专用语言模型、面向法庭裁决的论证挖掘系统以及跨辖区的法律规范对齐分析。其公布的抓取与清洗流水线代码,成为许多后续法律数据构建项目的参考范式。同时,由于该数据集与AWS开放数据注册处的原始判决PDF相互衔接,后续研究结合原始图像与结构化文本,推动了多模态法律文档理解领域的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务