遇见数据集

awesome-legaltech

收藏
github2026-06-02 更新2026-06-04 收录
官方服务:

资源简介:

这是一个精选的法律科技资源合集,涵盖开源平台、AI模型、MCP服务器、公司、数据集和工具,专门针对全球法律生态系统。合集内容组织为多个类别,包括法律数据API、机器学习数据集与语料库(如预训练语料、法律判决预测、法律文本分类、法律问答、法律摘要和合同分析)、法律AI模型与嵌入、全栈法律平台、法律研究平台等,旨在为法律技术领域提供全面的资源索引和推荐。

This is a curated collection of legal tech resources, covering open-source platforms, AI models, MCP servers, companies, datasets and tools, specifically tailored for the global legal ecosystem. The collection is organized into multiple categories, including legal data APIs, machine learning datasets and corpora (e.g., pre-training corpora, legal judgment prediction, legal text classification, legal question answering, legal summarization and contract analysis), legal AI models and embeddings, full-stack legal platforms, legal research platforms, etc. It aims to provide comprehensive resource indexing and recommendations for the legal technology field.

创建时间:
2026-03-12
原始信息汇总

Awesome Legaltech 数据集详情

该页面是一个精心整理的全球法律技术资源列表,涵盖了开源平台、AI模型、数据集、工具等。以下按类别总结其核心内容:

一、法律数据API

提供程序化访问判例法、法规和法律文件的商用及开源API,覆盖多个司法管辖区:

  • 美国:Vaquill AI API(800万+联邦和州法院意见)、CourtListener REST API(900万+意见)、LegiScan API(50州立法)、Open States API v3、USPTO Open Data Portal API、Regulations.gov API
  • 欧洲:EPO Open Patent Services(OPS)、EUR-Lex Webservice & CELLAR SPARQL
  • 法国:JudiLibre API(法国最高法院)
  • 英国:UK Parliament Open Data API
  • 德国:Bundestag Open Data
  • 全球:The Lens Patent & Scholarly API(1.4亿+专利记录)

二、机器学习数据集与语料库

按任务类型组织的法律文本数据集,多数对研究开放:

1. 数据提取与处理工具

  • 美国:Juriscraper(爬虫)、Eyecite(引文提取)
  • 英国:Blackstone(spaCy NLP管道)
  • 法国:French Legal Case Anonymization(匿名化)
  • 印度:Opennyai(NLP管道)
  • 通用:LegalCrawler、ContextGem(基于LLM的提取)、CiteURL(引文解析器)

2. 预训练语料库与批量数据

  • 多语言:MultiLegalPile(689GB,24种语言)、LeXFiles(190亿token)、JRC-Acquis、EUR-Lex
  • 美国:Pile of Law(~256GB)、CourtListener Bulk Data(900万+)、Caselaw Access Project(690万判决)、RECAP Archive、HUPD(450万+专利)
  • 印度:Indian Kanoon Dataset、IL-TUR(17.6万文档)
  • 澳大利亚:Open Australian Legal Corpus
  • 日本:gitlaw-jp
  • 全球:S2ORC(法律子集)、Oyez Project Audio、WIPO Lex、SSRN、OpenAlex

3. 法律判决预测(LJP)

  • 中国:CAIL2018(260万案件)
  • 欧洲人权法院:ECtHR Dataset(1.1万案件)
  • 印度:ILDC(3.4万案件)、NyayaAnumana(70万+)、CaseSumm、IndianBailJudgments-1200
  • 美国:The Supreme Court Database(1791年至今)

4. 法律文本分类

  • 多语言:LexGLUE(7任务基准)
  • 美国:LEDGAR(6万+合同条款)、CUAD(510份合同,41种条款)
  • 瑞士:AsyLex(5.9万文档)

5. 法律问答

  • 美国:CaseHOLD(5.3万多选题)
  • 国际:COLIEE(加拿大/日本法律)
  • 中国:JEC-QA(2.6万司考题目)

6. 法律摘要

  • 美国:BillSum(2.2万法案摘要)、Multi-LexSum、mteb/legal_summarization
  • 欧盟:EUR-Lex Sum(24种语言)
  • 印度/英国:IN-Abs / UK-Abs
  • 瑞士:Swiss Judgment Summarization(约1.8万裁决)

7. 法律语义搜索与信息检索

  • 美国:opinions-synthetic-query-512、LexTREC、CLERC
  • 多语言:Massive Legal Embedding Benchmark (MLEB)
  • 德国:german_legal_sentences
  • 巴西:JurisTCU(1.6万文档)

8. 合同分析

  • CUAD(合同条款提取基准)、MAUD(并购合同理解,3.9万问题)、ToS;DR(服务条款评分)、ContractNLI(非公开协议自然语言推理)

三、法律AI模型与嵌入

1. 大型语言模型(LLMs)

  • 英语:SaulLM-7B/54B/141B(30B+法律token预训练)、Lawma-8B/70B、AdaptLLM/law-LLM/law-chat、SL-Llama-3.2-1b
  • 印度英语:InLegalBERT(540万文档)、Aalap-Mistral-7B、NyayaSahayak
  • 中文:ChatLaw(北大,3万+法律数据集)、DISC-LawLLM(复旦,Apache 2.0)、InternLM-Law、Lawyer-LLaMA、Fuzi.Mingcha
  • 印尼语:Pasal.id(Claude + RAG)

2. 嵌入与BERT风格模型

  • voyage-law-2:闭源法律文本检索嵌入模型(API形式)
搜集汇总
数据集介绍
awesome-legaltech 数据集图片
构建方式
在数字化浪潮席卷法律行业的当下,法律科技(Legaltech)正通过技术手段重塑法律服务的提供方式、自动化法律工作并提升司法可及性。Awesome Legaltech 数据集正是这一变革的结晶,它并非传统意义上的单一数据集,而是一个精心编纂的资源索引库。其构建方式遵循了开源社区中广受欢迎的“Awesome List”模式,通过系统性地梳理全球法律科技生态,将分散的优质资源进行结构化整合。该列表涵盖了从API接口、机器学习数据集、AI模型到商业平台等数十个类别,每个条目均附有详细的描述、来源链接及适用场景,旨在为研究者、开发者和法律从业者提供一个一站式的导航工具。
使用方法
使用者可以根据自身需求,通过该数据集的分类目录快速定位目标资源。例如,研究者若需进行法律语义搜索实验,可直接索引至“Legal Semantic Search & Information Retrieval”部分,获取如opinions-synthetic-query-512或LexTREC等标注数据;开发者若需集成法律API,则可从“APIs for Legal Data”中挑选CourtListener或Vaquill AI等接口。每个条目均提供了直接链接或Hugging Face数据集地址,用户可便捷地下载或通过API调用使用。此外,该列表还提供了MCP服务器、文档自动化工具等实用资源,支持从模型训练到系统部署的全流程开发。
背景与挑战
背景概述
法律科技(Legaltech)作为技术驱动法律服务的交叉领域,近年来随着人工智能与大数据技术的深度融合而蓬勃发展。该领域的研究聚焦于利用自然语言处理、机器学习等手段,实现法律文本的自动化分析、判决预测、合同审查及法律检索等核心任务。在此背景下,awesome-legaltech数据集应运而生,由开源社区维护,系统性地汇集了全球法律科技领域的优质资源,涵盖开放平台、AI模型、数据集、工具及商业平台等。该数据集的核心研究问题在于构建一个结构化、可扩展的法律科技资源索引,以促进学术研究与产业应用的协同发展。自创建以来,它已成为法律人工智能领域的重要参考基准,对推动法律文本理解、信息检索及知识图谱构建等方向具有显著影响力。
当前挑战
该数据集所面临的挑战主要体现在两个层面。首先,在领域问题层面,法律文本具有高度专业化、结构复杂且语义严谨的特点,导致现有模型在判决预测、法律问答等任务中面临数据稀疏性与长文本建模的难题,同时不同法域(如大陆法系与英美法系)的差异进一步增加了跨域泛化的难度。其次,在构建过程中,资源的持续维护与更新是一大挑战,因为法律数据源(如判例、法规)具有动态演变特性,需定期同步与去重;此外,不同来源的数据格式异构、标注标准不统一,以及版权与隐私限制,均对数据集的质量控制与扩展性构成了显著障碍。
常用场景
经典使用场景
在法律科技领域,该数据集最为经典的使用场景集中于构建和评估面向法律文本的机器学习模型。研究人员常利用其收录的判例法、法规及合同语料,开展诸如法律判决预测(LJP)、法律文本分类、法律问答(QA)以及法律摘要生成等核心任务。通过诸如LexGLUE、CaseHOLD、CUAD等标准化基准,研究者得以在统一框架下对比不同模型在理解法律文书、预测司法结果及提取关键条款方面的性能。这些场景不仅验证了自然语言处理技术在法律领域的适用性,也为后续更复杂的法律推理系统奠定了数据与评估基础。
解决学术问题
该数据集体系系统地回应了法律人工智能领域的若干关键学术挑战。首先,它解决了法律文本领域标注数据匮乏与任务碎片化的问题,通过提供多任务、多语言、多司法管辖区的结构化语料,使得跨任务迁移学习与多语言法律建模成为可能。其次,它直面法律推理中的可解释性困境,例如ILDC与NyayaAnumana等数据集不仅要求预测判决结果,更强调提供判决依据,推动了可解释法律AI的发展。此外,通过构建如LexGLUE等综合性评估基准,该数据集为衡量模型在法律逻辑、语境理解与知识检索等维度的能力提供了标准化工具,从而促进了法律NLP研究从简单分类向复杂推理的范式演进。
实际应用
在实际应用中,该数据集衍生出的模型与工具已深度嵌入法律服务的多个环节。在合同审查领域,基于CUAD与MAUD训练的模型能够自动识别并购协议中的关键条款并标记潜在风险,显著提升法务团队的工作效率。在法律检索场景中,利用CourtLister与Vaquill AI API等资源构建的语义搜索引擎,使律师能够通过自然语言而非关键词精准定位相关判例与法规。此外,在消费者法律服务领域,如ChatLaw与Aalap-Mistral等模型被部署为智能法律助手,为公众提供初步的法律咨询与文书起草支持,从而在一定程度上缓解了法律服务资源分配不均的问题,推动了法律服务的普惠化。
数据集最近研究
最新研究方向
当前法律科技领域的前沿研究正加速向大语言模型(LLM)与检索增强生成(RAG)深度融合的方向演进,以SaulLM、Lawma、InternLM-Law等为代表的法律专用LLM不断涌现,通过在海量判例、法规与合同语料上进行领域预训练与指令微调,显著提升了法律文本理解、判决预测、合同审查等核心任务的性能。同时,多语言与跨法域语料库的构建成为研究热点,如MultiLegalPile、LeXFiles等大规模预训练语料覆盖数十种语言与司法体系,为打破语言壁垒、推动全球法律AI的普惠化奠定了数据基础。此外,以CUAD、MAUD为代表的合同分析数据集与LexGLUE、IL-TUR等综合评测基准的完善,正推动模型从实验室走向实务场景,尤其在电子取证、合规审查与公益法律服务中展现出巨大潜力,深刻重塑着法律服务的可及性与效率。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务