awesome-legaltech
收藏资源简介:
这是一个精选的法律科技资源合集,涵盖开源平台、AI模型、MCP服务器、公司、数据集和工具,专门针对全球法律生态系统。合集内容组织为多个类别,包括法律数据API、机器学习数据集与语料库(如预训练语料、法律判决预测、法律文本分类、法律问答、法律摘要和合同分析)、法律AI模型与嵌入、全栈法律平台、法律研究平台等,旨在为法律技术领域提供全面的资源索引和推荐。
This is a curated collection of legal tech resources, covering open-source platforms, AI models, MCP servers, companies, datasets and tools, specifically tailored for the global legal ecosystem. The collection is organized into multiple categories, including legal data APIs, machine learning datasets and corpora (e.g., pre-training corpora, legal judgment prediction, legal text classification, legal question answering, legal summarization and contract analysis), legal AI models and embeddings, full-stack legal platforms, legal research platforms, etc. It aims to provide comprehensive resource indexing and recommendations for the legal technology field.
Awesome Legaltech 数据集详情
该页面是一个精心整理的全球法律技术资源列表,涵盖了开源平台、AI模型、数据集、工具等。以下按类别总结其核心内容:
一、法律数据API
提供程序化访问判例法、法规和法律文件的商用及开源API,覆盖多个司法管辖区:
- 美国:Vaquill AI API(800万+联邦和州法院意见)、CourtListener REST API(900万+意见)、LegiScan API(50州立法)、Open States API v3、USPTO Open Data Portal API、Regulations.gov API
- 欧洲:EPO Open Patent Services(OPS)、EUR-Lex Webservice & CELLAR SPARQL
- 法国:JudiLibre API(法国最高法院)
- 英国:UK Parliament Open Data API
- 德国:Bundestag Open Data
- 全球:The Lens Patent & Scholarly API(1.4亿+专利记录)
二、机器学习数据集与语料库
按任务类型组织的法律文本数据集,多数对研究开放:
1. 数据提取与处理工具
- 美国:Juriscraper(爬虫)、Eyecite(引文提取)
- 英国:Blackstone(spaCy NLP管道)
- 法国:French Legal Case Anonymization(匿名化)
- 印度:Opennyai(NLP管道)
- 通用:LegalCrawler、ContextGem(基于LLM的提取)、CiteURL(引文解析器)
2. 预训练语料库与批量数据
- 多语言:MultiLegalPile(689GB,24种语言)、LeXFiles(190亿token)、JRC-Acquis、EUR-Lex
- 美国:Pile of Law(~256GB)、CourtListener Bulk Data(900万+)、Caselaw Access Project(690万判决)、RECAP Archive、HUPD(450万+专利)
- 印度:Indian Kanoon Dataset、IL-TUR(17.6万文档)
- 澳大利亚:Open Australian Legal Corpus
- 日本:gitlaw-jp
- 全球:S2ORC(法律子集)、Oyez Project Audio、WIPO Lex、SSRN、OpenAlex
3. 法律判决预测(LJP)
- 中国:CAIL2018(260万案件)
- 欧洲人权法院:ECtHR Dataset(1.1万案件)
- 印度:ILDC(3.4万案件)、NyayaAnumana(70万+)、CaseSumm、IndianBailJudgments-1200
- 美国:The Supreme Court Database(1791年至今)
4. 法律文本分类
- 多语言:LexGLUE(7任务基准)
- 美国:LEDGAR(6万+合同条款)、CUAD(510份合同,41种条款)
- 瑞士:AsyLex(5.9万文档)
5. 法律问答
- 美国:CaseHOLD(5.3万多选题)
- 国际:COLIEE(加拿大/日本法律)
- 中国:JEC-QA(2.6万司考题目)
6. 法律摘要
- 美国:BillSum(2.2万法案摘要)、Multi-LexSum、mteb/legal_summarization
- 欧盟:EUR-Lex Sum(24种语言)
- 印度/英国:IN-Abs / UK-Abs
- 瑞士:Swiss Judgment Summarization(约1.8万裁决)
7. 法律语义搜索与信息检索
- 美国:opinions-synthetic-query-512、LexTREC、CLERC
- 多语言:Massive Legal Embedding Benchmark (MLEB)
- 德国:german_legal_sentences
- 巴西:JurisTCU(1.6万文档)
8. 合同分析
- CUAD(合同条款提取基准)、MAUD(并购合同理解,3.9万问题)、ToS;DR(服务条款评分)、ContractNLI(非公开协议自然语言推理)
三、法律AI模型与嵌入
1. 大型语言模型(LLMs)
- 英语:SaulLM-7B/54B/141B(30B+法律token预训练)、Lawma-8B/70B、AdaptLLM/law-LLM/law-chat、SL-Llama-3.2-1b
- 印度英语:InLegalBERT(540万文档)、Aalap-Mistral-7B、NyayaSahayak
- 中文:ChatLaw(北大,3万+法律数据集)、DISC-LawLLM(复旦,Apache 2.0)、InternLM-Law、Lawyer-LLaMA、Fuzi.Mingcha
- 印尼语:Pasal.id(Claude + RAG)
2. 嵌入与BERT风格模型
- voyage-law-2:闭源法律文本检索嵌入模型(API形式)




