lexlms/lex_files
收藏资源简介:
LeXFiles是一个新的多样化的英语多国法律语料库,包含了来自6个主要英语法律系统(欧盟、欧洲委员会、加拿大、美国、英国、印度)的立法和判例法,共11个不同的子语料库。该语料库包含约190亿个标记。与Hendersons等人(2022年)发布的“Pile of Law”语料库相比,后者总共有320亿个标记,其中大部分(26/30)子语料库来自美国,因此整个语料库在很大程度上偏向于美国法律系统,特别是联邦或州司法管辖区。
LeXFiles是一个新的多样化的英语多国法律语料库,包含了来自6个主要英语法律系统(欧盟、欧洲委员会、加拿大、美国、英国、印度)的立法和判例法,共11个不同的子语料库。该语料库包含约190亿个标记。与Hendersons等人(2022年)发布的“Pile of Law”语料库相比,后者总共有320亿个标记,其中大部分(26/30)子语料库来自美国,因此整个语料库在很大程度上偏向于美国法律系统,特别是联邦或州司法管辖区。
数据集概述
名称: LeXFiles
语言: 英语(en)
许可: CC-BY-NC-SA-4.0
多语言性: 单语(monolingual)
大小: 1M<n<10M
源数据集: 扩展(extended)
任务类别:
- 文本生成(text-generation)
- 填充掩码(fill-mask)
任务ID:
- 语言建模(language-modeling)
- 掩码语言建模(masked-language-modeling)
标签:
- 法律(legal)
- 法律(law)
数据集详细信息
概述: LeXFiles是一个包含11个不同子语料库的新型多样化英语跨国法律语料库,涵盖了6个主要英语国家的立法和判例法(欧盟、欧洲理事会、加拿大、美国、英国、印度)。该语料库包含约190亿个令牌。
子语料库详情:
| 子语料库名称 | 文档数量 | 令牌数量 | 百分比 |
|---|---|---|---|
| EU Legislation | 93.7K | 233.7M | 1.2% |
| EU Court Decisions | 29.8K | 178.5M | 0.9% |
| ECtHR Decisions | 12.5K | 78.5M | 0.4% |
| UK Legislation | 52.5K | 143.6M | 0.7% |
| UK Court Decisions | 47K | 368.4M | 1.9% |
| Indian Court Decisions | 34.8K | 111.6M | 0.6% |
| Canadian Legislation | 6K | 33.5M | 0.2% |
| Canadian Court Decisions | 11.3K | 33.1M | 0.2% |
| U.S. Court Decisions | 4.6M | 11.4B | 59.2% |
| U.S. Legislation | 518 | 1.4B | 7.4% |
| U.S. Contracts | 622K | 5.3B | 27.3% |
总览:
- 文档总数: 5.8M
- 总令牌数: 18.8B
使用方法: 通过指定子语料库别名加载特定子语料库。
示例: python from datasets import load_dataset
dataset = load_dataset(lexlms/lex_files, name=us-court-cases)
引用: Chalkidis, Ilias et al. "LeXFiles and LegalLAMA: Facilitating English Multinational Legal Language Model Development." Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics. Toronto, Canada, 2023.




