AUEB-NLP/ecthr_cases
收藏资源简介:
该数据集是关于欧洲人权法院(ECtHR)案件的文本分类数据集,包含了11,000个案件。数据集涵盖了案件的事实、被指控违反的条款、法院判决的违反条款以及相关的理由。数据集支持多标签文本分类任务,包括被指控违反条款的预测和实际违反条款的预测,以及理由提取任务。数据集的所有文档均为英文,且数据集的创建者包括Ilias Chalkidis和Dimitris Tsarapatsanis。数据集的使用遵循CC BY-NC-SA 4.0许可。
This is a text classification dataset focused on cases from the European Court of Human Rights (ECtHR), consisting of 11,000 case records. The dataset covers case facts, alleged violated articles, the court's adjudicated violated articles, and relevant justifications. It supports multi-label text classification tasks, including prediction of alleged violated articles and prediction of actual adjudicated violated articles, as well as justification extraction tasks. All documents in the dataset are in English. The dataset was created by Ilias Chalkidis and Dimitris Tsarapatsanis, and its use follows the CC BY-NC-SA 4.0 license.
数据集概述
名称: European Court of Human Rights Cases
别名: ECtHR cases dataset
语言: 英语 (en)
许可证: CC-BY-NC-SA-4.0
多语言性: 单语
大小类别: 10K<n<100K
源数据集: 原始
任务类别: 文本分类
任务ID: 多标签分类 (multi-label-classification)
论文代码ID: ecthr
标签: rationale-extraction, legal-judgment-prediction
数据集结构
数据实例
- 事实 (facts): 案件的事实描述,以段落形式呈现。
- 标签 (labels): 讨论的欧洲人权公约条款(被指控违反的条款)。
- 银色理由 (silver_rationales): 法院评估中提及的案件事实段落的索引。
- 金色理由 (gold_rationales): 法律专家标注的,支持指控违反条款的案件事实段落的索引。
数据字段
- 事实 (facts): 列表[字符串],案件段落(事实)。
- 标签 (labels): 列表[字符串],讨论的ECHR条款(被指控违反的条款);或法院判定违反的ECHR条款。
- 银色理由 (silver_rationales): 列表[整数],法院评估中提及的段落(事实)的索引。
- 金色理由 (gold_rationales): 列表[整数],支持指控违反的段落(事实)的索引,由法律专家标注。
数据分割
| 分割 | ECtHR案件数量 | 银色理由比例 | 平均指控/案件 |
|---|---|---|---|
| 训练 | 9,000 | 24% | 1.8 |
| 开发 | 1,000 | 30% | 1.7 |
| 测试 | 1,000 | 31% | 1.7 |
数据集创建
- 注释创建者: 专家生成, 发现
- 语言创建者: 发现
- 金标理由注释者: Dimitris Tsarapatsanis (York Law School讲师)
支持的任务和排行榜
- 指控违反预测 (alleged-violation-prediction): 多标签文本分类任务,根据ECtHR案件的事实,模型预测申请人指控违反的40个可违反ECHR条款。
- 违反预测 (violation-prediction): 多标签文本分类任务,根据ECtHR案件的事实,模型预测法院判定违反的被指控违反的ECHR条款。
- 理由提取: 模型还可以预测支持其分类任务决策的案件事实。银色理由可用于两个分类任务,而金色理由仅专注于指控违反预测任务。




