MuPLeR-retrieval
收藏资源简介:
MuPLeR-retrieval 是一个多语言并行法律检索数据集,专为评估检索和跨语言检索任务而设计。数据集包含来自欧盟DGT-Acquis语料库的10,000条人工翻译的平行法律段落(每种语言)和200条合成的平行查询(覆盖14种欧洲语言)。该数据集属于法律领域,适用于文本检索任务。数据经过严格的清洗、分块、去重和语义对齐处理,确保高质量和跨语言一致性。数据集支持的语言包括英语、法语、斯洛文尼亚语、意大利语、波兰语、芬兰语、荷兰语、葡萄牙语、瑞典语、斯洛伐克语、拉脱维亚语、立陶宛语、希腊语和西班牙语。
MuPLeR-retrieval is a multilingual parallel legal retrieval dataset specifically designed for evaluating retrieval and cross-language retrieval tasks. The dataset contains 10,000 manually translated parallel legal paragraphs (per language) from the EU DGT-Acquis corpus, as well as 200 synthetic parallel queries covering 14 European languages. It belongs to the legal domain and is applicable to text retrieval tasks. The data has undergone rigorous cleaning, chunking, deduplication and semantic alignment processing to ensure high quality and cross-linguistic consistency. The languages supported by the dataset include English, French, Slovenian, Italian, Polish, Finnish, Dutch, Portuguese, Swedish, Slovak, Latvian, Lithuanian, Greek and Spanish.
MuPLeR-retrieval 数据集概述
基本信息
- 数据集名称:MuPLeR-retrieval
- 任务类别:文本检索
- 领域:法律
- 多语言性:多语言
- 许可证:eupl-1.2
- 标注创建者:LM-generated and reviewed
- 源数据集:eherra/MuPLeR-retrieval
语言覆盖
数据集涵盖以下14种欧洲语言:
- 希腊语 (ell)
- 英语 (eng)
- 芬兰语 (fin)
- 法语 (fra)
- 意大利语 (ita)
- 拉脱维亚语 (lav)
- 立陶宛语 (lit)
- 荷兰语 (nld)
- 波兰语 (pol)
- 葡萄牙语 (por)
- 斯洛伐克语 (slk)
- 斯洛文尼亚语 (slv)
- 西班牙语 (spa)
- 瑞典语 (swe)
数据集构成与规模
数据集为每种语言包含三个独立的配置:语料库、查询和相关性判断。
语料库配置
每种语言的语料库包含10,000个测试集样本,每个样本具有以下特征:
id(字符串)text(字符串)title(字符串)
各语言语料库具体规模:
- 希腊语 (el-corpus):13,691,971字节
- 英语 (en-corpus):6,684,520字节
- 西班牙语 (es-corpus):7,649,144字节
- 芬兰语 (fi-corpus):7,299,865字节
- 法语 (fr-corpus):7,893,805字节
- 意大利语 (it-corpus):7,480,260字节
- 立陶宛语 (lt-corpus):6,751,646字节
- 拉脱维亚语 (lv-corpus):6,834,219字节
- 荷兰语 (nl-corpus):7,352,444字节
- 波兰语 (pl-corpus):7,407,578字节
- 葡萄牙语 (pt-corpus):7,452,692字节
- 斯洛伐克语 (sk-corpus):7,079,534字节
- 斯洛文尼亚语 (sl-corpus):6,395,786字节
- 瑞典语 (sv-corpus):7,019,496字节
查询配置
每种语言的查询集包含200个测试集样本,每个样本具有以下特征:
id(字符串)text(字符串)
各语言查询集具体规模:
- 希腊语 (el-queries):61,088字节
- 英语 (en-queries):35,801字节
- 西班牙语 (es-queries):36,601字节
- 芬兰语 (fi-queries):42,267字节
- 法语 (fr-queries):38,059字节
- 意大利语 (it-queries):37,113字节
- 立陶宛语 (lt-queries):39,171字节
- 拉脱维亚语 (lv-queries):39,592字节
- 荷兰语 (nl-queries):38,449字节
- 波兰语 (pl-queries):39,189字节
- 葡萄牙语 (pt-queries):36,858字节
- 斯洛伐克语 (sk-queries):38,572字节
- 斯洛文尼亚语 (sl-queries):36,706字节
- 瑞典语 (sv-queries):38,793字节
相关性判断配置
每种语言的相关性判断集包含200个测试集样本,每个样本具有以下特征:
query-id(字符串)corpus-id(字符串)score(int64)
所有语言的相关性判断集规模均为11,176字节。
数据来源与处理
- 原始语料:欧盟委员会的DGT-Acquis语料库(段落级别,2004-2011年)
- 语料参考:An Overview of the European Unions Highly Multilingual Parallel Corpora (https://link.springer.com/article/10.1007/s10579-014-9277-0)
- 数据处理流程:
- 文本文件提取
- 文本清理
- 句子分割与分块(60-150词,最多5句)
- 去重(98%模糊匹配阈值)
- 语言检测
- 余弦相似度对齐(≥0.75)
- 最终选择(每种语言10,000个段落)
- 合成查询生成(使用LlamaIndex和GPT-5-mini)
- 跨语言查询验证(余弦相似度≥0.80)
最终数据集组成
- 14种语言 × 10,000个平行上下文块
- 14种语言 × 200个合成查询,映射到相应段落
评估方法
可通过MTEB(Massive Text Embedding Benchmark)库进行评估: python import mteb task = mteb.get_task("MuPLeR-retrieval") evaluator = mteb.MTEB([task]) model = mteb.get_model(YOUR_MODEL) evaluator.run(model)
相关资源
- MTEB GitHub仓库:https://github.com/embeddings-benchmark/mteb
- DGT-Acquis语料库网站:https://joint-research-centre.ec.europa.eu/language-technology-resources/dgt-acquis_en
- DGT-Acquis研究论文:https://joint-research-centre.ec.europa.eu/document/download/5943acfd-6edb-4955-84cc-4ad21071e538_en?filename=2014_08_LRE-Journal_JRC-Linguistic-Resources_Manuscript.pdf




