mteb/MultilingualNanoTouche2020Retrieval
收藏资源简介:
MultilingualNanoTouche2020Retrieval是一个多语言文本检索数据集,属于大规模文本嵌入基准(MTEB)的一部分。该数据集基于Touché Task 1: Argument Retrieval for Controversial Questions(争议性问题的论点检索)的NanoTouche2020子集构建,专注于学术领域。数据集涵盖11种语言:阿拉伯语、德语、英语、西班牙语、法语、意大利语、日语、韩语、挪威语、葡萄牙语和瑞典语,每个语言版本包含语料库文本、查询和相关度判断,用于评估多语言文本嵌入模型的检索性能。数据来源于zeta-alpha-ai/NanoTouche2020和LiquidAI/nanobeir-multilingual-extended,测试集包含63,734个样本、539个查询和63,195个文档,平均每个查询有19个相关文档。
MultilingualNanoTouche2020Retrieval is a multilingual text retrieval dataset, part of the Massive Text Embedding Benchmark (MTEB). It is based on a smaller subset of Touché Task 1: Argument Retrieval for Controversial Questions, specifically NanoTouche2020, and focuses on the academic domain. The dataset covers 11 languages: Arabic, German, English, Spanish, French, Italian, Japanese, Korean, Norwegian, Portuguese, and Swedish. Each language version includes a corpus, queries, and relevance judgments (qrels) for evaluating multilingual text embedding models in retrieval tasks. The data is derived from source datasets zeta-alpha-ai/NanoTouche2020 and LiquidAI/nanobeir-multilingual-extended. The test set contains 63,734 samples, 539 queries, and 63,195 documents, with an average of 19 relevant documents per query.




