mteb/MultilingualNanoNFCorpusRetrieval
收藏资源简介:
MultilingualNanoNFCorpusRetrieval 是一个多语言文本检索数据集,属于大规模文本嵌入基准(MTEB)的一部分。该数据集基于NanoNFCorpus,后者是NFCorpus(一个用于医学信息检索的全文本学习排序数据集)的较小子集。数据集涵盖医学、学术和书面文本领域,支持11种语言:阿拉伯语、德语、英语、法语、意大利语、日语、韩语、挪威语、葡萄牙语、西班牙语和瑞典语。每个语言配置包括语料库(包含文档文本)、查询(用于检索的问题或关键词)和相关度判断(标识查询与文档之间的相关性分数)。数据集的测试集包含33033个样本,其中550个查询和32483个文档,平均文档长度约为1451.7个字符,平均查询长度约为23.0个字符,每个查询平均有50.36个相关文档。该数据集适用于评估多语言嵌入模型在文本检索任务上的性能。
MultilingualNanoNFCorpusRetrieval is a multilingual text retrieval dataset that is part of the Massive Text Embedding Benchmark (MTEB). It is based on NanoNFCorpus, a smaller subset of NFCorpus: A Full-Text Learning to Rank Dataset for Medical Information Retrieval. The dataset covers domains such as medical, academic, and written texts, and supports 11 languages: Arabic, German, English, French, Italian, Japanese, Korean, Norwegian, Portuguese, Spanish, and Swedish. Each language configuration includes a corpus (containing document texts), queries (questions or keywords for retrieval), and relevance judgments (scores indicating the relevance between queries and documents). The test set of the dataset contains 33,033 samples, with 550 queries and 32,483 documents, an average document length of approximately 1,451.7 characters, an average query length of about 23.0 characters, and an average of 50.36 relevant documents per query. This dataset is suitable for evaluating the performance of multilingual embedding models on text retrieval tasks.




