mteb/MultilingualNanoSciFactRetrieval
收藏资源简介:
MultilingualNanoSciFactRetrieval是一个多语言科学事实检索数据集,属于大规模文本嵌入基准(MTEB)的一部分。该数据集基于NanoSciFact构建,后者是SciFact的一个较小子集,旨在通过研究文献中的科学论文摘要来验证科学主张。数据集涵盖多个语言(包括阿拉伯语、德语、英语、法语、意大利语、日语、韩语、挪威语、葡萄牙语、西班牙语和瑞典语),每个语言配置包含语料库(corpus)、查询(queries)和相关度判断(qrels),用于文本检索任务,特别适用于事实核查和科学信息检索。数据集适用于学术、医学和书面材料领域,支持多语言文本嵌入模型的评估。
MultilingualNanoSciFactRetrieval is a multilingual scientific fact retrieval dataset, part of the Massive Text Embedding Benchmark (MTEB). It is based on NanoSciFact, a smaller subset of SciFact, which verifies scientific claims using evidence from research literature containing scientific paper abstracts. The dataset covers multiple languages (including Arabic, German, English, French, Italian, Japanese, Korean, Norwegian, Portuguese, Spanish, and Swedish), with each language configuration containing a corpus, queries, and relevance judgments (qrels) for text retrieval tasks, particularly suited for fact-checking and scientific information retrieval. It is applicable in academic, medical, and written material domains, supporting the evaluation of multilingual text embedding models.




