mteb/MultilingualNanoNQRetrieval
收藏资源简介:
MultilingualNanoNQRetrieval是一个用于大规模文本嵌入基准(MTEB)的多语言数据集。NanoNQ是数据集的较小子集,包含来自真实用户的问题,要求问答系统阅读并理解整个维基百科文章(这些文章可能包含或不包含问题的答案)。该数据集适用于文本检索(文本到文本)任务,领域涵盖学术和网络。它基于源数据集zeta-alpha-ai/NanoNQ和LiquidAI/nanobeir-multilingual-extended构建,支持包括阿拉伯语、德语、英语、法语、意大利语、日语、韩语、挪威语、葡萄牙语、西班牙语和瑞典语在内的多种语言。
MultilingualNanoNQRetrieval is an MTEB dataset. NanoNQ is a smaller subset of a dataset which contains questions from real users, and it requires QA systems to read and comprehend an entire Wikipedia article that may or may not contain the answer to the question. The task category is Retrieval (text-to-text), with domains in Academic and Web. It is derived from source datasets zeta-alpha-ai/NanoNQ and LiquidAI/nanobeir-multilingual-extended, and supports multiple languages including Arabic, German, English, Spanish, French, Italian, Japanese, Korean, Norwegian, Portuguese, and Swedish.




