遇见数据集

mteb/MultilingualNanoQuoraRetrieval

收藏
Hugging Face2026-06-21 更新2026-07-22 收录
官方服务:

资源简介:

MultilingualNanoQuoraRetrieval是一个多语言文本检索数据集,属于大规模文本嵌入基准(MTEB)。该数据集是QuoraRetrieval数据集的一个较小子集,基于Quora平台上被标记为重复的问题构建。核心任务是在给定一个问题的情况下,从语料库中检索出其他语义相同或相似的重复问题。数据集覆盖11种语言:阿拉伯语、德语、英语、西班牙语、法语、意大利语、日语、韩语、挪威语、葡萄牙语和瑞典语。每种语言都包含三个部分:语料库(corpus,即文档集合)、查询(queries,即问题)和相关性判断(qrels,即查询与文档的匹配关系)。该数据集主要用于评估多语言文本嵌入模型在跨语言检索任务上的性能,特别适用于社交领域的问题去重和语义匹配场景。

MultilingualNanoQuoraRetrieval is a multilingual text retrieval dataset belonging to the Massive Text Embedding Benchmark (MTEB). It is a smaller subset of the QuoraRetrieval dataset, constructed based on questions marked as duplicates on the Quora platform. Its core task is to retrieve semantically identical or similar duplicate questions from the corpus given a query question. The dataset covers 11 languages: Arabic, German, English, Spanish, French, Italian, Japanese, Korean, Norwegian, Portuguese, and Swedish. Each language contains three components: corpus (document collection), queries (i.e., target questions), and qrels (query-document relevance matching relationships). This dataset is primarily used to evaluate the performance of multilingual text embedding models on cross-lingual retrieval tasks, and is particularly suitable for question deduplication and semantic matching scenarios in the social domain.

提供机构:
mteb
搜集汇总
数据集介绍
mteb/MultilingualNanoQuoraRetrieval 数据集图片
构建方式
在信息检索与多语言嵌入模型的评估领域中,MultilingualNanoQuoraRetrieval数据集应运而生。该数据集基于Quora平台上标记为重复的问题对构建,源自NanoQuoraRetrieval的轻量级子集,并通过LiquidAI/nanobeir-multilingual-extended的翻译扩展技术,将原始英文语料迁移至阿拉伯语、德语、法语、意大利语、日语等11种语言。每个语言版本均包含由5046个文档组成的语料库、50条查询及相关性判定文件,确保多语言检索任务的标准化与可复现性。
特点
该数据集的核心特点在于其多语言覆盖与轻量化设计。语料涵盖从印欧语系到日韩语的广泛语言谱系,每个语言子集保持一致的样本规模(5046个文档)与查询数量(50条),便于跨语言性能的横向对比。数据集聚焦于社交领域的重复问题检索任务,平均每个查询对应1.4个相关文档,最大相关数可达6个,体现真实场景中语义匹配的多样性。所有数据均采用CC-BY-4.0许可,并集成至MTEB基准框架,支持公平的模型评估。
使用方法
研究者可通过MTEB工具库便捷地调用该数据集进行评估。具体而言,使用`mteb.get_task("MultilingualNanoQuoraRetrieval")`加载任务,并通过`mteb.evaluate(model, task)`接口直接评测嵌入模型的检索性能。数据集按语言划分为独立的配置项(如ar-corpus、en-queries等),支持按需加载特定语言的语料、查询及相关性文件。其标准化结构兼容HuggingFace Datasets库,允许用户通过`load_dataset`指定配置名称进行细粒度访问,从而适配多元化的实验方案。
背景与挑战
背景概述
MultilingualNanoQuoraRetrieval数据集诞生于多语言文本嵌入表示学习蓬勃发展的背景下,由MTEB(Massive Text Embedding Benchmark)社区基于Quora平台上的重复问题对数据构建而成,旨在评估跨语言文本检索模型的性能。该数据集源自2017年Kaggle竞赛中发布的Quora Question Pairs数据集,后经NanoQuoraRetrieval与LiquidAI的多语言扩展项目整合,覆盖阿拉伯语、德语、英语、法语、意大利语、日语、韩语、挪威语、葡萄牙语、西班牙语和瑞典语共11种语言。其核心研究问题在于,面对语义等价但语言各异的查询与文档,模型能否准确捕捉跨语言的对齐关系,从而推动多语言密集检索技术的评测标准与基准提升。数据集通过MTEB框架被广泛采用,成为衡量多语言嵌入模型在社交领域文本检索任务上表现的重要标尺。
当前挑战
该数据集所解决的领域问题聚焦于跨语言语义检索中的核心挑战:如何在多种语言环境下准确识别问题间的语义重复或关联,克服单语数据集在全球化应用中的局限性。构建过程中面临三重困难:其一,原始Quora数据以英语为主,需借助机器翻译或平行语料扩充至其他语言,可能引入翻译噪声与语义漂移;其二,各语言语料库规模与质量不均衡,如日语语料字符数达53.6万,而阿拉伯语仅58.2万,导致评测偏差;其三,查询与文档的标注稀疏性凸显——测试集仅有50条查询对应70条相关文档对,且每个查询平均仅1.4个相关项,对模型区分细粒度语义差异构成严峻考验,加剧了过拟合与泛化性能评估的复杂性。
常用场景
经典使用场景
在跨语言文本检索领域,MultilingualNanoQuoraRetrieval 数据集被广泛用于评估和训练文本嵌入模型。该数据集源自 Quora 问题对数据集,通过筛选标记为重复的问题对构建检索任务,并经过多语言扩展,涵盖了阿拉伯语、德语、英语、法语、意大利语、日语、韩语、挪威语、葡萄牙语、西班牙语和瑞典语等 11 种语言。经典使用场景是作为 MTEB(大规模文本嵌入基准)的子任务,用于衡量模型在跨语言、跨领域场景下,从给定语料库中检索与查询问题语义相似或重复问题的能力。研究者利用该数据集测试模型对多语言语义理解、跨语言对齐和细粒度文本匹配的性能,为开发更鲁棒的多语言文本嵌入系统提供标准化的评估平台。
衍生相关工作
MultilingualNanoQuoraRetrieval 数据集衍生了一系列重要的学术工作和开源项目,最具代表性的是其作为 MMTEB(大规模多语言文本嵌入基准)核心组件的一部分。MMTEB 系统性地整合了多语言检索、分类、聚类等多种任务的评估数据集,为多语言嵌入模型的标准化评测奠定了基础。受此启发,研究者开发了如 Sentence-BERT 的多语言变体、XLM-R 等跨语言预训练模型,并通过该数据集验证其检索性能。此外,该数据集还催生了针对低资源语言的嵌入增强方法,以及基于对比学习的跨语言表示学习技术。这些工作共同推动了多语言 NLP 生态的繁荣,并为后续的多语言信息检索研究提供了可复用的基准和灵感源泉。
数据集最近研究
最新研究方向
MultilingualNanoQuoraRetrieval 数据集聚焦于多语言文本检索任务的前沿探索,其核心价值在于应对跨语言语义匹配的挑战。该数据集基于 Quora 问题对中的重复问题构建,通过扩展至包括阿拉伯语、德语、法语等在内的十一种语言环境,为评估多语言嵌入模型的跨语言泛化能力提供了标准化基准。在自然语言处理领域,随着多语言模型(如 XLM-R 和 mBERT)的广泛应用,该数据集成为检验模型在异构语言间进行精准检索与语义对齐的重要工具。其引入的 MTEB(大规模文本嵌入基准)框架,更推动了多语言检索系统的公平性比较,对于构建全球化的智能问答与信息检索系统具有里程碑式的意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务