遇见数据集

mteb/MultilingualNanoNQRetrieval

收藏
Hugging Face2026-06-21 更新2026-07-22 收录
官方服务:

资源简介:

MultilingualNanoNQRetrieval是一个用于大规模文本嵌入基准(MTEB)的多语言数据集。NanoNQ是数据集的较小子集,包含来自真实用户的问题,要求问答系统阅读并理解整个维基百科文章(这些文章可能包含或不包含问题的答案)。该数据集适用于文本检索(文本到文本)任务,领域涵盖学术和网络。它基于源数据集zeta-alpha-ai/NanoNQ和LiquidAI/nanobeir-multilingual-extended构建,支持包括阿拉伯语、德语、英语、法语、意大利语、日语、韩语、挪威语、葡萄牙语、西班牙语和瑞典语在内的多种语言。

MultilingualNanoNQRetrieval is an MTEB dataset. NanoNQ is a smaller subset of a dataset which contains questions from real users, and it requires QA systems to read and comprehend an entire Wikipedia article that may or may not contain the answer to the question. The task category is Retrieval (text-to-text), with domains in Academic and Web. It is derived from source datasets zeta-alpha-ai/NanoNQ and LiquidAI/nanobeir-multilingual-extended, and supports multiple languages including Arabic, German, English, Spanish, French, Italian, Japanese, Korean, Norwegian, Portuguese, and Swedish.

提供机构:
mteb
搜集汇总
数据集介绍
mteb/MultilingualNanoNQRetrieval 数据集图片
构建方式
MultilingualNanoNQRetrieval数据集在构建上采用了一种精巧的跨语言迁移策略。该数据集以源自真实用户搜索查询的英文自然问答子集NanoNQ为基础,通过结合多语言扩展语料库LiquidAI/nanobeir-multilingual-extended,将原始的英文检索任务翻译并扩展至涵盖阿拉伯语、德语、法语、意大利语、日语、韩语、挪威语、葡萄牙语、西班牙语和瑞典语在内的十一种语言。每一个语言配置下都包含三个核心组件:语料库、查询集以及相关性判断文件,从而构成了一个完整的、可复用的多语言文本检索评估框架。
特点
该数据集最显著的特点在于其面向多语言检索评测的精细化设计。每个语言配置均包含5035篇文档构成的语料库、50个真实用户查询以及57条相关性标注,确保了评估的全面性与一致性。数据集隶属于Massive Text Embedding Benchmark(MTEB)体系,专为衡量文本嵌入模型在跨语言环境下的检索性能而生。其统计数据显示,测试集中总计包含55935个样本、550个查询与55385篇文档,平均每篇文档约含492个字符,查询则平均长度为48个字符,展现了真实的问答检索场景分布。
使用方法
该数据集的使用高度集成在MTEB框架内,研究者可通过简洁的Python代码直接调用。用户仅需通过mteb.get_task("MultilingualNanoNQRetrieval")获取任务实例,加载预训练的文本嵌入模型,随后调用mteb.evaluate(model, task)即可完成自动评估流程。此外,数据集提供了丰富的统计接口,允许用户通过task.metadata.descriptive_stats获取详细的评估数据分布特征,便于进行深入分析与模型调优。
背景与挑战
背景概述
MultilingualNanoNQRetrieval数据集由MTEB(Massive Text Embedding Benchmark)团队于2025年构建,旨在弥合多语言文本检索领域的评估鸿沟。该数据集源于经典的Natural Questions基准,通过对真实用户查询与维基百科文章的映射,将单语检索任务拓展至涵盖阿拉伯语、德语、英语等11种语言的多语言场景。其核心研究问题聚焦于评估嵌入模型在跨语言环境中检索相关文档的能力,尤其关注模型对非英语语言语义理解的鲁棒性。作为MMTEB(Massive Multilingual Text Embedding Benchmark)计划的重要组成部分,该数据集为多语言检索系统的性能比较提供了标准化测试平台,显著推动了多语言嵌入技术与信息检索领域的交叉发展。
当前挑战
该数据集所解决的领域问题核心在于多语言文本检索中语义对齐的挑战:不同语言表达同一查询意图时存在词汇与句法差异,模型需克服语言屏障实现跨语言的相关文档匹配。构建过程中面临的双重挑战包括:其一,从原始Natural Questions数据中筛选高质量的多语言样本,需确保50个查询及5035篇文档在11种语言间保持语义等价性与注释一致性;其二,通过机器翻译生成的语料可能引入文化偏差与翻译噪声,导致检索基准的可靠性受损。此外,测试集中仅含57个相关性标注对,稀疏的监督信号对模型泛化能力构成严峻考验。
常用场景
经典使用场景
在信息检索与开放域问答的交叉领域中,MultilingualNanoNQRetrieval 数据集被广泛用于评估和训练多语言文本嵌入模型。其核心任务在于,给定一个来自真实用户的自然语言问题,系统需从包含多个Wikipedia段落的多语言语料库中精准检索出包含答案的相关文档。该数据集覆盖阿拉伯语、德语、英语、法语等12种语言,每个语言配置均包含约5000个文档和50条查询,以其高度浓缩的规模和跨语言特性,成为检验模型在低资源语言以及多语言场景下细粒度语义匹配能力的经典基准。
衍生相关工作
MultilingualNanoNQRetrieval 作为 MMTEB(大规模多语言文本嵌入基准)的重要组成部分,催生了一系列旨在提升多语言检索性能的研究工作。经典成果包括探索基于双语词典的知识蒸馏方法以强化跨语言对齐,以及研究对比学习策略在异构语种空间中构建统一嵌入空间的有效性。此外,针对小语种在检索中表现不佳的问题,衍生出聚焦于零样本跨语言迁移的微调方案。这些工作不仅丰富了多语言自然语言处理的理论体系,也为后续研究如动态词汇增强和多模态检索奠定了实验基础,展现了该数据集在推动领域前沿发展中的核心引擎作用。
数据集最近研究
最新研究方向
MultilingualNanoNQRetrieval数据集聚焦于跨语言文本检索的前沿探索,其核心价值在于为多语言环境下的密集检索与问答系统提供细粒度评估基准。基于真实用户查询的自然问题(Natural Questions)框架,该数据集通过翻译扩展覆盖阿拉伯语、德语、法语、日语、韩语等11种语言,每个语言配置均包含50条查询与5035篇文档,形成了统一规模的多语言检索测试集。这一设计直接回应了当前跨语言信息检索领域对高质量、低资源语言评估数据的需求,与MMTEB(大规模多语言文本嵌入基准)的最新研究脉络紧密相连。作为MTEB生态的重要组成部分,该数据集为衡量现代嵌入模型在多样化语言上的泛化能力提供了关键工具,推动了多语言语义理解技术的发展,尤其在全球化知识库与多语言对话系统等热点应用中具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务