遇见数据集

mteb/MultilingualNanoTouche2020Retrieval

收藏
Hugging Face2026-06-21 更新2026-07-22 收录
官方服务:

资源简介:

MultilingualNanoTouche2020Retrieval是一个多语言文本检索数据集,属于大规模文本嵌入基准(MTEB)的一部分。该数据集基于Touché Task 1: Argument Retrieval for Controversial Questions(争议性问题的论点检索)的NanoTouche2020子集构建,专注于学术领域。数据集涵盖11种语言:阿拉伯语、德语、英语、西班牙语、法语、意大利语、日语、韩语、挪威语、葡萄牙语和瑞典语,每个语言版本包含语料库文本、查询和相关度判断,用于评估多语言文本嵌入模型的检索性能。数据来源于zeta-alpha-ai/NanoTouche2020和LiquidAI/nanobeir-multilingual-extended,测试集包含63,734个样本、539个查询和63,195个文档,平均每个查询有19个相关文档。

MultilingualNanoTouche2020Retrieval is a multilingual text retrieval dataset, part of the Massive Text Embedding Benchmark (MTEB). It is based on a smaller subset of Touché Task 1: Argument Retrieval for Controversial Questions, specifically NanoTouche2020, and focuses on the academic domain. The dataset covers 11 languages: Arabic, German, English, Spanish, French, Italian, Japanese, Korean, Norwegian, Portuguese, and Swedish. Each language version includes a corpus, queries, and relevance judgments (qrels) for evaluating multilingual text embedding models in retrieval tasks. The data is derived from source datasets zeta-alpha-ai/NanoTouche2020 and LiquidAI/nanobeir-multilingual-extended. The test set contains 63,734 samples, 539 queries, and 63,195 documents, with an average of 19 relevant documents per query.

提供机构:
mteb
搜集汇总
数据集介绍
mteb/MultilingualNanoTouche2020Retrieval 数据集图片
构建方式
MultilingualNanoTouche2020Retrieval数据集源于Touché Task 1,聚焦于争议性问题的论点检索任务。它通过整合zeta-alpha-ai/NanoTouche2020与LiquidAI/nanobeir-multilingual-extended两个源数据集,经翻译与衍生构建而成。数据集覆盖阿拉伯语、德语、英语、法语、意大利语、日语、韩语、挪威语、葡萄牙语、西班牙语及瑞典语共11种语言,每种语言均包含独立配置,由语料库(corpus)、查询(queries)及相关性标注(qrels)三部分组成,充分体现了多语言信息检索任务的典型架构。
特点
该数据集的核心特征在于其多语言与学术领域的深度融合。每个语言配置均包含5745篇文档与49条查询,每条查询对应6至32个不等的相关文档,平均约19个相关条目,确保了检索评估的丰富性。测试集规模总计63,734个样本,涵盖约1.27亿字符,文档平均长度约2009字符,查询则更为精炼,平均仅43字符。这一特性使得该数据集既能评估模型在跨语言场景下的鲁棒性,又能测试其对学术论点文本的细粒度理解能力。
使用方法
使用该数据集时,可借助MTEB库进行便捷评估。用户通过mteb.get_task函数加载任务,再用mteb.get_model指定嵌入模型,最后调用mteb.evaluate执行完整评测。数据集已按测试集分割,每种语言的corpus、qrels和queries配置均可独立调用,便于进行单语言或多语言联合分析。评估结果可直接对比不同模型在统一基准上的性能,助力多语言文本嵌入技术的进步与优化。
背景与挑战
背景概述
MultilingualNanoTouche2020Retrieval数据集诞生于2022年,由Potthast、Gienapp、Wachsmuth、Hagen、Fröbe、Bondarenko、Ajjour及Stein等研究人员基于Touché任务1构建,其核心研究问题聚焦于多语言环境下争议性问题的论点检索。作为MTEB(大规模文本嵌入基准)的重要组成部分,该数据集面向阿拉伯语、德语、英语、法语、意大利语、日语、韩语、挪威语、葡萄牙语、西班牙语及瑞典语等11种语言,每个语言配置均包含5745个语料文档、49个查询及932个相关性判定。其在学术领域的广泛引用显著推动了多语言文本检索系统评估标准的发展,为跨语言信息检索的公平性比较提供了坚实基准。
当前挑战
该数据集旨在解决跨语言论点检索这一核心领域难题,即如何在语义复杂、文化多元的争议性议题中,实现不同语言查询与文档的高效匹配,其挑战在于捕捉论点的细微差异与立场倾向。构建过程中,最大的困难在于确保机器翻译质量与跨语言语义对齐的精确性,避免因翻译偏差导致检索偏差。另需平衡各语言数据量的均匀性,以及处理译后语料中隐含的文化特异性表达,同时维护原始论点检索任务中针对争议性问题的立场标注一致性,这些因素共同构成了数据集构建与评估中的关键技术壁垒。
常用场景
经典使用场景
在自然语言处理与信息检索的交叉领域,MultilingualNanoTouche2020Retrieval数据集主要用于评估和提升多语言文本嵌入模型在论证检索任务上的表现。该数据集源自Touché Task 1中的争议性问题论证检索任务,经过精炼形成了规模适中的NanoTouche2020子集,并扩展至涵盖阿拉伯语、德语、英语、法语、意大利语、日语、韩语、挪威语、葡萄牙语、西班牙语和瑞典语等11种语言。其核心应用场景在于检验模型能否从大规模语料库中精准检索出与特定争议性查询相关的论证段落。研究人员通过在该数据集上运行经典的信息检索评估流程,能够系统性地衡量不同跨语言与多语言嵌入模型在复杂语义匹配与跨语言泛化方面的能力差异。
解决学术问题
该数据集有效回应了多语言环境下论证检索这一学术难题,其核心挑战在于如何跨越语言壁垒,精准捕捉不同语言表达中蕴含的立场与论据信息。学术界长期面临统一评测基准缺失的问题,导致各类多语言嵌入模型的对比缺乏公平性。MultilingualNanoTouche2020Retrieval通过提供标准化的11种语言查询、语料库及相关性标注,为研究者提供了可复现的评估框架。该数据集的引入推动了多语言信息检索从单语向多语范式转变的进程,其意义在于首次将Touché竞赛的论证检索任务系统性地扩展至多语言场景,为分析跨语言语义对齐、语言迁移以及零样本检索性能等关键科学问题提供了坚实的实验基础,显著促进了多语言自然语言处理与论证挖掘领域的交叉融合。
衍生相关工作
围绕MultilingualNanoTouche2020Retrieval数据集,衍生出一系列重要的学术与工程工作。该数据集作为Massive Multilingual Text Embedding Benchmark(MMTEB)的重要组成部分,被广泛用于评估如text-embedding-3-small、Multilingual-E5等前沿嵌入模型的多语言检索性能。研究者还基于此数据集开展了针对性的跨语言迁移学习研究,探索如何利用高资源语言训练提升低资源语言上的论证检索效果。此外,针对该数据集中争议性查询的特点,部分工作深入分析了模型检索结果中的立场偏差问题,推动了可信赖信息检索的发展。数据集的构建方法论也启发了后续NAACL、ECIR等顶会上的相关研究,将多语言论证检索与对话系统、事实验证等任务相结合,不断拓展着研究边界的深度与广度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务