遇见数据集

mteb/MultilingualNanoSciFactRetrieval

收藏
Hugging Face2026-06-21 更新2026-07-22 收录
官方服务:

资源简介:

MultilingualNanoSciFactRetrieval是一个多语言科学事实检索数据集,属于大规模文本嵌入基准(MTEB)的一部分。该数据集基于NanoSciFact构建,后者是SciFact的一个较小子集,旨在通过研究文献中的科学论文摘要来验证科学主张。数据集涵盖多个语言(包括阿拉伯语、德语、英语、法语、意大利语、日语、韩语、挪威语、葡萄牙语、西班牙语和瑞典语),每个语言配置包含语料库(corpus)、查询(queries)和相关度判断(qrels),用于文本检索任务,特别适用于事实核查和科学信息检索。数据集适用于学术、医学和书面材料领域,支持多语言文本嵌入模型的评估。

MultilingualNanoSciFactRetrieval is a multilingual scientific fact retrieval dataset, part of the Massive Text Embedding Benchmark (MTEB). It is based on NanoSciFact, a smaller subset of SciFact, which verifies scientific claims using evidence from research literature containing scientific paper abstracts. The dataset covers multiple languages (including Arabic, German, English, French, Italian, Japanese, Korean, Norwegian, Portuguese, Spanish, and Swedish), with each language configuration containing a corpus, queries, and relevance judgments (qrels) for text retrieval tasks, particularly suited for fact-checking and scientific information retrieval. It is applicable in academic, medical, and written material domains, supporting the evaluation of multilingual text embedding models.

提供机构:
mteb
搜集汇总
数据集介绍
mteb/MultilingualNanoSciFactRetrieval 数据集图片
构建方式
在大规模多语言文本嵌入模型评测的背景下,MultilingualNanoSciFactRetrieval数据集应运而生。该数据集通过整合源自zeta-alpha-ai/NanoSciFact与LiquidAI/nanobeir-multilingual-extended两大数据源,构建了一个用于科学事实检索的多语言评估基准。其构建方式是对原始NanoSciFact数据集进行多语言扩展,利用机器翻译技术将英文的论文摘要和科学声明精准转化为阿拉伯语、德语、法语等11种语言,从而形成每个语言独立的语料库、查询集及相关性标注文件,实现了跨语言科学事实检索任务的标准化测试。
特点
该数据集最鲜明的特性在于其卓越的多语言覆盖与科学领域的深度聚焦。数据集涵盖11种代表性语言,每种语言均包含2919篇文档语料、50条精心设计的查询和56条相关性标注,总计逾32000篇文档与550条查询,确保了评测统计的可靠性。所有数据均源自真实的科学论文摘要,文本长度分布广泛,平均约1378个字符,既保留了原始科学文献的严谨性,又通过多语言扩展突破了语言壁垒,为评估嵌入模型在跨语言学术场景下的检索能力提供了理想的测试平台。
使用方法
研究人员可借助MTEB(Massive Text Embedding Benchmark)框架便捷地使用该数据集进行评估。具体而言,通过调用mteb.get_task('MultilingualNanoSciFactRetrieval')获取任务实例,再结合mteb.get_model加载待评模型,最后执行mteb.evaluate即可完成端到端的评估流程。数据集已按照语言划分为独立的配置,如ar-corpus、en-queries等,支持针对特定语言或综合多语言的性能分析。使用时需注意引用相关论文,以确保学术规范性。
背景与挑战
背景概述
科学论证的可信度验证是自然语言处理领域一项极具挑战性的任务,尤其当涉及跨语言场景时,检索系统需精准定位支撑或反驳科学主张的证据。MultilingualNanoSciFactRetrieval数据集应运而生,它作为SciFact数据集的精简多语言扩展版本,由LiquidAI等机构研究人员基于NanoSciFact和nanobeir-multilingual-extended构建,旨在评估嵌入模型在多语言环境下对科学事实的检索能力。该数据集覆盖阿拉伯语、德语、英语、法语等11种语言,通过翻译对齐的方式保留了原始英文科学摘要的语义结构与事实标签,为多语言信息检索与事实核查研究提供了标准化测试床。其诞生推动了多语言文本嵌入基准(MMTEB)的发展,成为衡量跨语言科学证据检索系统性能的关键资源。
当前挑战
该数据集面临多重挑战。在领域问题层面,科学事实检索需从巨量学术文献中精准匹配与待验证主张相关的摘要,跨语言场景下语义对齐的稀疏性导致检索难度陡增,且科学主张中隐含的逻辑关系(如蕴含、矛盾)对模型推理能力提出严苛要求。在构建过程中,挑战主要源于多语言翻译的质量控制——自动翻译可能引入术语歧义或句式失真,导致跨语言证据关联性削弱;同时,从SciFact中抽取的子集需在保持事实标签完整性的前提下压缩语料规模,避免因过度简化而损失科学论证的细微差别。此外,测试集仅提供每查询平均1.12个相关文档,极低的正例密度加剧了评估的不稳定性,使模型难以在有限监督信号下收敛。
常用场景
经典使用场景
在自然语言处理与科学文献挖掘的交汇领域,MultilingualNanoSciFactRetrieval 数据集主要用于多语言科学事实检索任务。研究者利用该数据集训练和评估跨语言文本嵌入模型,通过给定科学主张(queries)在海量多语种论文摘要(corpus)中精准定位支撑或反驳证据。其典型流程包括构建查询与文档的语义匹配,并以相关度分数(qrels)作为标准答案进行监督学习。该数据集覆盖阿拉伯语、德语、英语等11种语言,为多语言环境下的事实核查与信息检索提供了标准化的评测基准,尤其适配于主流嵌入模型(如SPECTER)的跨语言迁移能力验证。
衍生相关工作
MultilingualNanoSciFactRetrieval 衍生了一系列重要的学术工作。在模型层面,研究者基于该数据集评估并改进了SPECTER等文档级嵌入模型的多语言版本,推动了跨语言语义表示学习的发展。在基准层面,该数据集被纳入大规模多语言文本嵌入基准(MMTEB),用于系统比较各类嵌入模型在11种语言上的检索性能。代表性文献如《MMTEB: Massive Multilingual Text Embedding Benchmark》系统性地分析了该数据集的统计特性与评估结果,而其引用关系则进一步连接至SciFact等原始事实核查数据集,形成了从单一语言到多语言、从简单检索到复合验证的完整研究链条。
数据集最近研究
最新研究方向
在科学文献验证与多语言信息检索的交汇点上,MultilingualNanoSciFactRetrieval数据集为跨语言事实核查研究构筑了关键基石。其前沿方向聚焦于利用多语言嵌入模型,在包含英、德、法、日等11种语言的学术摘要语料中,精准检索支持或反驳科学论断的证据段落。该数据集作为MMTEB基准的核心组件,紧密关联着多语言文本嵌入与可复现科学这一热点议题,旨在量化评估模型在异构语言环境下处理长尾医学与学术文本的鲁棒性。通过提供纳秒级粒度的正负样本标注,它显著推动了跨语种零样本事实核查的发展,对于构建全球性、少偏见的科研证据追踪系统具有深远影响,标志着NLP领域从单语技能向多语境泛化能力评估的重要跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务