遇见数据集

amitbcp/nomir

收藏
Hugging Face2024-05-15 更新2024-06-12 收录
官方服务:

资源简介:

NoMIRACL是一个人工标注的数据集,旨在评估大语言模型(LLMs)在增强检索生成(RAG)中的鲁棒性,涵盖18种不同的语言。数据集包括‘非相关’和‘相关’两个子集:‘非相关’子集包含所有被手动判断为非相关或嘈杂的查询,而‘相关’子集包含至少有一个被判断为相关文档的查询。LLM的鲁棒性通过两个关键指标来衡量:幻觉率和错误率。所有主题均由每种语言的母语者生成,并标注了主题与给定文档列表之间的相关性。无相关文档的查询用于创建‘非相关’子集,而至少有一个相关文档的查询(即MIRACL开发和测试中的查询)用于创建‘相关’子集。

NoMIRACL is a manually annotated dataset developed to evaluate the robustness of Large Language Models (LLMs) in Retrieval-Augmented Generation (RAG) across 18 distinct languages. The dataset comprises two subsets: the "Irrelevant" subset and the "Relevant" subset. The "Irrelevant" subset encompasses all queries manually categorized as irrelevant or noisy, whereas the "Relevant" subset includes queries for which at least one relevant document has been annotated. Two critical metrics are employed to assess LLM robustness: the hallucination rate and the error rate. All topics are generated by native speakers of the corresponding language, and the relevance between each topic and the provided list of documents is manually annotated. Queries without any relevant documents are utilized to construct the "Irrelevant" subset, while queries with at least one relevant document (i.e., the queries from the MIRACL development and test splits) are used to build the "Relevant" subset.

提供机构:
amitbcp
原始信息汇总

数据集概述

数据集名称

  • 名称: NoMIRACL

语言多样性

  • 语言: 包含18种语言,包括阿拉伯语(ar)、孟加拉语(bn)、英语(en)、西班牙语(es)、波斯语(fa)、芬兰语(fi)、法语(fr)、印地语(hi)、印度尼西亚语(id)、日语(ja)、韩语(ko)、俄语(ru)、斯瓦希里语(sw)、泰卢固语(te)、泰语(th)、中文(zh)、葡萄牙语(pt)
  • 多语言性: 多语言

数据集大小

  • 大小: 10K<n<100K

数据集来源

  • 来源: 源自MIRACL/miracl数据集

任务类型

  • 任务: 文本分类

许可证

  • 许可证: Apache-2.0

数据集结构

  • 文件格式:
    • 文档: .jsonl.gz格式,每行包含docid, title, text
    • 主题: .tsv格式,每行包含qidquery
    • qrels: 标准TREC格式,每行包含qid, Q0, docid, relevance

数据集子集

  • 子集: 包含non-relevantrelevant两个子集
    • non-relevant: 所有文档被手动判定为不相关或噪声
    • relevant: 至少有一个文档被判定为相关

数据集使用

  • 使用方法: 通过HuggingFace datasets库加载数据集,支持18种语言和两个子集的选择

数据集统计信息

  • 统计信息: 详细统计信息请参考相关出版物

引用信息

  • 引用格式:

    @article{thakur2023nomiracl, title={NoMIRACL: Knowing When You Dont Know for Robust Multilingual Retrieval-Augmented Generation}, author={Nandan Thakur and Luiz Bonifacio and Xinyu Zhang and Odunayo Ogundepo and Ehsan Kamalloo and David Alfonso-Hermelo and Xiaoguang Li and Qun Liu and Boxing Chen and Mehdi Rezagholizadeh and Jimmy Lin}, journal={ArXiv}, year={2023}, volume={abs/2312.11361} }

搜集汇总
数据集介绍
amitbcp/nomir 数据集图片
构建方式
在检索增强生成(RAG)技术日益成为提升大语言模型生成响应准确性与忠实度的重要范式的背景下,NoMIRACL数据集应运而生,旨在系统评估多语言环境下大语言模型在面对外部检索知识错误时的鲁棒性。该数据集由母语为各目标语言的专家精心构建,其基础源自MIRACL数据集中的主题与文档。构建过程首先由母语者生成覆盖18种不同语系的语言主题,并对主题与给定文档列表之间的相关性进行人工标注。随后,将那些无相关文档的查询归入“非相关”子集,而将至少包含一篇相关文档的查询(即MIRACL开发集与测试集中的查询)归入“相关”子集,从而形成两个互为对照的评估子集。
使用方法
使用NoMIRACL数据集进行模型评估时,研究者可通过HuggingFace的datasets库便捷加载。首先指定目标语言(如德语)以及所需的子集('relevant'或'non_relevant')与数据切分('dev'或'test'),通过load_dataset函数即可获取对应组合,例如'dev.relevant'。加载后的数据集以查询为中心,每条记录包含查询ID、查询文本、正例段落与负例段落列表。研究者可迭代遍历数据,提取段落中的文档ID、标题与正文内容,进而构建评估管线。通过对比模型在相关与非相关子集上的幻觉率与错误率,即可系统评估其在不同语言与检索噪声条件下的鲁棒性表现。
背景与挑战
背景概述
随着检索增强生成(RAG)技术在大语言模型中的广泛应用,如何评估模型在多语言环境下对外部检索知识错误的鲁棒性,成为自然语言处理领域亟待解决的关键问题。在此背景下,Nandan Thakur等研究人员于2023年发布了NoMIRACL数据集,该数据集由MIRACL项目团队开发,涵盖阿拉伯语、孟加拉语、英语等18种语言,旨在系统性地衡量LLM在面对不相关或噪声检索段落时的表现。通过引入幻觉率和错误率两大核心指标,NoMIRACL为多语言RAG系统的鲁棒性评估提供了标准化基准,填补了现有研究在跨语言错误知识场景下的评估空白,对推动多语言信息检索与语言模型融合领域的发展具有重要影响力。
当前挑战
NoMIRACL数据集首要解决的领域挑战在于多语言RAG系统中模型对噪声检索内容的鲁棒性评估,传统评测多聚焦于单语言环境下的相关段落检索,而忽略了模型在接收到不相关或干扰信息时产生幻觉的风险。构建过程中,团队面临的一大挑战是跨语言人工标注的一致性与准确性,需由18种语言的母语者独立生成查询并判断文档相关性,确保非相关子集中所有段落均被严格标注为不相关,同时维护相关子集中至少包含一条相关段落。此外,数据集的规模控制与语言平衡亦构成挑战,需在10K至100K样本范围内覆盖多语种分布,避免因数据稀疏导致评估偏差。
常用场景
经典使用场景
在跨语言检索增强生成(RAG)的蓬勃发展中,NoMIRACL数据集以其独特的设计成为评估大语言模型鲁棒性的基石。该数据集涵盖18种语言,通过人工标注将查询划分为“非相关”和“相关”子集,专门用于测试模型在面对外部检索知识中噪声或无关信息时的表现。研究者常利用其“非相关”子集模拟真实场景中的信息污染,从而衡量模型的幻觉率与错误率。这一经典使用场景为多语言RAG系统的可靠性提供了标准化测试平台,尤其适用于那些需要确保生成内容忠实于事实的低资源语言环境。
解决学术问题
NoMIRACL直面了多语言RAG领域中长期悬而未决的评估难题:如何系统性地量化大语言模型在跨语言检索信息不完美时的脆弱性。传统评估多聚焦于单语环境或理想化检索假设,忽略了现实世界中检索结果常包含噪声甚至无关文档。该数据集通过精细的负样本设计,首次在18种语言上统一了鲁棒性度量标准,揭示了模型在不同语系中的表现差异。其提出的幻觉率与错误率指标,为后续研究提供了可复现的基准,推动了多语言自然语言处理领域对模型边界认知与不确定性估计的深入探索。
实际应用
在实际部署中,NoMIRACL为多语言问答系统、对话代理及知识密集型应用的质量保障提供了关键工具。例如,在构建面向阿拉伯语或斯瓦希里语的医疗咨询机器人时,开发者可利用该数据集的非相关子集模拟检索错误,提前诊断模型是否会产生误导性回答。金融领域的跨语言报告自动生成系统同样受益于其评估范式,能够有效过滤掉因检索噪声导致的虚假信息。此外,社交媒体内容审核与多语种新闻摘要生成等场景,均借助NoMIRACL的鲁棒性测试来避免模型对错误上下文产生过度自信。
数据集最近研究
最新研究方向
NoMIRACL数据集聚焦于检索增强生成(RAG)框架下大语言模型的鲁棒性评估,尤其在多语言场景中应对检索知识噪声的能力。当前前沿研究围绕幻觉率与错误率两大核心指标,探索模型在不同语系(涵盖18种语言)中对非相关或噪声检索结果的判别与抑制机制。该数据集通过人工标注的“相关”与“非相关”子集,为理解LLM在跨语言信息检索中的知识边界提供了关键基准,其意义在于推动RAG系统从检索到生成的全链路可靠性验证,为构建更稳健的多语言问答、对话及知识密集型应用奠定基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务