Magic Mushroom
收藏官方服务:
资源简介:
Magic Mushroom是一个用于评估在复杂检索噪声下LLM鲁棒性的可控测试平台。该数据集由7,468个单跳和3,925个多跳问答对组成,每个问答对都与金标准和多种噪声文档配对,比之前的基准测试更复杂。Magic Mushroom允许研究人员根据特定的研究目标或应用场景灵活配置检索噪声的组合,从而实现高度控制的评估设置。
Magic Mushroom is a controllable testbed for evaluating the robustness of Large Language Models (LLMs) under complex retrieval noise. This dataset comprises 7,468 single-hop and 3,925 multi-hop question-answer pairs, each paired with a gold-standard reference and multiple noisy documents, making it more complex than prior benchmark datasets. Magic Mushroom allows researchers to flexibly configure combinations of retrieval noises based on specific research objectives or application scenarios, thereby enabling highly controlled evaluation settings.
创建时间:
2025-06-04
搜集汇总
数据集介绍

构建方式
检索增强生成系统虽能缓解大模型的幻觉与知识过时问题,却极易受到现实检索场景中复杂噪声的侵蚀。Magic Mushroom基准数据集基于Natural Questions与HotpotQA构建,包含7,468个单跳与3,925个多跳问答对,每个实例均配备金标准文档及四类噪声文档。构建过程历经三个阶段:首先通过语义消歧与正则清洗筛选高质量问答实例;继而利用GPT-4对金标准文档进行同义词替换与句法变换以增强多样性,并辅以回译验证确保语义保真;最后依照语言学属性与噪声特征,系统性地引入干扰性、低质量、无关紧要与无关四类噪声文档,模拟真实检索中细粒度且异质的噪声分布。
特点
Magic Mushroom的核心创新在于其灵活的噪声配置机制,研究者可根据特定研究目标或应用场景动态调整噪声类型与比例,实现高度可控的评估设定。该基准定义了四类反映真实噪声异质性的干扰类型:干扰性噪声通过实体替换制造表面相关但事实误导的上下文;低质量噪声包含反事实信息或格式异常;无关紧要噪声提供主题相关但无助于答案推演的冗余内容;无关噪声则完全偏离查询主题。实验揭示,现有生成系统与去噪策略对噪声分布极其敏感,在50%噪声比例时出现陡峭的性能雪崩,且不同噪声类型对模型注意力的诱导效应存在显著差异。
使用方法
研究者可通过从候选文档池中按指定比例随机采样来构建检索上下文,灵活设定噪声类型与比例的组合。该基准提供公开的开发集与测试集,以及保留的私有测试集以防数据泄露。评估采用GPT-4评分的正确性与拒绝率双指标,支持对多种大语言模型生成器与经典去噪策略(如VanillaRAG、Chain-of-Note、DRAGIN、SKR、CRAG)的全面评测。通过渐进的噪声侵蚀实验,可系统观察系统在0%至100%噪声比例下的性能演化轨迹,并可针对特定场景(如高干扰噪声、低质量检索环境)定制噪声分布,从而精准定位最优的生成器-去噪器组合,推动鲁棒RAG系统的研发与部署。
背景与挑战
背景概述
Magic Mushroom 数据集诞生于检索增强生成(RAG)系统在真实场景中面临噪声侵蚀的严峻挑战之下,由东南大学计算机科学与工程学院及法学院的研究人员于2025年联合创建。其核心研究问题在于:现有基准无法模拟现实检索环境中复杂且异质的噪声分布,导致对RAG系统鲁棒性的评估失准。该基准通过定义四种精细噪声类型(分散性、低质量、无关紧要、不相关),并允许灵活配置噪声组合,为评估大语言模型在复杂检索噪声下的表现提供了高度可控的测试平台,涵盖7,468个单跳与3,925个多跳问答对,对推动噪声鲁棒RAG系统的开发具有重要影响力。
当前挑战
该基准主要应对两大挑战:领域问题层面,RAG系统对检索噪声高度敏感,现有研究多采用粗粒度的噪声分类,忽略了噪声类型的细粒度异质性,导致不同噪声对生成质量的干扰机制难以被准确揭示,且静态基准无法反映真实世界检索中噪声分布的多样性。构建过程层面,需在现有问答数据集上系统性地构造四种符合语义与分布特性的噪声文档,例如通过核心实体替换生成分散性噪声,借助跨问题负采样构建不相关噪声,并需确保低质量噪声包含反事实信息而不违背常识,同时通过人工与LLM结合的验证流程保证数据质量与语义保真度。
常用场景
经典使用场景
在检索增强生成(RAG)系统的鲁棒性评估研究中,Magic Mushroom 基准测试被广泛应用于模拟真实世界中检索噪声的异质性侵蚀效应。该数据集通过精心设计的四类噪声——干扰性、低质量、无关紧要与不相关文档——构建了一个可灵活配置噪声类型与比例的评价框架。研究者借助此基准,能够在从纯净到全噪声的递增比例下,系统性地审视不同参数规模的大语言模型生成器与经典去噪策略的性能动态,从而揭示噪声对答案正确性与拒绝率的非线性影响路径,为细粒度鲁棒性分析提供了标准化的实验平台。
实际应用
在工业级检索增强生成系统的实际部署中,Magic Mushroom 基准测试可应用于检索管道质量监控、去噪模块选型与超参数调优等关键环节。例如,在构建医疗问答或法律文档辅助系统时,工程师可依据目标领域检索日志中噪声分布的统计特征,在该数据集中构造对应的噪声配置场景,从而在离线阶段评估不同生成器-去噪器组合在特定噪声环境下的鲁棒性边界。该基准还支持对检索上下文长度与文档排列顺序的敏感性分析,这些洞察可直接指导线上系统中重排序策略的设计与检索截断阈值的校准,切实提升生成内容在嘈杂信息环境中的可靠性。
衍生相关工作
Magic Mushroom 基准测试的发布已催生了一系列聚焦于噪声鲁棒性的后续研究工作。基于该数据集定义的细粒度噪声分类,研究者开发了面向噪声类型的自适应去噪策略,如为干扰性噪声设计对抗性过滤模块,以及为低质量噪声引入基于信息密度的文档剪枝机制。此外,该基准中揭示的注意力偏移现象促使了注意力校准方法的探索,后续工作通过显式约束生成器在不同噪声比例下的注意力分布来缓解误导效应。该数据集提供的场景级鲁棒性分析框架也被后续工作采纳,用于探讨跨语言泛化场景下检索噪声的迁移影响,推动了多语种鲁棒 RAG 系统评估方法论的发展。
以上内容由遇见数据集搜集并总结生成



