遇见数据集

Eva-KELLM

收藏
arXiv2023-08-19 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

该数据集用于评估大型语言模型(LLMs)的知识编辑效果,包括一个评估框架和一个相应的数据集。数据集支持通过原始文档进行知识编辑,并从多个角度评估更新后的LLM,包括知识编辑的有效性、无关知识的保留、基于改变知识的推理能力以及跨语言知识转移能力。

This dataset is developed for evaluating the knowledge editing performance of Large Language Models (LLMs), and it consists of an evaluation framework and a corresponding dataset. The dataset supports knowledge editing based on original documents, and assesses the updated LLMs from multiple dimensions, covering the effectiveness of knowledge editing, the retention of irrelevant knowledge, the reasoning capability based on altered knowledge, and cross-lingual knowledge transfer capability.

创建时间:
2023-08-19
搜集汇总
数据集介绍
Eva-KELLM 数据集图片
构建方式
Eva-KELLM数据集的构建基于COUNTERFACT数据集中的反事实实例。首先,每个实例包含一个完形填空句子x和反映改变后知识的预测y′,两者结合形成反事实句子[x, y′]。随后,设计特定提示引导ChatGPT生成新闻稿或杂志文章形式的反事实文档,要求文档多次提及目标反事实知识,并模仿知名媒体的写作风格。生成后,通过过滤包含“misinformation”、“mistake”等关键词的文档,确保文档准确传达反事实信息。此外,将部分反事实句子从英文翻译为中文,利用中文提示生成中文反事实文档,使数据集涵盖中英双语,支持跨语言知识迁移评估。最终,数据集包含8,882个英文文档和6,930个中文文档,平均长度分别为315.25和588.65个词。
特点
Eva-KELLM数据集的核心特点在于其评估框架的多维性和创新性。与以往仅依赖事实三元组的研究不同,该数据集使用原始文档进行知识编辑,降低了收集成本并增强了实用性。评估从四个视角展开:直接知识编辑评估(DKEE)衡量编辑成功率;无关知识保留评估(UKRE)检测模型对未修改知识的保持能力;间接知识编辑评估(IKEE)通过推理任务检验模型是否真正理解而非记忆改变的知识;跨语言知识编辑评估(CKEE)评估模型从中文文档学习后回答英文查询的能力。这种多视角设计突破了传统评估的局限,特别关注推理和跨语言迁移能力,为知识编辑方法提供了更全面的性能衡量标准。
使用方法
使用Eva-KELLM数据集时,首先需让大语言模型基于提供的反事实原始文档进行知识编辑,可采用全微调或LoRA等参数高效微调方法。编辑后,利用四个专用子数据集进行评估:DKEE通过完形填空任务比较模型对改变后和原始知识的输出概率,计算Efficacy Score等指标;UKEE用无关查询评估知识保留,计算Neighborhood Score;IKEE要求模型回答基于改变知识的推理问题(True/False分类),结合DeBERTa的NLI模型判断答案正确性,以准确率为指标;CKEE用英文查询检测模型从中文文档学到的知识,计算Cross-lingual Efficacy Score。实验表明,当前方法在IKEE和CKEE上表现不佳,需进一步优化模型中间层和MLP层的参数调整策略。
背景与挑战
背景概述
大型语言模型(LLMs)在其参数中编码了海量知识,然而这些知识可能随时间推移而过时或不适用,由此催生了知识编辑领域的兴起。现有研究多依赖事实三元组进行编辑,但此类方式不仅采集成本高昂,且难以表达复杂事实。为此,厦门大学与百度研究院的研究团队于2023年联合提出了Eva-KELLM基准,旨在构建一个更通用、更全面的知识编辑评估体系。该基准创新性地引入原始文档作为编辑媒介,替代传统的事实三元组,并设计了四维评估框架,涵盖直接编辑效果、无关知识保留、推理能力及跨语言迁移能力。Eva-KELLM的发布为知识编辑领域提供了新的评估范式,推动了LLMs动态知识更新技术的深入发展。
当前挑战
Eva-KELLM所揭示的挑战主要集中于两个层面。其一,在领域问题层面,现有知识编辑方法难以实现有效的原始文档级知识更新,尤其在推理与跨语言迁移方面表现欠佳;实验表明,当前方法虽能提升直接编辑得分,却往往导致无关知识遗忘加剧,且模型在基于修改知识的推理任务中准确率仅约47%,远未达到实用标准。其二,在构建过程中,团队面临反事实文档生成的难题,需借助ChatGPT生成既包含目标知识又保持文体多样性的文档,并过滤掉包含“misinformation”等关键词的无效内容;同时,为确保跨语言评估的有效性,还需精心构建中英文对照的文档与查询对,这一过程对数据质量与一致性提出了极高要求。
常用场景
经典使用场景
Eva-KELLM基准数据集的核心应用场景在于评估大型语言模型在接收原始文档形式的知识编辑后的综合表现。与以往依赖事实三元组进行知识更新的研究不同,该数据集推动知识编辑走向更通用、更贴近现实的场景,即模型需从自然语言文档中习得并整合新知识。其评估框架从四个维度展开:直接知识编辑效果、无关知识保留、基于修改知识的推理能力,以及跨语言知识迁移能力,为全面衡量知识编辑方法的优劣提供了标准化测试平台。
衍生相关工作
Eva-KELLM的提出催生了一系列围绕原始文档知识编辑的研究工作。其评估框架直接启发了后续对中间层参数(如前馈网络层)在知识存储中关键作用的深入探索,并推动了参数高效微调方法(如LoRA)在知识编辑场景下的系统比较。此外,该数据集揭示的跨语言知识迁移挑战,促使研究者开发了针对多语言模型的知识编辑增强策略,以及融合自然语言推理模型进行编辑效果验证的技术路线。这些衍生工作共同丰富了知识编辑的理论体系与工具生态。
数据集最近研究
最新研究方向
在大语言模型知识编辑领域,Eva-KELLM基准的提出标志着评估范式从基于事实三元组的传统方法向原始文档驱动的更通用场景的深刻转变。该基准不仅评估知识编辑的直接效果与无关知识保留能力,更开创性地引入基于修改知识的推理能力与跨语言知识迁移两大前沿评估维度。实验揭示,当前主流方法在利用原始文档进行知识更新时,面对复杂推理与跨语言泛化任务仍存在显著局限,尤其是全微调方法易导致模型丧失指令遵循能力,而LoRA等参数高效方法在中间层MLP上的表现更为关键。这一发现呼应了Transformer中MLP作为知识存储核心的已有认知,并为未来研究指明了优化方向——即如何设计策略使模型聚焦文档关键信息并高效调整参数,从而真正实现知识的深层习得与跨语言迁移。
相关研究论文
  • 1
    Eva-KELLM: A New Benchmark for Evaluating Knowledge Editing of LLMs · 2023年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务