遇见数据集

ElephantBench

收藏
github2026-08-31 更新2026-09-03 收录
官方服务:

资源简介:

ElephantBench是一个闭卷知识探针,用于评估语言模型是否记住长尾事实以及是否回忆与这些事实相关的不同已验证账户。该基准测试包含1094个问题,使用两种形式:命名实体形式和线索形式。

ElephantBench is a closed-book knowledge probe for evaluating whether language models have memorized long-tail facts and can recall different verified accounts associated with such facts. This benchmark contains 1,094 questions, which are presented in two formats: named entity format and cue format.

创建时间:
2026-08-26
原始信息汇总

数据集概述

核心定位

ElephantBench 是一个封闭式知识探测基准(closed-book knowledge probe),用于评估语言模型是否能够记忆长尾事实,以及是否能够回忆与这些事实相关的不同已验证信息源(verified accounts)。该基准包含 1,094 个问题,采用两种表述形式:命名实体形式(named-entity form)和线索形式(clue-based form)。

可用性

评估指标

结果分为三类互斥且穷尽的评分:

  • C(完整回忆,Complete recall): 所有已验证答案均被覆盖,且无实质性矛盾;
  • P(部分回忆,Partial recall): 至少一个(但非全部)已验证答案被覆盖;
  • F(回忆失败,Failed recall): 无已验证答案被覆盖、答案与参考资料存在实质性矛盾,或生成/评判失败。

三者满足 C + P + F = 1。条件完整度 K = C / (C + P) 用于衡量在至少回忆出一个已验证答案的问题中,达到完整回忆的比例。缺失的结果行和请求失败仍保留在固定基准分母中,计入 F。

工具包功能

项目提供六个命令:

  • elephantbench-run:查询兼容 OpenAI 接口的模型(不提供来源或工具);
  • elephantbench-judge:使用 LLM 评判器判定完整、部分或失败回忆;
  • elephantbench-score:计算固定分母的 C/P/F/K 指标;
  • elephantbench-analyze:报告每个模型的指标及贪心跨模型 Oracle 覆盖率;
  • elephantbench-validate:验证数据集结构和 ID;
  • elephantbench-construct:标注原始文档、检索并分类文档对、构建冲突子图、合成配对问题、验证并导出基准记录。

基准构建流程

构建流水线将预过滤的 D_low 文档转换为经过验证的配对基准问题,主要步骤包括:

  1. 构建全文文档库 + SuperGPQA++ 知识点标注 + T-NER 实体抽取;
  2. 生成 (知识要点, 主语, 槽位) 对齐锚点;
  3. 候选取对(组内及跨组);
  4. 文档关系二分类(支持/冲突/无);
  5. 构建冲突子图并挂接支持性邻居;
  6. 为每个保留的冲突组生成命名实体问题和线索问题各一个;
  7. 源文档全文独立 LLM 验证;
  8. 通过 Brave Search 与内置网页抓取器进行公开网络独立验证;
  9. 导出基准记录;
  10. 发布前对每个冲突组进行人工审查,确认问题无答案泄漏或实质性歧义。

预过滤源语料 D_low 可从 ElephantBench-Source 下载。

运行要求

  • Python 3.10 或更高版本;
  • 核心包无第三方运行时依赖;重建基准需额外安装构造依赖;
  • 评判与模型调用采用标准非流式 OpenAI 兼容 /chat/completions 接口,请求中仅包含系统指令和基准问题,不包含金标答案、源文档、检索工具等。

引用

@article{pan2026elephantbench, title={Blind Men and the Elephant: Probing the Epistemic Myopia of LLMs under Long-Tail Divergent Knowledge}, author={Pan, Zhuoshi and Lu, Junru and Qian, Yan and Zhao, H. Vicky and Yin, Di and Sun, Xing}, journal={arXiv preprint arXiv:2608.28478}, year={2026} }

搜集汇总
数据集介绍
ElephantBench 数据集图片
构建方式
ElephantBench 的构建过程严谨而系统,旨在探索语言模型对长尾知识与相关事实账户的记忆与回忆能力。其核心流程始于预过滤的低频文档集 D_low,通过全文档存储、SuperGPQA++ 知识点标注与 T-NER 实体提取,形成主题-槽位锚点。随后,在锚点组内及共享实体的跨知识点间进行候选文档对检索,并通过关系分类区分支持、冲突或无关联。冲突边及其支持邻居构成冲突子图,进而针对每个保留的冲突组合成两种表述形式的问题:命名实体型与线索型。所有生成问题均经过全文档验证与独立网络核验,确保答案的可靠性;最后,人工审查确认问题的无泄露性与无歧义性,仅通过审查的冲突组得以纳入基准。该流程融合自动化提取与多级验证,保证了数据的高质量与可追溯性。
使用方法
ElephantBench 的使用便捷且灵活。用户可通过 `elephantbench-run` 命令,利用任何兼容 OpenAI 的 API 模型进行推理,仅需提供系统指令与问题,模型即可生成回答,无需访问任何外部来源。随后,通过 `elephantbench-judge` 命令,使用 LLM 评判器对回答进行完整、部分或失败回忆的判定;`elephantbench-score` 计算标准的 C/P/F/K 指标,而 `elephantbench-analyze` 支持跨模型的对比与分组分析,便于研究者深入洞察模型性能。命令支持并发与断点续跑,适合大规模评估。此外,数据集也提供在 Hugging Face 上的镜像,便于直接下载使用。对于希望复现构建流程的研究者,`elephantbench-construct` 命令提供了全套构建工具的接口,从文档标注到问题验证,每一步均可独立执行与调试。
背景与挑战
背景概述
ElephantBench是由腾讯团队于2026年构建的闭卷知识探测基准,旨在评估大语言模型对长尾事实及其关联的多元已验证信息的记忆与召回能力。该基准包含1094个问题,采用命名实体与线索两种形式,填补了现有基准在矛盾性知识验证上的空白。通过系统的构建流程,包括知识标注、实体抽取、关系分类及冲突子图构建,ElephantBench提供了严谨的评测框架,对推动语言模型在细粒度知识一致性研究方面具有重要影响。
当前挑战
ElephantBench所解决的领域挑战在于,现有基准多聚焦于单源一致知识,未能模拟真实世界中同一事实存在多个不兼容的权威描述的情况,导致模型输出常与已验证信息冲突。构建过程中,团队面临从海量低资源文档中提取可靠长尾知识、自动识别并分类支持与矛盾关系、确保合成问题无答案泄漏并经受独立验证的挑战。此外,构建流水线涉及多阶段模型辅助处理,需平衡计算开销与数据质量,最终通过人工审查以保证基准的准确性和可靠性。
常用场景
经典使用场景
ElephantBench作为闭卷知识探针,旨在评估语言模型对长尾事实的回忆能力及其关联的已验证账户。其经典使用场景是,在无外部检索工具和源文档辅助的条件下,向模型提出两类问题:具名实体形式与线索形式,以严格考验模型内部存储的知识完整性。研究者通过运行`elephantbench-run`命令,对任意兼容OpenAI接口的模型进行基准测试,随后使用`elephantbench-judge`和`elephantbench-score`计算C/P/F/K指标,从而量化模型的完整回忆(C)、部分回忆(P)和失败回忆(F)比率。该场景为比较不同模型在长尾知识维度上的表现提供了标准化框架,尤其适用于闭卷问答、知识截止后的事实稳定性以及模型置信度校准等研究。
解决学术问题
该数据集精准回应了当前大语言模型研究中一个关键但常被忽视的学术问题:模型在长尾知识上的‘认知盲区’如何被系统性量化与诊断。传统基准往往聚焦于高频常识或通用能力,忽略了对罕见、争议性事实的微细区分。ElephantBench通过构造包含矛盾知识点的冲突子图,并引入两阶段验证流程,确保了每个问题焦点明确、无答案泄漏且存在独立证据支持,从而解决了评估中虚假相关性和数据污染等顽疾。其意义在于提供了一种可复现的、细粒度的知识回忆度测试方案,推动了对模型知识边界的理论探索,并为‘模型是否真正理解还是表面记忆’这一长期争论提供了实证工具。
实际应用
在实际应用中,ElephantBench可用于模型发布前的知识健壮性筛查,帮助开发团队识别特定领域的长尾事实错误或过时信息。其指标系统C/P/F/K可嵌入自动评估流水线,作为模型迭代的回归测试基准。此外,该数据集的构建工具链(如`elephantbench-construct`)允许从业者从自定义文档语料中生成类似基准,适应不同垂直领域(如法律、医学或历史文化)的专用模型评测。对于依赖精确事实的知识密集型应用(如问答系统、辅助决策工具),该基准能揭示模型在未经检索增强时的真实知识底线,从而引导是否加入外部知识库或混合检索策略的设计决策。
数据集最近研究
最新研究方向
在当前大语言模型迅猛发展的浪潮中,知识与真实世界之间的鸿沟日益成为学界瞩目的焦点。ElephantBench作为闭卷知识探针基准,以长尾事实与分歧性知识为切入点,通过命名实体与线索双模态问题设计,深入探究模型对多重验证答案的记忆与召回能力。其研究前沿已从单一事实检索拓展至知识冲突情境下的认知完整性评估,尤其关注模型在长尾知识分布中暴露的'认知盲区'现象。该基准首创的C/P/F/K四维指标体系,不仅量化了完全召回、部分召回与失败召回的状态,更通过跨模型贪婪覆盖分析揭示了多模型协同在弥合知识缺口方面的潜力。这一方向与检索增强生成、知识编辑等热点课题形成互补,为构建兼具事实准确性与知识鲁棒性的下一代语言系统提供了关键评测工具,对推动可信AI的发展具有里程碑式的意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务