遇见数据集

ENTLORE

收藏
arXiv2026-08-12 更新2026-08-14 收录
数据链接:
官方服务:

资源简介:

ENTLORE是一个由ScitiX.ai构建的图基基准,专为评估企业问答中的潜在组织推理能力而设计。该数据集包含2,341份来自三类企业源类型的文档和907个精心设计的问题,涵盖显式查找、跨源组合及潜在组织推理三个层次。其构建过程通过重建审计的企业世界,从常规文档、权威组织表和操作记录中生成真相图,并匿名化发布,确保目标关系在发布的语料中隐而不显。该基准旨在解决现有企业问答基准仅测试显式事实组合的局限,推动系统从隐含的组织关系中恢复目标关系,从而提升企业级问答的实用性与鲁棒性。

ENTLORE is a graph-based benchmark constructed by ScitiX.ai, specifically designed to evaluate latent organizational reasoning capabilities in enterprise question answering (QA). This dataset includes 2,341 documents from three types of enterprise source materials, alongside 907 meticulously designed questions covering three levels: explicit lookup, cross-source composition, and latent organizational reasoning. Its construction process involves reconstructing audited enterprise scenarios, generating a ground-truth graph from routine documents, authoritative organizational tables, and operational records, and releasing the dataset after anonymization to ensure that target relationships remain implicit in the published corpus. This benchmark aims to address the limitation of existing enterprise QA benchmarks that only test explicit fact combinations, pushing systems to recover target relationships from implicit organizational relations, thereby enhancing the practicality and robustness of enterprise-grade QA systems.

提供机构:
ScitiX.ai
创建时间:
2026-08-11
原始信息汇总

🏛️ EntLORE 数据集概述

EntLORE(EntLORE: A Graph-Grounded Benchmark for Latent Organizational Reasoning in Enterprise Question Answering)是一个面向企业问答场景的图基基准数据集,专注于评估模型在潜在组织关系推理上的能力。

核心特点

  • 问题设定:企业答案往往依赖于未在单一文档中明确陈述的组织关系。EntLORE 重建了一个经过审计的企业真实图谱,发布一个匿名化的文档世界,其中金牌答案和证明均基于该图谱计算生成,但目标推导关系对被测系统完全保密。
  • 数据规模:数据集约 15 MB,包含 2,341 篇 Markdown 文档(1,194 篇报告、794 篇知识库、353 篇工单)、907 道问题、907 个金牌答案数据包(包含所需事实、证据指针、证明/评分模式)。其背后的真值图包含 1,153 个实体和 3,784 条类型化关系
  • 问题分层:问题分为三层——L1 显式事实(469 题)、L2 跨事实组合(204 题)、L3 推导潜在关系(234 题)。共有 62 种算子(问题类型),其中 18 题经过验证不可回答(弃权)。

访问条件与评测

评测覆盖 8 个答案模型 × 7 种知识访问条件,访问条件包括:

条件 基线ID 衡量内容
闭卷 closed_book 参数记忆下限(无检索)
BM25 bm25 朴素稀疏词汇检索
RAG rag 平坦稠密 top-k 单轮检索
智能体检索 agentic_rag 基于稠密索引的多轮自主工具循环
LLM Wiki okf 基于 LLM 编译离线知识库的导航循环
GraphRAG graphrag 基于归纳实体图 + Leiden 社区报告的双工具循环
Oracle Ω oracle_rag / oracle_agentic_rag / oracle_okf 完美证据上限(直接输入金牌数据包)

主要发现

  • 访问的组织方式比检索机制更重要:BM25(0.529)、GraphRAG(0.522)、LLM Wiki(0.509)位列顶尖;智能体检索(0.365)和平坦稠密 RAG(0.360)低于约 15 个百分点。
  • 即便提供完美证据,潜在关系问题仍无法解答:Oracle 条件下,L3 潜在关系问题仍有 30.4% 无法回答(L1 为 12.6%,L2 为 6.2%),残余差距源于推理而非检索。
  • 平坦稠密检索表现不及纯词汇索引:发布的文档通过稀疏锚点(项目别名、模块名、工单术语)标识其组织区域,BM25 能优先排序这些锚点,而单一稠密空间会将其淹没。
  • 文档失效时排序反转:70% 的 L3 条目抗拒平坦检索,此时 GraphRAG 领先(0.310),BM25 降至 0.251——GraphRAG 通过离线物化关系作答,而非更好检索。
  • 不匹配的检索框架浪费预算:在不可检索的 L3 条目上,30 步智能体检索得分 0.088,低于无语料闭卷下限(0.077)。
  • 差距集中于层级归属:部门归属方面,词汇检索 0.02 对比归纳图 0.53(Oracle 回答率 84% 时)。
  • 开放权重模型在关键场景媲美或超越专有模型:在最强可部署条件(GraphRAG)上,L3 最难题目前四名均为开放权重模型:GLM-5.2(0.431)、DeepSeek-V4-Flash(0.398)、Qwen3.5-397B(0.396)、DeepSeek-V4-Pro(0.386),均领先最佳专有模型(Claude-Sonnet-4.6,0.383)和 GPT-5.4(0.341)。专有模型仅在 Oracle 上限(Claude,L3 达 0.763)占优。

快速使用

  • 需要 Python 3.10+ 和 API 访问权限,无需本地 GPU;所有生成和嵌入调用通过远程端点进行。
  • 模型调用通过 src/llm.py,可将 API_BASE 指向任意 OpenAI 兼容端点,ANTHROPIC_BASE_URL 指向 Anthropic(或兼容中继)。路由依据模型名前缀——claude* 使用 Anthropic 原生协议,其余使用 OpenAI 兼容端点。
  • 提供 5 题子集 dataset/smoke.json 用于冒烟测试,仅需 closed_book + bm25,无需嵌入端点。
  • 全套流程包括:python scripts/build_indexes.py 构建索引、python scripts/run_eval.py 运行评估、python scripts/score.py 评分。支持自带系统(只需读取 dataset/corpus/dataset/questions.json 并输出答案)。

许可证与数据声明

  • 代码采用 Apache-2.0 许可证;数据集采用 CC BY-NC-SA 4.0
  • 语料为完全合成且匿名化(英文):将经审计的真实企业世界重建为虚构组织,人物、项目、别名和日期通过共享身份映射转换,私有元数据从未在文档中显式提及。
  • 第三方组件(third_party/)中包含附带的 GraphRAG(MIT)和 OKF(Apache-2.0)。

引用

@article{entlore2026, title = {{EntLORE}: A Graph-Grounded Benchmark for Latent Organizational Reasoning in Enterprise Question Answering}, author = {Zheng, Akrin and Wu, Alexander and Liu, Alaia}, journal = {arXiv preprint arXiv:2608.10679}, year = {2026}, eprint = {2608.10679}, archivePrefix = {arXiv}, primaryClass = {cs.IR} }

搜集汇总
数据集介绍
构建方式
在构建ENTLORE数据集时,我们首先从真实企业环境中采集了常规文档、权威组织表与运营记录三类异构源数据,通过重建带有来源追踪的原始图(raw graph)来刻画人员、项目、模块、活动与客户等实体间的多类型关系。随后,依据版本化的组织约定库,对图执行经过审计的推理规则,生成带有认证标记的真理图(truth graph),该图不仅区分了原生、元数据、启发式与认证派生关系,还确保每条派生边都记录其规则版本与依赖链。为保证数据隐私,我们应用统一的匿名化映射,将私有实体、别名及日期进行一致性替换,形成仅包含文档语料的发布版本,而私有结构、验证规则与目标关系则完全保留在内部。最后,每个问题均由类型化图算子生成,通过在图谱上执行查询获得完整答案与证明依赖,并由验证器审查答案的可判定性、完整性、唯一性以及目标关系在发布语料中的缺失性,最终形成包含2341篇文档与907个问题的基准。
特点
ENTLORE数据集的核心特色在于其面向潜在组织推理的图基构建范式与传统基准截然不同,它并非围绕预设答案路径来合成语料,而是从真实世界重建经审计的企业图谱,并仅对外发布对齐的匿名化文档集,从而将目标关系隐去,迫使系统从分散的证据中恢复隐含的组织结构。该数据集包含三个层次的能力分解:L1显式查找、L2跨源组合与L3潜在组织推理,其中L3问题确保目标关系在任意发布文档中均不出现,仅凭真理图中的认证推理可解。所有问题的答案均支持完整的证明证书与来源锚定,同时通过系列发布门控(如目标缺失性扫描、隐私筛选与原始保真校验)确保数据的可靠性、完整性与隐私安全。此外,数据集还提供多样化的评估配置,涵盖封闭式、词法检索、密集检索、代理流程、LLM知识库及图RAG等56种模型与访问组合,能够系统衡量不同方法在证据获取、组合推理与潜在关系恢复上的表现差异。
使用方法
使用ENTLORE时,研究者需先下载公开的文档语料与问题集,并通过提供的代码库加载版本化基准。系统仅能访问发布文档,不可接触私有真理图、组织约定或目标关系。评估流程要求对每个问题,系统依据所选访问范式(如BM25、Flat RAG、Agentic检索、LLM Wiki或GraphRAG)从语料中检索并生成答案。官方提供完整的评分脚本,支持对确定性答案类型(如实体、集合、计数)进行自动精确匹配,对自由形式答案则通过固定裁判模型进行原子主张的蕴含评分。为保证比较公平,所有条件共享相同的底层语料与索引构建参数,并遵循统一的预算限制(如迭代次数、令牌数与时间限制)。此外,数据集还附带了金文档路径的预言机参考(Ω),用于分离文档召回误差与推理残余误差,帮助用户定位系统在潜在组织推理上的具体瓶颈。用户可基于此基准进行方法对比、误差分析或训练数据增强,以推进企业问答系统对隐含组织结构的建模能力。
背景与挑战
背景概述
企业问答系统通常依赖于对内部文档的检索与生成式回答,然而,日常工作中产生的记录往往隐含了未被显式陈述的组织关系。现有基准虽能提供多源证据,却多围绕预设答案路径构建,难以评估系统从分散信息中恢复隐藏关系的能力。为填补这一空白,ScitiX.ai的Akrin Zheng等研究者于2026年提出了ENTLORE基准,通过重建经审计的企业世界并发布对齐的匿名化文档语料,共包含2,341篇文档与907个问题,覆盖显式查询、跨源组合与潜在组织推理三个层次,为评估企业问答中的潜在组织推理能力提供了严谨的测试平台,对相关领域研究具有重要推动意义。
当前挑战
ENTLORE所面临的挑战主要聚焦于潜在组织推理这一核心难题,即系统需从异构且未直接陈述的文档中恢复组织特定的关系,而非简单组合已有事实。此外,构建过程中亦充满挑战:需确保问题答案的完整性与唯一性,在匿名化发布时保持数据保真度,同时防止目标关系泄露。实验显示,即便提供黄金文档,仍有30.4%的潜在问题无法解答,凸显了该任务对组织推理能力的深度依赖。同时,传统检索方法在潜在推理上表现不佳,而图结构访问虽略优但仍存显著差距,表明现有技术尚难以充分应对此类复杂推理需求。
常用场景
经典使用场景
ENTLORE数据集的核心应用场景在于评估和提升企业问答系统对隐式组织关系的推理能力。该基准构建了一个经过审计的企业世界,包含来自日常文档、权威组织表和操作记录的2341篇文档,并设计了907个问题,其中覆盖显式查找、跨源组合和潜在组织推理三个能力层级。研究者可利用该数据集系统性地测试检索增强生成(RAG)、图检索(GraphRAG)及智能体(Agentic)等不同访问范式在复杂的组织信息需求上的表现,尤其关注那些目标关系未在语料库中显式出现的情形,从而推动企业级知识问答从简单的文本检索向深层次的组织结构理解演进。
实际应用
在实际应用中,ENTLORE可模拟企业员工日常遇到的信息需求场景,例如根据项目模块记录推断员工所属项目,或从多个部门文档中聚合职责归属。其评估矩阵覆盖从传统词汇检索(BM25)到现代图增强检索(GraphRAG)再到智能体工作流(Agentic)的多种部署条件,能帮助技术团队在部署真实企业知识库前,客观比较不同架构在显式查询与潜在组织推理上的性能差异,从而选择最合适的检索与推理方案。此外,该基准的匿名化发布机制和可审计的证明链设计,使其成为企业级RAG系统在上线前进行能力审计和风险排查的可靠测试床,确保系统不仅能够召回文档,更能正确利用隐性的组织结构关系。
衍生相关工作
ENTLORE的提出推动了多项相关研究工作的发展。一方面,其图基构建框架(graph-grounded construction)启发了后续研究者在其他垂直领域(如金融、法律)构建类似的可审计基准,通过真值图与语料投影分离的方式,精确衡量模型在缺失显式证据时的推理边界。另一方面,ENTLORE揭示的‘潜在组织推理’能力缺口,刺激了针对结构化访问方法的优化研究,例如改进图索引构建、增强跨源关系传播的检索器,以及设计更有效的智能体工具调用策略。此外,该基准提供的细粒度误差分析(如保留性分析、证据组装诊断)也为开发可解释性更强、鲁棒性更高的企业QA系统提供了方法论参考,促进了大语言模型在组织知识管理场景中的落地评估标准形成。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务