ENTLORE
收藏资源简介:
ENTLORE是一个由ScitiX.ai构建的图基基准,专为评估企业问答中的潜在组织推理能力而设计。该数据集包含2,341份来自三类企业源类型的文档和907个精心设计的问题,涵盖显式查找、跨源组合及潜在组织推理三个层次。其构建过程通过重建审计的企业世界,从常规文档、权威组织表和操作记录中生成真相图,并匿名化发布,确保目标关系在发布的语料中隐而不显。该基准旨在解决现有企业问答基准仅测试显式事实组合的局限,推动系统从隐含的组织关系中恢复目标关系,从而提升企业级问答的实用性与鲁棒性。
ENTLORE is a graph-based benchmark constructed by ScitiX.ai, specifically designed to evaluate latent organizational reasoning capabilities in enterprise question answering (QA). This dataset includes 2,341 documents from three types of enterprise source materials, alongside 907 meticulously designed questions covering three levels: explicit lookup, cross-source composition, and latent organizational reasoning. Its construction process involves reconstructing audited enterprise scenarios, generating a ground-truth graph from routine documents, authoritative organizational tables, and operational records, and releasing the dataset after anonymization to ensure that target relationships remain implicit in the published corpus. This benchmark aims to address the limitation of existing enterprise QA benchmarks that only test explicit fact combinations, pushing systems to recover target relationships from implicit organizational relations, thereby enhancing the practicality and robustness of enterprise-grade QA systems.
🏛️ EntLORE 数据集概述
EntLORE(EntLORE: A Graph-Grounded Benchmark for Latent Organizational Reasoning in Enterprise Question Answering)是一个面向企业问答场景的图基基准数据集,专注于评估模型在潜在组织关系推理上的能力。
核心特点
- 问题设定:企业答案往往依赖于未在单一文档中明确陈述的组织关系。EntLORE 重建了一个经过审计的企业真实图谱,发布一个匿名化的文档世界,其中金牌答案和证明均基于该图谱计算生成,但目标推导关系对被测系统完全保密。
- 数据规模:数据集约 15 MB,包含 2,341 篇 Markdown 文档(1,194 篇报告、794 篇知识库、353 篇工单)、907 道问题、907 个金牌答案数据包(包含所需事实、证据指针、证明/评分模式)。其背后的真值图包含 1,153 个实体和 3,784 条类型化关系。
- 问题分层:问题分为三层——L1 显式事实(469 题)、L2 跨事实组合(204 题)、L3 推导潜在关系(234 题)。共有 62 种算子(问题类型),其中 18 题经过验证不可回答(弃权)。
访问条件与评测
评测覆盖 8 个答案模型 × 7 种知识访问条件,访问条件包括:
| 条件 | 基线ID | 衡量内容 |
|---|---|---|
| 闭卷 | closed_book |
参数记忆下限(无检索) |
| BM25 | bm25 |
朴素稀疏词汇检索 |
| RAG | rag |
平坦稠密 top-k 单轮检索 |
| 智能体检索 | agentic_rag |
基于稠密索引的多轮自主工具循环 |
| LLM Wiki | okf |
基于 LLM 编译离线知识库的导航循环 |
| GraphRAG | graphrag |
基于归纳实体图 + Leiden 社区报告的双工具循环 |
| Oracle Ω | oracle_rag / oracle_agentic_rag / oracle_okf |
完美证据上限(直接输入金牌数据包) |
主要发现
- 访问的组织方式比检索机制更重要:BM25(0.529)、GraphRAG(0.522)、LLM Wiki(0.509)位列顶尖;智能体检索(0.365)和平坦稠密 RAG(0.360)低于约 15 个百分点。
- 即便提供完美证据,潜在关系问题仍无法解答:Oracle 条件下,L3 潜在关系问题仍有 30.4% 无法回答(L1 为 12.6%,L2 为 6.2%),残余差距源于推理而非检索。
- 平坦稠密检索表现不及纯词汇索引:发布的文档通过稀疏锚点(项目别名、模块名、工单术语)标识其组织区域,BM25 能优先排序这些锚点,而单一稠密空间会将其淹没。
- 文档失效时排序反转:70% 的 L3 条目抗拒平坦检索,此时 GraphRAG 领先(0.310),BM25 降至 0.251——GraphRAG 通过离线物化关系作答,而非更好检索。
- 不匹配的检索框架浪费预算:在不可检索的 L3 条目上,30 步智能体检索得分 0.088,低于无语料闭卷下限(0.077)。
- 差距集中于层级归属:部门归属方面,词汇检索 0.02 对比归纳图 0.53(Oracle 回答率 84% 时)。
- 开放权重模型在关键场景媲美或超越专有模型:在最强可部署条件(GraphRAG)上,L3 最难题目前四名均为开放权重模型:GLM-5.2(0.431)、DeepSeek-V4-Flash(0.398)、Qwen3.5-397B(0.396)、DeepSeek-V4-Pro(0.386),均领先最佳专有模型(Claude-Sonnet-4.6,0.383)和 GPT-5.4(0.341)。专有模型仅在 Oracle 上限(Claude,L3 达 0.763)占优。
快速使用
- 需要 Python 3.10+ 和 API 访问权限,无需本地 GPU;所有生成和嵌入调用通过远程端点进行。
- 模型调用通过
src/llm.py,可将API_BASE指向任意 OpenAI 兼容端点,ANTHROPIC_BASE_URL指向 Anthropic(或兼容中继)。路由依据模型名前缀——claude*使用 Anthropic 原生协议,其余使用 OpenAI 兼容端点。 - 提供 5 题子集
dataset/smoke.json用于冒烟测试,仅需closed_book+bm25,无需嵌入端点。 - 全套流程包括:
python scripts/build_indexes.py构建索引、python scripts/run_eval.py运行评估、python scripts/score.py评分。支持自带系统(只需读取dataset/corpus/和dataset/questions.json并输出答案)。
许可证与数据声明
- 代码采用 Apache-2.0 许可证;数据集采用 CC BY-NC-SA 4.0。
- 语料为完全合成且匿名化(英文):将经审计的真实企业世界重建为虚构组织,人物、项目、别名和日期通过共享身份映射转换,私有元数据从未在文档中显式提及。
- 第三方组件(
third_party/)中包含附带的 GraphRAG(MIT)和 OKF(Apache-2.0)。
引用
@article{entlore2026, title = {{EntLORE}: A Graph-Grounded Benchmark for Latent Organizational Reasoning in Enterprise Question Answering}, author = {Zheng, Akrin and Wu, Alexander and Liu, Alaia}, journal = {arXiv preprint arXiv:2608.10679}, year = {2026}, eprint = {2608.10679}, archivePrefix = {arXiv}, primaryClass = {cs.IR} }




