遇见数据集

neurographdb-results

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

NeuroGraphDB 实验结果数据集包含了针对多跳问答的图检索方法(无需 LLM 调用构建图)的完整实验原始结果。每个 JSON 文件存储一次运行的聚合指标(如检索准确率)、McNemar 统计检验结果以及运行配置(池大小、随机种子、嵌入模型、LLM 及超参数)。实验覆盖多个类别:基线(dense/BM25/RRF 混合检索)、图检索核心实验(种子-稀疏度扫描)、端到端问答(使用 Qwen2.5-7B 和 72B 模型)、HippoRAG 2 在相同条件下的复现、查询门控机制(三个种子重复)、以及被拒绝的预注册机制(Hebbian、传播、别名、扇出等,共九个中七个失败,并保留了运行前的机制预测记录)。数据集还提供了检索性能对比表(HotpotQA、2WikiMultihopQA、MuSiQue 上所有支持段落出现在前 10 中的问题比例),以及索引时间对比(4,943 个段落,本方法零 LLM 调用耗时秒级,HippoRAG 2 每段落两次 LLM 调用共 74 分钟)。该数据集主要用于复现实验、分析图检索方法在多跳问答中的表现,并验证预注册机制的假设。注意:作者不声称更高的答案准确率,在端到端问答中本方法未显著优于 HippoRAG 2,且在 MuSiQue 上被 HippoRAG 2 超越。

The NeuroGraphDB experimental results dataset contains complete raw experimental results for graph retrieval methods for multi-hop question answering that do not require LLM calls to construct graphs. Each JSON file stores the aggregated metrics (e.g., retrieval accuracy) from one run, the results of McNemar's statistical test, and the run configuration including pool size, random seed, embedding model, LLM and hyperparameters. The experiments cover multiple categories: baseline methods (dense/BM25/RRF hybrid retrieval), core graph retrieval experiments (seed-sparsity scan), end-to-end question answering using Qwen2.5-7B and 72B models, replication of HippoRAG 2 under identical conditions, query gating mechanism (three seed repetitions), and rejected pre-registered mechanisms (Hebbian, propagation, alias, fan-out, etc., 7 out of 9 failed, with pre-run mechanism prediction records retained). The dataset also provides retrieval performance comparison tables (the proportion of questions where all supporting paragraphs appear in the top 10 results on HotpotQA, 2WikiMultihopQA, and MuSiQue), as well as indexing time comparisons: for 4,943 paragraphs, the proposed method with zero LLM calls takes seconds, while HippoRAG 2 requires two LLM calls per paragraph, totaling 74 minutes. This dataset is primarily used to reproduce experiments, analyze the performance of graph retrieval methods in multi-hop question answering, and validate the hypotheses of pre-registered mechanisms. Note: The authors do not claim higher answer accuracy; this method does not significantly outperform HippoRAG 2 in end-to-end question answering, and is outperformed by HippoRAG 2 on MuSiQue.

创建时间:
2026-08-01
原始信息汇总

NeuroGraphDB 实验结果数据集概述

该数据集存储了 NeuroGraphDB 项目的全部实验结果原始文件。NeuroGraphDB 是一项关于多跳问答(multi-hop QA)中图检索(graph retrieval)方法的研究,其核心特点是在构建图的过程中完全不调用任何大语言模型(LLM)

数据集遵循 MIT 许可证,使用英文,主要标签包括检索(retrieval)、图 RAG(graph-rag)、多跳问答(multi-hop-qa)和可复现性(reproducibility)。

数据集内容结构

每个 JSON 文件记录一次实验运行的完整信息,包括:

  • 聚合指标(aggregate metrics)
  • McNemar 统计检验结果
  • 运行配置(池大小、随机种子、嵌入器、LLM、超参数)

项目 README 中的每个数据均可追溯到本数据集中的对应文件。

实验分类

数据集按前缀组织,涵盖以下实验类别:

前缀 实验内容
baseline_* Dense / BM25 / RRF 混合基线
graph_* 种子稀疏度扫描(核心发现)
qa_*compare3_* 端到端问答,使用 Qwen2.5-7B 和 72B
hipporag_* 在相同条件下运行 HippoRAG 2 及其排名
gate_* 查询门控,跨三个随机种子重复实验
hebbian_*prop_*alias_*fan_* 预注册但被否决的机制
rematch_* 启用门控后与 MuSiQue 的正面对比

值得注意的是,被否决的实验被有意保留在数据集中——九个预注册机制中有七个失败,每条记录都包含了实验前写下的机制预测。

核心结果

检索性能(top-10 内包含全部支持段落的问题比例,n=500,池、问题、嵌入器、LLM 均相同):

数据集 Dense 本方法 HippoRAG 2
HotpotQA 0.874 0.940 0.934
2WikiMultihopQA 0.534 0.920 0.796
MuSiQue 0.330 0.394 0.454

索引效率对比(4,943 个段落):

  • HippoRAG 2:74 分钟,每个段落需 2 次 LLM 调用
  • 本方法:仅需数秒,零 LLM 调用

明确声明: 该方法不声称更高的答案准确率——在端到端问答中从未显著超越 HippoRAG 2,且在 MuSiQue 上被 HippoRAG 2 反超。

搜集汇总
数据集介绍
neurographdb-results 数据集图片
构建方式
在面向多跳问答的图检索研究中,实验结果的透明留存与复现构成方法学基础。NeuroGraphDB以无任何大语言模型调用的方式构建图结构,其原始结果文件采用JSON格式逐次运行记录聚合指标、McNemar检验及运行配置(候选池规模、随机种子、嵌入模型、大语言模型与超参数),覆盖稠密检索、BM25、RRF混合基线、种子稀疏性扫描、端到端问答及HippoRAG 2对照等系列,并有意保留七项被拒机制及其事先预测,从而形成可完整追溯的实证档案。
特点
该数据集的核心特征在于其可复现性与消歧性兼顾。每条记录均绑定具体的实验配置与统计检验,使仓库README中的每一项数值均可回溯至单一文件;预注册机制经多随机种子重复验证,九项中七项被拒的结果亦被明确留存。相较于依赖逐段大语言模型调用的索引流程,本方法以零大语言模型调用实现秒级建索引,并在HotpotQA与2WikiMultihopQA的检索召回上展现优势,同时客观标明在MuSiQue上逊于HippoRAG 2。
使用方法
使用该数据集时,研究者可依据前缀定位特定实验族,解析JSON文件以获取聚合指标、McNemar检验统计量及完整运行配置。通过比对相同候选池、问题集、嵌入模型与大语言模型条件下的检索结果,可独立复现或验证原研究的结论;利用保留的被拒机制文件及其事前预测,可开展机制检验与偏差分析。该数据集亦适用于作为图检索增强生成与多跳问答研究的基准参照及可复现性审计资源。
背景与挑战
背景概述
多跳问答要求系统跨越多篇文档整合信息,其检索环节长期依赖稠密向量或稀疏词频匹配,难以捕捉实体间的结构性关联。在此背景下,NeuroGraphDB 项目探索了完全无需大语言模型调用即可构建图结构的检索方法,其配套数据集 neurographdb-results 系统记录了全部实验的原始结果。该数据集由 maninbook 团队创建,涵盖稠密、BM25、RRF 混合基线以及图检索、查询门控、端到端问答等多类实验,并保留九项预注册机制中七项被拒的完整记录。其核心贡献在于以零 LLM 调用的索引方式,在 HotpotQA 与 2WikiMultihopQA 上取得领先的检索覆盖率,同时将索引耗时从数十分钟压缩至秒级,为图检索的可复现研究提供了透明、细粒度的证据基础。
当前挑战
该数据集所面对的领域问题在于:多跳问答的检索阶段需在庞大语料中精确定位分散的支持性段落,现有稠密与稀疏方法在复杂多跳场景下覆盖率显著下降,而引入大语言模型构建图结构虽能提升效果,却带来高昂的索引成本与不可复现性。在构建过程中,挑战同样突出:既要保证不同基线、图检索、门控及端到端问答实验在相同问题集、池规模、嵌入器与语言模型条件下严格可比,又需完整记录被拒机制的预测与结果以避免选择性报告,同时还需在 MuSiQue 等困难数据集上呈现方法局限,确保结论不因实验设计偏差而失真。
常用场景
经典使用场景
在多跳问答的图检索研究领域,该数据集作为NeuroGraphDB实验的原始结果集合,承载了无LLM调用图构建方法的系统性评估。其经典使用场景聚焦于检索性能的基准对比,涵盖稠密检索、BM25及RRF混合基线,并针对种子稀疏性扫描这一核心发现,在HotpotQA、2WikiMultihopQA与MuSiQue三个标准数据集上开展受控实验。每个JSON文件完整记录聚合指标、McNemar检验及运行配置,确保从索引到检索的每一步均可追溯与复现。
解决学术问题
该数据集直面多跳问答中图检索方法可复现性不足与LLM依赖过重的双重困境。通过提供无LLM调用的图构建完整记录,包括被拒绝的预注册机制及其预测,它解决了学术研究中结果不可验证、失败实验缺失的常见问题。其意义在于以透明记录推动可复现研究文化,证明零LLM调用可在部分场景逼近甚至超越LLM增强方法,为资源受限下的图检索研究提供实证基础与批判性参照。
衍生相关工作
该数据集衍生了多项围绕图检索与多跳问答的经典工作。其与HippoRAG 2的受控对比激发了后续对LLM调用必要性的再审视;查询门控机制在三个种子上的复现为稳健性研究提供范例;被拒绝的七项预注册机制记录则催生了关于失败实验价值与机制设计边界的讨论。这些工作共同推进了无LLM图检索、可复现评估及混合检索策略等领域的发展,并持续影响多跳问答系统的设计哲学。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务