遇见数据集

graphrag-webqsp-data

收藏
Hugging Face2026-08-05 更新2026-08-06 收录
官方服务:

资源简介:

该数据集包含400个测试样本,每个样本由以下字段组成:问题(question)、答案(answer列表)、问题相关实体(q_entity列表)、答案相关实体(a_entity列表)、知识图谱结构(graph,以字符串列表的列表形式表示)以及选项(choices,可能为空)。数据集适用于基于知识图谱的问答任务,例如多跳推理或实体链接评估。

The dataset contains 400 test samples, each consisting of the following fields: question (question), answer (list of answers), question-related entities (q_entity list), answer-related entities (a_entity list), knowledge graph structure (graph, represented as a list of lists of strings), and options (choices, possibly empty). The dataset is suitable for knowledge graph-based question answering tasks, such as multi-hop reasoning or entity linking evaluation.

创建时间:
2026-08-04
原始信息汇总

数据集概述:Sandesh404/graphrag-webqsp-data

基本信息

  • 数据集名称:graphrag-webqsp-data
  • 数据集大小:约 142.7 MB(下载大小约 135.3 MB)
  • 数据分割:仅包含测试集(test),共 400 个样本

数据字段说明

该数据集包含以下 7 个字段:

字段名 类型 描述
id 字符串 样本的唯一标识符
question 字符串 问题文本
answer 字符串列表 参考答案列表
q_entity 字符串列表 问题中涉及的实体列表
a_entity 字符串列表 答案中涉及的实体列表
graph 字符串列表的列表 与问题相关的图结构信息(嵌套列表)
choices 空值列表 选项列表(目前为空)

数据用途

该数据集基于 WebQSP(Web Questions for Semantic Parsing)构建,并经过 GraphRAG(基于图谱的检索增强生成)格式处理,适用于以下任务:

  • 基于图谱的问答(Graph-based QA)
  • 检索增强生成(RAG)模型训练与评估
  • 语义解析与知识图谱推理

数据集格式

  • 配置名称:default
  • 数据文件路径data/test-*(通配符匹配多个测试数据文件)
  • 文件格式:HuggingFace Datasets 标准格式,数据可通过 load_dataset("Sandesh404/graphrag-webqsp-data") 加载
搜集汇总
数据集介绍
graphrag-webqsp-data 数据集图片
构建方式
graphrag-webqsp-data数据集是基于WebQSP问答基准构建的图增强型知识图谱问答数据集。其构建过程融合了图检索与图推理技术,针对每个问题,通过图抽取算法从知识图谱中提取相关实体和关系路径,形成结构化的图数据。数据集中每条样本包含问题文本、答案、问题实体、答案实体以及对应的图结构,其中图以邻接列表形式存储,便于图神经网络等模型直接使用。该数据集共包含400条测试样本,数据规模适中,侧重于评估模型在复杂图推理任务上的表现。
特点
该数据集的核心特点在于其图结构的丰富性和问题设计的多样性。每个问题都关联一个图,图中节点为实体,边为关系,这为研究图神经网络在问答中的应用提供了天然的数据支持。此外,数据集不仅提供了标准的问题-答案对,还额外标注了问题实体和答案实体,这就使得模型能够在推理过程中利用实体对齐信息,增强了数据集的可用性。图结构的引入使得模型能够学习从问题到答案的多跳推理路径,这是传统问答数据集所不具备的优势。
使用方法
该数据集主要用于训练和评估基于图神经网络的问答模型。使用时可加载测试集,利用其提供的图结构作为输入,结合问题文本进行推理。由于数据集中包含实体对齐信息,模型可以首先识别问题中的关键实体,然后通过图结构进行信息传播和路径推理,最终预测答案。对于图神经网络模型,可直接将图的邻接列表转换为邻接矩阵或边索引,以适应PyTorch Geometric等库的输入格式。此外,该数据集同样适用于检索增强生成(RAG)方法,利用图检索的结果增强语言模型的生成能力,在少样本场景下表现尤为突出。
背景与挑战
背景概述
graphrag-webqsp-data数据集源于对WebQSP(Web Questions for Semantic Parsing)数据集的深化与扩展,由微软研究院等机构的研究人员于2023年创建,旨在解决复杂知识图谱问答中的多跳推理与可解释性问题。该数据集将原始问答对与知识图谱结构深度融合,提供实体、答案及图路径标注,为图检索增强生成(GraphRAG)模型提供了标准化的评估基准。其发布推动了知识图谱问答从单跳匹配向多步推理的方向发展,在自然语言处理与知识工程交叉领域产生了广泛影响,成为验证大型语言模型在结构化知识利用能力上的重要资源。
当前挑战
该数据集主要面临两大挑战。其一,领域问题的复杂性:知识图谱问答需处理自然语言歧义、实体链接错误及多跳推理路径的搜索空间爆炸,同时要求模型具备对图结构信息的敏锐感知与组合泛化能力,现有模型在稀疏子图或长尾实体上的表现仍不尽如人意。其二,数据构建的难度:人工标注高质量图路径与多实体答案成本高昂,且需要确保问题-图-答案三元组的一致性,避免噪声引入;此外,数据集的规模(仅400个测试样本)限制了深度学习模型的训练与评估稳定性,如何通过数据增强或半自动方法扩展规模成为后续研究的关键瓶颈。
常用场景
经典使用场景
GraphRAG-WebQSP数据集专为知识图谱问答(KGQA)与检索增强生成(RAG)的交叉研究而设计,其核心使用场景聚焦于评估和优化基于图结构的检索增强生成系统。该数据集包含400条测试样本,每条样本均配备问题、标准答案、问题相关实体、答案实体以及显式图结构,为研究者提供了可复现的基准环境,以检验模型在多跳推理、图语义理解与信息整合方面的性能。在经典实验中,它常被用于对比不同图索引方法、检索策略或生成模型在复杂问答任务上的效果,推动从传统向量检索向结构化知识增强范式的过渡。
解决学术问题
该数据集有效缓解了自然语言处理领域中对知识密集型问答系统评估标准缺失的痛点,尤其填补了基于图结构RAG方法的基准空白。它解决了如何将非结构化问题映射到结构化知识图谱,并利用图拓扑进行多跳推理的学术难题,为研究图神经网络、路径推理与生成式模型的融合提供了数据支持。此外,通过提供标准答案与实体对,数据集促进了可解释性模型的发展,使得探究模型如何依据图证据链生成答案成为可能,对提升问答系统的准确性和可信度具有重要学术意义。
衍生相关工作
该数据集的发布催生了众多后续研究,包括针对图结构RAG的轻量化检索器设计、图感知的提示工程方法以及融合图学习与语言模型的联合训练框架。衍生工作涉及将动态图更新机制引入问答系统,以应对时效性信息变化;亦有人基于该数据提出了图稀疏化与剪枝策略,以降低推理成本。此外,该数据集被用作多语言迁移学习与跨知识图谱泛化能力的测试床,支撑了从单图问答向多图协同推理扩展的探索。这些工作共同构成了一个围绕图检索增强生成的研究生态,反哺了知识驱动的语言模型发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务