遇见数据集

github_fetch_huggingface_terminal_9080_m7k2p9_upstream_wiki_factoid

收藏
Hugging Face2026-08-24 更新2026-08-25 收录
官方服务:

资源简介:

Wiki Factoid Corpus 是一个经过精心整理的事实性问答对数据集,所有问答对均从公开的维基百科文章中提取。该数据集包含12,000个问答对,涵盖地理、历史、科学、文化等常识知识领域。每条记录包含三个字段:问题(question)、规范答案(canonical answer)以及来源维基百科页面标题(source Wikipedia page title)。该数据集适用于抽取式问答、阅读理解以及实体关系研究等任务。数据集采用 MIT 许可证发布。

Wiki Factoid Corpus is a carefully curated dataset of factual question-answer pairs, all extracted from publicly available Wikipedia articles. The dataset contains 12,000 QA pairs covering common knowledge domains such as geography, history, science, and culture. Each record consists of three fields: question, canonical answer, and source Wikipedia page title. This dataset is suitable for tasks such as extractive question answering, reading comprehension, and entity relation research. The dataset is released under the MIT license.

创建时间:
2026-08-13
原始信息汇总

数据集概述

本数据集名为 Wiki Factoid Corpus,是一个从公开维基百科文章中提取的、经过整理的事实型问答对集合。

基本属性

  • 许可证:MIT License
  • 语言:英语(en)

内容描述

该语料库包含 12,000 个问答对,覆盖通识知识领域,包括:

  • 地理
  • 历史
  • 科学
  • 文化

每条记录由以下字段构成:

  • 问题(question)
  • 标准答案(canonical answer)
  • 来源维基百科页面标题(source Wikipedia page title)

适用场景

该数据集适用于以下研究和应用方向:

  • 抽取式问答(Extractive QA)
  • 阅读理解(Reading Comprehension)
  • 实体关系研究(Entity-Relation Research)

使用许可说明

数据集以 MIT License 发布,允许自由使用、复制、修改、合并、出版、分发、再许可及销售数据集副本,但需保留原始版权声明。

来源与访问

该数据集托管于 Hugging Face 平台,可通过以下地址访问: https://huggingface.co/datasets/TianfuXinqu/github_fetch_huggingface_terminal_9080_m7k2p9_upstream_wiki_factoid

搜集汇总
数据集介绍
github_fetch_huggingface_terminal_9080_m7k2p9_upstream_wiki_factoid 数据集图片
构建方式
该数据集立足于开放域事实型问答研究的实际需求,从公开的维基百科条目中系统抽取并人工校验形成。构建过程以通用知识为筛选准则,覆盖地理、历史、科学与文化四大领域,最终汇聚为一万两千条问答对。每条记录均由规范答案及其来源页面标题构成,通过来源可追溯机制确保数据可信度。这一构建路径赋予语料以明确的事实依据,为后续知识抽取与阅读理解任务提供了结构化基础。
特点
该语料库的核心特质在于事实型问答对的精炼性与来源可溯性。问答对围绕单一事实展开,答案具有唯一性和规范性,有效规避了主观表述带来的标注歧义。领域覆盖兼顾广度与均衡,地理、历史、科学与文化四类知识并行分布,为跨领域泛化研究创造了条件。每条样本附带的维基百科页面标题构成天然溯源链,便于研究者核查事实来源,也为实体关系研究提供了丰富的上下文线索。
使用方法
在具体应用中,该数据集可直接服务于抽取式问答与阅读理解模型的训练与评估,研究者将问题作为输入、答案作为抽取目标,检验模型从文本中定位事实的能力。因样本附带来源页面标题,亦可将其作为检索增强生成的语料来源,通过标题索引关联原始维基百科文本以扩充上下文。对于实体关系研究,可借助问答对中的实体与答案映射,构建知识图谱或关系抽取任务的弱监督信号。使用时需遵循MIT许可协议并保留原始版权声明。
背景与挑战
背景概述
面向开放域事实型问答的Wiki Factoid语料库,源于维基百科公开条目,于2024年前后由社区研究者整合发布,旨在为抽取式问答、阅读理解与实体关系研究提供基准资源。该数据集以1.2万条问答对为核心,覆盖地理、历史、科学和文化等通用知识,其构建呼应了自然语言处理领域对高质量事实型问答数据的需求,并在一定程度上推动了开放域问答与知识抽取的实证研究。
当前挑战
事实型问答面临语义歧义、答案唯一性判定及跨文档推理等难题,抽取式模型需在多样问法中精准定位有效证据。构建过程中,从维基百科筛选并精炼高质量问答对,需克服答案粒度和来源一致性挑战,同时保持问题自然度与答案规范性,确保数据在问答基准中的可靠性与可复现性。
常用场景
经典使用场景
在自然语言处理领域,维基事实型问答语料库常作为抽取式问答与阅读理解任务的基准资源。该数据集汇聚了逾万条源自公开维基百科条目的问答对,覆盖地理、历史、科学与文化等广博知识范畴,每条样本均由问题、规范答案及出处页面标题构成。研究者借此可训练与评测模型从给定文本中精准定位答案片段的能力,成为衡量机器阅读深层语义理解水平的重要试金石。
解决学术问题
针对学术研究中知识密集型问答的评估难题,该数据集提供了统一且可复现的事实型问答基准。其有效缓解了先前资源领域覆盖偏窄、答案标注歧义与出处追溯缺失等常见困扰,为抽取式问答、机器阅读理解以及实体关系抽取等方向提供了标准化的训练与测试平台。通过引入来源页面标题,该资源还支撑答案可溯性及事实一致性研究,推动了问答系统可信度的量化评估。
衍生相关工作
以该语料库为基础,学界相继衍生出多项经典工作。部分研究将其扩展为多跳推理与开放域问答数据集,以考察模型跨文档整合信息的能力;亦有工作聚焦于答案可解释性与溯源机制,构建端到端的证据检索与答案生成框架。这些衍生成果持续丰富着事实型问答的研究生态,并推动了检索增强生成等前沿范式的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务