遇见数据集

encyclopedic-completion-corpus

收藏
Hugging Face2026-07-24 更新2026-07-27 收录
官方服务:

资源简介:

百科全书补全语料库是一个用于文本生成和问答任务的大规模英文数据集,专注于事实性知识的多词补全。它提供基于年份条件的长短语补全对,涵盖科学常数、人物(如创始人)、地理信息、事件日期和算术运算等领域。每个数据样本包括提示和对应的补全短语,短语长度通常为8-20个词,超越单一实体标记。数据集还标注了知识截止年份(表示事实在该年份前有效)、类别和来源。数据规模为每个文件约5500万行,按年份组织(如2013年)。类别分布近似为:科学常数占30%,事件日期占26%,人物创始人占22%,地理占13%,算术占9%。数据来源于公共百科全书式时间线、传记、地理资料、离线CC0风格静态表格/公式、合成算术,以及可选的Wikidata SPARQL查询(CC0许可)。该数据集适用于训练或评估模型在百科全书式事实补全、知识问答和文本生成任务中的性能。

The Encyclopedic Completion Corpus is a large-scale English dataset for text generation and question-answering tasks, focusing on multi-word completion of factual knowledge. It provides year-conditioned long-phrase completion pairs covering areas such as scientific constants, people (e.g., founders), geographic information, event dates, and arithmetic operations. Each data sample includes a prompt and a corresponding completion phrase, typically 8-20 words long, going beyond single-entity tokens. The dataset also annotates the knowledge cutoff year (indicating when the fact was valid), category, and source. The data scale is approximately 55 million lines per file, organized by year (e.g., 2013). The category distribution is roughly: scientific constants 30%, event dates 26%, people founders 22%, geography 13%, arithmetic 9%. Data sources include public encyclopedic timelines, biographies, geographic materials, offline CC0-style static tables/formulas, synthetic arithmetic, and optional Wikidata SPARQL queries (CC0 license). This dataset is suitable for training or evaluating models in encyclopedic fact completion, knowledge-based QA, and text generation tasks.

创建时间:
2026-07-23
搜集汇总
数据集介绍
encyclopedic-completion-corpus 数据集图片
构建方式
该数据集基于公开的百科全书式时间线、传记与地理资料,结合离线CC0风格静态表格与公式,以及合成算术问题构建而成。可选地,还利用Wikidata SPARQL查询(CC0协议)进行补充。数据以年份为知识截止条件,形成多词补全对,每个样本包含提示、补全短语、年份、类别与来源字段,覆盖科学常量、事件日期、人物创始人、地理与数学算术五大类别,其中科学常量占比最高达30%,数学算术占比最低为9%。
特点
数据集独具匠心,聚焦于多词短语补全任务,短语长度通常为8至20词,超越了单一实体词的补全局限。其年份条件化设计确保事实知识在特定时间点有效,赋予数据动态切面。类别混合精心调配,科学常量、事件日期与人物创始人合计占比超78%,强化了事实性与百科全书式知识的代表性。数据规模宏大,每个年份文件含约1.19亿行,为大规模文本生成与问答任务提供了坚实基础。
使用方法
数据集适用于文本生成与问答任务,用户可直接使用JSON格式的样本进行模型训练与评估。每个样本包含‘prompt’作为输入提示,‘phrase’作为目标补全。建议按‘year’字段筛选特定知识截止时间的数据分片,以适应时间敏感型应用。类别标签可用于多任务学习或分层采样,例如重点训练科学常量或地理类别。仅支持英文,使用前需解压并加载如‘years/2013.jsonl’这样的文件,兼容HuggingFace Datasets库的流式加载方式。
背景与挑战
背景概述
Encyclopedic Completion Corpus于2013年由研究机构基于公开百科全书式时间线、传记、地理资料及CC0协议下的静态表格构建而成,旨在解决大规模事实性知识的多词补全任务。该数据集的核心研究问题在于超越传统单实体标记的预测,生成8至20个词汇的精细化短语,涵盖科学常数、事件日期、人物创始人、地理信息及数学运算五大类别,显著提升了预训练语言模型对时序事实及跨域知识的理解与生成能力。其在文本生成与问答任务中作为基准资源,推动了知识增强型自然语言处理领域的发展,尤其为年份条件化的事实检索与多跳推理提供了高质量评估框架。
当前挑战
该数据集所针对的领域问题挑战在于现有模型无法有效处理多词连续补全与时序事实的依赖性,导致生成结果缺乏精确性与逻辑连贯性。构建过程中面临多重困难:首先需从异构来源(如维基数据SPARQL接口、合成算术语料)中筛选并统一格式,确保事实在给定年份截断点(2013年)的时效性与权威性;其次需平衡类别分布以避免偏差——例如科学常数占30%而算术仅9%,同时应对多源数据中的噪声与缺失值;此外还需设计足够长的短语(8-20词)以测试模型的长程依赖建模能力,这对数据标注与质量审核提出了严峻要求。
常用场景
经典使用场景
该数据集旨在服务于百科知识驱动的文本生成与问答任务,尤其聚焦于多词短语的连贯补全。与传统单实体填空不同,它要求模型基于年份条件生成8至20个词长的完整陈述,涵盖科学常数、人物传记、地理信息、事件日期与数学运算等五大知识类别。研究者常将其用作评估语言模型事实记忆能力与时序敏感性的基准,通过比对模型在不同知识截止年份下的输出,检验模型对静态事实与动态信息的区分与更新能力。其设计精妙之处在于,每个样本均附带明确的时间戳,使得知识时效性成为可量化的评价维度,从而推动模型从单纯的语言流畅性向事实可靠性迈进。
实际应用
在实际应用中,该数据集可直接用于教育辅助系统的知识问答增强、智能搜索的片段补全优化以及事实核查工具的基准构建。例如,在构建科学知识助手时,模型需能准确补全“碳的原子序数是…”并继续阐述其化学分类,而非仅仅输出单个数字;在地理问答场景中,模型需生成包含上下文关系的完整描述。此外,新闻摘要与百科条目的自动化撰写亦可借助该数据进行风格与事实一致性的微调。其年份标注特性尤其适用于金融、法律等对信息时效性敏感的行业,帮助系统区分“当前有效”与“历史存档”的事实,从而降低因知识过时而引发的决策风险。
衍生相关工作
该数据集衍生了一系列围绕知识时效性、事实记忆与持续学习的前沿工作。研究者基于其年条件化特性,提出了时间感知的知识图谱补全方法,以及针对语言模型知识更新频率的动态评估协议。部分工作聚焦于对比不同规模模型在科学常量与人事动态上的记忆衰减曲线,进而设计出优化训练数据配比的策略。此外,该数据集还催生了面向长跨度生成的可信度评测框架,促使学界开发出能够显式建模事实有效期的神经网络架构。这些衍生研究共同将数据集的贡献从简单的评测基准,拓展为推动语言模型向知识可靠、时间自适应方向发展的重要驱动力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务