TEMPORALWIKI
收藏资源简介:
TEMPORALWIKI是由韩国科学技术院开发的一个持续性基准数据集,用于训练和评估不断进化的语言模型。该数据集利用英文维基百科和英文维基数据的连续快照之间的差异,构建了用于训练的TWIKI-DIFFSETS和用于评估的TWIKI-PROBES。数据集的创建过程完全自动化,每月随着维基媒体发布新的快照而更新,旨在解决语言模型因时间变化的需求而产生的知识更新问题。
TEMPORALWIKI is a sustained benchmark dataset developed by the Korea Advanced Institute of Science and Technology (KAIST) for training and evaluating evolving language models. It constructs TWIKI-DIFFSETS for model training and TWIKI-PROBES for model evaluation by leveraging the differences between consecutive snapshots of English Wikipedia and English Wikidata. The entire dataset creation workflow is fully automated, and it is updated monthly in line with new snapshots released by Wikimedia. Its core purpose is to address the knowledge update challenges faced by language models arising from temporal variations and shifting demands.
TemporaWiki 数据集概述
数据集来源
- 数据集用于论文《TemporalWiki: A Lifelong Benchmark for Training and Evaluating Ever-Evolving Language Models》,该论文被 EMNLP 2022 接受。
数据集内容
- 包含预处理的训练和评估数据,共5个时间快照,时间范围从2021年8月至2021年12月。
- 数据集包括以下部分:
- Wikipedia_Full: 完整的维基百科语料库。
- TWiki_Diffsets: 差异集,用于主要实验。
- TWiki_Probes: 探针集,用于评估。
数据集下载
数据集使用
- 数据集用于进行持续预训练和轻量级微调实验。
- 实验配置和组件详情请参考 Continual-Knowledge-Learning 仓库。
数据集生成
- 数据集的生成方法请参考 TemporalWikiDatasets 仓库。




