遇见数据集

slashyear

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

slashyear 是一个面向历史事件的结构化数据集,数据来源于英文维基百科中关于年份、年代和世纪的文章,涵盖了从约公元前3000年至今的所有有确切日期的历史事件。该数据集的核心创新在于每一行都记录了对应文本的维基修订版本 ID(source_revid),使得引用可追溯且不可变,解决了维基百科内容动态更新导致的引用失效问题。数据集共包含四个子配置:events(每条记录对应一个带原文引用的事件)、years(每个年份及其首段摘要)、subjects(每个主题,如人物、地点、机构,多数带有维基数据 QID)以及 subject_events(主题与事件的连接关系,支持按主题筛选)。数据规模在 10,000 到 100,000 条之间。字段丰富,包括年份(天文编号,如 -43 表示公元前44年)、年份标签、日期、主题标签、原文文本、来源文章标题、修订版本 ID、所在章节、来源 URL 等。数据的构建过程完全确定性,没有语言模型参与修改文本,仅用模型对句子进行主题分类(共12个主题标签),因此不会引入额外的错误。主题关联也是基于维基编辑创建的[[维基链接]],而非推断。数据集适用于问答、文本检索、文本分类、表格问答等任务,尤其适合需要时间推理、溯源检索、知识库增强生成等场景。局限性包括:数据继承了维基百科原有的错误;覆盖范围不均,偏向欧洲和近三个世纪,公元前1000年之前的事件稀疏且往往不精确;仅支持英文。许可证为 CC-BY-SA-4.0,允许商业用途。

slashyear is a structured dataset of historical events, sourced from English Wikipedia articles about years, decades, and centuries, covering all dated historical events from around 3000 BCE to the present. Its core innovation lies in recording the Wikipedia revision ID (source_revid) for each row, making citations traceable and immutable, solving the citation invalidation problem caused by dynamic Wikipedia updates. The dataset consists of four sub-configurations: events (each record corresponds to an event with original text citation), years (each year with its first-paragraph summary), subjects (each subject, e.g., person, place, organization, most with Wikidata QID), and subject_events (connections between subjects and events, supporting subject filtering). The data size ranges from 10,000 to 100,000 entries. Fields include year (astronomical numbering, e.g., -43 for 44 BCE), year label, date, subject label, original text, source article title, revision ID, section, source URL, etc. The construction process is fully deterministic, with no language model modifying text; only a model is used for sentence topic classification (12 topic labels), thus avoiding additional errors. Subject associations are based on [[wikilinks]] created by Wikipedia editors, not inference. The dataset is suitable for QA, text retrieval, text classification, table QA, etc., especially for time reasoning, traceable retrieval, and knowledge base augmented generation. Limitations include inheriting Wikipedia errors, uneven coverage (biased toward Europe and the last three centuries, sparse and imprecise events before 1000 BCE), and English-only support. License: CC-BY-SA-4.0, allowing commercial use.

创建时间:
2026-09-10
原始信息汇总

slashyear 数据集概述

基本信息

  • 数据集地址:https://huggingface.co/datasets/realmaud/slashyear
  • 许可协议:CC BY-SA 4.0(继承自 Wikipedia,可用于任何用途,包括商业用途和模型训练)
  • 语言:英语
  • 数据规模:10K < n < 100K
  • 数据来源:从英文 Wikipedia 的年份、年代和世纪文章中提取的有日期历史事件,时间跨度约为公元前 3000 年至今

核心特点

每一行数据均携带 source_revid 字段,即该句子所引用的 Wikipedia 具体修订版本的编号。修订编号指向一个不可变的版本,可确保引用的链接长期保持一致,避免 Wikipedia 文章变动导致的引用失效问题。

配置(Configs)

配置名 单行内容
events 一条带日期的逐字引用事件,附其来源修订号
years 一个年份及其导语摘要
subjects 一个主体(人物、地点、机构),多数带有 Wikidata QID
subject_events 联结表:一个(主体, 事件)对

字段说明

events

year(天文纪年,-43 表示公元前 44 年)、year_labeldatetopictextsource_titlesource_revidsource_sectionsource_urlpage

subjects

sluglabelqiddescriptionentriesyearsfirst_yearlast_yearwikipediawikidatapage 带有 qid 的行可与任何以 Wikidata 为键的数据库联结,无需名称匹配。

subject_events

sluglabelqidyearyear_labeldatetopictextsource_revidsource_url

构建方式

  • 从固定修订版本的英文 Wikipedia 年份、年代和世纪文章 wikitext 中进行确定性提取,随后进行机械化清洗。
  • 没有任何语言模型改动措辞。模型仅执行一项任务:将句子归入十二个主题标签之一,该决策不会改变行的内容。
  • 主体关联也非推断得出——主体之所以与事件关联,是因为 Wikipedia 编辑在该日期行内写入了 [[wikilink]]

局限性

  • 继承 Wikipedia 的错误:若其中日期有误,此处同样有误。
  • 不继承 Wikipedia 的不稳定性,且因流程中不允许生成文本,故不新增自身错误。
  • 覆盖范围受 Wikipedia 年份文章所涵盖内容限制,各时期不均衡,严重偏向欧洲及近三个世纪。
  • 约公元前 1000 年之前的条目稀疏且常为近似值。
  • 仅限英语。

许可与署名

采用 CC BY-SA 4.0 协议。每行均携带文章标题和修订号,可自动完成署名:

{source_title}, English Wikipedia, revision {source_revid}. {source_url}

其他访问方式

  • 在线 API、全文搜索及 MCP 服务器:https://slashyear.com/data

任务类别

  • 问答(question-answering)
  • 文本检索(text-retrieval)
  • 文本分类(text-classification)
  • 表格问答(table-question-answering)

标签

history、chronology、timeline、wikipedia、wikidata、knowledge-base、rag、citations、temporal-reasoning、provenance

搜集汇总
数据集介绍
slashyear 数据集图片
构建方式
该数据集依托英文维基百科年、十年及世纪条目,以固定修订版本为抽取基准,通过确定性的维基文本解析流程获取带日期的历史事件,并实施机械化清洗。整个过程中未使用语言模型生成或改写文本,仅由模型对事件进行十二类主题标签的归类,主题关联亦严格沿袭维基百科编辑在行内所书写的维基链接,从而在源头上杜绝了内容篡改与虚构。
特点
数据集覆盖约公元前3000年至今的编年记录,每行均携带来源修订ID,确保引用指向不可变的维基百科版本,为回答提供可长期追溯的链接。数据结构包含事件、年份、主题及主题事件关联四个配置,主题行多附有维基数据QID,可与外部知识库无缝联接。数据规模介于一万至十万条之间,继承维基百科的记述偏差,而规避了其版本漂移之弊。
使用方法
通过Hugging Face数据集库加载相应配置即可使用,例如加载events配置并筛选特定年份,或加载subject_events配置按主题标识检索关联事件。使用者可借助来源标题与修订ID自动生成规范署名,亦可访问在线API与全文检索服务获取实时查询。该数据适用于问答、文本检索、分类及表格问答等任务,尤其利于需要时间推理与出处验证的场景。
背景与挑战
背景概述
在数字人文与历史信息检索领域,时间的精确锚定与来源的可追溯性始终是核心议题。slashyear数据集于2024年由独立研究者构建,旨在从英文维基百科的年份、十年及世纪条目中系统抽取约公元前3000年至今的带日期历史事件,并以source_revid字段固化每条记录的维基百科修订版本。该数据集直面维基百科内容动态漂移的痼疾,通过版本锚定确保引用在十年后仍可精确复现。其核心贡献在于为问答、检索与时间推理任务提供了兼具历史广度与来源稳定性的结构化语料,对基于知识库的检索增强生成及引用溯源研究具有显著推动力。
当前挑战
该数据集所应对的领域问题在于历史事件问答与检索中长期存在的来源易逝性与时间粒度参差性:维基百科页面持续编辑使得传统引用链接迅速失效,而历史记录本身横跨数千年,日期表述与覆盖密度极不均衡。构建过程中的挑战则体现为在不引入语言模型生成文本的前提下实现确定性抽取:需从维基文本中机械解析带日期的句子、机械关联维基链接所指示的主体,并仅由模型完成十二类主题标签的归类,任何生成步骤都可能引入失真。此外,条目覆盖偏重欧洲及近三百年,公元前1000年以前记录稀疏且常为近似值,英语单语限制亦构成其固有边界。
常用场景
经典使用场景
在时序问答与知识检索领域,对事件发生年份的精确溯源构成了构建可信系统的基石。slashyear数据集最为经典的使用场景,在于支撑带引证的时间推理任务:研究者可利用events配置按年份或日期筛选出逐字引用的事件记录,借助subjects与subject_events配置,将人物、地点或机构与具体年份的事件相互关联,从而回答诸如特定历史人物在何年参与了何事之类的查询。其每条记录均附带source_revid,使得所生成答案能够回溯至英文维基百科的确切修订版本,为问答与检索任务提供了可验证的时序证据链。
实际应用
在实际应用中,slashyear可被用于搭建历史时间线检索工具、维基百科引用校验服务以及基于检索增强生成的历史问答系统。开发者通过加载subject_events配置,能以slug或Wikidata QID为键,快速聚合某一主题相关的全部纪年事件,进而生成带稳定链接的时间脉络。该数据集亦可用于训练引用生成模型,使其输出的每条历史陈述均能附带来源修订号与可访问链接,从而在新闻核查、教育辅助与文化遗产数字化等场景中,提供兼具时效稳定性与来源可查性的信息支撑。
衍生相关工作
围绕slashyear的发布,一系列衍生工作已在时序知识建模与检索增强生成方向展开。其一为全文本检索与实时API服务,允许研究者以编程方式按主题、年份或关键词访问事件流;其二为兼容MCP协议的服务端实现,使大模型能够直接调用该数据集进行带引证的历史问答。此外,基于subject_events的关系型模式,催生了以Wikidata QID为枢纽的跨库实体链接实验,推动了历史知识图谱的自动化构建与时间轴可视化应用,为后续时序推理与出处追踪研究提供了可扩展的范例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务