遇见数据集

eb1911

收藏
Hugging Face2026-07-18 更新2026-07-19 收录
官方服务:

资源简介:

本数据集是1911年第11版《大英百科全书》的完整语料库,包含约37,000篇文章的清洁Markdown文本,并重建了三个知识图谱:交叉引用图、主题分类法和作者关系图。这些图谱基于印刷版分类索引和贡献者表格重建,而非原始文本中存在。数据集文件包括articles.jsonl(每篇文章的文本、元数据、章节、分类、交叉引用和贡献者信息)、xref_edges.jsonl(交叉引用图边)、topics.json(主题分类节点)、contributors.json(作者关系节点)以及清单和模式文件。文章记录包含ID、标题、类型、卷号、字数、分类、章节、贡献者、图像引用、交叉引用和Markdown内容等字段。数据集适用于文本检索、问答和文本生成任务,尤其支持GraphRAG等知识增强应用。需要注意的是,该数据集是1911年的历史文献,其科学、地理和政治内容已过时,可能包含当时共识但现代视为冒犯的观点,应作为历史文档谨慎使用。文本来源为Wikisource和Internet Archive的公共领域转录,项目贡献了Markdown渲染和知识图谱重建,采用CC-BY-SA 4.0许可证。

This dataset is the complete corpus of the 11th edition of Encyclopædia Britannica published in 1911, containing cleaned Markdown text of approximately 37,000 articles, and reconstructs three knowledge graphs: the cross-reference graph, the subject taxonomy, and the author relationship graph. These graphs are reconstructed based on the classification index and contributor tables of the print edition, rather than existing in the original text. The dataset files include articles.jsonl (containing the text, metadata, sections, categories, cross-references and contributor information of each article), xref_edges.jsonl (edges of the cross-reference graph), topics.json (subject taxonomy nodes), contributors.json (author relationship nodes), as well as manifest and schema files. Article records include fields such as ID, title, type, volume number, word count, categories, sections, contributors, image citations, cross-references and Markdown content. This dataset is applicable to tasks such as text retrieval, question answering and text generation, and particularly supports knowledge-enhanced applications including GraphRAG. It should be noted that this dataset is a historical document from 1911, whose scientific, geographical and political content is outdated, and may contain views that were widely accepted at the time but are considered offensive by modern standards. It should be used cautiously as a historical document. The text sources are public domain transcriptions from Wikisource and the Internet Archive. The project contributed Markdown rendering and knowledge graph reconstruction, and the dataset is licensed under CC-BY-SA 4.0.

创建时间:
2026-07-06
原始信息汇总

数据集概述:Encyclopædia Britannica, 11th Edition (1911) — Full Corpus with Knowledge Graphs

基本信息

  • 数据集名称:Encyclopædia Britannica, 11th Edition (1911) — Full Corpus with Knowledge Graphs
  • 许可证:CC-BY-SA 4.0
  • 语言:英语
  • 大小:10K < n < 100K 条记录
  • 标签:百科全书、历史、参考、知识图谱、GraphRAG、RAG
  • 任务类别:文本检索、问答、文本生成

数据集内容

  • 包含1911年版《大英百科全书》全部约37,000篇文章,以清晰的Markdown格式提供。
  • 除文本外,还包含从该版本及其索引卷重建的三个知识图谱
    • 交叉引用图xref_edges.jsonl):每篇文章与其提及的其他文章之间的链接,已解析和消歧(如区分“苏黎世市”与“苏黎世州”)。
    • 主题分类法topics.json):所有文章根据第29卷印刷分类索引归入该版本自己的主题层级体系(例如“动物学”下的所有子主题)。
    • 作者关系图contributors.json):撰稿学者名单及其著作,包括将首字母缩写(如“R. N. B.”)解析为具名学者及其资质。

文件结构

文件 说明
articles.jsonl 每行一篇文章:Markdown文本、元数据、章节、分类、交叉引用和贡献者信息
xref_edges.jsonl 交叉引用图的边:每条记录为 {from, to, display}
topics.json 主题分类法:节点包括 {id, name, path, parent, articles}
contributors.json 作者关系图:每位学者及其贡献的文章ID
manifest.json 版本、精确计数和SHA-256校验和
schema.json articles.jsonl 记录的JSON Schema
LICENSE 许可条款(CC-BY-SA 4.0)和署名要求

文章记录示例 json { "id": "21-0935-poland-POLAND", "title": "POLAND", "type": "article", "volume": 21, "page_start": 902, "word_count": 42817, "url": "https://www.britannica11.org/article/21-0935-poland-POLAND", "categories": ["history/europe-(continental)/general"], "sections": [{"title": "Polish Literature", "slug": "polish-literature", "level": 1}], "contributors": [{"initials": "R. N. B.", "name": "Robert Nisbet Bain"}], "images": [{"file": "..."}], "xrefs": [{"to": "21-0962-poland-russian-POLAND__RUSSIAN", "display": "Poland, Russian"}], "markdown": "(Polish Polska …)" }

  • 图片以引用(file字段)形式存储,不包含二进制数据。

知识图谱的价值

  • 本数据集不同于现有的扁平OCR版本,重建了印刷版中不直接存在的结构:
    • 交叉引用图:可用于GraphRAG(图检索增强生成)。
    • 主题分类法:支持按子主题范围检索(如“搜索所有属于动物学的文章”)。
    • 作者关系图:提供1911年学术界的群体传记学信息,以及权威性/来源追溯信号。

加载方式

  • 通用加载(JSON Lines): python import json articles = [json.loads(l) for l in open("articles.jsonl", encoding="utf-8")] edges = [json.loads(l) for l in open("xref_edges.jsonl", encoding="utf-8")] topics = json.load(open("topics.json", encoding="utf-8")) authors = json.load(open("contributors.json", encoding="utf-8"))

  • 使用Hugging Face Datasets库: python from datasets import load_dataset ds = load_dataset("britannica11/eb1911", data_files="articles.jsonl", split="train")

内容说明

  • 本数据集是1911年的历史文献,其科学内容已过时,地理和政治描述已不存在,且包含当时教育界共识中如今被视为冒犯的种族、帝国等观点。
  • 它作为历史文档被保存和分发,而非当前参考源。如用于训练或基础模型,需谨慎处理。

数据来源:文本源自维基文库和互联网档案馆的1911年《大英百科全书》转录,知识图谱从第29卷印刷分类索引和各卷撰稿人表格重建。完整方法论见 britannica11.org/about

许可与署名:在CC-BY-SA 4.0下发布。请署名:

Encyclopædia Britannica, 11th Edition corpus — britannica11.org — CC-BY-SA 4.0.

搜集汇总
数据集介绍
eb1911 数据集图片
构建方式
该数据集以1911年版《大英百科全书》的全部约37,000篇文献为基础,采用清洗后的Markdown格式文本,并附有三张重建的知识图谱:交叉引用图、主题分类图以及作者关系图。这些图谱并非从原始文本中直接提取,而是通过解析该百科全书印刷版第29卷的分类索引和各卷撰稿人表格,经系统化重构而成。数据集还提供了JSON Schema描述、版本清单与校验和文件,确保结构的可验证性与可复现性。
特点
其独特之处在于突破了传统OCR纯文本数字化的局限,将隐含于印刷文献中的知识结构显性化。交叉引用图精准链接了所有条目间的内部关联,并完成了实体消歧;主题分类图将全部文献纳入百科全书自身的层级分类体系,支持按学科子区域检索;作者关系图还原了撰稿人姓名缩写与全名、著作的对应关系,为文献溯源与学术权威性分析提供了结构化的元数据支撑。
使用方法
用户可直接通过JSON格式加载数据:使用Python的json模块读取articles.jsonl等文件,或借助Hugging Face Datasets库以load_dataset('britannica11/eb1911', data_files='articles.jsonl', split='train')方式便捷调用。该数据集适用于文本检索、问答系统与文本生成任务,尤其在基于知识图谱的检索增强生成(GraphRAG)场景中,其内置的图结构与分类体系可显著提升检索的精确性与上下文的语义丰富度。
背景与挑战
背景概述
《大英百科全书》第十一版(1911年)被誉为“学者版”的顶峰,由剑桥大学出版社出版,汇聚了当时全球顶尖学者的智慧,诸如阿尔伯特·爱因斯坦、西格蒙德·弗洛伊德等均参与撰稿。该数据集由britannica11.org项目团队于近年整理发布,旨在将这部约3.7万篇文章的巨著从零散OCR文本转化为结构化知识资源。其核心研究问题在于如何通过重构隐含于印刷索引与撰稿人列表中的知识图谱,使这部历史文献能够适配现代自然语言处理任务,特别是在检索增强生成(RAG)与知识图谱推理领域。该数据集因提供了跨引用图谱、主题分类体系与作者身份图谱三层重建结构,对数字人文学科与大型语言模型的基础设施建设具有开创性影响,成为连接历史学术传统与现代计算分析的桥梁。
当前挑战
该数据集所解决的领域问题聚焦于历史百科全书的深度结构化与知识图谱重建,挑战在于原始文本仅包含扁平化OCR内容,缺乏机器可读的关联信息。具体而言,跨引用图谱需从近4万篇文章中解析并消歧内部链接,例如区分同名的城市与州;主题分类需以印刷版第29卷分类索引为依据,将每个文章归入层级化主题树;作者身份图谱则需将短小缩写(如“R. N. B.”)解析为具名学者及其学术背景。构建过程中面临的主要困难包括:原文图片仅作为引用保留以维持文本处理轻量化,需按需动态获取;百余年前的学术用语、过时地理政治划分及种族观点需谨慎标注为历史文本,避免误导现代模型;同时需保证三角图谱的精确性与一致性,确保每个节点与边可溯源至印刷材料,这对数据清洗与验证流程提出了极高要求。
常用场景
经典使用场景
eb1911数据集以1911年版《大英百科全书》的完整文本为核心,融合了三类重构的知识图谱——交叉引用图、主题分类树与作者图谱,为自然语言处理领域提供了兼具历史深度与结构化语义的基准资源。其最经典的使用场景集中在基于检索增强生成(RAG)与图检索增强生成(GraphRAG)的知识密集型任务中,例如利用交叉引用图实现跨文档的语义关联推理,或借助主题分类树进行限定领域的精细检索。此外,该数据集还被广泛用于历史文本的机器阅读理解、段落级问答系统评估,以及在大语言模型微调中注入特定时期的百科全书式知识,以检验模型对历史语境的适应能力。
解决学术问题
eb1911数据集有效解决了历史文献数字化中结构稀缺与语义孤立两大核心问题。现有OCR文本通常仅保留平面字符,缺乏跨条目关联与知识体系的显式建模,而该数据集通过重构分类索引与作者贡献网络,将约3.7万条目的零散知识重塑为可计算的层次化图谱。这消解了传统研究中“文本孤岛”现象,支持学者探究20世纪初科学话语的学科边界、跨主题引用模式及学者社群的协作结构。其意义在于为计算历史学、知识考古与科学社会学提供量化分析工具,使“1911年知识景观”得以被系统性地比较与解释,推动数字人文从文本存储迈向语义理解。
衍生相关工作
eb1911数据集催生了多项标志性研究工作。在数字人文领域,研究者基于其作者图谱展开学者影响力分析,揭示了1911年顶尖知识分子如威廉·詹姆斯、阿尔伯特·爱因斯坦的跨学科贡献模式;在信息检索领域,该数据集被用作RAG系统的标准测试床,推动了对图结构索引与稠密向量检索的融合优化。此外,知识图谱重构方法论的创新也由此发端,例如从分类索引逆推语义层次结构的算法,被后续工作应用于《不列颠百科全书》其他版本及《自然》期刊历史语料。大语言模型领域,该数据集成为评估模型事实时效性遗忘的基准——通过比较模型对1911年与当代知识的回答差异,量化训练数据时间偏差的影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务