遇见数据集

NeuML/historical-english-books

收藏
Hugging Face2026-07-20 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是1919年之前的历史英语书籍集合,整合了来自以下四个数据集的书籍:British Library Books、Biodiversity Heritage Library、Library of Congress Selected Digitized Books和Project Gutenberg PG19。根据以下规则进行混合选择:语言为英语;对Biodiversity Heritage Library限制为最受欢迎的自然科学出版物(版本数大于1);对Library of Congress只选择科学主题,因为其他来源已提供良好的普通文学覆盖。数据字段包括书籍ID、来源集合、出版年份、书名、由LLM生成的19世纪散文风格摘要、应用的书域类别标签、OCR质量评分(0.0到1.0)以及书籍全文。

This dataset is a collection of historical English books from before 1919. It aggregates books from the following datasets into a single dataset: British Library Books, Biodiversity Heritage Library, Library of Congress Selected Digitized Books, and Project Gutenberg PG19. A blend of each of the datasets was selected using the following rules: Language = English; limit natural science to most popular publications (>1 edition) from Biodiversity Heritage Library; select only science subjects from Library of Congress collection given good general literature coverage from other sources. Fields include id, source, year, title, abstract (LLM-generated abstract written in prose of 1800s), label (domain category applied to book), quality (OCR quality from 0.0 to 1.0), and text (full text of the book).

提供机构:
NeuML
搜集汇总
数据集介绍
NeuML/historical-english-books 数据集图片
构建方式
该数据集汇聚了1919年以前的英文历史书籍,整合自英国图书馆藏书、生物多样性遗产图书馆、美国国会图书馆精选数字化图书及Project Gutenberg PG19四个来源。通过设定语言为英语、限制生物多样性遗产图书馆中自然科学的出版物仅保留一个以上版本、以及优先从国会图书馆选取科学类图书以补充其他来源在通用文学领域的覆盖,形成了统一的集合。
特点
数据集包含丰富的字段,如书籍ID、来源标识、出版年份、标题、LLM生成的19世纪风格摘要、领域标签、OCR质量评分及全文文本。其独特的摘要由大语言模型生成,语体仿照19世纪散文风格,增强了历史语境。OCR质量评分(0.0至1.0)提供了文本转录的可靠性指标,便于筛选高质量数据。
使用方法
该数据集适用于历史语言学、数字人文及机器学习领域的研究者,可用于训练文本生成模型、分析19世纪前英语语言演变、或开发历史文献的自动分类与摘要系统。用户可通过字段筛选特定来源、年份或质量区间的文本,并利用领域标签进行针对性研究。需注意这些书籍反映出版时代的文化价值观,可能包含与现代观点不符的内容。
背景与挑战
背景概述
historical-english-books数据集由NeuML等机构于近期创建,旨在汇聚1919年以前出版的英语书籍,为自然语言处理与历史文本分析领域提供统一的数据资源。该数据集整合了英国图书馆藏书、生物多样性遗产图书馆、美国国会图书馆精选数字图书以及Project Gutenberg PG19等四个来源,通过语言过滤与学科筛选(如限制生物多样性遗产图书馆的自然科学书籍为流行版本、仅选取国会图书馆的科学类书籍)生成高质量语料。数据集的核心研究问题聚焦于历史英语文本的语义理解与年代差异分析,其丰富的元数据字段(包括出版年份、领域标签、OCR质量评分及LLM生成摘要)为跨学科研究提供了基础。自发布以来,该数据集已广泛应用于历史语言学、数字人文及预训练语言模型等领域,推动了对19世纪及更早英语文本的深度挖掘与模型评估。
当前挑战
该数据集面临的主要挑战包括:1)领域问题层面,历史英语书籍的语言风格、拼写习惯与标点使用与现代英语差异显著,且涉及文学、科学、法律等多学科,导致模型在处理语义连贯性与时代适应性时存在困难,如OCR错误与罕见词汇的干扰;2)构建过程中,从四个异构数据源(如Biodiversity Heritage Library的偏移质量、国会图书馆的学科偏差)中统一格式并筛选高相关性文档面临技术障碍,此外,OCR质量评分(0.0-1.0)揭示了部分书籍的文本清晰度不足,影响了后续模型训练的可靠性。解决这些挑战需要开发专门的历史文本清洗算法与知识增强方法。
常用场景
经典使用场景
历史英语书籍数据集(historical-english-books)汇聚了1919年以前出版的大量英文书籍,源自大英图书馆、生物多样性遗产图书馆、美国国会图书馆及Project Gutenberg等多个权威机构。该数据集最经典的使用场景在于自然语言处理领域的预训练语言模型构建,尤其适用于需要理解历史英语文本语义与语法的任务。研究者可利用其丰富的文本资源,训练或微调模型以捕捉19世纪及更早时期的英语表达方式、词汇演变及文化语境,从而提升模型在古籍数字化、历史文献分析与跨时代文本理解上的表现。此外,该数据集还常被用于历史语言学研究中,通过大规模语料分析探索英语语言的历时性变化规律,为算法在非现代英语场景下的鲁棒性提供宝贵的训练数据。
实际应用
在实际应用中,历史英语书籍数据集为数字图书馆和文化遗产保护机构提供了坚实的资源基础,支持自动化的书籍分类、主题标注与元数据生成。出版商和内容管理平台利用该数据集训练模型,以改进古籍的全文检索系统和智能推荐引擎,使用户能够高效定位特定历史时期的文献。在教育领域,该数据集被用于开发历史英语学习工具,帮助语言学习者直观对比古今英语的异同。此外,生物多样性研究机构借助其中包含的科学文本,挖掘19世纪生态观察数据,以辅助现代环境变化分析。通过融合多源书籍,该数据集还赋能了跨文学与科学的知识图谱构建,推动人文与自然学科的交叉应用,展现了历史文本在当代知识服务中的持久价值。
衍生相关工作
基于历史英语书籍数据集,学术界衍生了多项经典工作。例如,研究人员利用该数据集构建了专门面向19世纪英语的领域标签器(domain-labeler),实现了对科技、文学、历史等类别的自动分类,显著提升了古籍检索的组织效率。另有工作聚焦于OCR质量评估与增强,通过分析数据集中的质量分数,开发出针对低质量扫描文本的校正算法,推动了历史文档数字化的精度。在语言模型领域,该数据集被用于微调如BLEU、ROUGE等评估指标在历史文本上的适应性,催生了更符合古英语特征的生成式模型。此外,跨数据集比较研究也由此展开,探索不同来源书籍在主题分布与语言风格上的异同,为语料库构建提供了方法论参考,这些工作共同拓展了历史语料在计算人文中的创新应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务