遇见数据集

NeuML/historical-english-books-similarity

收藏
Hugging Face2026-07-20 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是“历史英语书籍”数据集中标题-摘要对和查询-句子对的随机样本。数据主要来自维多利亚时代直至1899年。标题和摘要直接取自上游数据源,每本书按句子分割,每个分割随机选择句子,并确保分割间无重叠。查询使用19世纪散文风格由大型语言模型生成。此外,数据集还包含一个与BEIR兼容的“测试”分割版本,可用于评估基于此数据训练的向量模型的准确性。

This dataset constitutes a random sample of title-summary pairs and query-sentence pairs sourced from the "Historical English Books" dataset. The data primarily covers the Victorian era through 1899. Titles and summaries are directly extracted from upstream data sources. Each book is segmented at the sentence level, with sentences randomly selected from each segment, and no overlap is ensured between these segments. Queries were generated by a large language model in the style of 19th-century English prose. Additionally, the dataset includes a BEIR-compatible "test" split, which can be used to evaluate the accuracy of vector models trained on this dataset.

提供机构:
NeuML
搜集汇总
数据集介绍
NeuML/historical-english-books-similarity 数据集图片
构建方式
该数据集源于对历史英文书籍语料库的深入挖掘,从NeuML提供的historical-english-books数据集中随机抽取标题-摘要对与查询-句子对构建而成。其数据主体源自维多利亚时代至1899年的文献,标题与摘要保持原始形态。每本书籍被拆分为独立句子,随后按数据划分随机抽取样本,并通过逻辑验证确保各划分间无重叠。查询语句则利用19世纪散文风格,由大语言模型生成,以模拟时代语境。
特点
数据集的一大特色在于其时代聚焦性,专注于维多利亚时期及之前的英文文献,为研究历史语言演变与语义相似性提供了独特素材。其包含BEIR兼容的测试集划分,可直接用于评估向量模型的准确性,赋予了数据集在信息检索与语义匹配任务中的实用性。此外,通过逻辑验证的划分策略与LLM生成的上下文相关查询,确保了数据质量与时代风格的统一。
使用方法
用户可直接加载该数据集进行文本相似度计算与检索任务,尤其适用于训练或微调面向历史文本的嵌入模型。利用其BEIR兼容版本,可便捷接入BEIR基准测试框架,评估模型在历史语料上的检索性能。推荐将标题-摘要对作为训练语料,查询-句子对作为测试查询,以验证模型对19世纪英文语义的理解能力。
背景与挑战
背景概述
在自然语言处理与信息检索领域,历史文本的语义相似度计算是一个极具挑战性的研究方向,尤其对于19世纪及更早时期的英语文学作品而言,其独特的语言风格、词汇演变和语法结构使得现代模型难以直接迁移。为此,研究者构建了Historical English Books Similarity数据集,该数据集来源于以维多利亚时代(1837–1901年)为主、涵盖至1899年的历史英语书籍,由NeuML团队于近期发布。数据集以随机抽样的方式,从原始Historical English Books中提取了标题-摘要对与查询-句子对,旨在为历史语境的句子相似度评估提供基准。其核心研究问题在于,如何通过适配19世纪英语独有文风的数据来提升语义相似度模型的域外泛化能力,同时兼容BEIR框架以标准化模型评估。该数据集的出现,填补了历史文学文本在密集检索与语义匹配任务中的空白,对数字人文学科与低资源时代的语言模型研究具有重要推动作用。
当前挑战
该数据集面临的核心挑战首先体现在领域问题的特殊性上:历史英语文本(尤其是维多利亚时期)在词汇、句法和修辞上与当代英语存在显著差异,传统语义相似度模型直接应用于此类文本时,常因语言演变导致的特征偏移而产生不准确的匹配结果。其次,在数据集构建过程中,挑战来源于两个方面:一是原始书籍的预处理难度,包括不规则拼写、过时用词及OCR错误带来的噪声干扰;二是查询句的生成方式,虽然借助了大语言模型基于19世纪散文风格生成数据,但如何确保生成的查询符合历史语言习惯、避免现代语言痕迹,同时维持查询与原文的语义对齐,是一大技术难点。此外,数据集的随机采样与分段拆分需严格验证无重叠,以避免评估偏误,这进一步增加了构建的复杂性。
常用场景
经典使用场景
该数据集专为计算历史英语文献中文本语义相似度而设计,尤其聚焦于维多利亚时代至1899年的书籍。其核心使用场景涵盖基于标题-摘要对与查询-句子对的检索与匹配任务,为评估词嵌入、句子编码器等模型在处理19世纪英语散文风格时的表现提供了标准化测试基准。数据集中包含的BEIR兼容测试集进一步扩展了其在信息检索领域的应用,允许研究人员直接评估向量模型在历史文本上的检索精度。
实际应用
在实际应用中,该数据集可服务于数字图书馆的语义搜索系统,帮助提升对历史书籍内容的检索准确率,使得用户能够以自然语言查询(如“描述工业革命时期工人阶级生活的段落”)快速定位相关文献。此外,它还可用于历史文献的自动摘要生成、文本相似性驱动的版本比较,以及文化遗产数字化项目中辅助学者进行跨文本关联挖掘,从而加速人文研究的数字化进程。
衍生相关工作
该数据集衍生出多项经典工作,包括针对维多利亚时代文学语境的专用嵌入模型训练,以及基于BEIR框架的历史文本检索基准评测。其生成查询与验证拆分的方法论被后续研究工作借鉴,用于构建类似的中世纪英语或早期现代英语语义相似度数据集。此外,该数据集推动了面向历史文本的对比学习与领域微调技术发展,相关成果常被引用于探讨预训练模型对时域语言变化的鲁棒性研究之中。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务