遇见数据集

vintage-v2

收藏
Hugging Face2026-07-13 更新2026-07-14 收录
官方服务:

资源简介:

Vintage-v1 是一个历史书籍文本数据集,旨在为历史语言研究和文本分析提供资源。该数据集整合了来自四个著名历史语料库的书籍:CLMET v3.1(包含 335 本书)、ECCO(3,102 本书)、EEBO(34,937 本书)以及 EVANS(5,013 本书),书籍总数超过 4.3 万本。所有书籍文本均经过清理处理(尽最大努力),从原始的 XML 格式转换为更易读的 Markdown 格式。此外,对于源数据中已标注对话的书籍,其对话内容被专门提取并存储为 JSON 格式,便于结构化访问。数据集整体规模在 1 万到 10 万条之间(以书籍为单位),适用于历史语言学分析、文本风格迁移、对话系统训练或作为大语言模型预训练的历史领域数据。

Vintage-v1 is a historical book text dataset designed to provide resources for historical language research and text analysis. The dataset integrates books from four well-known historical corpora: CLMET v3.1 (containing 335 books), ECCO (3,102 books), EEBO (34,937 books), and EVANS (5,013 books), with a total of over 43,000 books. All book texts have been cleaned (to the best effort) and converted from the original XML format to a more readable Markdown format. Additionally, for books with annotated dialogue in the source data, the dialogue content has been specifically extracted and stored in JSON format for structured access. The overall dataset size ranges from 10,000 to 100,000 entries (in terms of books) and is suitable for historical linguistic analysis, text style transfer, dialogue system training, or as historical domain data for large language model pre-training.

创建时间:
2026-07-10
原始信息汇总

数据集名称

Vintage-v2

数据集描述

Vintage 数据集是一个包含历史书籍文本的集合,所有书籍均经过清洗处理,从 XML 格式转换为 Markdown 格式。其中对话部分已进行标注并提取为 JSON 格式。

数据集规模

  • 样本数量:10,000 < n < 100,000

语言

  • 英语(en)

标签

  • vintage(复古)
  • historical(历史)

数据来源

数据集包含以下四个来源的书籍:

  • CLMET v3.1:335 本书
  • ECCO:3,102 本书
  • EEBO:34,937 本书
  • EVANS:5,013 本书

许可证

  • Creative Commons(CC)

配置文件

  • 配置名称:default
  • 数据文件:训练集位于 data/train-*.parquet

引用信息

如使用本数据集,请引用: bibtex @misc{vintage-v2, title = {Vintage v2}, author = {Cristi Constantin}, month = {July}, year = {2026}, url = {https://huggingface.co/datasets/croqaz/vintage-v2} }

搜集汇总
数据集介绍
vintage-v2 数据集图片
构建方式
Vintage-v2数据集是一个汇聚了历史文献精华的语料库,其构建源于对四个经典古籍项目的系统整合。具体而言,该数据集融合了CLMET v3.1中的335部著作、ECCO项目中的3102册书籍、EEBO项目中的34937部文本以及EVANS项目中的5013册典籍,总计超过四万本历史文献。所有原始资料均经过精细的清洗处理,从XML格式转换为更为便捷的Markdown格式,从而确保了文本的可读性与通用性。此外,针对其中已标注对话的部分,数据集将其提取为结构化JSON文件,极大提升了细粒度信息的可用性。
特点
该数据集的核心特点在于其规模宏大且覆盖广泛的历史文献资源,时间跨度从早期印刷时代到近代出版,为研究者提供了不可多得的语言与历史样本。所有文本均经过一致性清洗,从XML转为Markdown,不仅保留了原始结构的完整性,也便于后续的自然语言处理任务。对话部分被提取为JSON格式,这一设计使得该数据集特别适用于历史对话分析、文体演化研究以及语言模型的预训练与微调。整体而言,Vintage-v2兼具古朴的文本魅力与现代数据科学的高效性。
使用方法
使用Vintage-v2数据集时,可通过HuggingFace平台的datasets库轻松加载。数据集配置名为'default',训练数据以Parquet格式存储于'data/train-*.parquet'路径下,支持高效的列式读取与内存管理。用户可根据研究需求,直接调用加载函数获取完整的文本内容,或利用对话JSON进行特定任务的训练。该数据集适合用于历史语言建模、文学分析、对话系统开发等场景。由于采用开放CC许可证,研究人员可在遵守引用规范的前提下自由使用与分发,具体引用格式详见数据集说明页面的bibtex条目。
背景与挑战
背景概述
在历史语言学研究与文化遗产数字化浪潮中,大规模历史文本语料库的构建成为探索早期英语演变的关键基础设施。Vintage-v2数据集由研究者Cristi Constantin于2026年7月发布,整合了CLMET v3.1、ECCO、EEBO及EVANS四大典籍库,涵盖约4.3万册从早期现代英语到近代英语的书籍。该数据集核心研究问题在于提供一份经XML至Markdown清洗、对话结构已自动标注为JSON的高质量历史文本资源,为计算语言学家与数字人文学者研究历史语言变迁、文体特征及社会话语演变提供标准化数据支撑,对推动历史文本的自动化分析与跨语料比较产生了重要影响。
当前挑战
该数据集所解决的领域问题挑战在于,历史文本语料通常来源分散、格式异构且缺乏统一标注,导致跨语料可比较性差,Vintage-v2通过标准化清洗与对话提取显著提升了研究效率。构建过程中面临的主要挑战包括:海量书籍的XML源文件存在结构不一致与损坏,需开发自适应清洗管线;历史语言中拼写变体、古体字符与残缺文本的识别与校正;对话标注需区分独白与多轮交互,防止噪声引入;最后,跨四个不同来源的版权与元数据合规性审查,确保公开数据集合法性,这些步骤均需大量人工校验与迭代优化。
常用场景
经典使用场景
Vintage-v2数据集汇聚了跨越数个世纪的英文历史文献,涵盖CLMET、ECCO、EEBO与EVANS四大经典语料库,总计包含超过四万册经过精细清洗与格式转换的书籍。其最经典的使用场景在于为历史语言学、计算文体学及数字人文学科提供大规模、高质量的历时文本资源。研究者可借助该数据集追踪英语语言在句法、词汇与语义层面的演变轨迹,探索古典文学作品中的修辞模式与风格变迁,从而在时间维度上复原语言与文化的演进脉络。
实际应用
在实际应用层面,vintage-v2可作为训练古英语至现代英语翻译模型的核心语料,助力古籍数字化阅读与文化遗产的智能索引。它能够为历史文献的自动标引、主题建模及人名地名的实体识别提供训练与评测基准,支撑图书馆与档案馆构建高效的文本挖掘系统。此外,该数据集还能辅助教育领域开发面向历史文本解读的智能辅助工具,使学者与学生更便捷地探索早期英文文献的思想遗产与文化深度。
衍生相关工作
基于vintage-v2数据集,衍生出多项富有影响力的学术工作,包括针对早期现代英语的历时词义消歧模型、基于统计方法的作者身份归属工具,以及融合时间维度的文本风格迁移框架。这些工作通常将vintage-v2作为基准语料,用于验证语言模型在历史文本上的泛化能力,或构建面向古文献的语言资源库。数据集在预训练语言模型微调阶段的价值尤为突出,催生了专门针对18至19世纪英语文本的领域适配模型,进一步拓展了数字人文研究的计算边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务