Early Novels Dataset
收藏资源简介:
Early Novels Dataset包含了早期小说作品的丰富书目元数据,这些作品主要收藏在宾夕法尼亚大学的Collection of British and American Fiction, 1660-1830中。该数据集通过定制的MARC记录子字段,提供了关于早期英语小说的版次和副本特定信息,这些信息比传统图书馆目录记录更为详尽。数据集旨在支持对18世纪长期英语小说的研究,记录了包括权威声明、全标题和半标题、准确的出版地和版次声明等重要书目细节,以及边注、题词、藏书票等副本特定信息,还有作者笔记、题词、脚注和索引等重要旁注特征。
The Early Novels Dataset encompasses a rich collection of bibliographic metadata from early novelistic works, primarily housed within the University of Pennsylvania's Collection of British and American Fiction, 1660-1830. This dataset offers detailed information on editions and specific copies of early English novels through customized MARC record subfields, surpassing the depth of traditional library catalog records. Designed to facilitate research into the long 18th-century English novel, it meticulously documents crucial bibliographic details such as authoritative statements, full and half titles, precise publication locations, and edition declarations. Additionally, it captures copy-specific information like marginalia, dedications, and bookplates, alongside significant paratextual features including authorial notes, inscriptions, footnotes, and indices.
关于数据集
数据集概述
名称:Early Novels Dataset (END)
内容:该数据集包含早期英语小说的书目元数据,特别是1660年至1830年间出版的作品。这些数据主要来源于宾夕法尼亚大学的英国和美国小说收藏(CBAF),并补充了其他地区图书馆的藏品。
特点:
- 数据集基于MARC目录记录,并增加了定制子字段,以提供关于早期英语小说的结构化数据。
- 包含高质量的人工生成元数据,捕捉了版本和副本特定的详细信息,这些信息通常超出传统图书馆目录记录的范围。
- 记录了重要的书目细节,如权威声明、全标题和半标题、准确的出版地点和版本声明,以及副本特定的信息如旁注、题词和藏书票。
- 记录了重要的辅助文本特征,如作者笔记、铭文、脚注和索引。
数据集规模
- 总记录数:2,041条
- 核心十八世纪子集:1,325条记录,代表1700-1794年间出版的所有CBAF藏品及1795-1799年间的一部分藏品。
- 核心十八世纪子集(1700-1789):1,094条记录,代表1700至1789年间出版的所有CBAF藏品。
数据集格式
- MARCXML:数据集的主要格式,用于存储完整的书目元数据。
- 表格子集:提供简化的数据版本,便于用户探索特定特征。这些子集包括:
- full.tsv:包含精选的数据类别,提供数据集的概览。
- 按时期划分的子集:如18c-full.tsv(1700-1799年出版的记录)和19c-full.tsv(1800-1853年出版的记录)。
- 特定辅助文本的子集:提供关于前言、献词、广告等辅助文本的详细信息。
数据集使用
- 探索工具:数据集可通过Google Sheets或Microsoft Excel打开和查看。
- 数据分析:提供了使用Excel数据透视表的教程,以及使用OpenRefine处理MARCXML数据的指南。
- 全文本与元数据结合:数据集正在初步阶段与CBAF小说的全文本结合,用于主题建模等研究。
定制MARC架构
- 架构特点:基于标准的MARC记录,增加了非标准的定制子字段,以收集全新的信息类型。
- 字段细节:包括000至596字段,详细记录了书目数据、作者/标题信息、标题数据、物理信息、集合、添加的字段、解释性和分析性元数据以及副本特定的元数据。
该数据集为研究十八世纪英语小说提供了丰富的书目和文本信息,支持多种研究方法和数据分析技术。




