corpus de novelas anglófonas
收藏资源简介:
该数据集包含了一系列英语小说的文本,用于文体分析。数据集以纯文本格式(.txt)存储,采用UTF-8编码,每部小说以作者_标题.txt的形式命名,符合stylo()函数的要求。此外,还包括了词形还原版本的数据集。
This dataset comprises a collection of English novel texts intended for stylistic analysis. The dataset is stored in plain text format (.txt) with UTF-8 encoding, and each novel is named in the format of author_title.txt, conforming to the requirements of the stylo() function. Additionally, a lemmatized version of the dataset is included.
数据集概述
数据集名称
Estilometría computacional en Humanidades Digitales
数据集描述
本数据集专注于使用计算文体学工具和技术对现实主义和现代主义的英语小说进行文体分析。数据集中的数据和脚本是该研究的核心部分,可供复现使用。
数据集内容
-
小说语料库:位于名为corpus的文件夹中,包含一系列用于文体分析的英文小说。这些小说以UTF-8编码的纯文本格式(.txt)存储,文件名为作者_标题.txt,符合stylo()的要求。此外,还包括一个词形还原后的版本。
-
附加数据:位于data文件夹中,包含两个文件:
- metadata.md:提供每部作品的详细信息,如作者、标题和出版年份。
- values.md:包含语料库的重要统计数据,如标记数、类型数和类型-标记比率。
-
Python代码:位于python-code文件夹中,包含用于生成语料库基本统计数据的脚本。
-
R代码:位于r-code文件夹中,包含使用Stylo包进行文体分析的R脚本。
数据集使用
- 克隆或下载本仓库的ZIP文件,并在本地系统中解压。
- 使用r-code文件夹中的脚本,在R中使用Stylo包进行更高级的文体分析。
- 浏览data文件夹中的表格,获取语料库的详细信息和关键统计数据。




