遇见数据集

Japanese Novel Data

收藏
DataONE2022-11-27 更新2024-06-08 收录
官方服务:

资源简介:

A dataset on Japanese novels. This dataset contains 1113 novels. This dataset contains the following variables: Title, words, unique words, unique words used once, UWUU%, kanji, kanji used once, kanji readings, difficulty, average sentence length, characters, publisher, pages, ASIN, and the Japanese title. Note: not all observations have complete publisher, page, ASIN, and Japanese title data. The variables title, words, unique words, unique words used once, UWUU%, kanji, kanji used once, kanji readings, difficulty, average sentence length, and characters were obtained from Jpdb.io. Publisher, pages, ASIN, and the Japanese title were obtained from Amazon.co.jp. The dataset was mined using python and BS4 by CDT Budwell. This dataset was created in support of MA206 (Intro to Statistics) at USMA West Point by CDT Jackson Budwell '25.

本数据集聚焦日本小说,共收录1113部作品。该数据集包含以下字段:标题、总词数、唯一词数、仅单次出现的唯一词数、UWUU%、汉字、仅单次出现的汉字、汉字读音、文本难度、平均句长、登场人物数、出版社、页数、ASIN及日文标题。 注:并非所有样本均包含完整的出版社、页数、ASIN及日文标题数据。 其中标题、总词数、唯一词数、仅单次出现的唯一词数、UWUU%、汉字、仅单次出现的汉字、汉字读音、文本难度、平均句长及登场人物数均取自Jpdb.io;出版社、页数、ASIN及日文标题数据则来源于Amazon.co.jp。 本数据集由CDT杰克逊·巴德韦尔(25届)为支持美国西点军校(USMA)的MA206(统计学导论)课程创建,其数据爬取工作由CDT巴德韦尔使用Python与BS4完成。

创建时间:
2023-11-08
二维码
社区交流群
二维码
科研交流群
商业服务