chcaa/memo_enriched
收藏资源简介:
该数据集是一个包含1174个示例的文学文本数据集,主要涵盖丹麦或相关语言的文学作品。数据集包含丰富的元数据特征,如文件名、文本内容、标题、副标题、作者信息(包括姓名、性别、国籍、笔名)、出版信息(年份、出版社、价格)、扫描来源、文本来源、条码、在线状态、注释等。此外,还包括作者生平信息(如出生和死亡年份)、作品分类(如历史时期、类别)、词数统计、以及作者和作品在文学参考中的提及情况(如是否在特定文学指南或经典文学中被引用)。数据集可用于文学研究、文本分析、作者网络分析或文化经典研究等任务。
数据集信息: 特征字段: - 字段名:filename,数据类型:字符串型(string) - 字段名:text,数据类型:字符串型(string) - 字段名:title,数据类型:字符串型(string) - 字段名:subtitle,数据类型:字符串型(string) - 字段名:volume,数据类型:字符串型(string) - 字段名:auth_first,数据类型:字符串型(string) - 字段名:auth_last,数据类型:字符串型(string) - 字段名:pseudonym,数据类型:字符串型(string) - 字段名:gender,数据类型:字符串型(string) - 字段名:nationality,数据类型:字符串型(string) - 字段名:year,数据类型:64位浮点型(float64) - 字段名:pages,数据类型:字符串型(string) - 字段名:illustrations,数据类型:字符串型(string) - 字段名:typeface,数据类型:字符串型(string) - 字段名:publisher,数据类型:字符串型(string) - 字段名:price,数据类型:字符串型(string) - 字段名:note to bibl. inf.,数据类型:字符串型(string) - 字段名:scan source,数据类型:字符串型(string) - 字段名:text source,数据类型:字符串型(string) - 字段名:kb-levering,数据类型:字符串型(string) - 字段名:barcode (kb),数据类型:字符串型(string) - 字段名:online,数据类型:字符串型(string) - 字段名:note to text,数据类型:字符串型(string) - 字段名:full_firstnames,数据类型:字符串型(string) - 字段名:auth_last_modern,数据类型:字符串型(string) - 字段名:publ_date,数据类型:64位浮点型(float64) - 字段名:title_modern,数据类型:字符串型(string) - 字段名:published_under_gender,数据类型:字符串型(string) - 字段名:real_gender,数据类型:字符串型(string) - 字段名:auth_id,数据类型:64位浮点型(float64) - 字段名:surname,数据类型:字符串型(string) - 字段名:title.1,数据类型:字符串型(string) - 字段名:source,数据类型:字符串型(string) - 字段名:notes,数据类型:字符串型(string) - 字段名:historical,数据类型:64位浮点型(float64) - 字段名:period,数据类型:字符串型(string) - 字段名:period_notes,数据类型:字符串型(string) - 字段名:novel_start,数据类型:64位浮点型(float64) - 字段名:novel_end,数据类型:64位浮点型(float64) - 字段名:serialno,数据类型:64位浮点型(float64) - 字段名:category,数据类型:字符串型(string) - 字段名:full,数据类型:字符串型(string) - 字段名:simple_word_count,数据类型:64位浮点型(float64) - 字段名:__index_level_0__,数据类型:64位浮点型(float64) - 字段名:search_term,数据类型:字符串型(string) - 字段名:search_pseudonym,数据类型:字符串型(string) - 字段名:arbejdsliv_auth,数据类型:字符串型(string) - 字段名:familie_auth,数据类型:字符串型(string) - 字段名:name_lex_auth,数据类型:字符串型(string) - 字段名:full_name_lex_auth,数据类型:字符串型(string) - 字段名:wordcount_main_text_lex_auth,数据类型:64位整型(int64) - 字段名:mentioned_links_lex_auth,数据类型:序列型(sequence),元素为字符串序列 - 字段名:mentioned_works_lex_auth,数据类型:字符串序列 - 字段名:search_link_lex_auth,数据类型:字符串型(string) - 字段名:birth_auth,数据类型:64位浮点型(float64) - 字段名:death_auth,数据类型:64位浮点型(float64) - 字段名:title_mention_lex_authorpage,数据类型:布尔型(bool) - 字段名:search_link_lex_auth_norm,数据类型:字符串型(string) - 字段名:lex_author_mentioned_in_other_authorpage,数据类型:64位整型(int64) - 字段名:auth_mention_grøn_dan_lithis5_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_grøn_dan_lithis6_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_grøn_dan_lithis7_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_lithåndb_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_littveje_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_litt_find_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_littmøn_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_littgenveje_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_bruglitt_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_medtiden_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_litt_intro_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_trane_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_håndb_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_rød_dan_lithis2_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_rød_dan_lithis3_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_rød_dan_lithis_titleregistry,数据类型:布尔型(bool) - 字段名:title_mention_rød_dan_lithis_titleregistry,数据类型:布尔型(bool) - 字段名:canon_culture_authors,数据类型:布尔型(bool) - 字段名:canon_educational_2025,数据类型:布尔型(bool) - 字段名:canon_educational_2004,数据类型:布尔型(bool) - 字段名:title_mention_canon_culture_authors,数据类型:布尔型(bool) - 字段名:title_mention_canon_culture_authors_dsl_classic,数据类型:布尔型(bool) - 字段名:author_mention_dsl_classic,数据类型:布尔型(bool) 数据集拆分: - 拆分名称:train,字节大小:438734847,样本数量:1174 下载大小:272317354 数据集总大小:438734847 配置项: - 配置名称:default,数据文件: - 拆分:train,路径:data/train-*




