遇见数据集

chcaa/memo_enriched

收藏
Hugging Face2026-07-15 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是一个包含1174个示例的文学文本数据集,主要涵盖丹麦或相关语言的文学作品。数据集包含丰富的元数据特征,如文件名、文本内容、标题、副标题、作者信息(包括姓名、性别、国籍、笔名)、出版信息(年份、出版社、价格)、扫描来源、文本来源、条码、在线状态、注释等。此外,还包括作者生平信息(如出生和死亡年份)、作品分类(如历史时期、类别)、词数统计、以及作者和作品在文学参考中的提及情况(如是否在特定文学指南或经典文学中被引用)。数据集可用于文学研究、文本分析、作者网络分析或文化经典研究等任务。

数据集信息: 特征字段: - 字段名:filename,数据类型:字符串型(string) - 字段名:text,数据类型:字符串型(string) - 字段名:title,数据类型:字符串型(string) - 字段名:subtitle,数据类型:字符串型(string) - 字段名:volume,数据类型:字符串型(string) - 字段名:auth_first,数据类型:字符串型(string) - 字段名:auth_last,数据类型:字符串型(string) - 字段名:pseudonym,数据类型:字符串型(string) - 字段名:gender,数据类型:字符串型(string) - 字段名:nationality,数据类型:字符串型(string) - 字段名:year,数据类型:64位浮点型(float64) - 字段名:pages,数据类型:字符串型(string) - 字段名:illustrations,数据类型:字符串型(string) - 字段名:typeface,数据类型:字符串型(string) - 字段名:publisher,数据类型:字符串型(string) - 字段名:price,数据类型:字符串型(string) - 字段名:note to bibl. inf.,数据类型:字符串型(string) - 字段名:scan source,数据类型:字符串型(string) - 字段名:text source,数据类型:字符串型(string) - 字段名:kb-levering,数据类型:字符串型(string) - 字段名:barcode (kb),数据类型:字符串型(string) - 字段名:online,数据类型:字符串型(string) - 字段名:note to text,数据类型:字符串型(string) - 字段名:full_firstnames,数据类型:字符串型(string) - 字段名:auth_last_modern,数据类型:字符串型(string) - 字段名:publ_date,数据类型:64位浮点型(float64) - 字段名:title_modern,数据类型:字符串型(string) - 字段名:published_under_gender,数据类型:字符串型(string) - 字段名:real_gender,数据类型:字符串型(string) - 字段名:auth_id,数据类型:64位浮点型(float64) - 字段名:surname,数据类型:字符串型(string) - 字段名:title.1,数据类型:字符串型(string) - 字段名:source,数据类型:字符串型(string) - 字段名:notes,数据类型:字符串型(string) - 字段名:historical,数据类型:64位浮点型(float64) - 字段名:period,数据类型:字符串型(string) - 字段名:period_notes,数据类型:字符串型(string) - 字段名:novel_start,数据类型:64位浮点型(float64) - 字段名:novel_end,数据类型:64位浮点型(float64) - 字段名:serialno,数据类型:64位浮点型(float64) - 字段名:category,数据类型:字符串型(string) - 字段名:full,数据类型:字符串型(string) - 字段名:simple_word_count,数据类型:64位浮点型(float64) - 字段名:__index_level_0__,数据类型:64位浮点型(float64) - 字段名:search_term,数据类型:字符串型(string) - 字段名:search_pseudonym,数据类型:字符串型(string) - 字段名:arbejdsliv_auth,数据类型:字符串型(string) - 字段名:familie_auth,数据类型:字符串型(string) - 字段名:name_lex_auth,数据类型:字符串型(string) - 字段名:full_name_lex_auth,数据类型:字符串型(string) - 字段名:wordcount_main_text_lex_auth,数据类型:64位整型(int64) - 字段名:mentioned_links_lex_auth,数据类型:序列型(sequence),元素为字符串序列 - 字段名:mentioned_works_lex_auth,数据类型:字符串序列 - 字段名:search_link_lex_auth,数据类型:字符串型(string) - 字段名:birth_auth,数据类型:64位浮点型(float64) - 字段名:death_auth,数据类型:64位浮点型(float64) - 字段名:title_mention_lex_authorpage,数据类型:布尔型(bool) - 字段名:search_link_lex_auth_norm,数据类型:字符串型(string) - 字段名:lex_author_mentioned_in_other_authorpage,数据类型:64位整型(int64) - 字段名:auth_mention_grøn_dan_lithis5_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_grøn_dan_lithis6_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_grøn_dan_lithis7_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_lithåndb_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_littveje_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_litt_find_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_littmøn_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_littgenveje_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_bruglitt_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_medtiden_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_litt_intro_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_trane_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_håndb_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_rød_dan_lithis2_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_rød_dan_lithis3_nameregistry,数据类型:布尔型(bool) - 字段名:auth_mention_rød_dan_lithis_titleregistry,数据类型:布尔型(bool) - 字段名:title_mention_rød_dan_lithis_titleregistry,数据类型:布尔型(bool) - 字段名:canon_culture_authors,数据类型:布尔型(bool) - 字段名:canon_educational_2025,数据类型:布尔型(bool) - 字段名:canon_educational_2004,数据类型:布尔型(bool) - 字段名:title_mention_canon_culture_authors,数据类型:布尔型(bool) - 字段名:title_mention_canon_culture_authors_dsl_classic,数据类型:布尔型(bool) - 字段名:author_mention_dsl_classic,数据类型:布尔型(bool) 数据集拆分: - 拆分名称:train,字节大小:438734847,样本数量:1174 下载大小:272317354 数据集总大小:438734847 配置项: - 配置名称:default,数据文件: - 拆分:train,路径:data/train-*

提供机构:
chcaa
搜集汇总
数据集介绍
chcaa/memo_enriched 数据集图片
构建方式
memo_enriched数据集的构建基于丹麦文学史中作者自传、回忆录等文本资源的系统性数字化与结构化处理。首先,研究人员从众多典藏机构与数字图书馆中筛选出1174份原始回忆录文档,涵盖了从手稿到印刷书籍的多种形态。随后,每一份文本均被赋予统一的元数据标识,包括文件名、标题、作者信息、出版细节(如出版社、年份、价格)、插图与字体等特征。为了增强数据集的人文研究价值,项目团队引入了丰富的辅助信息,包括作者的真实姓名与笔名、生平年份、国籍及性别标注,同时补充了作品在文学史和教育经典中的引用频次。最终,通过多个名称注册表与典藏库的交叉比对,构建出包含文本、作者与文献关联关系的多层次结构化数据集。
特点
该数据集的核心特色在于其多维度的知识表征能力。它不仅保留了回忆录的原始文本(text字段)与基础出版信息,更深度整合了作者社会身份(性别、国籍、笔名)、作品影响力(在文学史教材中出现次数、被经典化收录情况)以及作者间的引用网络(mentioned_links_lex_auth)。特别值得注意的是,数据集区分了作者署名时的性别(published_under_gender)与真实性别(real_gender),为性别研究提供了关键数据支撑。此外,“历史性”字段(historical)与起止时间标记使得研究者可以精准定位文本所反映的历史时段。丰富的元数据字段与索引系统共同构成了一个可进行关联性分析、网络分析与历时性研究的综合数据平台。
使用方法
本数据集适用于多种数字化人文研究场景。用户可通过HuggingFace的datasets库直接加载,采用默认的train分割,每一条记录包含完整的文本内容与53个元数据字段。研究者可利用Python的pandas或DataFrame工具进行筛选与聚合,例如按作者性别、出版年份或经典化程度提取子集。同时,文本字段可直接用于自然语言处理任务,如主题建模、情感分析或传记文本的序列化分类。结合作者引用网络字段(如mentioned_links_lex_auth),可构建作者间的知识流动网络图。对于书目计量学研究者,所有出版相关的字段(如publisher, price, illustrations)可用于书籍物质史的分析。数据集的CSV格式确保了与其他数字人文工具(如Voyant、Gephi)的便捷对接。
背景与挑战
背景概述
memo_enriched数据集是丹麦文学与历史研究领域的一项重要成果,由丹麦皇家图书馆及相关学术机构的研究人员创建。该数据集不仅收录了丹麦文学史上大量匿名或使用笔名出版的作品元数据,还通过详尽的标注,将作者的真实身份、性别、国籍及出版年份等信息系统性地关联起来,从而为探索文学创作中的隐匿作者现象、性别与文学声誉的复杂关系提供了独特数据基础。凭借其覆盖从16世纪至当代的丰富文献资料与结构化档案信息,memo_enriched极大推动了数字人文领域对文学史文本的文化与社会语境分析,成为连接传统文献学与现代计算方法的标志性资源。
当前挑战
memo_enriched数据集在构建与应用上面临多重挑战。首先,在领域问题层面,该数据集致力于解决的隐匿作者身份与性别偏差问题本身便充满复杂性,文学作品中的虚假署名、笔名伪装及历史名册的不完整,使得在文学史料与作者真实身份间建立准确映射十分困难。其次,构建过程中,整合来自多个历史登记册、文学手册及馆藏系统的大量元数据,需应对数据格式不一、字段缺失及年代差异等异构性问题,同时确保人名、笔名与现代标准化形式的自动匹配精度,亦是一项艰巨任务。此外,数据集还需处理稀缺历史记录带来的信息稀疏性,并在此基础上维持大规模数字资源的一致性、追溯性与可重复使用性。
常用场景
经典使用场景
memo_enriched数据集以丹麦文学史中的回忆录与传记文献为核心,汇集了1174份涵盖19至20世纪的文本资料,每份记录均附有作者、出版信息、文本特征及文学史索引等丰富元数据。研究者常利用该数据集进行文学社会学与历史编纂学分析,通过作者性别、国籍、出版年份、匿名身份等字段,探究文学场域中的权力结构与性别表征。其经典使用场景包括量化分析女性作者在特定历史阶段的出版活跃度,或通过伪名与真实姓名对照,揭示文学市场中性别隐匿的写作策略。此外,文本的插图、字体、价格等物质性细节为书籍史研究提供了独特视角,使得memo_enriched成为联结文学内容与其社会物质载体的重要枢纽。
实际应用
在实际操作层面,memo_enriched数据集为图书馆数字化典藏管理、文学史教材编写以及文化政策制定提供了数据支撑。图书馆可利用其中的出版商、版本、扫描源等信息优化元数据标准,并辅助识别高影响力的文学作品以进行重点保护。教材编撰者能够依据作者在各类经典名录中的出现频率,合理调整文学史叙事的权重分配。此外,该数据集还可服务于文化机构评估现行经典标准的包容性与多样性,例如通过统计女性或少数群体作者的收录比例,为修正性别与族裔失衡的文化政策提供量化论据。在公众史学领域,数据集支持开发交互式可视化平台,使普通读者能够探索丹麦文学的家族脉络与社会网络。
衍生相关工作
围绕memo_enriched数据集,已衍生出多项开拓性工作,如利用其作者身份链接字段构建丹麦文学家人的社会网络图谱,分析群体间的合作、引用与亲属关系对文学产出的影响。基于文本字数、出版年份与插图特征,研究者开发了预测文学作品类型归属的机器学习模型,验证了物质形式与文学类别间的统计关联。另外,通过比对作者在多个文献目录中的提及差异,有学者提出了文学史分期优化的算法,重新界定了丹麦文学黄金时代至现代主义的嬗变节点。这些工作不仅展示了memo_enriched在计算文学研究中的方法论价值,也为跨语种、跨时代的文学数据集构建提供了可复用的数据增强与知识图谱范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务