遇见数据集

memo_enriched

收藏
Hugging Face2026-07-15 更新2026-07-16 收录
官方服务:

资源简介:

该数据集是一个结构化的文献数据集,主要包含书籍或文章的文本内容及其丰富的元数据信息。数据集的核心内容包括:1. 文献文本与元数据:每个样本包含文献的完整文本、标题、副标题、卷册信息、出版年份、页数、出版社、价格等详细的出版信息。2. 作者信息:记录了作者的名字、笔名、性别、国籍、生卒年份以及作者ID等。3. 文献分类与来源:文献被分类并标注了历史时期,同时提供了文献的数字化来源和在线访问信息。4. 关联网络数据:数据集包含了作者或作品之间的引用与提及关系,例如提及的链接、提及的作品以及在多个权威文学名录或经典列表中是否被提及的布尔标记。5. 统计与标注信息:包含文本词数统计以及关于文献是否属于特定文化经典或教育经典的权威性标注。数据集共包含1174个样本,适用于文学研究、作者社会网络分析、文献数字化档案管理、文化经典性评估以及自然语言处理任务中的文本分析和元数据挖掘。

This dataset is a structured literature dataset that primarily includes the text content of books or articles along with rich metadata information. The core content of the dataset comprises: 1. Literature text and metadata: Each sample contains the complete text of the literature, title, subtitle, volume information, publication year, page count, publisher, price, and other detailed publication information. 2. Author information: Records the authors name, pseudonym, gender, nationality, birth and death years, and author ID. 3. Literature classification and sources: The literature is categorized and labeled with historical periods, while also providing digital sources and online access information. 4. Relational network data: The dataset includes citation and mention relationships between authors or works, such as mentioned links, mentioned works, and Boolean markers indicating whether they are mentioned in authoritative literary directories or classic lists. 5. Statistical and annotation information: Includes text word count statistics and authoritative annotations regarding whether the literature belongs to specific cultural canons or educational canons. The dataset contains a total of 1174 samples and is suitable for literary research, author social network analysis, digital literature archive management, cultural canon evaluation, and text analysis and metadata mining in natural language processing tasks.

创建时间:
2026-07-15
原始信息汇总

数据集概述

  • 数据集名称: memo_enriched
  • 数据集地址: https://huggingface.co/datasets/chcaa/memo_enriched
  • 数据集大小: 下载大小为272,317,354字节,整个数据集大小为438,734,847字节
  • 样本数量: 训练集包含1,174个样本

数据特征

该数据集包含丰富的元数据字段,覆盖了书籍、作者、文本内容及相关索引信息,主要分为以下几类:

书籍元信息

  • filename: 文件名
  • text: 文本内容
  • title: 标题
  • subtitle: 副标题
  • volume: 卷/册
  • pages: 页数
  • illustrations: 插图信息
  • typeface: 字体
  • publisher: 出版商
  • price: 价格
  • publ_date: 出版日期
  • title_modern: 现代标题
  • novel_start, novel_end: 小说起始与结束信息
  • serialno: 序列号
  • category: 分类
  • full: 完整文本标识

作者信息

  • auth_first, auth_last: 作者名与姓
  • auth_last_modern: 现代形式的姓
  • pseudonym: 笔名
  • gender: 性别
  • real_gender: 真实性别
  • published_under_gender: 发表时使用的性别
  • nationality: 国籍
  • birth_auth, death_auth: 出生与逝世年份
  • surname: 姓氏
  • full_firstnames: 全名
  • auth_id: 作者ID

文本来源与处理

  • scan source: 扫描来源
  • text source: 文本来源
  • note to bibl. inf.: 书目信息注释
  • note to text: 文本注释
  • barcode (kb): 条形码
  • online: 在线状态
  • kb-levering: 交付信息
  • simple_word_count: 简单字数统计
  • wordcount_main_text_lex_auth: 主文本词汇量
  • search_term, search_pseudonym: 搜索词与笔名搜索

作者索引与提及信息

  • arbejdsliv_auth, familie_auth, name_lex_auth, full_name_lex_auth: 作者姓名及相关索引
  • mentioned_links_lex_auth: 提及的链接
  • mentioned_works_lex_auth: 提及的作品
  • search_link_lex_auth, search_link_lex_auth_norm: 搜索链接
  • title_mention_lex_authorpage: 作者页面标题提及
  • lex_author_mentioned_in_other_authorpage: 在其他作者页面被提及的次数

规范与经典索引

  • auth_mention_*: 在多个文学史、手册、指南等资源中被提及的标识(如 grøn_dan_lithis5_nameregistry, lithåndb_nameregistry, trane_nameregistry, rød_dan_lithis2_nameregistry 等)
  • title_mention_rød_dan_lithis_titleregistry: 在红色丹麦文学史标题注册表中的标题提及
  • canon_culture_authors, canon_educational_2025, canon_educational_2004: 文化经典与教育经典作者标识
  • title_mention_canon_culture_authors, title_mention_canon_culture_authors_dsl_classic, author_mention_dsl_classic: 经典作品与DSL经典提及

其他

  • year: 年份
  • period, period_notes: 时期与时期注释
  • historical: 历史标识
  • notes: 注释
  • source: 来源
  • title.1: 备选标题
  • __index_level_0__: 索引层级

数据划分

  • 训练集: 仅有 train 划分,包含1,174个样本。
  • 数据文件: 数据存储在 data/train-* 路径下。
搜集汇总
数据集介绍
memo_enriched 数据集图片
构建方式
memo_enriched数据集是基于丹麦文学史中回忆录与自传类文本构建的综合性语料库。其构建过程首先从多个数字档案与文献库中采集原始文本,并赋予每篇文档唯一的文件名与文本内容。随后,通过自动化与人工校验相结合的方式,为每条记录添加了详尽的元数据,包括标题、副标题、卷册信息、作者姓名与笔名、性别、国籍、出版年份与日期、页码、插图信息、字体、出版商、价格等书籍信息,以及扫描来源、文本来源、KB借阅号、条形码等数字化源信息。此外,还融入了作者生平数据(如生卒年、职业领域类目)、词汇统计(如词数)以及跨文本引用关系(如作者提及的链接、作品提及情况)。为了支持文学史研究,数据集进一步整合了来自多种丹麦文学史手册与名册的规范名称和作者提及信息,并标注了文化经典与教育经典中的收录状态,形成了多维度、跨来源的结构化数据集。
特点
该数据集最显著的特征在于其丰富的元数据层次与跨学科研究潜力。每条记录不仅包含传统的书目描述,还深度整合了作者社会身份信息(如性别、笔名下的真实性别)、数字人文标记(如权威名称标识、词典页面的链接与提及关系),以及经典化指标(如文化经典作者、教育经典2004与2025年版中的收录情况)。这些字段使得研究者能够围绕匿名发表、性别与笔名、经典溯源等议题展开量化分析。另一个突出特点是其包含来自不同丹麦文学史文献的规范化名称匹配结果,例如来自Grøn Danmarks Litteratur、Lithåndbog等系列手册的作者提及布尔标记,这为重建文学史话语网络提供了基础。此外,数据集中还包含了词数统计等文本结构信息,适用于文本分类、风格计量或主题建模等自然语言处理任务,兼顾了人文研究的深度与计算方法的广度。
使用方法
memo_enriched数据集以Hugging Face Datasets库的标准格式发布,包含唯一一个训练集分割,共计1174个样本。用户可通过load_dataset('memo_enriched')便捷加载,直接获取包含所有元数据字段的表格化数据。对于需要细粒度文本分析的研究者,可基于'text'字段提取全文内容,并结合'wordcount_main_text_lex_auth'等统计字段进行风格计量。对于文学史网络研究,可利用'mentioned_links_lex_auth'与'mentioned_works_lex_auth'等序列字段构建引用或提及图谱。此外,经典化相关布尔字段(如'canon_culture_authors')可用于筛选特定子集,比较经典与非经典文本的元数据差异。由于数据集已包含多种规范化名称与ID字段(如'auth_id'、'full_name_lex_auth'),研究者可轻松将其与其他外部数据库(如作者生平表)进行关联,拓展分析维度。数据处理时需注意数值型字段可能存在缺失值,建议根据具体分析目标进行过滤或插补。
背景与挑战
背景概述
memo_enriched数据集是一个专注于文学与出版史研究的丰富型数据集,创建于近年来,由丹麦相关研究机构主导开发,旨在系统性地整合19至20世纪丹麦文学作品的元数据。该数据集涵盖了文本的标题、作者、出版信息、性别、国籍、关键词等多维特征,并进一步关联了作者生平、文献引用、经典化索引等深度信息,为数字人文领域提供了珍贵的结构化资源。其核心研究问题聚焦于文学作品的传播路径、作者性别对出版的影响以及文学经典的形成机制,对理解丹麦文学的社会文化脉络具有重要推动作用。
当前挑战
该数据集所解决的领域问题在于克服传统文学研究中元数据分散、格式不统一且缺乏机器可读性的挑战,为大规模计量分析提供标准化数据基础。构建过程中面临的挑战包括:多源异构数据的整合与消歧,例如不同历史时期的出版记录、作者笔名与真实身份的映射;性别信息的准确判定,尤其涉及匿名或中性笔名的作者;文学经典索引的跨库对齐,如不同版本文选中的作者收录差异;以及时间跨度带来的数据残缺与字段缺失问题,需要借助历史文献考据与算法推断进行补充校正。
常用场景
经典使用场景
memo_enriched数据集在文学研究与数字人文学科中扮演着关键角色,其核心应用场景在于构建与分析丹麦文学回忆录语料库。该数据集汇聚了1174部具有丰富元数据的回忆录文本,涵盖作者性别、国籍、笔名、出版年份及历史时期等维度,为研究者提供了深入探索文学社会学的理想平台。通过整合作者生平、作品提及关系及出版信息,该数据集使学者能够系统性地考察文学经典的形成机制、性别书写的历史变迁以及不同时期文学场域的权力博弈,成为连接传统文本细读与计算文本分析的重要桥梁。
衍生相关工作
基于memo_enriched数据集,学术界已衍生出一系列创新工作,涵盖文学社会网络分析、女性主义文学计量研究以及丹麦文学经典的数字化重构等方向。代表性的工作包括:利用作者提及关系网络揭示丹麦文学场域中女性作家的社群结构;通过性别字段分析笔名使用与文学发表的性别策略;以及结合文学史提及数据重塑丹麦文学经典的历史谱系。此外,该数据集还催生了关于文学回忆录中民族身份叙事、教育政策与文学经典互动等交叉研究,极大地拓展了数字人文学科在文学社会史领域的应用边界。
数据集最近研究
最新研究方向
memo_enriched数据集聚焦于丹麦文学史与性别研究的交叉前沿,通过整合作者生平、笔名、性别及文学典律等元数据,为计算文学分析提供了结构化语料。当前热点方向包括利用该数据集揭示19至20世纪丹麦文学中女性作家的出版实践与身份隐匿机制,结合目录学信息与典律列表追踪性别差异在文学经典化过程中的演变。该数据集的高丰富度支持作者网络分析与跨典律比较,其意义在于将人文阐释与数据驱动方法深度融合,为北欧文学研究开辟了可量化的实证新路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务