遇见数据集

media-metadata-gutenberg-books

收藏
Hugging Face2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

Project Gutenberg Catalog数据集是一个包含约79,000个文本元数据的目录,源自古登堡计划(Project Gutenberg)——成立于1971年的最古老数字图书馆,专门收录美国版权已过期的公共领域书籍。该数据集不包含实际文本内容,而是提供了每个古登堡文本的元数据信息,包括下载链接,可作为构建语料库的便捷索引。数据字段包括:gutenberg_id(文本编号)、title(标题)、authors(作者姓名及生卒年份)、subjects(美国国会图书馆主题标题)、bookshelves(古登堡书架分类)、languages(语言代码)、formats(字典格式,映射MIME类型到下载URL,支持epub、txt、html等格式)、download_count(30天下载次数,作为流行度指标)。数据集适用于文本分析、语料库构建、书籍元数据研究等任务,用户可通过HuggingFace datasets库加载,并利用下载计数筛选热门文本。

The Project Gutenberg Catalog dataset is a directory containing metadata for approximately 79,000 texts, sourced from Project Gutenberg—the oldest digital library founded in 1971, dedicated to public domain books with expired U.S. copyrights. This dataset does not include actual text content but provides metadata for each Gutenberg text, including download links, serving as a convenient index for corpus construction. Data fields include: gutenberg_id (text identifier), title (title), authors (author names and birth/death years), subjects (Library of Congress subject headings), bookshelves (Gutenberg bookshelf classifications), languages (language codes), formats (dictionary mapping MIME types to download URLs, supporting formats like epub, txt, html), and download_count (30-day download count as a popularity metric). The dataset is suitable for tasks such as text analysis, corpus building, and book metadata research, and can be loaded via the HuggingFace datasets library, allowing users to filter popular texts based on download counts.

创建时间:
2026-06-24
搜集汇总
数据集介绍
media-metadata-gutenberg-books 数据集图片
构建方式
该数据集通过对古腾堡计划(Project Gutenberg)网站进行系统化网络爬取而构建,基于metadatarr工具中专门开发的‘gutenberg_books’爬虫(scrapers/gutenberg_books.py)获取原始信息。爬取过程不仅完整抓取了书籍的基础元数据,如书名、作者、译者、主题、书架分类、语言、版权状态及媒体类型,还记录了下载量、文本与EPUB格式可用性等使用统计指标。最终整合了78,738条记录,形成丰富的实体数据集。
使用方法
该数据集以开放格式在HuggingFace平台发布,采用CC0-1.0许可证,可自由用于学术研究与商业应用。用户可直接通过HuggingFace Datasets库加载数据,或下载原始文件进行离线分析。由于每条记录均以gutenberg_id作为唯一标识,便于与其他古腾堡项目数据集进行交叉关联与合并。推荐在自然语言处理任务中,利用author、subject等字段作为语义特征,或以download_count作为流行度标签,从而挖掘电子书领域的深层模式。
背景与挑战
背景概述
media-metadata-gutenberg-books数据集创建于2024年,由TigreGotico团队通过其开发的元数据抓取工具metadatarr从古登堡计划(Project Gutenberg)中系统性地采集而成。作为人类文化遗产数字化的重要阵地,古登堡计划拥有超过七万部免费电子书籍,但长期以来缺乏结构化的元数据标注。该数据集包含78,738条记录,涵盖了古登堡ID、标题、作者、翻译者、主题、书架分类、语言、版权状态、媒体类型、下载次数及文本与EPUB格式可用性等13个关键字段,为数字人文研究、推荐系统开发、文献计量分析以及自然语言处理中的文本分类任务提供了规模化的实体元数据资源。其开放性(CC0许可)和丰富的结构化信息使其成为连接传统文献学与现代数据科学的重要桥梁。
当前挑战
该数据集所解决的领域问题在于,古登堡计划虽规模庞大,但其元数据分散于不同页面,缺乏统一的结构化接口,阻碍了跨书籍的统计分析、内容推荐及多语言文献研究。构建过程中的挑战主要体现在三个方面:首先,需要应对古登堡计划网站动态页面结构的解析复杂性,确保书籍ID与对应元数据字段(如多作者、多语言并存情况)的准确映射;其次,版权状态(copyright字段)的判断依赖法律条款与出版年份的交叉验证,容易因规则模糊导致误标;最后,下载次数(download_count)等动态指标在爬取窗口内存在时间敏感性,不同批次数据可能因采集时序差异而产生统计偏差,这要求爬虫设计具备高效的增量更新机制以维持数据一致性。
常用场景
经典使用场景
media-metadata-gutenberg-books数据集是一份汇集古腾堡计划中近八万册图书元数据的宝藏,涵盖书名、作者、译者、主题、书架分类、语言、版权状态及下载量等丰富字段。该数据集最经典的使用场景在于为数字人文研究提供结构化的文学资源索引,研究者可基于作者网络、主题分布或语言多样性,量化分析西方文学经典的历史变迁与传播规律。同时,它常被用作实体链接与元数据补全任务的基准,助力图书推荐系统或知识图谱构建中多源信息的融合。
解决学术问题
该数据集有效解决了文学研究领域长期存在的元数据分散与异构问题——古腾堡计划虽提供了海量免费电子书,但其原始页面缺乏统一的结构化描述,难以支撑大规模量化分析。通过整合标识符、版权、媒体类型及格式可用性等关键信息,研究人员得以系统追踪公有领域作品的数字化进程,并探讨版权存续期对文化传播的阻碍效应。此外,下载量字段为阅读接受史研究提供了量化指标,揭示经典作品在不同时代的受欢迎度波动,从而深化对文学经典形成机制的认知。
实际应用
在实际应用中,该数据集常被嵌入数字图书馆的智能检索系统与个性化推荐引擎中。例如,基于主题字段与书架分类,平台可为用户推荐具有相似文学标签的书籍链;结合下载量与语言字段,则能识别出跨语种传播的热门作品,优化版权政策下的资源开放策略。开发者还可利用作者与译者信息构建文学合作网络,辅助出版机构进行经典重译或欠发达语言资源的填补。
数据集最近研究
最新研究方向
该数据集聚焦于古腾堡计划(Project Gutenberg)中近八万册电子图书的实体元数据采集与结构化解析,为数字人文与文学计算领域提供了不可多得的语料基础。围绕这一资源,前沿研究多集中于利用细粒度的作者、译者、主题与书架分类信息,训练实体识别与关联模型,探究经典文学作品的跨语言传播模式与版权变迁规律。此外,结合多模态阅读行为数据(如下载频次)来量化作品的文化影响力,已成为新的热点方向。该数据集的开放共享,显著降低了文学元数据研究的数据门槛,推动了数字图书馆、推荐算法及文化演化建模等应用的发展,对重构知识传播图谱具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务