遇见数据集

sedthh/gutenberg_english

收藏
Hugging Face2023-03-17 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: TEXT dtype: string - name: SOURCE dtype: string - name: METADATA dtype: string splits: - name: train num_bytes: 18104255935 num_examples: 48284 download_size: 10748877194 dataset_size: 18104255935 license: mit task_categories: - text-generation language: - en tags: - project gutenberg - e-book - gutenberg.org pretty_name: Project Gutenberg eBooks in English size_categories: - 10K<n<100K --- # Dataset Card for Project Gutenber - English Language eBooks A collection of non-english language eBooks (48284 rows, 80%+ of all english language books available on the site) from the Project Gutenberg site with metadata removed. Originally colected for https://github.com/LAION-AI/Open-Assistant (follows the OpenAssistant training format) The METADATA column contains catalogue meta information on each book as a serialized JSON: | key | original column | |----|----| | language | - | | text_id | Text# unique book identifier on Prject Gutenberg as *int* | | title | Title of the book as *string* | | issued | Issued date as *string* | | authors | Authors as *string*, comma separated sometimes with dates | | subjects | Subjects as *string*, various formats | | locc | LoCC code as *string* | | bookshelves | Bookshelves as *string*, optional | ## Source data **How was the data generated?** - A crawler (see Open-Assistant repository) downloaded the raw HTML code for each eBook based on **Text#** id in the Gutenberg catalogue (if available) - The metadata and the body of text are not clearly separated so an additional parser attempts to split them, then remove transcriber's notes and e-book related information from the body of text (text clearly marked as copyrighted or malformed was skipped and not collected) - The body of cleaned TEXT as well as the catalogue METADATA is then saved as a parquet file, with all columns being strings **Copyright notice:** - Some of the books are copyrighted! The crawler ignored all books with an english copyright header by utilizing a regex expression, but make sure to check out the metadata for each book manually to ensure they are okay to use in your country! More information on copyright: https://www.gutenberg.org/help/copyright.html and https://www.gutenberg.org/policy/permission.html - Project Gutenberg has the following requests when using books without metadata: _Books obtianed from the Project Gutenberg site should have the following legal note next to them: "This eBook is for the use of anyone anywhere in the United States and most other parts of the world at no cost and with almost" no restrictions whatsoever. You may copy it, give it away or re-use it under the terms of the Project Gutenberg License included with this eBook or online at www.gutenberg.org. If you are not located in the United States, you will have to check the laws of the country where you are located before using this eBook."_

数据集信息: 特征字段: - 字段名:TEXT,数据类型:字符串 - 字段名:SOURCE,数据类型:字符串 - 字段名:METADATA,数据类型:字符串 数据集划分: - 划分名称:训练集(train),占用字节数:18104255935,样本数量:48284 下载大小:10748877194,数据集总大小:18104255935 开源协议:MIT许可证(mit) 任务类别: - 文本生成(text-generation) 语言: - 英语(en) 标签: - 古腾堡计划(Project Gutenberg) - 电子书(e-book) - 古腾堡官网(gutenberg.org) 美观名称:英语语言古腾堡计划电子书(Project Gutenberg eBooks in English) 规模类别: - 样本量介于10000至100000之间(10K<n<100K) # 古腾堡计划英语语言电子书数据集卡片 本数据集源自古腾堡计划(Project Gutenberg)官网,为移除元数据的英语电子书集合(共48284条样本,占该网站可获取英语书籍总量的80%以上)。 本数据集最初为https://github.com/LAION-AI/Open-Assistant 项目采集,遵循OpenAssistant训练格式。 METADATA字段以序列化JSON格式存储每本图书的编目元信息,具体键值说明如下表所示: | 元数据键 | 说明 | | ---- | ---- | | language | 语言 | | text_id | 古腾堡计划图书唯一标识符Text#,类型为整数(int) | | title | 图书标题,类型为字符串(string) | | issued | 图书发布日期,类型为字符串(string) | | authors | 作者信息,类型为字符串,多个作者以逗号分隔,部分条目附带作者生卒日期 | | subjects | 图书主题,类型为字符串,格式多样 | | locc | LoCC分类代码(Library of Congress Classification Code),类型为字符串(string) | | bookshelves | 书架分类信息,类型为字符串,为可选字段 | ## 数据源 ### 数据采集流程 - 爬虫(详见Open-Assistant仓库)基于古腾堡编目中的**Text#**编号(若存在)下载每本电子书的原始HTML代码 - 由于元数据与正文未明确分离,需通过额外解析器拆分二者,随后从正文中移除转录者注释及电子书相关信息(带有明确版权声明或格式错误的文本将被跳过,不予收录) - 清理后的正文TEXT字段与编目METADATA字段将保存为Parquet格式文件(Parquet),所有字段均为字符串类型 ## 版权声明 - 部分图书受版权保护!爬虫通过正则表达式过滤了带有英语版权声明的图书,但请务必手动检查每本图书的元数据,确保其在您所在国家可合法使用。更多版权相关信息请参考:https://www.gutenberg.org/help/copyright.html 与 https://www.gutenberg.org/policy/permission.html - 古腾堡计划对无元数据的图书使用提出如下要求:**"从古腾堡计划官网获取的电子书需附带以下法律声明:'本电子书可供美国境内及全球绝大多数地区的用户免费使用,几乎无任何使用限制。您可复制、分发或再使用本电子书,需遵循随本电子书附带的古腾堡计划许可协议,或访问www.gutenberg.org在线查看。若您不在美国境内,使用本电子书前请务必核查所在国家的相关法律法规。'"**

提供机构:
sedthh
原始信息汇总

数据集概述

基本信息

  • 名称: Project Gutenberg eBooks in English
  • 语言: 英语 (en)
  • 任务类别: 文本生成 (text-generation)
  • 许可证: MIT
  • 标签:
    • Project Gutenberg
    • e-book
    • gutenberg.org

数据集结构

  • 特征:
    • TEXT: 文本内容,字符串类型
    • SOURCE: 来源信息,字符串类型
    • METADATA: 元数据信息,字符串类型
  • 分割:
    • train: 包含48284个样本,总大小为18104255935字节
  • 下载大小: 10748877194字节
  • 数据集大小: 18104255935字节

元数据详情

  • METADATA 列包含的详细信息:
    • language: 语言
    • text_id: 唯一书籍标识符,整数类型
    • title: 书籍标题,字符串类型
    • issued: 发行日期,字符串类型
    • authors: 作者,字符串类型,有时包含日期,逗号分隔
    • subjects: 主题,字符串类型,格式多样
    • locc: 美国国会图书馆分类代码,字符串类型
    • bookshelves: 书架分类,字符串类型,可选

数据生成方式

  • 使用爬虫从Gutenberg目录下载原始HTML代码。
  • 通过额外的解析器尝试分离元数据和文本主体,并移除转录者笔记和电子书相关信息。
  • 清洗后的文本主体和目录元数据保存为parquet文件,所有列均为字符串类型。

版权注意事项

  • 部分书籍受版权保护,爬虫通过正则表达式忽略所有带有英文版权头的书籍。
  • 使用前需手动检查每本书的元数据,确保符合使用国的法律规定。
搜集汇总
数据集介绍
构建方式
在自然语言处理与文本生成研究领域,大规模且高质量的语料库是模型训练的重要基石。sedthh/gutenberg_english数据集源自著名的Project Gutenberg电子书项目,旨在为英语文本生成任务提供丰富的训练资源。其构建过程首先通过爬虫程序依据Gutenberg目录中的唯一文本编号获取每本电子书的原始HTML代码,随后利用解析器将元数据与正文内容分离,并剔除转录者注释、版权声明等无关信息。对于明确标记版权或格式异常的文本,系统予以跳过以确保数据合规性。最终,经过清洗的文本与序列化的JSON格式元数据被保存为Parquet文件,所有字段均为字符串类型,形成了包含48284条记录的高质量语料集合。
特点
该数据集的核心特点在于其规模与结构上的精心设计。它收录了Project Gutenberg网站上超过80%的英文电子书,共计48284本,覆盖了文学、科学、历史等多个学科领域,为文本生成模型提供了广泛的知识背景。数据集的每条记录包含TEXT、SOURCE和METADATA三个字段,其中METADATA以JSON格式存储了语言、标题、作者、发行日期、主题等丰富的目录信息,便于研究者进行细粒度的数据筛选与分析。此外,数据集严格遵循OpenAssistant的训练格式,并采用MIT许可证发布,在学术与商业应用中均具备较高的灵活性与可用性。
使用方法
在实际应用中,sedthh/gutenberg_english数据集主要面向文本生成任务,如语言模型预训练、故事续写、风格迁移等。研究者可直接通过HuggingFace的datasets库加载该数据集,并使用其提供的train split进行模型训练。由于METADATA字段包含了书籍的标题、作者与主题等结构化信息,用户可根据具体需求过滤出特定领域或时期的文本子集,例如仅保留19世纪的小说或科学著作。值得注意的是,部分书籍可能仍受版权保护,尽管爬虫已尝试过滤版权声明,使用者仍需依据所在国家法律自行核实每本书的版权状态,并在分发时附上Project Gutenberg要求的法律声明以确保合规性。
背景与挑战
背景概述
在自然语言处理领域,大规模、高质量且开放的文本语料库是驱动语言模型发展的基石。sedthh/gutenberg_english数据集正是为响应这一需求而生,由LAION-AI团队在开源助手项目Open-Assistant的框架下构建,于近年发布。该数据集系统性地收集了古腾堡计划网站中超过80%的英文电子书,共计48284册,覆盖了从经典文学到科学文献的广泛题材。其核心研究问题在于如何从复杂、混杂元数据的原始网页中提取纯净的正文文本,并去除转写者注释与版权声明,从而为文本生成任务提供可靠的训练素材。这一数据集的问世,不仅为Open-Assistant等对话系统项目提供了丰富的语言多样性,更对学术界的语言模型预训练、风格迁移及文学分析等领域产生了深远影响,成为连接历史文献与现代NLP技术的桥梁。
当前挑战
sedthh/gutenberg_english数据集所面临的挑战体现在多个层面。首先,在领域问题层面,它着力解决的是从非结构化、元数据密集的电子书页面中高效提取正文的难题——古腾堡计划中文本与元数据交织,且版权信息、转写者注释等噪声干扰严重,传统规则与正则表达式难以完全剔除所有异常。其次,在构建过程中,爬虫需规避版权保护内容,仅收录无英文版权声明的书籍,但不同国家版权法律差异导致部分书籍仍需人工校验,增加了数据合规的复杂性。此外,元数据字段如作者、主题、书架分类等格式不统一,部分书籍缺失关键信息,进一步提升了数据清洗与标准化处理的难度。这些挑战共同构成了数据集从采集到应用的全链条障碍,要求研究者不断优化解析算法与版权筛查机制。
常用场景
经典使用场景
该数据集汇集了来自古腾堡计划(Project Gutenberg)的逾四万八千部英文电子书,涵盖小说、诗歌、历史文献、哲学著作等多元文类,为自然语言处理领域的文本生成任务提供了丰沛且规范的语料资源。研究者常将其作为大规模、高质量英文文本语料库,用于训练语言模型、预训练编码器-解码器架构或进行无监督文本生成实验。其文本经过元数据剥离与初步清洗,保留了较为纯粹的文学语言风格,尤其适用于需要长文本依赖建模与文学体裁感知能力的任务场景。
实际应用
在实际应用中,该数据集可用于构建智能写作辅助系统,例如自动续写小说、生成诗歌或润色散文等创意写作工具。其丰富的文学内容也为教育科技领域提供了语料支撑,助力开发面向英语学习者的文学阅读推荐系统、自动摘要生成器或历史文本解释工具。此外,出版行业可借助该数据集训练模型以辅助校对、版权归属分析或经典作品的数字化注释与再版编辑,提升文学内容的可访问性与再利用效率。
衍生相关工作
该数据集衍生了一系列经典工作,其中最具代表性的是作为LAION开源助手项目(Open-Assistant)的语料基础,支撑了对话式语言模型在文学知识问答与文本生成上的能力提升。在此基础上,研究者进一步开发了针对古腾堡语料的风格感知语言模型、跨体裁文本生成框架以及基于元数据的主题条件生成方法。这些工作不仅拓展了文学语料在预训练范式中的应用边界,也催生了关于版权合规文本采集与清洗标准的技术讨论,推动了学术社区对开放文学资源利用的规范与创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务