遇见数据集

Books-Ending

收藏
Hugging Face2026-06-20 更新2026-06-21 收录
官方服务:

资源简介:

该数据集是一个书籍信息数据集,专门用于书籍结局类型分类或书籍内容分析任务。数据集包含1710个书籍样本,分为训练集(1368个样本)和验证集(342个样本)。每个样本包含以下字段:书籍ID、Freebase知识库ID、书名、作者、出版日期、体裁类型、内容摘要、附加信息、虚构类型标识以及结局类型标签。标签系统将书籍分为五类:悲剧结局、快乐结局、苦乐参半结局、开放结局和非虚构类作品。数据集适用于自然语言处理任务,特别是文本分类、内容分析和结局预测等应用场景。

This dataset is a book information dataset specifically designed for book ending type classification or book content analysis tasks. It contains 1710 book samples, divided into a training set (1368 samples) and a validation set (342 samples). Each sample includes the following fields: book ID, Freebase knowledge base ID, book title, author, publication date, genre type, content summary, additional information, fiction type identifier, and ending type label. The labeling system categorizes books into five classes: tragic ending, happy ending, bittersweet ending, open ending, and non-fiction works. The dataset is suitable for natural language processing tasks, particularly text classification, content analysis, and ending prediction applications.

创建时间:
2026-06-18
原始信息汇总

数据集概述:Books-Ending

  • 数据集名称:Books-Ending
  • 访问地址:https://huggingface.co/datasets/dsA58/Books-Ending
  • 数据集大小:共约 70.44 MB,其中训练集约 56.35 MB,验证集约 14.09 MB;下载大小约为 42.24 MB。

数据规模与划分

  • 总样本数:13,010 条
  • 训练集 (train):10,408 条
  • 验证集 (validation):2,602 条

特征字段

数据集包含以下 10 个字段:

字段名 数据类型 描述
book_id int64 书籍唯一标识符
freebase_id string Freebase 知识库中的标识符
title string 书名
author string 作者
pub_date string 出版日期
genres string 书籍的体裁(类型)
summary string 书籍摘要
information string 其他相关信息
fiction string 是否为虚构作品
labels class_label 结局类型标签(多分类)

标签分类

标签字段(labels)为多分类问题,包含以下 5 个类别:

  • 0:TragicEnding(悲剧结局)
  • 1:HappyEnding(幸福结局)
  • 2:BittersweetEnding(苦乐参半结局)
  • 3:OpenEnding(开放式结局)
  • 4:Non-Fiction(非虚构类)

数据文件与配置

  • 默认配置default
  • 训练数据路径:data/train-*
  • 验证数据路径:data/validation-*
搜集汇总
数据集介绍
Books-Ending 数据集图片
构建方式
在文学作品的叙事研究中,故事结局的情感基调与主题归属始终是文本分析的核心议题。Books-Ending数据集基于海量书籍的元数据与文本摘要构建而成,系统性地整合了来自Freebase知识图谱的书籍唯一标识符、书名、作者、出版日期、流派及虚构性标签等结构化信息。其构建关键在于引入人工标注的结局分类体系,将每本书籍依据其摘要与内容倾向,严格归入悲剧结局、幸福结局、苦乐参半结局、开放结局以及非虚构作品五大类别,从而为量化分析结局类型提供了高质量的训练数据。
特点
该数据集的核心特色在于其精细化的结局类别标注与多维度元数据融合。通过将抽象的情节走向转化为具体的分类标签,不仅涵盖了主流叙述中的二元对立(悲剧与幸福),还纳入了现实文学中常见的复杂情感(苦乐参半)与开放性叙事,同时分离出非虚构作品以避免语义混淆。与标准书籍数据集相比,它首次以大规模标注的形式将结局作为可计算特征,并结合书目信息与摘要内容,为预测结局类型提供了丰富的上下文线索。
使用方法
使用Books-Ending数据集时,研究者可直接通过HuggingFace的datasets库加载预划分的训练集与验证集,分别包含10,408和2,602个样本。该数据集最直接的应用是训练文本分类模型,以书籍摘要或书目信息作为输入,预测其所属的结局类别。此外,学者们亦可将其用作文学类型分析的基准资源,探索不同流派、作者或出版时期与结局模式的关联性,进而在计算叙事学与数字人文学科中开展更深层的叙事模式挖掘。
背景与挑战
背景概述
Books-Ending数据集由研究者构建,旨在探索文学作品结局分类这一跨学科问题,融合了自然语言处理与文学分析的交叉领域。该数据集创建于近年来,涵盖了从经典到现代的多样书籍,包含书号、作者、出版日期、体裁、摘要及情节信息等元数据,并依据结局类型(悲剧、喜剧、苦乐参半、开放式结局及非虚构类)进行标注。其核心研究问题在于如何通过文本特征自动识别故事的情感走向与叙事收束方式,为计算叙事学提供数据基础。这一资源对于情感计算、文本风格分析以及推荐系统等下游任务具有重要价值,推动了文学文本的量化研究进程。
当前挑战
Books-Ending数据集面临的挑战兼具领域问题与构建难点。在领域层面,结局分类的语义边界模糊,如“苦乐参半”与“开放式结局”常难以明确区分,且依赖读者主观解读,导致标注一致性困难。此外,不同文化背景下的叙事传统差异显著,单一标签体系可能无法覆盖所有文学类型。构建过程中,元数据(如摘要或完整篇幅)的缺失与体裁多样性增加了特征提取的复杂度,非虚构类作品与虚构结局的混合更考验分类器的泛化能力。数据规模虽达万余条,但类别分布不均(如悲剧结局样本稀少)进一步加剧了模型训练的偏差风险。
常用场景
经典使用场景
Books-Ending数据集聚焦于文学作品的结局分类任务,其核心在于通过书籍的摘要、元数据等多维信息,自动判别一部文学作品属于悲剧结局、幸福结局、苦乐参半结局、开放式结局还是非虚构类作品。该数据集为自然语言处理领域中的情感分析、叙事结构理解以及文本风格识别提供了标准化的评估基准。研究者常将其应用于文本情感倾向的细粒度判别,尤其关注文学作品结尾处的情感基调与情节收束方式,从而推动对长篇叙事文本深层情感结构的量化分析。
实际应用
在实际应用中,Books-Ending可赋能数字图书馆与文学推荐系统,通过结局类型标签帮助读者根据偏好筛选作品,例如偏好幸福结局的读者可快速锁定契合的书籍。出版行业可借助该数据集对投稿作品进行自动化结局分类,辅助编辑进行内容评估与市场定位。此外,该数据集还可用于教育领域,辅助文学教学中的作品解读与比较分析,自动归纳不同历史时期或地域的文学作品结局模式。
衍生相关工作
基于Books-Ending数据集,研究者衍生出多项经典工作。部分工作聚焦于利用预训练语言模型微调进行结局分类,验证了BERT等模型在叙事文本情感结局判别上的有效性。另有工作探索不同模态信息的融合,如将书籍摘要与情感时序列特征结合以提升分类精度。此外,该数据集还被用于研究跨文化文学作品结局模式的差异,衍生出面向多语言叙事结局分类的扩展性研究,推动了计算叙事学与跨文化比较文学的交叉发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务