遇见数据集

model-specs/blbooksgenre-spec

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集用于训练一个二元文本分类器,旨在根据19世纪图书的标题判断其属于小说(Fiction)或非小说(Non-fiction)。特别设计用于重新分类大英图书馆目录元数据,尤其是那些现有杜威分类或类型注释缺失或不可靠的标题。数据涵盖维多利亚时代的英文出版物,遵循大英图书馆编目惯例,标题通常包含5-30个单词。数据集主要来自biglam/blbooksgenre中的title_genre_classifiction配置,包含1,736行数据,并提供了20个分层随机样本(10个小说和10个非小说标题)作为示例。

A binary text classifier dataset that takes a 19th-century book title and outputs Fiction or Non-fiction. Designed for re-classifying British Library catalogue metadata — especially titles where the existing Dewey or genre annotation is missing or unreliable. Victorian-era English-language publications, BL cataloguing conventions; titles typically 5–30 words. The dataset is primarily based on the title_genre_classifiction config from biglam/blbooksgenre, containing 1,736 rows, and includes a stratified random sample of 20 titles (10 Fiction + 10 Non-fiction).

提供机构:
model-specs
搜集汇总
数据集介绍
model-specs/blbooksgenre-spec 数据集图片
构建方式
在19世纪英国文学与图书分类研究的背景下,为应对大英图书馆目录元数据中杜威分类号或体裁标注缺失、不可靠的困境,研究者构建了blbooksgenre-spec数据集。该数据集选用来自biglam/blbooksgenre仓库中名为title_genre_classifiction的配置,仅筛选出1,736条记录,剔除了含‘无法判断’或‘兼有’标签及其他55,343条未过滤的数据,形成一个针对维多利亚时期英文出版物标题的二分类语料库。数据以分层随机抽样方式从训练集中划分,确保两类别均衡,并通过jsonl格式存储20个样本,其中虚构与非虚构作品各占10条,对应标题文本长度通常为5至30个单词,且严格遵循大英图书馆的编目惯例。
特点
该数据集围绕模型规范(hf-model-spec-0.1草案)进行设计,呈现三大鲜明特性。首先,其标签体系极度简洁,仅包含Fiction与Non-fiction两个类别,契合图书馆元数据重分类的实际需求,排除了含混标注的干扰项。其次,数据集内置了评估与约束机制:预设80/20分层留出验证策略,并以94%的准确率为目标,同时限制模型参数量不得超过5亿,预算仅为1美元,体现了轻量化、高效率的开发导向。此外,通过配套的样本文件与评审关卡,确保了输出模型须包含混淆矩阵与性能指标,增强了可复现性与质量控制。
使用方法
使用该数据集进行文本分类时,需遵循明确的流程。数据直接取自HuggingFace上的biglam/blbooksgenre仓库,加载时仅需指定title_genre_classifiction配置,并将输入字段设为title、标签字段设为label。训练前应依据分层策略以80:20比例划分训练集与留出集,用于评估模型准确率。模型训练完成后,需在HuggingFace上发布至target_org指定组织,并确保模型卡包含pipeline_tag、id2label、label2id、模型索引及准确率与宏F1分数、混淆矩阵等必填字段,同时记录spec_repo_commit_sha以供追溯。若验证集准确率低于90%,则建议暂停并重新设计方案,而非简单重复训练。
背景与挑战
背景概述
在数字人文与文化遗产计算领域,古籍文献的自动分类是提升元数据质量与检索效率的关键技术。该数据集由英国图书馆(British Library)研究人员于2024年创建,聚焦于19世纪英文图书体裁的二元分类任务,旨在解决馆藏编目数据中杜威分类号缺失或体裁标注不准确的问题。通过将书名映射至Fiction与Non-fiction两类,该数据集为大规模历史文献的自动重分类提供了标准化基准。其影响力体现在推动了小规模模型在文化遗产领域的应用,并成为HF模型规范草案的典型案例,为GLAM(画廊、图书馆、档案馆、博物馆)机构部署轻量级分类器奠定了基础。
当前挑战
数据集面临的核心挑战包括:1)19世纪英文书名的语言学复杂性——维多利亚时期的标题常包含古体词、缩写及非标准标点,而典型书名仅5-30词,导致特征稀疏与分类歧义;2)构建过程中的数据偏差问题——原始数据集包含55,343条未筛选记录,其中仅1,736条适用于二元体裁分类,其余记录因包含“Can't tell”等模糊标签而需排除,导致训练样本量有限且类别分布不均衡;3)模型性能的严格约束——需在500M参数量内实现94%准确率,且成本预算不足1美元,这对特征工程与迁移学习策略提出了极高要求。
常用场景
经典使用场景
在数字人文与图书馆学交叉研究领域,blbooksgenre-spec数据集作为专为19世纪英国书籍体裁分类设计的规范文档,其最经典的使用场景在于构建和验证基于标题的二元文本分类器。研究人员利用该数据集提供的1,736条经过精心标注的训练样本,结合其定义的模型约束(如参数上限5亿、预算1美元)和评估指标(准确率目标0.94),系统性地开发能从维多利亚时代英文标题中精准区分小说与非小说类别的机器学习模型。该规范还内置了20条分层随机采样的样例数据,用于快速检验模型性能,确保分类器在应对5至30词长度的历史书目元数据时能保持稳定表现。
解决学术问题
该数据集规范精准回应了历史文献元数据治理中一个长期存在的学术痛点:19世纪大英图书馆书目记录中杜威分类号或体裁标注缺失、不一致甚至错误的问题。通过提供标准化的训练配置(标题字段作为输入、体裁作为标签)、明确的评估策略(基于标签分层的80/20留出集划分)以及严格的技术约束(模型规模、预算、许可协议),它为可复现的书籍体裁分类研究建立了方法论基准。这不仅提升了大规模历史馆藏自动化整理的科学严谨性,更推动了文化遗产机构中机器学习模型部署的规范化进程,为后续类似数据集规范的制定提供了可借鉴的范式。
衍生相关工作
该数据集规范衍生了一系列与之紧密关联的经典工作,其中最核心的是其父级数据集biglam/blbooksgenre,后者提供了包含多种标注配置(如4,398行的“无法判断”与“兼具小说与非小说特征”标签)的更丰富数据资源,为后续的主动学习循环和多标签分类研究奠定了基础。基于本规范训练的TheBritishLibrary/bl-books-genre模型本身即作为一个基准分类器被广泛引用,其约94%的留出集准确率成为了同类工作的比较基线。此外,该规范提出的hf-model-spec草案格式也启发了small-models-for-glam组织下针对文化遗产小模型的标准制定探索,推动了机器学习模型在非商业、低资源场景下的合规性研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务