遇见数据集

british-library-book-images

收藏
Hugging Face2026-08-07 更新2026-08-08 收录
官方服务:

资源简介:

该数据集包含1,080,814张从英国图书馆与微软合作数字化的大约49,455本书籍(约65,227卷,约2500万页)中裁剪出的图像,出版年份介于约1510年至约1900年之间。这些书籍涵盖地理、哲学、历史、诗歌和文学等多个语种。图像由British Library Labs在Flickr Commons上以“来自扫描书籍的100万张图像”的形式发布。数据集分为四个配置,基于对每个裁剪区域的算法估计类型:embellishments(装饰物,416,935张)、plates(整版插画,385,231张)、medium(中型图像,217,100张)、covers(封面,61,548张)。注意这些类型标签是算法生成的,而非策展分类,尤其是medium和plates之间的边界可能模糊。每个样本包含JPEG图像、出版年份(字符串格式,部分为“Unknown”或超过1900年的错误记录)、原始文件名(包含英国图书馆系统编号,可用于关联OCR文本)以及图像类型字段。该数据集适用于图像分类、图像到文本、文本到图像等任务。此外还提供了使用SigLIP2模型预计算的嵌入配置(siglip2_embeddings),便于基于文本的检索。数据集采用CC0-1.0许可,但建议在引用时注明来源。

This dataset contains 1,080,814 images cropped from approximately 49,455 books (about 65,227 volumes, roughly 25 million pages) digitized through a collaboration between the British Library and Microsoft, with publication dates ranging from around 1510 to 1900. The books cover multiple languages including geography, philosophy, history, poetry, and literature. The images were released by British Library Labs on Flickr Commons as 1 Million Images from Scanned Books. The dataset is divided into four configurations based on algorithmically estimated types of each cropped region: embellishments (416,935 images), plates (385,231 images), medium (217,100 images), and covers (61,548 images). Note that these type labels are algorithmically generated, not curated categories, and the boundary between medium and plates may be ambiguous. Each sample includes a JPEG image, publication year (string format, some entries are Unknown or erroneous records beyond 1900), original filename (containing the British Library system number, which can be used to link to OCR text), and an image type field. The dataset is suitable for tasks such as image classification, image-to-text, and text-to-image. Additionally, a precomputed embedding configuration (siglip2_embeddings) using the SigLIP2 model is provided to facilitate text-based retrieval. The dataset is licensed under CC0-1.0, but citation of the source is recommended.

创建时间:
2026-08-06
原始信息汇总

British Library Book Images 数据集详情

数据集概览

这是一个包含 1,080,814 张图像的数据集,图像来源于49,455 本数字化图书(共65,227卷,约2500万页),出版时间跨度约为 1510年至1900年。这些图书由大英图书馆与微软合作数字化,并由大英图书馆实验室(British Library Labs)在Flickr Commons上以"从扫描书籍中提取的100万图像"名义发布。图书内容涵盖地理、哲学、历史、诗歌和文学,涉及多种语言。

数据集配置

数据集分为四个主要配置,每个配置对应一种算法估计的图像类型:

配置名 图像数量 最早日期
embellishments(装饰图) 416,935 1510
plates(整版图) 385,231 1528
medium(中等图) 217,100 1567
covers(封面) 61,548 1510

此外还有一个 siglip2_embeddings 配置,包含所有图像的 SigLIP2 嵌入向量(1152维 float32,图像缩放至256x256),每个图像配置对应一个嵌入分割。

数据字段

  • image:原始分辨率的JPEG图像
  • date:出版年份,以字符串形式存储(非整数)。其中5,291行(0.5%)标记为"Unknown",2,151行的日期在1900年之后(最晚至1946年),属于目录错误
  • fname:原始文件名。开头的数字为大英图书馆系统编号,其余部分编码了卷/页位置及书名
  • image_type:四种图像类型之一,与配置冗余但便于合并

时间分布特征

  • 1890年代的图像占总数的三分之一(348,302张)
  • 1800年之前的所有图像仅占约1.6%
  • 整个数据集主要代表维多利亚时代晚期的书籍插图
  • plates(整版图)在1800年前后差异显著:1690年代仅86张,而1800年代有4,682张,说明整版图是19世纪的印刷现象

图像与文本关联

fname 开头的数字是系统编号,可与 biglam/blbooks-parquet 数据集中的 record_id 关联(该数据集包含同一数字化项目的OCR文本,14,011,953页)。在20,000行样本中,96% 的系统编号可匹配到OCR记录。关联为书籍级别,而非页面级别。

许可与维护

  • 许可:图像以公共领域(Public Domain Mark)发布,标记为 CC0-1.0,无已知版权限制
  • 维护状态有限维护,这是2014年静态存量的镜像,预计不会变更
  • 原始存量的联系邮箱:labs@bl.uk

注意事项

  • 图像类型标签是算法生成的,非策展分类,platesmedium 之间的界限模糊
  • 语料库存在殖民时期出版物的过度代表,图像可能带有当时的描绘、标题和分类,未经过冒犯性内容审查
  • 数据集描述了"早期2010年代大型英国机构数字化"的内容,而非印刷插图的代表性样本
搜集汇总
数据集介绍
british-library-book-images 数据集图片
构建方式
该数据集源自大英图书馆与微软合作开展的图书数字化项目,从约49,455本出版于1510年至1900年间的书籍中,通过算法切割出超过一百万张图像,涵盖地理、哲学、历史、诗歌与文学等多元主题。图像依据算法对页面切割区域的尺寸与位置进行启发式分类,划分为embellishments、plates、medium与covers四种类型,分别包含416,935、385,231、217,100与61,548张图像。这些图像以parquet格式存储,每张图像附带出版日期、原始文件名及类型标签,部分图像还提供了经SigLIP2模型预计算的嵌入向量,便于高效检索与分析。
特点
该数据集规模宏大,总量逾百万张图像,时间跨度近四个世纪,但年代分布极不均衡,19世纪后期书籍插图占据主导,1890年代图像数量占全体的三分之一,而1800年以前的图像不足2%。图像类型标签为算法生成而非艺术史分类,边界模糊,需谨慎解读。数据包含图像、出版年份字符串、原始文件名及类型字段,其中年份存在未知值及少量目录错误,需预处理。此外,图像可与同源OCR文本数据通过系统号进行书籍级别关联,为跨模态研究提供可能,但页级对齐需进一步验证。
使用方法
使用者可通过Hugging Face datasets库加载所需配置,如load_dataset("biglam/british-library-book-images", "covers", split="train", streaming=True)以流式方式获取数据,避免一次性加载全部约621GB内容。图像可用于图像分类、图像到文本、文本到图像等任务,结合SigLIP2嵌入配置可实现基于文本的语义搜索。借助文件名中的系统号,可连接OCR语料库探索图文关系。数据以公共领域许可发布,可自由复用,但需注意历史内容可能含有冒犯性元素,并应合理处理年代字段中的异常值。
背景与挑战
背景概述
British Library Book Images数据集由英国图书馆与微软合作,于2014年由英国图书馆实验室发布,旨在将约49,455本数字化书籍中提取的超过一百万幅图像公开,覆盖1510年至1900年间的地理、哲学、历史、诗歌及文学等多领域文献。该数据集通过Flickr Commons平台以公共领域标记发布,为数字人文研究提供了大规模的历史图像资源,推动了图像分类、图像到文本及文本到图像等任务的发展,尤其对书籍插图的历史演变及19世纪印刷文化的研究具有深远影响。
当前挑战
该数据集面临的核心挑战包括:其一,领域问题层面,图像类型标签(如embellishments、plates等)为算法生成而非策展性分类,导致类别边界模糊,尤其在medium与plates之间,需研究者自行过滤或重新分类;其二,构建过程中,日期字段存在约0.5%的“Unknown”值及少数晚于1900年的记录,需数据清洗;同时,图像与OCR文本的关联仅基于书籍级系统编号匹配,页级对齐不保证,且4%的图像无法对应到OCR数据;此外,语料库因选择层级(数字化优先、版权状态)导致时间分布不均,1890年代占据三分之一,且包含殖民时期内容未经审核,可能引发伦理问题。
常用场景
经典使用场景
British Library Book Images数据集汇聚了来自大英图书馆与微软合作数字化的大约一百万幅书籍图像,时间跨度自1510年至1900年,涵盖了地理、哲学、历史、诗歌及文学等多个领域。这一数据集的经典使用场景在于数字人文研究,尤其是对早期印刷书籍插图的系统性分析与理解。研究者可借助图像分类、图像到文本生成及文本到图像生成等任务,探索书籍插图在历史语境中的演变、风格变迁以及图像与文本之间的关联。其丰富的历史纵深和庞大的数据规模,为跨学科研究提供了宝贵的视觉资源。
实际应用
在实际应用中,该数据集被广泛用于训练和评估图像识别与多模态模型,尤其是在历史文档图像处理领域。具体场景包括:开发自动化的书籍插图分类与检索系统,助力图书馆和档案馆的数字化资源管理;构建图像与文本的跨模态检索工具,支持学者快速定位特定书籍中的视觉元素;以及用于文化遗传资源的智能标注与知识图谱构建,提升GLAM(画廊、图书馆、档案馆、博物馆)机构的数据可访问性和利用效率。其公开领域许可进一步降低了应用门槛,促进了文化遗产的数字化转型。
衍生相关工作
该数据集衍生了一系列重要的学术工作,推动了历史图像研究的发展。例如,研究者基于此数据集训练了针对历史书籍图像的视觉特征提取模型,并将其与同一数字化项目的OCR文本数据(如biglam/blbooks-parquet)相结合,实现了图像与页面的书级关联,为图像-文本配对研究提供了基础。此外,数据集中附带的SigLIP2嵌入版本,为多模态检索和聚类分析提供了预计算的向量表示,催生了基于语义的图像搜索和主题建模研究。这些工作不仅深化了对书籍插图历史演变的理解,也为后续大规模文化遗产数据集的构建与利用树立了范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务