遇见数据集

SBB/Colibri

收藏
Hugging Face2025-07-15 更新2025-08-09 收录
官方服务:

资源简介:

Colibri数据集包含了从19世纪儿童和青少年书籍中提取的53,533张插图,这些书籍出版于1800年至1925年之间。数据集还包括元数据和注释,旨在为研究目的和人工智能应用开发提供支持。该数据集由柏林国家图书馆的图书管理员和研究人员收集和整理,包含了各种语言的图像和文本,其中主要是德语。数据集在创意共享知识共享署名4.0国际许可下发布,并且可以通过DOI链接下载。README文件还提供了数据收集过程、数据集背后的原理、源数据以及创建数据集时涉及的预处理和清理步骤的详细信息。此外,它还详细说明了注释过程和数据集的结构,包括使用的文件格式和元数据标准的合规性。

The Colibri dataset consists of 53,533 illustrations extracted from 3,412 childrens and youth books published between 1800 and 1925. The dataset includes metadata and annotations and is intended for research and AI application development in the field of historical cultural data. Curated by librarians and researchers at the Berlin State Library, the dataset features images and text predominantly in German, with some content in other languages. Distributed under a Creative Commons Attribution 4.0 International license, the dataset is available for download via a DOI link. The README provides information on the data collection process, the rationale behind the dataset, source data, preprocessing and cleaning steps, annotation process, and dataset structure, including file formats and metadata standards compliance.

提供机构:
SBB
搜集汇总
数据集介绍
SBB/Colibri 数据集图片
构建方式
在数字人文与计算机视觉交叉研究的浪潮中,柏林国家图书馆依托其丰富的19世纪儿童与青少年文献馆藏,精心构建了Colibri数据集。该数据集源自德国研究基金会资助的“Colibri”合作项目,旨在填补历史图像数据在AI应用中的空白。构建流程始于对约5,600本历史儿童与青少年书籍的数字化扫描,随后利用基于Eynollah套件的图像提取模型,从这些数字副本中自动抽取出90,688幅图像。在此基础上,研究团队通过人工标注与自动分类相结合的方式,对图像进行了精细的16类语义分类,并最终筛选出53,533幅核心图像(涵盖插图、装饰、乐谱等类别),连同元数据与注释信息,以结构化的压缩包、CSV文件及示例PDF形式发布。
特点
Colibri数据集以其鲜明的历史纵深与专业聚焦而独树一帜。其图像全部源自1800年至1925年间出版的3,412种儿童与青少年书籍,时间跨度长达一个多世纪,为研究印刷技术、艺术风格及阅读习惯的演变提供了珍贵的视觉档案。数据集不仅规模可观(约41.5GB),更在标注上实现了双轨并行:一方面提供14,495幅图像的人工真实标注(groundtruth),另一方面为全部53,533幅图像配备自动分类标签(classification),这种设计既保证了核心数据的准确性,又为大规模自动分析奠定了基础。尤为独特的是,其分类体系涵盖了从常见插图、装饰到罕见的藏书票、地图、照片等多元视觉元素,深刻反映了历史书籍的丰富物质形态。
使用方法
作为面向计算机视觉研究的友好型数据集,Colibri的使用灵活而开放。用户可直接加载解压后的图像文件夹(以PPN唯一标识符命名),并借助配套的CSV文件(包含文件名、PPN、人工与自动标签)进行数据索引与筛选。该数据集天然适用于三大典型任务:历史图像中的目标检测(如识别特定装饰元素)、书籍印刷形态的历时性分析(如统计不同年代插图的密度与色彩变化),以及跨出版物插图复用现象的追踪。由于数据集未预设训练/测试划分,建议研究者根据自身任务(如按出版年代比例)自行切分,以最大化其学术价值。所有数据均以CC-BY 4.0许可发布,支持便捷的学术引用与二次开发。
背景与挑战
背景概述
在历史文化遗产数字化浪潮中,19世纪儿童与青少年书籍中的插图作为反映印刷技术演变、艺术风格变迁及阅读习惯形成的重要载体,长期缺乏大规模、可计算的数据集。由柏林国家图书馆(Staatsbibliothek zu Berlin)主导,联合莱比锡大学等机构,在德国研究基金会及联邦政府文化与媒体专员资助下,Sebastian Schmideler、Sigrun Putjenter与Jörg Lehmann等学者于2021至2025年间创建了Colibri数据集。该数据集源自“Colibri——Corpus Libri et Liberi”合作项目,从3412本1800至1925年间出版的儿童与青少年书籍中提取了53533幅插图,并附有元数据及人工与自动标注。作为首个聚焦该历史时期书籍视觉元素的大型公开数据集,它填补了计算文化遗产领域的空白,为计算机视觉与数字人文的交叉研究提供了关键资源,尤其推动了图像特征提取、书籍视觉呈现演变及插图复用等领域的探索。
当前挑战
Colibri数据集面临多重挑战。在领域问题层面,其核心任务是实现历史图像中的目标检测、分析书籍视觉呈现的时间演化(如装饰元素、配色模式)以及追踪插图在跨出版物中的复用,这些任务均需应对19世纪印刷品中图像风格的多样性、标注类别的细粒度差异(如16类视觉元素)以及手工与自动标注之间的不一致性。在构建过程中,挑战尤为显著:首先,从约5600本数字化书籍中基于机器学习模型提取插图,需处理图像质量参差、书页背景干扰及文本与图像边界模糊等问题;其次,标注流程依赖人工与自动分类的迭代,但仅有14495幅图像拥有真实标注,且部分类别(如“其他”“文本”)被排除后,数据集在类别分布上极不均衡,例如“插图”类占自动标注的76%,而“照片”类仅占0.1%,这为训练鲁棒性模型带来困难;此外,元数据遵循METS/MODS标准,但书籍语言以德语为主,少数涉及法语、英语等,增加了多语言环境下视觉元素分析的复杂性。
常用场景
经典使用场景
Colibri数据集汇聚了1800年至1925年间出版的3412册儿童与青少年书籍中的53533幅插图,为历史图像分析提供了丰沛的数字化素材。其最经典的使用场景聚焦于计算机视觉领域的图像特征提取任务,研究者可借助该数据集训练模型,自动识别并分类书页中的插图、装饰首字母、乐谱、藏书票等多元视觉元素。这一过程不仅推动了针对历史印刷品中非文本成分的量化研究,更填补了大规模文化遗产图像数据集长期匮乏的空白,为数字人文与机器学习交叉领域开辟了新的实验场域。
实际应用
在实际应用中,Colibri数据集可直接服务于文化遗产机构的数字化策展与智能检索系统开发。图书馆与博物馆可利用基于该数据集训练的模型,自动对海量历史文献中的图像进行元数据标注、主题分类与相似性检索,大幅提升馆藏资源的可发现性与利用率。同时,该数据集也为教育科技领域提供了独特素材:通过分析19世纪儿童书籍的视觉叙事模式,可辅助设计面向当代青少年的数字阅读产品,或为艺术史教学中的风格辨识训练提供真实历史案例支撑。
衍生相关工作
围绕Colibri数据集已衍生出若干具有代表性的研究工作。在目标检测方向,Kim等人(2024)借鉴该数据集构建了面向历史图像的物体识别框架;在书籍呈现形态演化方面,研究者利用数据集中的装饰首字母与纹饰图像,探讨了19世纪印刷书籍版式设计的历时性变迁。此外,Czernow等人(2025)针对儿童书籍中插图的跨出版物复用现象进行了系统分析。这些工作共同彰显了Colibri作为基准数据集在推动文化遗产计算化研究中的枢纽作用,也预示着其在风格分析、机器学习等数字人文工具开发中的广阔前景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务