遇见数据集

Institutional Books — Visual Elements

收藏
arXiv2026-08-19 更新2026-08-21 收录
官方服务:

资源简介:

Institutional Books — Visual Elements 数据集由哈佛法学院图书馆等机构创建,收录了从哈佛图书馆Google Books数字化藏书中提取的2260万视觉元素,涵盖插图、照片、版画等历史文献内容,并附带766,992,447个o200k_base文本标记的实验性标题。该数据集通过开源pipeline对近百万卷图书的页面扫描进行检测、分类、去重和标题生成,旨在弥补视觉语言模型对历史视觉内容理解不足的缺陷,为人工智能模型训练与数字人文研究提供高质量、多样化的历史视觉语料。

The Institutional Books — Visual Elements dataset was developed by institutions including Harvard Law School Library. It houses 22.6 million visual elements extracted from the digitized Google Books holdings of Harvard Library, encompassing historical documentary content such as illustrations, photographs, and prints, and includes experimental titles associated with 766,992,447 o200k_base text tokens. This dataset utilizes an open-source pipeline to detect, classify, deduplicate, and generate titles for page scans of nearly one million book volumes, aiming to address the gap in visual language models' comprehension of historical visual content, and provide high-quality, diverse historical visual corpora for artificial intelligence model training and digital humanities research.

创建时间:
2026-08-19
搜集汇总
数据集介绍
Institutional Books — Visual Elements 数据集图片
构建方式
该数据集基于哈佛大学图书馆的Google Books数字化馆藏构建,从983,004卷扫描图书中提取视觉元素。构建流程采用开源管道,依次执行检测、分类、去重和标题生成等步骤。检测阶段使用YOLO26n模型在页面级别定位视觉元素区域,分类阶段采用YOLO26s-cls模型将元素归为图像/插图、音乐、人工制品、藏书票/装饰、图表/图形等类别。去重阶段结合感知哈希与语义嵌入的两阶段策略,精确识别重复内容。标题生成则借助GPT-4.1-nano模型为符合条件的元素生成描述,最终形成包含22,622,060个视觉元素的数据集。
特点
该数据集规模庞大,涵盖多种视觉元素类型,每个元素附带分类标签、图像嵌入及实验性标题。其特性在于来源的历史书籍跨度广,集中于19至20世纪,以英语文献为主,学科分布偏向科学、艺术等图像密集型领域。数据集通过保守的去重策略确保高唯一性,并清晰区分原始数据与生成数据,其中标题部分标注为实验性内容。检测与分类模型在精度和召回率上表现优异,证明了管道在历史文献处理中的有效性。
使用方法
数据集可直接用于训练视觉语言模型,提升其对历史图像的理解能力,或供数字人文学者分析书籍插图的演变趋势。用户可通过Hugging Face平台访问数据集,并利用附带的SKILL.md文件支持代理式应用。基于视觉元素的嵌入向量,可进行相似性检索、聚类及跨卷比较。实验性标题可辅助快速浏览或作为生成模型的参考,但需注意其对历史内容的描述可能包含误差。
背景与挑战
背景概述
Institutional Books — Visual Elements 数据集由哈佛大学法学院图书馆的机构数据计划于近期创建,旨在从哈佛图书馆谷歌图书数字化馆藏的983,004卷扫描书籍中提取视觉元素。该数据集包含22,622,060个视觉元素,涵盖插图、照片、雕刻、装饰艺术等,并附有分类、嵌入和实验性字幕。其核心研究问题是弥补大规模数字化项目中视觉内容未被充分利用的空白,推动视觉语言模型对历史材料的理解,为人工智能训练和数字人文研究提供新的数据资源。该数据集及其配套的开源管道有望为图书馆、人工智能和研究社区带来重要影响,促进计算访问历史馆藏的新途径。
当前挑战
该数据集面临多重挑战。在领域问题方面,视觉语言模型通常以当代互联网视觉文化为训练基础,难以处理历史内容,存在时间分布偏移、文化时代错误和时间推理不准确等问题。在构建过程中,挑战包括:处理约4亿页扫描的高计算成本,需在保真度与资源消耗间权衡;检测模型需在大量无视觉元素的页面中精准识别,并应对密集中小元素的邻近检测;分类模型需区分易混淆的类别(如装饰性藏书票与图像插图);去重需处理副本和近重复图像,采用哈希与嵌入结合的策略;实验性LLM字幕生成面临幻觉、语言不匹配和历史知识不足的风险;最终数据集存在时间、语言和主题偏差,偏向英语、19至20世纪及图像密集型学科。
常用场景
经典使用场景
该数据集为历史书籍中的视觉元素提取与分析提供了标准化的数据基础,其经典使用场景包括大规模数字化图书馆藏书的图像检测、分类、去重和描述性字幕生成。研究者可基于该数据集对19至20世纪印刷品中的插图、照片、乐谱、装饰元素及图表进行系统化的自动识别与内容挖掘,从而突破传统文本OCR的局限,深入探索历史视觉文化的演变轨迹与知识传播模式。
解决学术问题
该数据集有效解决了历史文献数字化过程中视觉内容长期缺乏结构化访问的学术难题,弥补了现有视觉语言模型在历史图像理解上的数据鸿沟。它支持研究者对模型进行时间分布偏移下的性能评估与校准,缓解了文化时代误置和时空推理失准等问题,为跨学科的数字人文研究、人工智能训练及图书馆馆藏的智能服务提供了可靠的数据支撑,推动了历史视觉资料的可计算化研究范式。
衍生相关工作
该数据集衍生出一系列具有影响力的工作,包括基于开源视觉模型微调的目标检测器、分类器及方向校正模型,以及针对历史图像语义相似性匹配的嵌入与哈希联合去重方案。其LLM辅助的字幕生成实验启发了对视觉语言模型在历史语境中幻觉与多语言表达的研究,并推动了如Chronicling America词表等工具在文化内容分析中的应用,形成了从数据构建到模型评估的完整研究链条。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务