遇见数据集

AnonymousAuthors123/Halftonerevolution

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

Halftone Revolution 是一个历史图像数据集,专为档案报纸图像的图像检索、相似性检测和视觉聚类研究而设计。数据集包含数字化的历史照片,主要来源于 Victor Forbin 收藏和 Rol 机构,这些作为原始连续色调照片的参考来源。此外,数据集还包括许多19世纪末和20世纪初出版的报纸复制品。这些复制品经常展示通过历史印刷和编辑过程引入的变换,包括:半色调印刷、裁剪、修图、覆盖绘画、对比度退化、污渍和数字化噪声。数据集的创建旨在支持历史图像流通、视觉相似性以及原始照片与其印刷复制品之间的跨域图像匹配研究。数据集结构分为两个主要文件夹:similar/ 包含已知复制品或同一原始照片的变体,并附有标注文件 groundtruth.xlsx;unique/ 包含被识别为独特实例的图像,没有在数据集中找到相应的复制品或重复项,并附有元数据文件 recto.csv。报纸来源包括《每日镜报》、《伦敦新闻画报》等多种历史报纸。潜在应用包括图像检索、视觉相似性学习、聚类、数字人文研究、文化遗产AI应用以及在严重印刷退化下的鲁棒性评估。

Halftone Revolution is a historical image dataset designed for image retrieval, similarity detection, and visual clustering research on archival newspaper imagery. The dataset contains digitized historical photographs originating primarily from the Victor Forbin collection and the Rol agency, which serve as reference sources for the original continuous-tone photographs. In addition, the dataset includes numerous newspaper reproductions published in the late 19th and early 20th centuries. These reproductions frequently exhibit transformations introduced through historical printing and editorial processes, including: halftone print, cropping, retouching, overpainting, contrast degradation, stains, and digitization noise. The dataset was created to support research on historical image circulation, visual similarity, and cross-domain image matching between original photographs and their printed reproductions. The dataset is divided into two main folders: similar/ contains images that correspond to known reproductions or variants of the same original photograph, with an annotation file groundtruth.xlsx; unique/ contains images identified as unique instances for which no corresponding reproduction or duplicate was found within the dataset, accompanied by the metadata file recto.csv. Newspaper sources include publications such as The Daily Mirror, The Illustrated London News, and others. Potential use cases include image retrieval, visual similarity learning, clustering, digital humanities research, cultural heritage AI applications, and robustness evaluation under severe print degradation.

提供机构:
AnonymousAuthors123
搜集汇总
数据集介绍
AnonymousAuthors123/Halftonerevolution 数据集图片
构建方式
Halftone Revolution数据集旨在服务于历史报纸图像的检索、相似性检测与视觉聚类研究。其图像主要来源于Victor Forbin收藏与Rol机构的连续调原始照片,以及19世纪末至20世纪初报纸上的印刷复制品。这些复制品经历了半色调印刷、裁剪、润饰、重绘、对比度退化、污渍及数字化噪声等复杂历史印刷与编辑转换。数据集从法英两国的多家档案馆收集,包括法国国防历史服务处、帝国战争博物馆、苏格兰国家图书馆等机构,最终划分为“相似”与“独特”两个子集,前者包含经人工标注的多版本照片聚类,后者收录无对应副本的独立影像。
特点
该数据集的核心特点在于其聚焦历史图像在印刷传播中的形态变异与跨域匹配难题。涵盖的变换类型丰富多样,从简单的裁剪到复杂的重绘与低质量扫描,反映了早期新闻图像生产与流通的真实生态。随附的groundtruth.xlsx与recto.csv元数据文件提供了精细的标注信息,支撑聚类与相似性研究。数据集规模介于1000至10000张图像之间,语言覆盖英语与法语,标签涉及数字人文、档案学、图像检索与历史文档分析,展现出多学科交叉价值。
使用方法
研究者可直接使用数据集进行基于内容的图像检索、视觉相似性学习与聚类实验,特别适用于评估模型在严重印刷退化条件下的鲁棒性。通过加载“similar”子集及其groundtruth.xlsx标注,可训练跨域图像匹配模型;而“unique”子集中的recto.csv有助于识别单页副本。数据集采用CC BY-NC 4.0许可协议,仅限非商业研究用途,使用时需注明出处。典型工作流包括特征提取、相似度计算与聚类分析,适合数字人文与文化遗产AI应用场景。
背景与挑战
背景概述
Halftone Revolution数据集诞生于数字人文与计算机视觉交叉的学术前沿,由匿名研究团队于近期构建,旨在探究19世纪末至20世纪初报纸印刷图像的历史传播与视觉相似性。数据集整合了Victor Forbin收藏与Rol机构的原始连续调照片,以及来自《每日镜报》等英法报刊的印刷复制品,形成跨越原始摄影与印刷媒介的独特图像对。其核心研究问题聚焦于历史图像在印刷过程中的变换追踪、跨域检索与聚类分析,为数字人文领域的图像流通研究提供了量化工具。该数据集已引起文化遗产AI研究者的关注,为理解早期报刊视觉文化奠定了数据基础。
当前挑战
图像检索与相似性检测面临历史印刷图像严重退化的挑战,包括半色调网纹、对比度损失、污渍与数字化噪声,这些变换模糊了原始照片与印刷品间的视觉对应关系。构建过程中需克服多源档案的异构性,从法国国防部历史服务处等九个英法机构收集散落影像,并手动标注包含润饰、裁剪、覆绘等复杂变体的真实聚类,工作量巨大。此外,手绘复制品与劣质扫描的存在进一步加剧了跨域匹配的难度,使得研究需同时处理物理退化和编辑干预的双重交织。
常用场景
经典使用场景
Halftone Revolution 数据集专为历史报纸图像的分析与检索而设计,其核心应用场景聚焦于图像相似性检测与视觉聚类。该数据集囊括了19世纪末至20世纪初报纸上的半色调印刷照片,这些图像经历了裁剪、修饰、覆盖绘画、对比度退化、污渍及数字化噪声等多种复杂变换,为研究者提供了挑战真实世界图像匹配难题的宝贵资源。经典用法包括利用这些带有印刷退化痕迹的图像,训练或评估图像检索模型在跨域匹配中的鲁棒性,例如从原始连续调照片中准确找到报纸上的对应复制品,从而重建历史图像的传播路径。
实际应用
在实际应用中,Halftone Revolution 数据集赋能文化遗产机构与数字档案库自动化处理大规模历史图像集。例如,图书馆和博物馆可利用基于此数据集训练的检索系统,快速识别同一张照片在不同报纸版本中的出现情况,从而追溯图像来源与历史语境。此外,该数据集还能支撑新闻史研究中的视觉内容分析,辅助学者通过聚类技术发现被反复使用的经典图像,并揭示编辑策略与印刷质量对视觉叙事的影响,最终提升数字人文研究中的数据管理效率与学术洞察力。
衍生相关工作
该数据集的发布衍生了一系列经典研究工作,主要集中在历史图像检索与鲁棒视觉特征学习领域。例如,研究者利用其标注的相似与唯一图像对,发展了专门针对印刷退化环境的抗噪图像匹配算法,显著提升了半色调照片的检索精度。同时,基于数据集的聚类任务催生了融合手工标注与深度特征的无监督学习方法,成功应用于跨源历史图像组织。此外,这些工作还推动了对抗性数据增强技术的进步,通过模拟印刷噪声来训练更通用的视觉模型,为文化遗产AI应用树立了重要基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务