遇见数据集

GenHisDoc_dataset

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

GenHisDoc是一个用于历史文档布局识别与检测的通用性数据集,包含9448张图像。它整合了多个已公开发布的数据集(如The Sacrobosco Dataset、IlluHisDoc、Horae LSv2和El Picpic Stamps Dataset)以及部分未发布项目(如Projet VHS和Projet EIDA)的数据,经过统一的适应、校正和重新标注处理,以确保数据一致性和协同工作能力。数据标注采用YOLO格式,定义了五个目标类别:插图(Illustration)、首字母(Initial)、装饰图案(Ornament)、印章(Stamp)和表格(Table)。数据集文件结构清晰,包含图像文件夹、标签文件夹、类别列表文件、YAML配置文件和CSV来源记录文件,以及实用脚本。该数据集适用于计算机视觉领域的历史文档分析任务,特别是文档版面分析、目标检测和布局识别。

GenHisDoc is a general-purpose dataset for historical document layout recognition and detection, containing 9,448 images. It integrates multiple publicly released datasets (such as The Sacrobosco Dataset, IlluHisDoc, Horae LSv2, and El Picpic Stamps Dataset) as well as data from unpublished projects (e.g., Projet VHS and Projet EIDA), which undergo unified adaptation, correction, and re-annotation to ensure data consistency and interoperability. The data is annotated in YOLO format, defining five object categories: Illustration, Initial, Ornament, Stamp, and Table. The dataset has a clear file structure, including image folders, label folders, a category list file, a YAML configuration file for training, a CSV file recording the original source of each image, and utility scripts. This dataset is suitable for historical document analysis tasks in computer vision, particularly document layout analysis, object detection, and layout recognition.

创建时间:
2026-07-09
原始信息汇总

数据集名称:GenHisDoc(Generalistic Historical Document Dataset)

  • 规模:9448张图像,属于小规模数据集(n < 10k)。
  • 语言:英语(en)、法语(fr)。
  • 标签:计算机视觉、历史文档、检测、Python。
  • 许可证:CC BY-NC-SA 4.0。
  • 注释创建者:Jules Musquin 及基于已发表数据集的改编与再注释。

任务与标注

  • 任务:历史文档版面识别与检测(Layout Recognition and Detection)。
  • 标注格式:YOLO格式,每个图像附带一个对应的txt文件。
  • 标注类别(共5类):
    • 插图(Illustration)
    • 首字母(Initial)
    • 装饰(Ornament)
    • 印章(Stamp)
    • 表格(Table)
  • 数据组织:包含 images/(图像)、labels/(标签)、classes.txt(类别列表)、data.yaml(训练配置)、origin.csv(图像来源)、split.py(划分训练/测试/验证集,种子42)、htmlgenerator.py(生成统计与标注展示页面)。

数据集构成

已发表数据集的改编与整合

  1. The Sacrobosco Dataset (S-VED)
    • 来源:Zenodo(doi: 10.3390/jimaging8100285)。
    • 修改:将“打印机标记”类别合并至“插图”类别;将CSV格式注释转换为YOLO格式(txt)。
  2. IlluHisDoc
    • 来源:Dropbox(论文:docExtractor, arXiv:2012.08191)。
    • 修改:将逐像素分割(4类)转换为YOLO检测格式。
  3. Horae LSv2
    • 来源:Zenodo(版本2,中世纪祈祷书版面分割)。
    • 修改:合并其精细注释体系为本数据集的5类分类;保留4244条关于装饰、插图、首字母的注释,去除18720条文本分割注释。
  4. El Picpic Stamps Dataset
    • 来源:Roboflow(CC by 4.0授权,用户El PicPic)。
    • 修改:对印章进行完全重新注释,并补充表格注释。

未发表数据集的整合与修正

  • Aikon / Projet VHS / Eida
    • 背景:Aikon是IIIF自动注释项目(ERC项目DISCOVER),来自IMAGINE-LIGM实验室与LTE实验室。
    • Projet VHS(科学史跨学科项目):整合了9个手稿注释(如Cyclopaedia、BnF Latin 7416等),注释者均为Alexandre。
    • Projet EIDA(天文图解分析):整合了4个手稿注释(如Latin 7293A、Sprenger 1838等)。
    • 修改:对Aikon原有的单类检测进行完全修正与丰富。

项目结构与附加信息

  • 项目仓库:https://github.com/Anarchiviste/GenHisDoc_Lab/tree/main
  • 架构图(注:原文为相对路径 img/projectarchitecture.jpg,未提供绝对地址,无法转为完整链接)
  • 类别分布图(注:原文为相对路径 img/GenHisDoc_class_distribution.png,未提供绝对地址,无法转为完整链接)
搜集汇总
数据集介绍
GenHisDoc_dataset 数据集图片
构建方式
GenHisDoc数据集汇集了多个公开的历史文档数据集,包括Sacrobosco、IlluHisDoc、Horae LSv2以及El Picpic Stamps,并经过重新标注与格式统一,形成了涵盖9448张图像的综合性集合。原始数据集的标注格式各异,如逐像素分割或CSV标注,均被统一转换为YOLO格式的目标检测标注。此外,数据集整合了来自Aikon平台中VHS与EIDA项目的未公开人工校正数据,经过类别合并与标注增强,最终形成包含插图、首字母、装饰、印章和表格五类对象的标注体系。所有图像及标签文件按统一目录结构组织,并附带数据来源追踪文件origin.csv。
特点
GenHisDoc的核心特色在于其通用性与跨数据集兼容性。它通过将多个来源的历史文档图像统一格式与标注体系,解决了不同数据集之间标注标准不一致的问题。数据集涵盖欧洲中世纪手稿、早期印刷书籍及天文学图表等多种文献类型,标注类别虽然精简为五类,但通过合并原始数据集的精细分类(如将印刷商标记归入插图类),确保了关键视觉元素的覆盖。此外,数据集附带了训练/验证/测试集的划分脚本(split.py)和可视化HTML生成工具,方便使用者快速评估标注质量与数据集统计信息。
使用方法
GenHisDoc以YOLO格式提供标注,可直接用于主流目标检测框架(如YOLOv5、YOLOv8)的训练。用户需将图像与对应的文本标注文件放置于images和labels文件夹中,并依据data.yaml文件中的类别信息与路径配置启动训练。数据集内嵌的split.py脚本可按42号随机种子将数据划分为训练、验证和测试集,确保实验可重复性。对于需要原始数据集溯源的研究者,origin.csv文件提供了每张图像的来源标注,便于在论文中明确引用各子数据集。
背景与挑战
背景概述
GenHisDoc数据集由Jules Musquin主导创建,整合了来自Sacrobosco、IlluHisDoc、Horae LSv2及El Picpic Stamps等多个公开数据集的标注,并补充了Aikon平台下VHS与EIDA项目的人工校正数据,形成包含9448张图像的历史文档通用数据集。该数据集发表于2024年前后,旨在解决历史文档布局识别与检测领域中缺乏统一标注标准与跨类别兼容性的问题。通过将不同来源的标注统一转换为YOLO格式,并定义插图、首字母、装饰、印章、表格五类视觉元素,GenHisDoc为计算机视觉在历史文献分析中的研究提供了标准化基准,推动了数字人文与文化遗产自动解析领域的发展。
当前挑战
GenHisDoc面临的挑战首先来自领域核心问题:历史文档布局检测需应对页面复杂多样性,如非线性排版、多语言混合及手写与印刷共存的场景,而现有模型常因缺乏统一的高质量标注数据而泛化能力不足。在构建过程中,原始数据集存在格式不一(如语义分割与CSV标注)、分类体系冲突(如Sacrobosco中印刷标记需重分类为插图)及噪声干扰(如Horae LSv2中精细文本分割类被剔除)等问题,需大量人工重新标注与清洗。此外,整合多源数据时需协调不同许可协议(如CC-by-NC-SA-4.0),并确保跨数据集标注一致性,这增加了数据集的维护与扩展难度。
常用场景
经典使用场景
GenHisDoc数据集专为历史文档布局识别与检测任务而设计,其经典使用场景聚焦于从各类历史文献中自动提取和定位视觉元素,如插图、首字母装饰、装饰图案、印章及表格等。该数据集整合了多个公开子集并进行了统一标注,覆盖英语和法语文献,适用于训练和评估基于深度学习的对象检测模型(如YOLO系列),为历史文档的数字化解析提供了标准化的基准资源。
衍生相关工作
GenHisDoc的构建模式催生了一系列衍生工作,包括基于YOLO格式的标准化检测管线开发、多源历史文档标注融合策略的优化,以及零样本迁移学习在古籍元素检测中的探索。其整合的子数据集如Sacrobosco与Horae均催生了独立的版面分割基准,而Aikon(如VHS与EIDA项目)中的众包校正标注则为该领域提供了高质量的半原始数据,进一步拓展了历史科学图谱与天文图示的自动化分析研究。
数据集最近研究
最新研究方向
GenHisDoc数据集整合了多个历史文档图像标注资源,构建了一个面向历史文档版面布局识别与检测的通用型数据集,涵盖插图、首字母、装饰、印章和表格五类元素。在当前数字人文与计算机视觉交叉融合的前沿,该数据集推动了历史文化资产的智能化分析,尤其为大规模手稿与早期印刷品的自动版面解析提供了标准化训练基准。随着深度学习在文化遗产领域的深入应用,GenHisDoc的出现有效缓解了历史文档标注数据零散、标准不一的难题,支撑了跨语种、跨时期文档结构理解的模型研发,对古籍数字化、知识图谱构建及视觉史料计量分析具有重要的学术价值与方法论意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务