GenHisDoc_dataset
收藏资源简介:
GenHisDoc是一个用于历史文档布局识别与检测的通用性数据集,包含9448张图像。它整合了多个已公开发布的数据集(如The Sacrobosco Dataset、IlluHisDoc、Horae LSv2和El Picpic Stamps Dataset)以及部分未发布项目(如Projet VHS和Projet EIDA)的数据,经过统一的适应、校正和重新标注处理,以确保数据一致性和协同工作能力。数据标注采用YOLO格式,定义了五个目标类别:插图(Illustration)、首字母(Initial)、装饰图案(Ornament)、印章(Stamp)和表格(Table)。数据集文件结构清晰,包含图像文件夹、标签文件夹、类别列表文件、YAML配置文件和CSV来源记录文件,以及实用脚本。该数据集适用于计算机视觉领域的历史文档分析任务,特别是文档版面分析、目标检测和布局识别。
GenHisDoc is a general-purpose dataset for historical document layout recognition and detection, containing 9,448 images. It integrates multiple publicly released datasets (such as The Sacrobosco Dataset, IlluHisDoc, Horae LSv2, and El Picpic Stamps Dataset) as well as data from unpublished projects (e.g., Projet VHS and Projet EIDA), which undergo unified adaptation, correction, and re-annotation to ensure data consistency and interoperability. The data is annotated in YOLO format, defining five object categories: Illustration, Initial, Ornament, Stamp, and Table. The dataset has a clear file structure, including image folders, label folders, a category list file, a YAML configuration file for training, a CSV file recording the original source of each image, and utility scripts. This dataset is suitable for historical document analysis tasks in computer vision, particularly document layout analysis, object detection, and layout recognition.
数据集名称:GenHisDoc(Generalistic Historical Document Dataset)
- 规模:9448张图像,属于小规模数据集(n < 10k)。
- 语言:英语(en)、法语(fr)。
- 标签:计算机视觉、历史文档、检测、Python。
- 许可证:CC BY-NC-SA 4.0。
- 注释创建者:Jules Musquin 及基于已发表数据集的改编与再注释。
任务与标注
- 任务:历史文档版面识别与检测(Layout Recognition and Detection)。
- 标注格式:YOLO格式,每个图像附带一个对应的txt文件。
- 标注类别(共5类):
- 插图(Illustration)
- 首字母(Initial)
- 装饰(Ornament)
- 印章(Stamp)
- 表格(Table)
- 数据组织:包含 images/(图像)、labels/(标签)、classes.txt(类别列表)、data.yaml(训练配置)、origin.csv(图像来源)、split.py(划分训练/测试/验证集,种子42)、htmlgenerator.py(生成统计与标注展示页面)。
数据集构成
已发表数据集的改编与整合
- The Sacrobosco Dataset (S-VED)
- 来源:Zenodo(doi: 10.3390/jimaging8100285)。
- 修改:将“打印机标记”类别合并至“插图”类别;将CSV格式注释转换为YOLO格式(txt)。
- IlluHisDoc
- 来源:Dropbox(论文:docExtractor, arXiv:2012.08191)。
- 修改:将逐像素分割(4类)转换为YOLO检测格式。
- Horae LSv2
- 来源:Zenodo(版本2,中世纪祈祷书版面分割)。
- 修改:合并其精细注释体系为本数据集的5类分类;保留4244条关于装饰、插图、首字母的注释,去除18720条文本分割注释。
- El Picpic Stamps Dataset
- 来源:Roboflow(CC by 4.0授权,用户El PicPic)。
- 修改:对印章进行完全重新注释,并补充表格注释。
未发表数据集的整合与修正
- Aikon / Projet VHS / Eida
- 背景:Aikon是IIIF自动注释项目(ERC项目DISCOVER),来自IMAGINE-LIGM实验室与LTE实验室。
- Projet VHS(科学史跨学科项目):整合了9个手稿注释(如Cyclopaedia、BnF Latin 7416等),注释者均为Alexandre。
- Projet EIDA(天文图解分析):整合了4个手稿注释(如Latin 7293A、Sprenger 1838等)。
- 修改:对Aikon原有的单类检测进行完全修正与丰富。
项目结构与附加信息
- 项目仓库:https://github.com/Anarchiviste/GenHisDoc_Lab/tree/main
- 架构图(注:原文为相对路径 img/projectarchitecture.jpg,未提供绝对地址,无法转为完整链接)
- 类别分布图(注:原文为相对路径 img/GenHisDoc_class_distribution.png,未提供绝对地址,无法转为完整链接)




