遇见数据集

almanach/LADaS

收藏
Hugging Face2024-07-17 更新2024-07-22 收录
官方服务:

资源简介:

LADaS数据集是一个多文档历时布局分析数据集,包含了从17世纪至今的多种文档类型,如专著、博士论文、销售目录、学术论文等。数据格式为YoloV8 bbox格式,主要使用SegmOnto词汇进行标注。数据集由Inria的ALMANaCH团队创建,并与其他研究人员合作继续开发。数据集的结构包括8个字段,如图像路径、年份、图像、宽度、高度等,并且包含对象的边界框和类别信息。

LADaS, created by the ALMANaCH team-project at Inria, is a multidocuments diachronic layout analysis dataset. It includes various types of documents such as monographs from the Bibliothèque Nationale de France, PhD theses, selling catalogs, noisy digitized documents, academic papers, technology and video game magazines, etc. The data are in YoloV8 bbox format, primarily using Latin script, with the main language being French and some representation of the main western academic languages. The annotations use the SegmOnto vocabulary, and a detailed annotation guide is provided. The dataset is curated by Thibault Clérice and Juliette Janès, funded by Défi COLaF and Inria, and licensed under CC-BY.

提供机构:
almanach
原始信息汇总

LADaS: Layout Analysis Dataset with SegmOnto

数据集详情

  • 创建者: ALMANaCH团队项目,Inria
  • 合作伙伴: 其他研究人员
  • 类型: 多文档历时布局分析数据集
  • 包含内容:
    • 法国国家图书馆的专著(17世纪至今)
    • 博士论文(20-21世纪,不限于STEM领域)
    • 销售目录(18-20世纪,手稿和艺术品)
    • 噪声数字化(如手指遮挡,20-21世纪)
    • 学术论文(主要为人文和社会科学,19-21世纪)
    • 技术与电子游戏杂志(1920s-2010)
    • 其他杂项
  • 数据格式: YoloV8 bbox格式(center_x center_y width height)
  • 语言: 主要为法语,包含主要西方学术语言

标注

  • 标注工具: SegmOnto词汇表
  • 标注指南: AnnotationGuide.md
  • 标注者:
    • Clérice, Thibault
    • Janès, Juliette
    • Scheithauer, Hugo
    • Bénière, Sarah
    • Bougrelle, Roxane
    • [匿名,待论文发表]

数据集描述

  • 策划者: Thibault Clérice & Juliette Janès
  • 资助: Défi COLaF, Inria
  • 许可证: CC-BY

用途

  • 直接用途: 布局分析

数据集结构

  • 字段:
    • image_path: 文件的字符串标识符
    • year: 生产年份,可为空
    • dating-certainty: 用于指定基于日期范围和世纪范围自动提供的日期
    • set: 数据子集,包括theatre(戏剧)、monographies(专著)、theses(博士论文)等
    • image: 图像
    • widthheight: 图像的宽度和高度
    • objects: 包含以下条目的字典:
      • bbox: 使用COCO/YOLO格式的bbox序列(相对center_x, center_y, width, height)
      • category: 每个bbox的标注类别的纯文本表示,共41个类别
      • objects可以包含空的bbox列表和空的category列表,表示图像不包含任何对象

引用

BibTeX:

tex @misc{Clerice_Layout_Analysis_Dataset, author = {Clérice, Thibault and Janès, Juliette and Scheithauer, Hugo and Bénière, Sarah and Bougrelle, Roxane and Romary, Laurent and Sagot, Benoit}, title = {{Layout Analysis Dataset with SegmOnto (LADaS)}}, url = {https://github.com/DEFI-COLaF/LADaS} }

数据集卡片联系

Thibault Clérice 或 Juliette Janes (first.last@inria.fr)

搜集汇总
数据集介绍
构建方式
LADaS数据集由法国国立信息与自动化研究所(Inria)的ALMANaCH团队主导创建,并联合多位研究人员持续完善。该数据集旨在服务于多文档历时性版面分析任务,其构建过程中广泛收集了来自法国国家图书馆的17世纪至今的专著、涵盖非STEM领域的20至21世纪博士论文、18至20世纪的销售目录、含有噪声的数字化文档(如带有手指遮挡的20至21世纪资料)、19至21世纪的人文社科类学术论文、以及1920年代至2010年的科技与电子游戏杂志等多种类型的文档。所有数据均采用YoloV8格式的边界框标注,并基于SegmOnto本体词汇进行语义注释,确保标注体系的一致性与规范性。
特点
LADaS数据集具有显著的历时性与多文档类型融合特征,其覆盖了从17世纪至21世纪长达四个世纪的文献资料,横跨专著、论文、目录、杂志等多种形态。数据集的标注体系基于SegmOnto本体,包含41个细粒度的版面元素类别,并提供了详细的注释指南以供参考。此外,每条样本均包含年份、年代确定性指标以及所属子集(如戏剧、专著、论文等)等元信息,使得研究者能够灵活地根据时间跨度或文档类型进行针对性分析。特别地,数据集还包含了部分不含任何标注对象的图像,为模型对空白或噪声页面的处理能力提供了测试场景。
使用方法
LADaS数据集以Parquet格式存储,用户可通过HuggingFace Datasets库直接加载使用。每条样本包含图像路径、图像数据、宽度、高度、年份及年代确定性等字段,其中核心的标注信息存储于'objects'字段内,该字段以字典形式提供边界框列表(采用COCO/YOLO格式的相对坐标)及其对应的类别标签。用户可根据自身需求选择特定子集(如theatre、monographies、theses等)进行训练或评估,亦可利用年份信息实现时间维度的分层抽样。该数据集特别适用于版面分析任务的模型训练与基准测试,其CC-BY 4.0许可协议允许广泛的学术与非商业用途。
背景与挑战
背景概述
LADaS(Layout Analysis Dataset with SegmOnto)是由法国国家信息与自动化研究所(Inria)下属的ALMANaCH团队主导,联合多位研究人员于2024年创建的多文档历时性版面分析数据集。该数据集聚焦于历史与当代文档的版面结构理解,涵盖法国国家图书馆的17世纪至当代专著、多学科博士论文、艺术与手稿销售目录、噪声数字化图像、人文社科类学术论文、20世纪20年代至2010年的科技与游戏杂志等丰富类型。其核心研究问题在于为复杂、异构的历史文档提供统一的版面标注基准,并推动SegmOnto本体词汇在版面分析领域的标准化应用。作为首个大规模采用SegmOnto标注体系的数据集,LADaS为文档图像分析、数字人文与文化遗产数字化领域提供了重要的训练与评估资源,对促进跨时期、跨语种(以法语为主,兼涉主要西方学术语言)的版面理解研究具有深远影响。
当前挑战
LADaS所解决的领域问题在于文档版面分析中历史文档的异构性与标注一致性挑战。历史文档的版面结构因时代、类型和数字化质量差异巨大,现有数据集多聚焦于现代文档,难以泛化至17世纪至当代的多样化材料。构建过程中,团队面临多重困难:首先,需从法国国家图书馆等机构获取并筛选跨越四个世纪的文档,确保数据的时间覆盖性与类型多样性;其次,采用SegmOnto本体进行41类细粒度标注,需制定详尽的标注指南以维持跨注释者的一致性,并应对版面元素(如页眉、页脚、注释框)的模糊边界;此外,噪声图像(如包含手指遮挡的数字化样本)和拉丁字母以外的少量非标准字符增加了标注与模型训练的复杂性。这些挑战要求数据集在规模有限(1K至10K样本)的条件下,兼顾历史真实性与标注可靠性,为后续模型泛化提供坚实基础。
常用场景
经典使用场景
LADaS(Layout Analysis Dataset with SegmOnto)数据集在文档布局分析领域扮演着基准测试的核心角色。该数据集汇聚了自17世纪至今的多元文献类型,包括法国国家图书馆的善本、多学科博士论文、艺术品与手稿销售目录、带有噪声的数字化图像(如手指遮挡的页面)、人文社科领域的学术论文、以及20世纪初至2010年的科技与游戏杂志。所有标注均采用SegmOnto本体词汇,涵盖41种版面元素类别,并以YOLOv8格式的边界框呈现。研究者在训练和评估版面分割、文本区域检测、图像元素分类等深度学习模型时,常将LADaS作为跨时代、跨文档类型的标准化测试平台,尤其适用于处理历史文献与复杂排版的版面理解任务。
实际应用
在实际应用中,LADaS数据集赋能了多项文档数字化与知识服务的关键环节。图书馆与档案馆可借助基于该数据集训练的版面分析模型,自动识别古籍中的标题、段落、页眉、注释、插图等元素,实现大规模历史文献的结构化转录与元数据提取。出版机构利用其对杂志、论文等现代文档的布局解析能力,优化电子书制作流程和学术论文的自动排版。文化遗产数字化项目中,该数据集支持的模型能有效处理手指遮挡、纸张破损等噪声场景,提升OCR前处理的鲁棒性。此外,在数字人文研究平台如Gallica或HathiTrust中,LADaS衍生的工具可自动为百万级页面生成语义标签,支撑文本重用检测、主题建模等下游分析任务,显著降低了人工标注的成本。
衍生相关工作
LADaS数据集催生了一系列具有影响力的后续研究工作。在模型层面,研究者基于该数据集提出了融合SegmOnto本体的多任务学习框架,同时预测版面类别与几何位置,并探索了利用对比学习增强历史文档视觉表征的方法。在工具开发方面,开源项目如‘docling’和‘LayoutParser’将LADaS的标注规范集成到其训练管线中,支持用户快速微调适用于特定馆藏的自定义版面分析器。在理论贡献上,数据集作者后续发表了关于跨世纪版面演化模式的定量分析,揭示了段落密度、页边距等特征从17世纪到21世纪的非线性变化趋势。此外,该数据集还促进了SegmOnto本体本身的扩展,催生了针对手稿、乐谱等特殊文献类型的子本体,形成了更完整的文档结构描述生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务