遇见数据集

textindiagrams

收藏
github2026-06-23 更新2026-06-26 收录
官方服务:

资源简介:

这是第一个大型、多样、开放访问的历史天文图表数据集,包含948张图表,标注了10,940个定向多边形文本区域,时间跨度从8世纪到18世纪,涵盖阿拉伯、波斯、中文、拜占庭、拉丁、希伯来和梵文七大传统。

This is the first large-scale, diverse, open-access historical astronomical chart dataset, consisting of 948 charts annotated with 10,940 oriented polygonal text regions. It spans from the 8th to the 18th century and covers seven cultural traditions: Arabic, Persian, Chinese, Byzantine, Latin, Hebrew, and Sanskrit.

创建时间:
2026-06-12
原始信息汇总

文本区域检测在历史天文图表中的应用

数据集概述

  • 数据集名称: Text Region Detection in Historical Astronomical Diagrams
  • 论文标题: "Text region detection in historical astronomical diagrams"
  • 规模: 包含 948 张历史天文图表,标注了 10,940 个定向多边形文本区域
  • 时间跨度: 跨越十个世纪(8世纪至18世纪)
  • 文化传统: 涵盖七大主要传统:阿拉伯、波斯、中文、拜占庭、拉丁、希伯来和梵文

数据集结构

数据集分为两个主要目录:

EIDA

  • 包含所有传统(包括拉丁)的图像和标注
  • 分为训练集(train)、验证集(val)和测试集(test)
  • 标注格式为 LabelMe 格式,每张图像对应一个 .jpg 文件和 .json 标注文件

EIDALatin

  • 拉丁语子集,包含文本类别信息
  • 提供 .txt 格式的划分文件(train.txt、val.txt、test.txt)
  • 每个文件对应图像和 JSON 标注

数据获取

数据集可通过 Hugging Face 下载,链接为:https://huggingface.co/datasets/sonatbaltaci/textindiagrams

评估方法

类别无关的文本区域检测

  • 支持验证集(val)和测试集(test)模式
  • 使用 evaluate.py 脚本进行评估
  • 支持阅读顺序检查和不同阈值的 F1 和 F1-RO 指标

类别感知的文本区域检测(拉丁子集)

  • 支持每个类别的匹配、mAP、mF1 等指标
  • 使用 evaluate_class.py 脚本进行评估
  • 支持 20 类和 19 类两种配置

基准模型

  • 提供 Poly-DETR 基线模型,基于 DINO-DETR 实现
  • 提供预训练检查点和合成数据生成资源
  • 支持类别无关和类别感知两种模式的预训练与微调

许可协议

  • 许可证: Creative Commons Attribution 4.0 International License (CC BY 4.0)

引用信息

@inproceedings{baltaci2026text, title={Text region detection in historical astronomical diagrams}, author={Baltaci, Zeynep Sonat and Baena, Raphael and Meng, Fei and Norindr, Somkeo and Somer, Florence and Husson, Matthieu and Aubry, Mathieu}, booktitle={ICDAR}, year={2026} }

搜集汇总
数据集介绍
textindiagrams 数据集图片
构建方式
textindiagrams数据集是首个大规模、多样化的历史天文图表文本区域检测数据集,涵盖从8世纪至18世纪长达十个世纪的时间跨度,并囊括阿拉伯、波斯、中国、拜占庭、拉丁、希伯来和梵文七大主要传统。该数据集包含948张历史天文图表,共计标注了10,940个定向多边形文本区域。构建过程中,研究者以LabelMe格式提供标注,并将其划分为EIDA和EIDALatin两个子集,前者包含所有传统的图像与标注,并按训练、验证和测试集划分;后者则聚焦拉丁子集,额外提供类别感知的文本区域标注,并以.txt文件记录数据分割。数据集可通过Hugging Face平台下载,或运行所提供的脚本自动获取。
特点
该数据集的核心特点在于其跨文化、跨时代的丰富多样性,为研究历史天文图表中的文本区域检测提供了独特的资源。所有文本区域均以定向多边形形式标注,精准契合图表中文字旋转、倾斜的复杂布局。数据集的构建高度关注文本的阅读顺序,在评估指标中引入基于顶点索引的阅读顺序校验机制。此外,拉丁子集还支持类别感知的文本检测评估,涵盖20个文本类别,进一步拓宽了研究维度。研究者提供了面向脚本的分析映射文件,便于进行跨书写系统的细粒度性能对比。
使用方法
数据集的使用方法围绕检测与评估两条主线展开。对于类无关的文本区域检测任务,用户需运行evaluate.py脚本,并在结果JSON文件中指定图像名称、多边形分割坐标及置信度分数,通过--key_indices参数设定阅读顺序相关的顶点索引。对于测试集,可使用--thresholds固定分数阈值计算F1与F1-RO指标。处理拉丁子集的类感知检测时,则调用evaluate_class.py,结合配置文件指定类别数量,结果需包含类别ID或完整分数向量。研究者同时提供了Poly-DETR基线模型的训练与微调脚本,支持从预训练检查点出发,并附带了合成数据资源以增强训练效果。交互式评估可通过Jupyter Notebooks实现,分别对应类无关与类感知场景。
背景与挑战
背景概述
历史天文图表作为人类科学遗产的珍贵载体,其文本区域检测对于数字化分析至关重要。然而,现有数据集多聚焦于现代文档,缺乏对跨文化、跨时代手稿的覆盖。为此,由Zeynep Sonat Baltaci、Matthieu Aubry等学者组成的国际团队于2026年创建了TextIndiagrams数据集。该数据集汇集了948幅源自8至18世纪、涵盖阿拉伯、波斯、中文、拜占庭、拉丁、希伯来和梵文七大传统的天文图表,精心标注了10940个多边形文本区域。这一开创性资源填补了历史科学文献文档分析领域的空白,为研究古代天文知识的传播与演变提供了数据基石,亦推动了计算机视觉与数字人文的交叉发展。
当前挑战
该数据集面临的核心挑战在于处理历史天文图表中文本区域的极端多样性。一方面,跨越十个世纪的图表存在书写风格、语言、退化程度及布局结构的显著差异,文本常与复杂的图形、符号和装饰交织,且方向多变(包含旋转、弧线排列),使得通用文本检测模型难以泛化。另一方面,构建过程中需应对历史手稿的不规则拓扑(非水平文本行、不规则边界)、噪音(污渍、褪色、破损),以及标注视角的差异(如多文化对“文本区域”的定义不同)。此外,有限的高质量标注资源与专家知识的稀缺性,也加大了数据构建与模型评估的难度。
常用场景
经典使用场景
历史天文图解作为人类科学认知演变的视觉载体,其文字区域检测是数字人文学科与计算机视觉交叉领域中的一项独特挑战。TextIndiagrams数据集专为此场景设计,涵盖从8世纪至18世纪横跨阿拉伯、波斯、中文、拜占庭、拉丁、希伯来和梵文七种主要传统的948幅历史天文图片,共计10,940个带有精确多边形标注的文字区域。该数据集最经典的用法是训练和评估面向弯曲、倾斜、多朝向及复杂背景中文字区域的多边形检测模型,通过对不同书写系统和历史时期文本的鲁棒识别,推动面向罕见文档类型的文本检测研究。
解决学术问题
在学术层面,TextIndiagrams数据集解决了历史数字人文研究中长期缺乏大规模、多文化、多语种标注数据集的瓶颈。以往文本检测研究主要集中于现代印刷体和手写文档,对于天文图解中常出现的曲线排列、断裂、遮挡的文字区域缺乏系统研究。该数据集不仅提供了标准化的训练与评估协议(如基于读取顺序的F1-RO指标),还提出了Poly-DETR基线模型,从而有效推动了面向非矩形、多方向文本区域的检测方法发展,为跨文化科学遗产的自动化分析奠定了方法论基础。
衍生相关工作
基于TextIndiagrams数据集,研究团队衍生了一系列经典工作,包括专门针对历史图解设计的Poly-DETR检测器,它基于DINO-DETR框架并引入多边形顶点回归机制。此外,配套的合成数据生成工具(基于HDV项目)使得研究者可以模拟不同风格的古代天文图表,进而扩充训练样本。该数据集还关联了EIDA ANR项目与DISCOVER ERC项目,衍生出关于多语种历史文档分类、拉丁文字类感知检测方法等一系列后续研究,为跨国跨时代的科学图像理解提供了持续性的系统性研究平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务