遇见数据集

HPMD

收藏
arXiv2026-09-28 更新2026-10-01 收录
官方服务:

资源简介:

HPMD(Historical Persian Manuscript Dataset)是帕亚姆·努尔大学创建的历史波斯手稿数据集,专为单词定位任务设计。该数据集包含223页、3678行、37631个单词和130630个字符,源自多本历史波斯诗歌与散文书籍,并由11名标注者在区域、行和文本级别进行注释,未标注单词级边界以降低标注成本。创建过程精心选取不同流派、字体和布局的页面,通过Transkribus平台完成三层标注,并附有页面级属性标签。数据集主要服务于历史手稿的单词定位研究,旨在解决缺乏公开历史波斯手稿数据集及单词级标注昂贵的问题,支持仅需行级标注即可实现单词搜索的方法,助力历史学家快速定位特定名称、日期或事件。

HPMD (Historical Persian Manuscript Dataset) is a historical Persian manuscript dataset developed by Payame Noor University, specifically designed for word localization tasks. This dataset consists of 223 pages, 3678 lines, 37,631 words and 130,630 characters, sourced from multiple historical Persian poetry and prose books. It was annotated by 11 annotators at the region, line and text levels, while word-level boundaries were not labeled to reduce annotation costs. During its development, pages of different genres, scripts and layouts were carefully selected. Three-level annotation was completed via the Transkribus platform, with page-level attribute tags attached. This dataset primarily serves research on word localization for historical manuscripts, aiming to address the issues of the lack of publicly available historical Persian manuscript datasets and the high cost of word-level annotation. It supports methods that enable word spotting with only line-level annotations, assisting historians in quickly locating specific names, dates or events.

创建时间:
2026-09-28
搜集汇总
数据集介绍
HPMD 数据集图片
构建方式
围绕历史波斯语手稿难以检索的困境,该数据集从诗歌与散文类古籍中择取页面,涵盖哈菲兹诗集、列王纪与Majma al-Bayan等来源。图像经高分辨率扫描后由11名标注者在Transkribus平台上完成区域、行级与转写三级标注,未绘制词级边界框以控制标注成本。每页另附体裁、书体、退化程度、装饰与主观辨读难度五项页面级属性。最终形成223页、3678行、37631词、130630字符的规模,并按页面划分为训练、验证与测试三部分,确保无页面重叠。
特点
该数据集的独特之处在于其历史性与波斯语属性的双重稀缺,且行分布呈双峰形态,反映诗歌双栏与散文通栏两种版式的混合。字符频率跨越近三个数量级,从出现约一万七千次的alef到仅23次的zhe,长尾显著。书体以shekasteh为主导,兼有nastaliq与naskh,装饰与退化条件多样。页面级属性标签揭示光照与边框对识别性能的显著影响,为条件化评估提供了基础,同时错误分析表明短查询与子串匹配是检索精度的主要制约。
使用方法
该数据集适用于基于行级标注的词定位任务,亦可作为手写文本识别与版面分析的基准。使用时可借助微调后的BLLA模型检测文本行,再以CRNN识别器输出帧级字符后验矩阵,通过CTC维特比对齐将查询字符串直接与后验矩阵匹配,从而在不依赖词级边界框的情况下返回词的位置。决策阈值需在验证集上选定并固定,查询文本需与训练时一致地去除变音符号并统一字母形式。研究人员亦可将其用于少样本手写识别、版面分析或检索错误分析等方向。
背景与挑战
背景概述
波斯手稿作为世界最丰厚的书面遗产之一,其数字化图像长期处于不可检索状态,史学家若欲定位某一姓名、日期或事件,不得不逐页披览,耗时经月。既有波斯手写数据集如Sadri、Khayyam、Hoda、FHT及MPHD均由现代书写者在采集表上完成,难以反映历史手稿的版式、书体与退化特征;而面向阿拉伯文与乌尔都文的VML-HD、Urdu Katib及OpenITI MAKHZAN虽属历史文献,其波斯文部分却相当有限。在此背景下,Saeid Firouzi Daghigh与Majid Iranpour Mobarakeh于2026年提出HPMD数据集,由伊朗Payame Noor大学计算机工程与信息技术系构建,包含223页、3678行、37631词及130630字符,由11位标注者在区域、行与文本三个层级完成标注,并附有体裁、书体、退化、装帧及阅读难度等页面属性。该数据集填补了历史波斯手写公开资源的空白,为低资源文种下的词定位研究提供了基准。
当前挑战
HPMD所应对的领域问题在于历史波斯手稿的词定位:波斯文连写、字母随位置变形,且大量字母共享骨架而仅以点号的数量与位置相区别,如be/pe/te/se与jim/che/he/khe,古旧手稿中这些点号常褪色、错位或缺失,传统OCR仅取每帧最大概率字符,一字之差便导致检索失败。同时,历史手稿的版面包含金色云纹底、边框、污渍与淡墨,行检测与识别均受干扰。构建过程中的核心挑战在于标注成本:词级边界框的绘制极为昂贵,200页约需2000个行框却需约20000个词框,因此该数据集仅提供区域与行级标注,不绘制词框,并须证明仅凭行级弱监督仍能恢复词级位置;此外,字符频率分布跨越近三个数量级,zhe仅出现23次,稀有字符难以可靠学习,短查询词亦成为误检的主要来源。
常用场景
经典使用场景
在历史文献数字化的浪潮中,波斯手稿的检索长期依赖人工翻阅,效率低下且难以规模化。HPMD数据集以其223页、3678行、37631词的精细标注,为词定位任务提供了稀缺的基准资源。该数据集最经典的使用场景在于:研究者利用其区域、行及文本级标注,训练行检测与识别模型,并通过保留CTC后验概率矩阵而非解码文本,实现对历史波斯语手稿中特定人名、地名、事件或主题的快速定位。这种以行级标注驱动词级定位的范式,显著降低了标注成本,同时保持了检索的鲁棒性,尤其适用于诗歌与散文混杂、书写风格多样的古籍页面。
衍生相关工作
HPMD的发布激发了多项相关研究。在识别层面,研究者尝试将Transformer架构(如HATFormer)应用于历史手写波斯语,以提升识别精度;在检索层面,基于后验概率的搜索方法被进一步优化,例如引入空白帧约束以减少子串误匹配,或结合语言模型进行重排序。同时,该数据集也被用于评估联合嵌入框架(如HWNet v3)和语义重排序方法在波斯语手稿上的表现。此外,其分布分析与错误分类结果为后续数据集构建提供了参考,推动了针对光照、退化等页面级因素的自适应方法研究,并促进了低资源手写脚本检索的标准化评测。
数据集最近研究
最新研究方向
HPMD数据集的提出为历史波斯手稿的词语检索开辟了低标注成本的新路径。当前研究前沿聚焦于以行级标注替代昂贵的词级边界框,借助CTC后验矩阵直接计算查询词与图像帧的匹配得分,从而在相似字母混淆(如be与pe)的情况下仍保持高召回率。该方向与历史文献数字化、无分割词语检索及低资源手写文本识别等热点紧密相连。其意义在于显著降低标注门槛,使波斯手稿等低资源历史文献的自动检索成为可能,同时为基于Transformer的识别器、语义重排序等后续研究提供了可复现的基准与数据支撑。
相关研究论文
  • 1
    HPMD: A Historical Persian Manuscript Dataset for Word Spotting with Line-Level Annotation帕亚姆·努尔大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务