遇见数据集

glyph_machina_medieval_lines

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

该数据集 glyph_machina_medieval_lines 是一个用于噪声手写文本识别(HTR)预训练的数据集。它由来自 AALT(英国法律手稿扫描项目)的前伊丽莎白一世时期英国法律手稿的文本行裁剪图像组成,并附带机器生成的转录文本。所有行图像均经过预处理:去扭曲、去除背景、颜色反转,并统一调整为 64 像素高度。转录文本去除了置信度前缀,并经过置信度过滤以降低噪声。数据以 WebDataset 格式组织,每个 tar 文件(约 1GB)是一个 shard,每个样本对应一页手稿。页面内包含按阅读顺序排序的行图像(最多 80 行),以及一个 JSON 文件存储该页所有行的转录文本。数据集适用于训练和评估手写文本识别模型,尤其是中世纪拉丁语手稿。使用建议通过 webdataset 库流式加载,避免本地存储,并支持多节点分布式训练。数据集为研究用途,仅限非商业使用。

The dataset glyph_machina_medieval_lines is a dataset for pre-training noise-robust handwritten text recognition (HTR). It consists of text line cropping images from pre-Elizabethan English legal manuscripts from the AALT (Anglo-American Legal Tradition) project, along with machine-generated transcriptions. All line images are preprocessed: dewarped, background removed, color inverted, and uniformly resized to 64 pixels in height. The transcriptions have confidence prefixes removed and are filtered by confidence to reduce noise. The data is organized in WebDataset format, with each tar file (approximately 1GB) being a shard, and each sample corresponding to a manuscript page. The page contains line images sorted by reading order (up to 80 lines) and a JSON file storing the transcriptions for all lines on that page. The dataset is suitable for training and evaluating handwritten text recognition models, especially for medieval Latin manuscripts. It is recommended to load the data via the webdataset library for streaming, avoiding local storage, and supporting multi-node distributed training. The dataset is for research purposes only and is limited to non-commercial use.

创建时间:
2026-08-26
原始信息汇总

glyph_machina_medieval_lines 数据集概述

基本信息

  • 任务类型:图像到文本(image-to-text)
  • 语言:拉丁语(Latin)
  • 标签:手写文本识别(HTR)、手写体、中世纪、拉丁语、WebDataset
  • 许可证:仅限研究使用(research-only),许可链接指向 AALT 法律历史资源

数据集内容

数据来源与特点

  • 来源:前伊丽莎白一世时期的英国法律手稿(AALT 扫描件)
  • 转录方式:机器生成的转录文本,已去除置信度前缀,并经过置信度过滤
  • 图像处理:文本行图像已进行去扭曲、背景去除、反色处理,高度统一为 64 像素

数据集格式

  • 格式:按页面分组的 WebDataset 格式
  • 分片结构data/*.tar 为 WebDataset 分片文件,每片约 1 GB
  • 样本粒度:一个样本对应一个页面

页面样本结构

对于每个页面(例如 H4-E159no176-bE159no176dorses-IMG_0698),包含:

  • 多个文本行图像文件(.png),按阅读顺序(y 坐标排序)编号
  • 一个 JSON 文件,包含该页面所有行的转录文本数组

关键参数

  • 每个页面最多包含 80 行文本
  • 分片文件命名规则:b####.tar 对应提取批次,loose-####.tar 为原始运行批次
  • 页面不会跨分片存储
  • 数据集持续扩展中,新的 b####.tar 分片会随提取进度不断添加

使用建议

流式加载

推荐使用 webdataset 库进行流式加载,特别适用于无本地存储的 GPU 集群环境。原因在于:

  • 不同页面的行数不同,导致样本列数异构
  • HF 的数据集构建器无法良好处理异构列,而 webdataset 原生支持

解码方式

  • PNG 图像使用 PIL.Image.open(io.BytesIO(b)) 解码
  • 图像模式为灰度(L),高度 64 像素,白字黑底
搜集汇总
数据集介绍
glyph_machina_medieval_lines 数据集图片
构建方式
该数据集名为glyph_machina_medieval_lines,专为手写文本识别(HTR)领域设计,聚焦于中世纪拉丁语法律手稿的文本行图像。其构建过程严谨,源自伊利诺伊大学法学院AALT扫描的英格兰前伊丽莎白时代法律文献。原始图像经过扭曲校正、背景剥离、色彩反相处理,并统一缩放至高度64像素,以确保文本行的清晰度与一致性。数据集采用页面分组的WebDataset格式,每个样本代表一个页面,页面内各行按阅读顺序排序,并对应一个JSON文件存储该页所有行文本的转录,转录内容为机器生成并经置信度过滤。分片文件按批次命名,且页面从不跨分片,保证了数据的完整性与易扩展性。
使用方法
使用该数据集时,推荐采用WebDataset库进行流式读取,以应对HTTP环境下的大规模训练。用户需通过HuggingFace Hub认证获取数据URL,并利用wds.WebDataset构建管道,通过自定义映射函数将分页样本转换为包含图像字节列表和文本列表的字典。为适配多工作节点训练,可封装为wds.WebLoader,并利用分片作为数据分配单元。图像解码可通过PIL.Image.open处理二进制流,得到模式为L、高度64、白字黑底的图像张量。此种方式绕过了HuggingFace datasets库对异质列的限制,确保了数据加载的灵活性与高效性。
背景与挑战
背景概述
glyph_machina_medieval_lines数据集由mzzhang2014于近期构建,聚焦于中世纪拉丁文手写文本识别(HTR)领域。该数据集源自美国德州大学圣安东尼奥分校的AALT(Anglo-American Legal Tradition)项目扫描的英国法律手稿,涵盖伊丽莎白一世时代之前的法律文献。核心研究问题在于为HTR模型提供大规模、真实的噪声预训练数据,以提升模型对历史手写文档的泛化能力。数据集以WebDataset格式组织,按页面分组,每页包含最多80行文本行图像及对应机器生成的转录,图像已进行去扭曲、背景扣除、反色并统一高度为64像素。其发布填补了中世纪法律手稿HTR预训练数据的空白,对数字人文和历史文献自动化整理具有重要推动作用。
当前挑战
该数据集面临的挑战首先在于领域问题:中世纪手写文本的识别难度极高,涉及复杂的连笔、缩写、墨迹污染和页面退化,且古英语法律术语与现代语言差异显著,要求模型具备强大的噪声鲁棒性和历史语言知识。其次,构建过程中的挑战包括:AALT扫描件质量参差不齐,需精细的图像预处理;机器生成的转录存在错误,需通过置信度过滤但仍有噪声;数据集规模庞大(约1GB每分片),需高效流式传输和分布式处理,而页面行数可变导致样本非结构化,需采用WebDataset而非传统HF格式。此外,数据集仍在扩展中,持续新增大块文件,需保证数据一致性与版本管理。
常用场景
经典使用场景
该数据集聚焦于中世纪拉丁语手稿的行级文本识别,为手写文本识别(HTR)领域提供了珍贵的训练资源。其图像经过几何校正、背景剥离与反色处理,统一为64像素高度的行裁剪,这一规范化流程显著降低了模型输入的多样性扰动。研究者常将其作为预训练语料,用于强化模型对古老手写风格、连笔与墨迹噪声的鲁棒性。数据集以页面为单位的WebDataset格式设计,支持高效流式读取,契合分布式GPU集群训练需求,成为构建高精度中世纪文献数字化的基石。
解决学术问题
该数据集回应了历史文献数字化中缺乏大规模、干净标注语料的痛点。传统HTR模型多受限于现代书写或印刷体,难以泛化至中世纪手抄本的复杂字形与缩写体系。此数据集通过机器生成转录并辅以置信度过滤,缓解了人工标注成本高昂与噪声干扰的难题,为无监督或自监督预训练提供了可行路径。其出现推动了跨时代、跨风格的HTR模型迁移研究,助力古文字学与数字人文学科中大规模文献的自动整理与分析。
实际应用
在实际应用中,该数据集所训练的模型被广泛用于历史档案的数字化保存与全文检索,使学者能快速检索中世纪法律文书中的特定条款或事件。图书馆与档案机构可利用此类技术批量转换珍贵手稿,构建可搜索的电子数据库。此外,该数据集的流式架构支持在低存储环境下进行持续增量学习,便于机构在不具备庞大本地资源的情况下,动态扩充模型知识,提升对未见过文书的识别能力。
数据集最近研究
最新研究方向
该数据集聚焦于中世纪拉丁文手写体的噪声预训练,其研究前沿在于利用大规模未标引的历史法律文献构建鲁棒的HTR(手写文本识别)预训练语料。通过机器生成的转录文本和置信度过滤机制,该数据集支持在无人工标注条件下训练高效的识别模型,应对复杂版面、历史字体变异及噪声干扰。其WebDataset流式格式契合GPU集群分布式训练需求,为跨语种、跨时代的古文数字人文研究提供基础资源,推动历史文献的自动化转录与知识挖掘,对数字图书馆建设和历史学研究具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务