官方服务:
资源简介:
Handwritten camera captured dataset
应用场景:
相关数据集
Nuremberg Letterbooks
Nuremberg Letterbooks数据集由弗里德里希-亚历山大-埃尔朗根-纽伦堡大学创建,包含15世纪初的历史文档,共计1711页,由10位抄写员书写。数据集提供了三种类型的转录:基本转录、外交转录和规范化转录,旨在满足不同研究领域的需求。数据集的创建过程包括文档数字化、手动标注转录和元数据,以及多次校正和验证。该数据集主要应用于历史文档分析和手写文本识别,旨在解决历史文档数字化与人文研究
arXiv2024-11-12 更新340
TRIDIS (Tria Digita Scribunt)
TRIDIS是一个开源的中世纪和早期现代手稿综合语料库,由多个开放许可的子集组成,并包含大量元数据描述。该数据集旨在促进手写文本识别和命名实体识别的联合研究,覆盖了12至17世纪的主要西欧手写体和语言。数据集通过统一的模式组织,并以Apache Parquet格式包装,以确保高效的访问和分析。它包括近200,000行文本和超过200万个标记,跨越不同的机构和时期,为文档资料提供了平衡和具有挑战性的
arXiv2025-03-25 更新220
Page-level Annotated Text Recognition Assemblage
A dataset for page level Bangla handwriting text recognition and analysis
kaggle2025-12-11 更新110
RIMES 2009
该数据集是一组广泛使用的灰度图像,包含了法语的手写文本,特别适用于邮件书写。它专注于页面级别的多样性,并具有复杂布局,包含了多个文本块类别。该数据集涵盖了多种手写文本,其任务是对手写文本进行识别。
arXiv280
magistermilitum/Tridis
这是**TRIDIS**(*Tria Digita Scribunt*)系列手写文本识别模型使用的第一个数据集版本,该模型基于中世纪和早期现代手稿的半外交转录进行训练。数据集包含4000页手稿,适用于研究法律、行政和纪念实践产生的文献手稿,如登记册、封建书籍、宪章、诉讼和会计记录,主要来自中世纪晚期(13世纪及以后)。
Hugging Face2024-12-06 更新150



