abdur75648/UTRSet-Real
收藏资源简介:
UTRSet-Real数据集是一个专门为印刷体乌尔都语OCR研究设计的手动注释数据集。它包含超过11,000张印刷文本行图像,每张图像都经过精心注释。数据集的一个显著特点是其多样性,包括字体、文本大小、颜色、方向、光照条件、噪声、样式和背景的变化。这种多样性使其非常适合于训练和评估在现实世界中乌尔都语文本识别任务中表现出色的模型。此外,UTRSet-Synth数据集是一个高质量合成数据集,与UTRSet-Real数据集相辅相成,用于训练目的。
UTRSet-Real数据集是一个专门为印刷体乌尔都语OCR研究设计的手动注释数据集。它包含超过11,000张印刷文本行图像,每张图像都经过精心注释。数据集的一个显著特点是其多样性,包括字体、文本大小、颜色、方向、光照条件、噪声、样式和背景的变化。这种多样性使其非常适合于训练和评估在现实世界中乌尔都语文本识别任务中表现出色的模型。此外,UTRSet-Synth数据集是一个高质量合成数据集,与UTRSet-Real数据集相辅相成,用于训练目的。
UTRSet-Real (UTRNet) 数据集概述
基本信息
- 标题: UTRSet-Real (UTRNet)
- 许可: cc-by-nc-4.0
- 任务类别: image-to-text
- 语言: urdu
- 标签: ocr, text recognition, urdu-ocr, utrnet
- 别名: UTRSet-Real
数据集描述
UTRSet-Real 数据集是一个专门为 Printed Urdu OCR 研究精心策划的手动注释数据集。该数据集包含超过 11,000 张印刷文本行图像,每张图像都经过细致的注释。数据集的一个突出特点是其卓越的多样性,包括字体、文本大小、颜色、方向、光照条件、噪声、样式和背景的变体。这种多样性非常接近现实场景,使得该数据集非常适合用于训练和评估旨在现实世界乌尔都语文本识别任务中表现出色的模型。
UTRSet-Real 数据集的可用性解决了全面真实世界印刷乌尔都语 OCR 数据集的稀缺问题。通过为研究人员提供开发和基准测试乌尔都语 OCR 模型的宝贵资源,该数据集促进了标准化评估和可重复性,并推动了乌尔都语 OCR 领域的发展。此外,为了补充 UTRSet-Real 用于训练目的,我们还提供了 UTRSet-Synth,这是一个高质量的合成数据集,与现实世界乌尔都语文本的表示非常接近。有关 UTRSet-Real 和 UTRSet-Synth 数据集的更多信息和详细信息,请参阅论文 "UTRNet: High-Resolution Urdu Text Recognition In Printed Documents"。




