遇见数据集

RusTitW

收藏
arXiv2023-03-29 更新2024-07-24 收录
官方服务:

资源简介:

RusTitW是由AIRI创建的大规模俄语文本识别数据集,包含13795张图像,用于解决野外文本识别的挑战。数据集内容丰富,包括多种文本类型和场景,通过人工标注确保质量。创建过程中,使用了先进的图像处理技术,如深度估计和语义分割,以增强数据集的实用性和多样性。该数据集主要应用于自动化文本识别技术,旨在提高模型在复杂环境下的识别能力,适用于多种实际应用,如水表读数、图像检索等。

RusTitW is a large-scale Russian text recognition dataset created by AIRI. It consists of 13,795 images and is designed to address the challenges of text recognition in wild scenes. The dataset features abundant content covering diverse text types and scenarios, with its quality ensured by manual annotation. During its development, advanced image processing technologies such as depth estimation and semantic segmentation were adopted to enhance its practicality and diversity. This dataset is mainly applied to automated text recognition techniques, with the goal of improving the recognition performance of models in complex environments, and is suitable for multiple real-world applications including water meter reading and image retrieval.

提供机构:
AIRI
创建时间:
2023-03-29
原始信息汇总

SynthText 数据集概述

数据集简介

SynthText 数据集包含约800,000张合成场景文本图像,这些图像由代码生成,用于文本定位研究。数据集的生成方法在论文 "Synthetic Data for Text Localisation in Natural Images", Ankush Gupta, Andrea Vedaldi, Andrew Zisserman, CVPR 2016 中描述。

数据集样本

数据集包含合成场景文本图像样本,具体样本图像可参考 这里。

数据生成

数据生成的主要依赖库包括:

pygame==2.0.0, opencv (cv2), PIL (Image), numpy, matplotlib, h5py, scipy

生成样本的命令如下:

python gen.py --viz [--datadir <path-to-dowloaded-renderer-data>]

其中,--datadir 指向下载的 renderer_data 目录,该目录包含以下内容:

  • sample.h5: 包含5张图像及其深度和分割信息的示例h5文件。
  • fonts: 三个示例字体文件。
  • newsgroup: 文本源文件,可替换为任意文本文件。
  • models/colors_new.cp: 前景/背景文本颜色模型。
  • models: 其他cPickle文件,如字符频率模型和字体大小转换模型。

生成的图像样本将存储在 results/SynthText.h5 文件中,可通过 python visualize_results.py 命令进行可视化。

预处理背景图像

数据集中包含8,000张预处理的背景图像及其分割和深度掩码,这些文件位于 bg_data 目录下,包括:

  • imnames.cp: 不包含背景文本的图像名称。
  • bg_img.tar.gz: 背景图像文件。
  • depth.h5: 深度图。
  • seg.h5: 分割图。

这些文件可通过 BitTorrent 或 HTTP 下载,具体下载链接和文件信息可参考 这里。

非拉丁文文本生成

数据集支持生成非拉丁文(如中文、阿拉伯文、日文等)文本图像,具体修改方法和代码可参考相关链接。

参考文献

更多信息请参考论文 "Synthetic Data for Text Localisation in Natural Images", Ankush Gupta, Andrea Vedaldi, Andrew Zisserman, CVPR 2016。

搜集汇总
数据集介绍
RusTitW 数据集图片
构建方式
RusTitW数据集由真实场景图像与合成图像两部分构成。真实部分包含超过13,000张来自自然场景的图像,由人工标注段落级边界框与文本字符串,标注涵盖西里尔字母、拉丁字母、数字及常见标点,忽略极小或不清晰的文字。合成部分基于改进的SynthText管线生成,利用CRAFT模型检测并模糊原始图像中的已有文字,借助COB模型进行边界检测以定位均匀区域,并通过MiDaS单目深度估计模型估算场景几何,确保文本自然地贴合物体表面。文本数据源自高频俄语词汇词典,经筛选去除不雅内容,并随机生成数字序列、电话号码及常见姓氏,采用96种俄语字体,背景图像取自经严格过滤的LAION数据集。
特点
该数据集具备显著的多样性与实用性。真实图像包含13,795张样本,合成图像超过900,000张,总计逾310万个单词实例。文本标注支持大小写敏感,并涵盖段落级、字符级边界框及分割掩码,为多种模型提供灵活标签。合成图像通过泊松融合与三角函数变换增强视觉真实感,使文本融入背景的纹理与色彩。数据集同时包含西里尔与拉丁字母,弥补了俄语场景文本识别领域的空白,为深度学习模型提供丰富的训练与评测基准。
使用方法
RusTitW数据集可直接用于训练和评估场景文本检测与识别模型。真实部分适用于微调模型以适应实际场景中的复杂光照、弯曲文字及遮挡情况;合成部分凭借其大规模与多样化标注,支持端到端文本定位、字符级识别及分割任务。研究者可依据任务需求选择子集,或结合两部分进行联合训练以提升泛化能力。此外,公开的生成代码允许用户复现并扩展数据集,适配特定应用场景,如车牌识别、翻译辅助或视觉障碍辅助系统。
背景与挑战
背景概述
在自然场景中精准识别文字信息是计算机视觉领域一项长期而艰巨的任务,其应用广泛涵盖自动驾驶、智能翻译与视障辅助等多个前沿方向。然而,现有研究多聚焦于英语文本,针对俄语等西里尔字母体系的公开数据集极为匮乏,严重制约了相关深度学习模型的发展。为填补这一空白,Igor Markov、Sergey Nesteruk、Andrey Kuznetsov 与 Denis Dimitrov 等研究人员于2023年3月发布了 RusTitW 数据集。该数据集由真实场景与合成图像两部分构成,包含超过13,000张真实标注图像与900,000张合成图像,提供了段落级边界框与文本标注,旨在为俄语自然场景文字识别提供大规模、高质量的训练与评测基准,对推动多语种文字识别领域的研究具有里程碑式意义。
当前挑战
RusTitW 数据集所面临的挑战主要源于自然场景文字识别的固有复杂性。真实世界图像中的文字常因背景杂乱、光照不均、弯曲变形或被其他物体遮挡而难以辨识,这对模型的鲁棒性提出了极高要求。此外,构建过程中需克服多重技术难题:原始图像中已有文本的干扰需通过 CRAFT 模型检测并模糊处理;文本插入位置需依赖边界检测与深度估计模型定位均匀区域;为使合成文字自然贴合场景几何,还需借助单目深度估计与泊松融合算法。数据集的多样性亦是一大挑战,需从 LAION 数据集中筛选背景图像并模糊人脸与原有文字,同时平衡96种俄文字体的使用与词频分布,确保生成的样本能真实反映现实应用场景。
常用场景
经典使用场景
在自然场景文本识别领域,RusTitW数据集填补了俄语文本识别资源的空白,成为训练与评测俄语场景文本检测与识别模型的核心基准。该数据集包含超过13,000张真实场景图像和900,000张合成图像,覆盖街道标牌、广告牌、商品包装等复杂视觉环境中的文本实例。研究者常将其用于训练基于深度学习的端到端文本识别系统,尤其针对弯曲、倾斜、光照不均及背景杂乱的俄语文本,以提升模型在真实世界中的鲁棒性和泛化能力。
衍生相关工作
RusTitW数据集的发布催生了多项衍生研究工作。其合成数据生成管线基于SynthText改进,引入了深度估计和语义分割模型(如MiDaS和COB),为后续合成场景文本数据集的设计提供了技术范本。研究者基于该数据集开发了针对俄语字符级别的文本检测模型,并探索了三角变换增强等数据增广策略。此外,该数据集被用作多语言文本识别竞赛(如ICDAR MLT)的补充资源,推动了跨脚本文本识别算法的迭代,相关代码已开源供社区复现和扩展。
数据集最近研究
最新研究方向
在自然场景文本识别领域,多语言与低资源语言的视觉文本理解正成为前沿焦点。RusTitW数据集作为首个大规模俄语自然场景文本数据集,填补了西里尔字母在真实与合成场景中的训练数据空白。其研究不仅推动了俄语OCR系统在复杂光照、弯曲文本与多语言混排场景下的鲁棒性提升,还通过集成深度估计与语义分割的合成管线,为跨语言场景文本生成提供了可复现的范式。该数据集与当前多语言智能翻译、无障碍辅助系统及自动驾驶路牌识别等热点应用紧密关联,为构建更包容的视觉语言模型奠定了关键基础。
相关研究论文
  • 1
    RusTitW: Russian Language Text Dataset for Visual Text in-the-Wild RecognitionAIRI · 2023年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务