遇见数据集

多源域适应文本识别数据集

收藏
arXiv2021-08-25 更新2024-06-21 收录
官方服务:

资源简介:

多源域适应文本识别数据集是由北京邮电大学创建的,包含超过520万张图像,分为五个不同的域:合成域、文档域、街景域、手写域和车牌域。该数据集是首个多域文本识别数据集,旨在解决文本识别中的域适应问题。数据集的创建过程涉及从多个来源收集和过滤图像,确保覆盖广泛的文本样式和背景。该数据集适用于深度学习模型在不同域间的适应性训练,特别是在解决字体多样性和复杂背景带来的挑战方面。

The multi-source domain adaptation text recognition dataset was created by Beijing University of Posts and Telecommunications. It contains over 5.2 million images, divided into five distinct domains: synthetic domain, document domain, street scene domain, handwritten domain, and license plate domain. This is the first multi-domain text recognition dataset, designed to address the domain adaptation problem in text recognition. The dataset creation process involves collecting and filtering images from multiple sources, ensuring coverage of a wide range of text styles and backgrounds. This dataset is applicable for adaptive training of deep learning models across different domains, especially in tackling challenges posed by font diversity and complex backgrounds.

提供机构:
北京邮电大学
创建时间:
2021-08-25
搜集汇总
数据集介绍
多源域适应文本识别数据集 数据集图片
构建方式
多源域适应文本识别数据集由五类不同来源的图像构成,涵盖合成域、文档域、街景域、手写域与车牌域,总计超过五百万张图像。合成域通过随机字体与背景生成约111万张图像;文档域从开源项目中筛选出约171万张来自新闻与文档的图像;街景域融合多个中英文场景文本数据集得到约20万张图像;手写域基于CASIA手写数据库拼接生成约190万张图像;车牌域结合CCPD数据集与额外采集的26省监控图像,总计约21万张。所有域按9:1比例划分为训练集与测试集,字符集包含3754个常用汉字及62个字母数字字符。
特点
该数据集作为首个面向文本识别的多源域适应基准,具有显著的域间差异与大规模字符集双重挑战。五个域在字体风格、背景复杂度、文本长度及语义分布上呈现高度异质性,例如文档域固定长度为10字符,而合成域采用随机采样以覆盖罕见字符。域间分布偏移导致直接训练模型平均准确率仅17.86%,凸显了适应算法的必要性。此外,数据集提供了丰富的域组合场景,支持多源域适应方法的系统评估与对比。
使用方法
该数据集适用于多源域适应任务的研究与基准测试。研究者可将任一域作为无标签目标域,其余四域作为有标签源域,构建无监督域适应场景。模型需利用源域数据与目标域无标签图像,通过自学习或元学习等方法提升目标域识别性能。数据集提供了标准化的训练/测试划分,并建议使用ResNet-50与BiLSTM结合注意力机制的识别架构,同时支持对伪标签质量、元更新策略等超参数的灵活调节。
背景与挑战
背景概述
文本识别作为计算机视觉领域的重要分支,在日常生活与工业应用中具有广泛意义。然而,真实场景下的文本识别因字体多样性、复杂背景及域间分布差异而面临严峻挑战。为缓解标注成本高昂与模型泛化能力不足的问题,北京邮电大学邱硕豪、朱闯、周文理等研究者于2021年构建了多源域适应文本识别数据集。该数据集包含超过500万张图像,横跨合成、文档、街景、手写及车牌五个领域,是目前首个面向文本识别的多源域适应基准数据集。其核心研究问题在于如何利用多个标注源域辅助无标签目标域实现高效识别,为领域自适应与元学习方法的结合提供了关键数据支撑,显著推动了文本识别在跨域场景下的研究进展。
当前挑战
该数据集面临的核心挑战源于多源域间显著的分布差异与字符集规模庞大。所解决的领域问题在于,现有单源域适应方法难以应对文本识别中训练数据来自多个异构来源的实际情况,导致模型在目标域上准确率低下。构建过程中,研究者需克服各域数据质量不一与类别不平衡的难题,例如车牌域中省份缩写字符稀缺导致模型偏见,手写域因预训练效果差而需设定更高伪标签置信度阈值。此外,合成域为覆盖全部字符而牺牲语义信息,文档域与街景域数据需经严格筛选以统一字符集,这些步骤均增加了数据集构建的复杂度与挑战性。
常用场景
经典使用场景
在文本识别领域,由于字体多样性、复杂背景及标注成本高昂,模型常面临域偏移挑战。多源域适应文本识别数据集应运而生,其经典使用场景在于为多源域适应算法提供统一的评估基准,涵盖合成、文档、街景、手写和车牌五个截然不同的图像域,共计超过五百万张图像。研究者可在此数据集上训练模型,将多个标注源域的知识迁移至无标注的目标域,例如利用合成、文档和街景数据提升手写文本识别性能,从而系统性验证域对齐与泛化能力。
衍生相关工作
该数据集衍生了一系列经典工作,其中最突出的是元自学习(Meta Self-Learning)框架,其将自训练与元学习范式结合,通过在线元更新过程中引入目标域伪标签,显著提升了伪标签质量与域适应效果。此外,相关工作还包括基于域混淆损失和对抗训练的跨域对齐方法,以及利用多核最大均值差异(MK-MMD)进行多源域分布匹配的研究。这些工作不仅在该数据集上取得了最佳性能,也为后续将元学习应用于更广泛的计算机视觉任务(如图像分类与语义分割)提供了重要启示。
数据集最近研究
最新研究方向
多源域适应文本识别数据集的研究前沿聚焦于跨领域文本识别中的域偏移问题,特别是在字体多样性和复杂背景下的泛化挑战。该数据集作为首个涵盖合成、文档、街景、手写及车牌五个域的超大规模资源,推动了元自学习与自训练方法的融合创新。通过引入元学习范式优化伪标签生成质量,研究者在无监督域适应场景下实现了显著的识别精度提升,为多源域适应在文本识别领域的实际应用(如自动驾驶场景文字理解、多语言文档分析)提供了关键基准,并引发了关于伪标签质量与域间语义差异对模型泛化影响的深入探讨。
相关研究论文
  • 1
    Meta Self-Learning for Multi-Source Domain Adaptation: A Benchmark北京邮电大学 · 2021年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务