遇见数据集

yunusserhat/MSRA-TD500-Dataset

收藏
Hugging Face2024-04-30 更新2024-06-12 收录
官方服务:

资源简介:

--- tags: - text-recognition - dataset - text-detection - scene-text - scene-text-recognition - scene-text-detection - text-detection-recognition - icdar - total-text - curve-text task_categories: - text-retrieval language: - en - zh size_categories: - n<1K --- # MSRA Text Detection 500 Database (MSRA-TD500) The MSRA Text Detection 500 Database (MSRA-TD500) is a publicly released benchmark designed to evaluate text detection algorithms. This dataset aims to track recent progresses in the field of text detection within natural images, particularly focusing on texts of arbitrary orientations. ## Dataset Overview MSRA-TD500 contains 500 natural images sourced from indoor (e.g., office and mall) and outdoor (e.g., street) scenes captured with a pocket camera. The images depict various elements such as: - **Indoor**: Signs, doorplates, and caution plates. - **Outdoor**: Guide boards and billboards, often set against complex backgrounds. Images resolutions range from 1296x864 to 1920x1280. This dataset challenges users with the diversity of texts and complexity of backgrounds, featuring texts in different languages (Chinese, English, or both), fonts, sizes, colors, and orientations. Backgrounds may include elements like vegetation and repeated patterns that can be difficult to distinguish from text. ## Example Images ![Typical images from MSRA-TD500](example_image_path.png) *Figure 1: Typical images from MSRA-TD500 showing texts labeled as difficult due to factors like blur or occlusion.* ## Dataset Structure The dataset is split into two sets: - **Training Set**: 300 images randomly selected from the original dataset. - **Test Set**: 200 images. All images are fully annotated, with the primary unit of annotation being the text line. This differs from the ICDAR datasets, which use the word as the basic unit. ## Ground Truth Annotation Ground truth generation involves locating and bounding each text line using a four-vertex polygon, followed by fitting a minimum area rectangle around the polygon. ![Ground truth generation](ground_truth_image_path.png) *Figure 2: Ground truth generation process.* ## Evaluation Protocol The evaluation protocol, designed to accommodate texts of arbitrary orientations, uses minimum area rectangles for tighter fitting. Texts labeled as "difficult" include additional challenges like small size, occlusion, blur, or truncation. Detection misses of such texts are not penalized. ## Ground Truth File Format Each image has a corresponding ground truth file. Each line in the file provides details about one text line, marking "difficult" texts with a label. ``` # Ground Truth Format Example Index; Text Coords; Difficulty 0; x1,y1,x2,y2,x3,y3,x4,y4; 0 ``` ![](illustration.png) *Figure 3: Illustration of the ground truth file format.* ## Reference C. Yao, X. Bai, W. Liu, Y. Ma, and Z. Tu. "Detecting Texts of Arbitrary Orientations in Natural Images." CVPR 2012.

--- 标签: - 文本识别(text-recognition) - 数据集(dataset) - 文本检测(text-detection) - 场景文本(scene-text) - 场景文本识别(scene-text-recognition) - 场景文本检测(scene-text-detection) - 文本检测与识别(text-detection-recognition) - 国际文档分析与识别会议(ICDAR) - Total-Text - Curve-Text 任务类别: - 文本检索(text-retrieval) 语言: - 英语 - 汉语 样本量类别: - n<1K --- # MSRA文本检测500数据库(MSRA-TD500) MSRA文本检测500数据库(MSRA-TD500)是一款公开发布的基准数据集,用于评估文本检测算法。本数据集旨在追踪自然图像领域中文本检测的最新进展,尤其聚焦于任意方向的文本。 ## 数据集概览 MSRA-TD500包含500张由便携相机拍摄的自然图像,涵盖室内(如办公室、商场)与室外(如街道)场景。图像中的元素包括: - **室内场景**:标识牌、门牌与警示标牌 - **室外场景**:导视牌与广告牌,背景通常较为复杂 图像分辨率范围为1296×864至1920×1280。该数据集通过多样的文本类型与复杂的背景设置对使用者形成挑战,涵盖不同语言(中文、英文或双语)、字体、尺寸、颜色与方向的文本。背景中可能包含植被、重复图案等易与文本混淆的元素。 ## 示例图像 ![MSRA-TD500典型图像](example_image_path.png) *图1:MSRA-TD500典型图像示例,展示了因模糊、遮挡等因素被标记为“困难”的文本。* ## 数据集结构 本数据集分为两个子集: - **训练集**:从原始数据集中随机选取的300张图像 - **测试集**:200张图像 所有图像均已完成完整标注,标注的基本单元为文本行。这与以单词为基本标注单元的国际文档分析与识别会议(ICDAR)系列数据集有所不同。 ## 真值(Ground Truth)标注 真值生成流程为:使用四顶点多边形定位并框定每个文本行,随后围绕该多边形拟合最小外接矩形(minimum area rectangle)。 ![真值生成流程](ground_truth_image_path.png) *图2:真值生成过程示意图。* ## 评估协议 本评估协议专为适配任意方向的文本设计,采用最小外接矩形以实现更精准的拟合。被标记为“困难”的文本包含尺寸过小、遮挡、模糊或截断等额外挑战,对这类文本的检测漏检不会被计入惩罚项。 ## 真值文件格式 每张图像对应一个真值文件,文件中的每一行详细描述一个文本行,并使用标签标记“困难”文本。 # 真值格式示例 索引; 文本坐标; 困难标记 0; x1,y1,x2,y2,x3,y3,x4,y4; 0 ![illustration.png](illustration.png) *图3:真值文件格式示意图。* ## 参考文献 C. Yao, X. Bai, W. Liu, Y. Ma and Z. Tu. *Detecting Texts of Arbitrary Orientations in Natural Images*. 国际计算机视觉与模式识别会议(CVPR)2012.

提供机构:
yunusserhat
原始信息汇总

MSRA Text Detection 500 Database (MSRA-TD500)

数据集概述

MSRA-TD500是一个公开发布的基准数据集,旨在评估文本检测算法。该数据集旨在追踪自然图像中文本检测领域的最新进展,特别关注任意方向的文本。

数据来源

MSRA-TD500包含500张自然图像,来源于室内(如办公室和商场)和室外(如街道)场景,使用便携式相机拍摄。图像展示了各种元素,如:

  • 室内:标志、门牌和警示牌。
  • 室外:指示牌和广告牌,通常背景复杂。

图像分辨率范围从1296x864到1920x1280。该数据集挑战用户面对文本多样性和背景复杂性,包括不同语言(中文、英文或两者)、字体、大小、颜色和方向的文本。背景可能包含难以与文本区分的元素,如植被和重复图案。

数据集结构

数据集分为两个部分:

  • 训练集:从原始数据集中随机选择的300张图像。
  • 测试集:200张图像。

所有图像都经过完全标注,主要标注单位是文本行。这与使用单词作为基本单位的ICDAR数据集不同。

标注生成

标注生成涉及使用四顶点多边形定位和包围每个文本行,然后围绕多边形拟合最小面积矩形。

评估协议

评估协议设计用于适应任意方向的文本,使用最小面积矩形进行更紧密的拟合。标记为“困难”的文本包括额外的挑战,如小尺寸、遮挡、模糊或截断。检测遗漏此类文本不会受到惩罚。

标注文件格式

每张图像都有一个对应的标注文件。文件中的每一行提供了一个文本行的详细信息,标记为“困难”的文本带有标签。

标注文件格式示例

索引; 文本坐标; 难度 0; x1,y1,x2,y2,x3,y3,x4,y4; 0

搜集汇总
数据集介绍
yunusserhat/MSRA-TD500-Dataset 数据集图片
构建方式
MSRA-TD500数据集由微软亚洲研究院发布,专为评估自然场景中任意方向文本检测算法而构建。该数据集包含500张由便携相机拍摄的自然图像,覆盖室内(如办公室、商场)与室外(如街道)场景,图像分辨率介于1296×864至1920×1280之间。数据集的构建以文本行而非单词为基本标注单元,通过四顶点多边形定位每个文本行,并拟合最小面积矩形作为最终边界框。训练集与测试集分别包含300张和200张图像,所有图像均经过完整标注,其中困难样本(如模糊、遮挡或截断的文本)被特别标记,在评估时不计入漏检惩罚。
特点
该数据集的核心特点在于聚焦任意方向文本的检测挑战,其图像内容涵盖中英文混合文本,字体、大小、颜色及方向高度多样化,背景复杂多变,包含植被、重复图案等易与文本混淆的元素。与ICDAR系列数据集以单词为标注单元不同,MSRA-TD500采用文本行作为基本标注对象,更贴合实际应用场景。评估协议采用最小面积矩形进行紧密拟合,支持任意方向文本的精准评估,且对困难样本给予宽容处理,凸显了数据集在鲁棒性评估上的设计巧思。
使用方法
使用MSRA-TD500数据集时,用户需从HuggingFace等平台加载图像与对应的标注文件。标注文件以文本格式存储,每行包含文本行索引、四个顶点坐标(x1,y1至x4,y4)及难度标签(0表示正常,1表示困难)。模型训练时,可基于300张训练图像进行文本检测器的训练,并利用200张测试图像按官方评估协议计算性能。推荐结合现有深度学习框架(如PyTorch或TensorFlow)编写数据加载器,解析标注文件并生成多边形或旋转矩形目标,以适配任意方向文本检测模型的输入需求。
背景与挑战
背景概述
MSRA-TD500数据集由微软亚洲研究院(MSRA)的姚聪、白翔、刘伟等研究者于2012年在CVPR会议上提出,旨在推动自然场景中任意方向文本检测算法的发展。该数据集包含500张来自室内外场景的自然图像,涵盖标识牌、门牌、广告牌等多种文本实例,图像分辨率介于1296×864至1920×1280之间。其核心研究问题在于应对复杂背景、多语言混合(中英文)、字体与颜色多变以及任意朝向文本的精准定位,为场景文本检测领域提供了首个专注于非水平方向文本的标准化基准。该数据集的影响力深远,直接催生了后续ICDAR、Total-Text等基准的改进方向,并成为评估旋转不变性文本检测算法的关键参考。
当前挑战
该数据集所解决的领域挑战在于自然场景中文本的任意朝向检测,不同于传统水平文本,此类文本需应对旋转、透视畸变及背景干扰(如植被、重复纹理)带来的误检问题。构建过程中,研究者面临标注一致性难题:由于文本行(而非单词)作为基本单元,需通过四顶点多边形拟合最小面积矩形,对模糊、遮挡或截断的文本需额外标注为“困难”样本,以避免评估偏差。此外,图像来源的多样性(室内外光照差异、分辨率变化)要求算法具备鲁棒性,而中英双语混合的文本分布进一步增加了字符分割与语言识别的复杂度。这些挑战促使后续工作探索更高效的旋转不变特征提取与端到端检测框架。
常用场景
经典使用场景
MSRA-TD500数据集作为自然场景文本检测领域的经典基准,广泛应用于评估和比较多方向文本检测算法的性能。研究者通常利用该数据集训练和测试能够处理任意方向文本的模型,例如基于深度学习的Faster R-CNN、EAST或CRAFT等架构。该数据集包含500张来自室内外复杂场景的高分辨率图像,涵盖中英文混合文本、不同字体和颜色,以及因遮挡或模糊而标注为“困难”的样本,为算法在真实世界中的鲁棒性提供了严苛的检验平台。
解决学术问题
该数据集的核心贡献在于解决了传统文本检测方法(如ICDAR系列)仅适用于水平或近似水平文本的局限性。通过提供任意方向文本的四边形标注和最小面积矩形标注,MSRA-TD500推动了旋转不变性检测技术的研究,例如C. Yao等人提出的基于文本区域方向估计的检测框架。它帮助学术界克服了复杂背景(如植被、重复纹理)中文本定位的难题,并建立了“困难”样本不惩罚的评价协议,从而更公平地评估算法对模糊、小尺寸或截断文本的处理能力。
衍生相关工作
MSRA-TD500衍生了一系列经典工作,包括C. Yao等人在CVPR 2012上提出的多方向文本检测方法,该方法首次引入文本区域方向估计和最小面积矩形拟合。随后,基于该数据集的改进工作如Zhang等人提出的FTSN(Fused Text Segmentation Networks)和He等人提出的PixelLink,均利用其多方向标注优化了像素级分割策略。此外,该数据集与Total-Text和CTW1500等曲线文本数据集结合,催生了如TextSnake和ABCNet等任意形状文本检测算法,进一步扩展了场景文本理解的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务