遇见数据集

MMTAD: A Multilingual, Multi-domain Textual Attribute Dataset

收藏
Zenodo2025-07-11 更新2026-05-26 收录
官方服务:

资源简介:

MMTAD DATASET MMTAD is a dataset specifically curated for word-level textual attribute recognition in real-world documents. It comprises 1623 real-world document images—from legal notices and circulars to land records, legislative documents, textbooks and notary papers—captured under varied illumination, layouts, background textures, noise patterns, scanning artifacts and resolutions. It delivers 1,117,716 word-level annotations across eight languages (English, Hindi, Telugu, Marathi, Punjabi, Bengali, Spanish and others), labeling bold, italic, bold & italic, underline, strikeout and underline &strikeout alongside “normal” text. Overall MMTAD facilitates robust, multilingual, multi-domain detection of word-level text attributes—such as bold, italic, underline and strikeout—even under the noise and distortions typical of real-world document images. Project Page Link : TexTAR

MMTAD数据集 MMTAD是专为真实世界文档中的词级文本属性识别精心构建的专用数据集。该数据集包含1623张真实世界文档图像,涵盖法律公告、通告、土地登记档案、立法文献、教科书及公证文书等,采集自不同光照条件、版式布局、背景纹理、噪声模式、扫描伪影以及分辨率场景。数据集包含覆盖8种语言(英语、印地语、泰卢固语、马拉地语、旁遮普语、孟加拉语、西班牙语及其他语言)的1,117,716个词级标注,标注类别包括粗体、斜体、粗斜体、下划线、删除线、下划线+删除线以及“普通”文本。总体而言,MMTAD能够支持在真实世界文档图像常见的噪声与畸变场景下,实现鲁棒的多语言、多领域词级文本属性检测,例如粗体、斜体、下划线和删除线等。 项目页面链接:TexTAR

提供机构:
Zenodo
创建时间:
2025-07-11
二维码
社区交流群
二维码
科研交流群
商业服务