遇见数据集

WATER (包括WATER-S、WATER-T、WATER-Z、WATER-R、WordArt-Bench)

收藏
github2026-06-24 更新2026-06-26 收录
数据链接:
官方服务:

资源简介:

WATER是一个用于艺术字导向场景文本识别(WordArt-Oriented Scene Text Recognition)的数据集集合。它包括WATER-S(一个200万规模的合成艺术文本数据集,由WATER-T和WATER-Z两个互补子集组成)、WATER-R(一个从Union14M-L、WordArt和WAS-R中精心去重的320万真实训练集)以及WordArt-Bench评估基准。该数据集旨在推动艺术字文本识别的研究。

WATER is a curated dataset suite tailored for WordArt-Oriented Scene Text Recognition. It comprises three core components: WATER-S, a 2-million-scale synthetic art text dataset composed of two complementary subsets, WATER-T and WATER-Z; WATER-R, a 3.2-million-scale real-world training dataset meticulously deduplicated from Union14M-L, WordArt and WAS-R; and the WordArt-Bench evaluation benchmark. This dataset suite is designed to advance research in the field of art-style scene text recognition.

创建时间:
2026-06-18
原始信息汇总

WATER 数据集概述

数据集简介

WATER(Advancing WordArt-Oriented Scene Text Recognition)是一个面向艺术字场景文本识别的数据集,由 ECCV 2026 接收。该数据集从数据和模型两个维度推进艺术字场景文本识别(WordArt-Oriented Scene Text Recognition)。

数据集构成

WATER-S(200万规模合成艺术文本数据集)

  • WATER-T(100万):通过 SynthWordArt 渲染引擎使用 11,250 种艺术字体生成
  • WATER-Z(100万):结合 Qwen3-VL 提示挖掘与 Z-Image 合成生成

WATER-R(320万真实训练集)

  • 经过严格去重的真实训练集,来源于 Union14M、WordArt 和 WAS-R

关键指标

  • WordArt-Bench 准确率:90.40%,首个突破 90% 的结果
  • 对比表现:优于 HunyuanOCR(81.54%)及其他视觉语言模型

数据集下载与资源

资源 链接 说明
WATER-Data HuggingFace 包含 WATER-S、WATER-R、WordArt-Bench
WATER-Z Captions HuggingFace 27.3万条 WATER-Z 生成的提示模板
artistic-fonts HuggingFace 11.2万种艺术字体

数据集生成工具

  • SynthWordArt:艺术文字渲染引擎,用于生成 WATER-T
  • Z-Image:图像生成工具,用于生成 WATER-Z
  • prompts:提示挖掘流水线,包括 caption_mining.py 和 fewshot_expansion.py

评估基准

WordArt-Bench 作为评估基准,附带 VLM 评估脚本(位于 eval_vlm/ 目录),支持 Qwen3-VL、InternVL3.5、GOT-OCR2.0、DeepSeek-OCR-2、PaddleOCR-VL、HunyuanOCR、Nemotron-VL-8B 等多种模型的推理与准确率计算。

引用

@inproceedings{water2026eccv, title = {Advancing WordArt-Oriented Scene Text Recognition: Datasets and Methods}, author = {Ye, Xingsong and Du, Yongkun and Zhang, Jiaxin and Zhang, Haojie and Sun, Chong and Li, Chen and Lyu, Jing and Chen, Zhineng}, booktitle = {European Conference on Computer Vision (ECCV)}, year = {2026} }

许可证

本项目采用 Apache 2.0 许可证。艺术字体从开源平台收集,遵循各自许可证(OFL、Apache、Creative Commons 等)。

搜集汇总
数据集介绍
WATER (包括WATER-S、WATER-T、WATER-Z、WATER-R、WordArt-Bench) 数据集图片
构建方式
在场景文本识别领域,现有方法多聚焦于规则印刷体或自然场景文本,而针对艺术字这类具有复杂字形、丰富纹理与多变排版的特殊文本的识别研究仍显不足。为填补这一空白,WATER数据集应运而生,其构建方式匠心独运,通过双轨并行的合成策略与真实数据精炼,打造了体系庞大的训练资源。该数据集包含三大核心组件:WATER-S是规模达200万级的合成艺术字数据集,其下细分为WATER-T与WATER-Z两个百万级子集。WATER-T依托自主开发的SynthWordArt渲染引擎,利用11250种艺术字体以工具渲染方式生成,确保了字形风格的极致多样性;WATER-Z则另辟蹊径,结合Qwen3-VL大语言模型的提示词挖掘技术与Z-Image图像合成管线,通过先挖掘艺术字图像的caption再扩展为生成提示的级联流程,赋予数据以视觉逼真度与语义丰富性。此外,WATER-R是从Union14M、WordArt及WAS-R三大真实数据源中经严格去重后精选出的320万张真实训练图片,为模型提供了扎实的底层视觉支撑。
特点
WATER数据集在艺术字场景文本识别领域展现出多项显著特质,使其成为推动该方向发展的标杆性资源。首先,其规模优势突出,合成数据WATER-S与真实数据WATER-R合计逾500万张图像,覆盖从规整排版到极富创意扭曲的广泛艺术字形态,为深度学习模型提供了充足的训练素材。其次,数据构成极具互补性:WATER-T侧重于字形风格的广度,通过海量字体库确保了字形覆盖的完备性;WATER-Z则借助生成式模型的强大能力,模拟出接近真实拍摄条件的背景融合、光照变化与透视畸变,有效弥合了合成数据与真实数据之间的分布鸿沟。再者,WATER-R的构建强调真实性与纯净度,通过对现有大型场景文本数据集进行精心去重,剔除了冗余与噪声,为模型在真实世界应用中的泛化能力提供了可靠保障。基于这些数据的训练,WATERec模型在WordArt-Bench测试基准上首次突破了90%的准确率大关,以90.40%的惊人成绩大幅领先于此前最优的通用大模型与OCR专用视觉语言模型,彰显了该数据集对模型性能的巨大提升作用。
使用方法
使用WATER数据集进行艺术字场景文本识别研究时,研究者可遵循一套清晰完整的工作流程。模型训练与推理依托基于OpenOCR框架开发的WATERec代码库,该框架专为支持任意形状输入而设计,其编码器采用类似NaViT架构并结合旋转位置编码(RoPE),解码器则采用自回归式序列生成结构,能够灵活应对弯曲、旋转等非规则艺术字形态。数据获取可通过HuggingFace平台轻松实现,WATER-Data仓库提供了完整的WATER-S(含WATER-T与WATER-Z)、WATER-R以及WordArt-Bench测试集的直接下载;此外,WATER-Z_Captions仓库存放了用于生成的27.3万条提示词模板,artistic-fonts仓库则收录了11.2万种艺术字体,供有二次渲染需求的用户使用。在评估环节,项目提供了完善的VLM评测脚本,位于eval_vlm目录下,覆盖了Qwen3-VL、InternVL3.5、GOT-OCR2.0、DeepSeek-OCR、PaddleOCR-VL、PP-OCRv5、HunyuanOCR及Nemotron-VL等主流模型的推理与准确率计算接口,研究者只需运行对应脚本即可在WordArt-Bench上完成性能评测与错误案例提取。
背景与挑战
背景概述
场景文字识别(Scene Text Recognition, STR)是计算机视觉领域的重要研究方向,旨在从自然场景图像中准确提取文字信息。然而,现有STR方法在面对艺术字(WordArt)这类具有复杂纹理、多样字体和抽象形状的文字时表现欠佳,成为制约技术落地的瓶颈。为攻克这一难题,由Ye、Du、Zhang等研究者于ECCV 2026提出的WATER数据集应运而生,该数据集涵盖WATER-S(包含工具渲染的WATER-T和合成生成的WATER-Z)、WATER-R及WordArt-Bench等子集,旨在系统性地推动艺术字场景文字识别的发展。WATER数据集不仅提供了200万规模的艺术字合成数据,还通过WATERec模型在WordArt-Bench上取得90.40%准确率的突破性成果,大幅超越通用与OCR专用视觉语言模型,为该领域树立了新的性能标杆。
当前挑战
当前艺术字场景文字识别面临的核心挑战集中于数据稀缺与模型泛化能力不足。首先,真实场景中的艺术字数据获取成本高昂,且现有公开数据集多集中于规则印刷体,导致模型难以适应艺术字丰富的字体、风格与变形。为此,WATER数据集通过构建200万合成样本(WATER-S)和320万去重真实样本(WATER-R)以缓解数据匮乏问题。其次,艺术字常具有任意形状和复杂背景,对识别模型的输入适应性和特征提取能力提出更高要求。WATERec模型采用NaViT风格编码器与AR解码器的架构,虽取得突破性进展,但面对极简化或高度抽象的艺术字时仍存在误识别。此外,合成数据与真实数据之间的域差异(Domain Gap)尚未完全弥合,成为模型泛化性能提升的另一技术挑战。
常用场景
经典使用场景
在场景文本识别领域,艺术字(WordArt)因其复杂的几何变形、丰富的纹理填充和多样的背景干扰,长期以来被视为极具挑战性的识别对象。WATER数据集专为此而生,其最经典的使用场景是作为艺术字场景文本识别(WordArt-Oriented STR)的基准训练与评测平台。研究者可借助WATER-S(含200万合成艺术字图像)进行模型预训练,并利用WordArt-Bench(首个公开的艺术字识别专用测试集)全面评估模型在扭曲文字、装饰性字体及极端光照条件下的识别鲁棒性。该场景的核心价值在于填补了现有STR数据集对艺术字形态覆盖不足的空白,使得模型能够在接近真实艺术字分布的合成数据上习得泛化特征,从而突破传统OCR在创意字体识别上的性能天花板。
解决学术问题
WATER数据集系统性地解决了艺术字场景文本识别中数据匮乏与模型适配两大核心学术难题。此前,学界缺乏大规模、高质量的艺术字训练数据,导致通用STR模型在艺术字上的识别准确率长期徘徊于较低水平。WATER通过构建WATER-T(工具渲染10725种艺术字体)和WATER-Z(大模型辅助生成多样化风格)两条互补的合成路径,提供了百万级带标注的艺术字样本,从根本上缓解了数据短缺问题。同时,该数据集催生了WATERec模型架构——采用NaViT风格编码器与旋转位置编码(RoPE)处理任意形状输入,搭配自回归解码器,首次在WordArt-Bench上突破90%准确率(90.40%),远超HunyuanOCR等先进模型,为学术共同体确立了新的性能标杆,并验证了通用STR框架向艺术字领域迁移的有效路径。
衍生相关工作
WATER数据集的发布催生了系列衍生研究工作,推动艺术字识别方向进入快速发展轨道。基于WATER-S训练数据,研究者可进一步探索域自适应方法,研究合成数据到真实艺术字(如WATER-R中的3.2M真实样本)的无监督迁移。WATERec模型架构为后续任意形状文本端到端识别提供了可复现的基线,激发了如结合扩散模型的艺术字去扭曲预处理、以及基于视觉语言模型的艺术字语义理解等创新方向。此外,WATER-Z的提示挖掘流水线(273K模板)启发了利用大模型进行训练数据自动生成的新范式,被后续工作借鉴以构建其他难例识别数据集。WordArt-Bench作为首个艺术字评测基准,已成为行业标准测试平台,多篇后续论文引用其指标进行对比,显著加速了该子领域的学术竞赛与迭代进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务