遇见数据集

MBZUAI/DuwatBench

收藏
Hugging Face2026-01-28 更新2026-02-07 收录
官方服务:

资源简介:

DuwatBench是一个全面的基准数据集,用于评估语言模型在阿拉伯书法识别上的表现。阿拉伯书法代表了阿拉伯语言最丰富的视觉传统之一,将语言意义与艺术形式相结合。DuwatBench填补了现代AI系统处理风格化阿拉伯文本评估的空白。数据集包含1,272个精选样本,涵盖6种古典和现代书法风格,超过9.5k个单词实例和约1,475个独特单词,涉及宗教和文化领域。此外,数据集还提供了边界框注释、完整文本转录、风格和主题标签,以及复杂的艺术背景,以保持现实世界的视觉复杂性。

DuwatBench is a comprehensive benchmark for evaluating LMMs on Arabic calligraphy recognition. Arabic calligraphy represents one of the richest visual traditions of the Arabic language, blending linguistic meaning with artistic form. DuwatBench addresses the gap in evaluating how well modern AI systems can process stylized Arabic text. The dataset contains 1,272 curated samples spanning 6 classical and modern calligraphic styles, over 9.5k word instances with approximately 1,475 unique words spanning religious and cultural domains. It also includes bounding box annotations, full text transcriptions with style and theme labels, and complex artistic backgrounds preserving real-world visual complexity.

提供机构:
MBZUAI
搜集汇总
数据集介绍
构建方式
阿拉伯书法作为阿拉伯语言最具视觉深度的艺术形式之一,将语言意义与美学形态融为一体。为填补现有大型多模态模型在风格化阿拉伯文本理解上的评估空白,DuwatBench应运而生。该数据集遵循一套严谨的结构化构建流程:首先从公共数字档案与社区资源库中广泛采集涵盖古典与现代风格的书法图像,随后由领域专家对每幅图像进行完整文本转录,并精确标注每个单词的边界框,同时赋予其风格与主题类别标签。数据经过多层级人工校验以确保准确性与完整性,最终汇聚为包含1,272个精心筛选样本、逾9,500个单词实例及约1,475个独特词汇的高质量基准。
特点
DuwatBench数据集的核心特色在于其多维度的精细标注与丰富的视觉复杂性。其涵盖六种代表性阿拉伯书法风格——从几何刚劲的库法体到华丽流畅的苏鲁斯体,再到日常手写的鲁卡体,全面映射了书法艺术的演变脉络。每个样本均包含完整文本转录、风格标签、主题分类(涵盖宗教与非宗教领域)以及单词级别的边界框标注,支持从识别到检测的多层次评估。数据图像保留了真实艺术作品中复杂的背景纹理与构图,避免了人工简化,从而真实考验模型在视觉与语言交织场景下的鲁棒性。
使用方法
DuwatBench专为评估大型多模态模型在阿拉伯书法理解上的综合能力而设计。研究者可通过HuggingFace平台直接加载数据集,利用其提供的图像、文本转录、边界框及风格/主题标签,开展文本识别、风格分类、目标检测等下游任务的评测。数据集采用Apache 2.0许可证,便于学术与商业使用。配合已公开的评估代码与排行榜,用户可便捷地复现论文中的基准结果,并在统一框架下对比不同模型在复杂书法场景中的表现,推动多模态理解在文化遗产领域的前沿探索。
背景与挑战
背景概述
阿拉伯书法作为伊斯兰文明与阿拉伯语言交融的璀璨瑰宝,以其独特的视觉韵律承载了深厚的宗教与世俗文化内涵。然而,现有的大规模多模态理解基准多聚焦于拉丁文字或现代印刷体,对阿拉伯书法这一兼具艺术性与语义复杂性的视觉文本形态关注甚少。为弥合这一鸿沟,穆罕默德·本·扎耶德人工智能大学(MBZUAI)联合多所高校的研究团队,于2026年发布了DuwatBench基准数据集。该数据集由Shubham Patle、Sara Ghaboura等人主导创建,精选1272幅涵盖六种古典与现代书法风格的样本,并附有超过9500个单词实例的边界框标注与完整转录,旨在系统评估大型多模态模型在阿拉伯书法识别与理解上的能力。DuwatBench的提出不仅填补了阿拉伯视觉文化遗产智能化处理的数据空白,更为跨语言、跨文脉的多模态研究提供了关键评测平台。
当前挑战
DuwatBench所应对的核心领域挑战在于阿拉伯书法识别的双重复杂性:一方面,书法风格(如苏鲁斯体的装饰性缠绕、库法体的几何棱角)与背景纹理高度融合,导致字符分割与识别较之于标准印刷体困难数倍;另一方面,现有模型在跨风格、跨主题(宗教与世俗文本)的泛化能力上显著不足,需应对稀疏标注数据下的细粒度语义解析难题。在数据集构建过程中,研究团队面临多重考验:首先,历史手稿来源分散于数字档案馆与社区资源,需逐一甄别版权与质量;其次,边界框的精确标注与多轮人工核验耗费大量精力,尤其针对重叠字符与装饰性延伸;此外,风格与主题的分类体系需兼顾书法学界的传统划分与AI任务的可操作性,确保标注一致性与文化准确性。
常用场景
经典使用场景
DuwatBench作为首个面向阿拉伯书法多模态理解的综合性基准数据集,其经典使用场景集中于评估大型多模态模型(LMMs)在艺术化阿拉伯文字识别与理解任务上的表现。该数据集精心收录了1272幅涵盖六种古典与现代书法风格的样本,包括Thuluth、Diwani、Naskh、Kufic、Ruq'ah和Nasta'liq,并提供了超过9500个词实例的边界框注释与完整文本转录。研究者可借此系统性地检验模型在复杂艺术背景下的文字定位、风格分类与语义转录能力,为多模态理解领域树立了具有文化深度的评测标杆。
解决学术问题
该数据集有效填补了现有视觉语言理解研究中阿拉伯书法领域系统化评测的空白。在学术层面,DuwatBench解决了两个关键问题:一是当前LMMs对非拉丁语系、高度艺术化文字的认知能力缺乏标准化度量;二是阿拉伯书法兼具语言符号与视觉艺术双重属性,传统OCR方法难以应对其风格变异与背景复杂性。通过提供细粒度的风格标签、主题类别与定位注释,该基准推动了跨文化视觉语义理解的研究进展,促使学界关注语言遗产数字化保护中的技术挑战。
衍生相关工作
DuwatBench的发布已催生了一系列富有影响力的衍生研究工作。在其基准框架基础上,研究者针对阿拉伯书法风格迁移与合成数据生成展开了探索,通过生成对抗网络或扩散模型创造多样化的书法训练样本。同时,该数据集促进了多模态模型在低资源语言场景下的细粒度评估方法学发展,部分工作将DuwatBench与其它文化遗产生成基准进行对比分析,构建了跨文明视觉语言理解的统一评测体系。此外,针对书法文本的行级与词级定位任务,也涌现了若干改进的检测与识别架构。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务