遇见数据集

Egyptian Hieroglyph Datasets (MMM, MEH, MuMMy)

收藏
github2026-06-01 更新2026-06-04 收录
官方服务:

资源简介:

三个用于埃及象形文字识别、分类和多模态理解的数据集。MMM包含16,015个单个符号的象形文字裁剪图像,按10种书写风格分类,标注有Gardiner符号代码;MEH包含完整页面的象形文字图像,具有行级和每个符号的边界框OCR标注,涵盖多种书写风格(56个标注页面);MuMMy包含子句级(984个)和段落级(107个)象形文字图像裁剪,配对Gardiner代码、音译和翻译。所有数据集基于CC BY-SA 4.0许可证发布。

Three datasets for Egyptian hieroglyph recognition, classification and multimodal understanding. MMM contains 16,015 cropped images of individual hieroglyphs, categorized into 10 writing styles and annotated with Gardiner symbol codes. MEH includes full-page hieroglyph images with both line-level and per-symbol bounding box OCR annotations, covering multiple writing styles across 56 annotated pages. MuMMy comprises cropped hieroglyph images at clause-level (984 samples) and paragraph-level (107 samples), paired with Gardiner codes, transliterations and translations. All datasets are released under the CC BY-SA 4.0 license.

创建时间:
2026-06-01
原始信息汇总

Egyptian Hieroglyph Datasets 概述

该数据集集合包含三个专注于埃及象形文字识别、分类和多模态理解的子数据集,其语言学注释源自 Thesaurus Linguae Aegyptiae (TLA) 和 AAEW 词表。所有数据集均采用 CC BY-SA 4.0 许可协议,图像数据以 ZIP 压缩包形式托管在 Google Drive 上。

子数据集详情

  1. MMM — Hieroglyph Classification Across Diverse Writing Styles

    • 内容: 包含 16,015 个单个符号的象形文字裁剪图像,按 10 种书写风格分类,每种风格下的图像均标注了 Gardiner 符号代码。
    • 书写风格: ABD, BAH, BIO, DEN, GLH, MED, SPL, STH, STN, UNC。
    • 出处: Golyadkin 等人发表的论文《Evaluation of Egyptian Hieroglyph Classification Across Diverse Writing Styles》(ACM Multimedia 2025)。
    • 下载: https://drive.google.com/file/d/1EGntzp66OnPi8VtlYg-2EBNoLTl4Huul/view?usp=sharing
  2. MEH — Multi-Style Egyptian Hieroglyph dataset

    • 内容: 包含 56 张注释过的全页象形文字图像,提供行级和每个符号的边界框 OCR 注释,涵盖多种书写风格。
    • 出处: Golyadkin 等人发表的论文《MEH: A Multi-Style Dataset and Toolkit for Advancing Egyptian Hieroglyph Recognition》(ICCV 2025)。
    • 下载: https://drive.google.com/file/d/1lM-XDgHpBcQ4-2JDyp5ZvDYgcvssT6an/view?usp=sharing
  3. MuMMy — Multimodal Egyptology dataset

    • 内容: 包含 984 个从句级和 107 个段落级的象形文字图像裁剪,并配对了 Gardiner 代码、转写和翻译。
    • 出处: Golyadkin 等人发表的论文《MuMMy: Multimodal Dataset supporting VLM-based Egyptology Research Assistant》(ACM Multimedia 2025)。
    • 下载: https://drive.google.com/file/d/1T2LyxaQ3D4WzjvbKB_oMr03FgGUt8pMD/view?usp=sharing

许可协议与引用

  • 许可: 采用 CC BY-SA 4.0。语言学注释衍生自同样采用 CC BY-SA 4.0 许可的 Thesaurus Linguae Aegyptiae (Corpus v18) 和 AAEW 词表。
  • 引用: 如需引用该数据集,请引用对应的三篇学术论文(具体 BibTeX 条目见原 README 文件)。
搜集汇总
数据集介绍
Egyptian Hieroglyph Datasets (MMM, MEH, MuMMy) 数据集图片
构建方式
埃及圣书体文字作为人类古代文明的重要载体,其图像识别与语义理解长期以来受限于数据资源的匮乏。埃及圣书体数据集(MMM, MEH, MuMMy)的构建,正是为了填补这一空白。MMM数据集从不同书写风格的文献中裁剪出16,015个独立的单符号图像,并以加德纳符号编码进行标注。MEH数据集则选取了涵盖多样书写风格的56页满版圣书体图像,提供从行级别到单个符号边界框的OCR标注信息。MuMMy数据集聚焦于多模态理解,构建了984个子句级别和107个段落级别的圣书体图像片段,并配对加德纳代码、转写文本与现代翻译。所有语言注释均源于《埃及语词典》(Thesaurus Linguae Aegyptiae)及AAEW词汇表,确保了语义标注的权威性与一致性。
特点
该系列数据集在埃及圣书体研究领域展现出多维度的独特价值。MMM数据集以10种不同书写风格(如ABD、BAH、BIO等)的分类框架,首次系统性地评估了圣书体符号在不同历史风格下的识别鲁棒性。MEH数据集突破了单一风格局限,提供全页面、多风格的OCR标注,为复杂版面文字的自动识别奠定了坚实基础。MuMMy数据集则将视觉与语言信息深度融合,从子句到段落的层级结构使得多模态理解研究得以深入,能够支撑视觉语言模型(VLM)驱动下的埃及学智能问答与翻译辅助系统。这三个数据集均采用CC BY-SA 4.0许可协议,鼓励学术共享与衍生研究。
使用方法
使用者可通过Google Drive链接分别下载MMM、MEH和MuMMy数据集的压缩包。MMM数据集适用于图像分类任务,加载16,015张单符号图像后,可直接基于加德纳符号标签训练或评估分类模型。MEH数据集适合版面分析与OCR任务,利用其提供的页面级、行级及符号级标注,可训练端到端的识别流水线或评测多风格文字检测效果。MuMMy数据集面向多模态学习场景,图像与标注配对完整,研究者可将其用于视觉-语言对齐、跨模态翻译以及基于VLMs的埃及学知识问答系统开发。各数据集详细的文档说明分别存放于对应子目录的README.md文件中,提供了更深入的格式规范与使用指引。
背景与挑战
背景概述
古埃及象形文字作为人类文明的重要载体,其数字化解读长期受限于高质量标注数据的匮乏。2025年,由Maksim Golyadkin、Valeria Rubanova等学者领衔的研究团队,联合莫斯科物理技术学院等机构,系统性构建了Egyptian Hieroglyph Datasets系列,涵盖MMM、MEH与MuMMy三个子数据集。该系列基于Thesaurus Linguae Aegyptiae及AAEW词表进行语言学标注,分别聚焦于单字符跨风格分类、整页文本的边界框OCR识别及子句与段落级别的多模态理解,旨在破解古文字识别与机器翻译中的低资源困境。相关研究成果连续发表于ACM Multimedia 2025与ICCV 2025,为数字埃及学注入了标准化、可复用的数据根基,显著推动了古文字视觉与语言联合建模的进程。
当前挑战
该数据集旨在应对多重挑战:其一,古埃及象形文字书写风格极度多样(包括ABD、BAH、BIO等10种风格),单字符形态变异剧烈,传统分类模型难以泛化;其二,整页文献存在线条模糊、符号重叠及版面破损等问题,逐行逐符的OCR标注需兼顾不同风格的几何与纹理差异,构建规模有限的56页标注数据对数据增强与迁移学习提出严苛要求;其三,多模态理解需在子句与段落层面联合处理图像符号、Gardiner编码、转写与翻译,语言与视觉模态间的语义鸿沟极大,且古语言资源稀缺导致标注成本高昂,制约了模型对上下文语法的深度解析能力。
常用场景
经典使用场景
埃及象形文字数据集的经典使用场景聚焦于跨书写风格的单字符分类与多风格文本的行级与符号级识别。MMM数据集包含16,015个按Gardiner编码标注的单字符裁剪图,覆盖10种迥异的书写风格,可用于训练鲁棒的分类器以应对风格多样性。MEH数据集则提供56页全页象形文图像,附带行级和符号级边界框标注,是开发端到端OCR系统的理想基准。这些数据集填补了古文字识别中风格泛化能力不足的空白,推动了低资源语言图像理解的前沿研究。
实际应用
在实际应用层面,该数据集驱动了埃及学数字化研究的革命性工具开发。MEH与MuMMy可直接赋能考古学家与语言学家,通过自动转录和翻译引擎加速庙宇与墓碑铭文解读,将人工数月的工作压缩至数小时。MMM为博物馆数字藏品管理提供分类标注服务,助力跨馆藏风格对比。此外,MuMMy的VLM支持特性使其成为智能科研助手的核心训练资源,能够以自然语言问答形式辅助非专业用户初步理解象形文内容,降低埃及学知识壁垒,促进人文学科的全民参与。
衍生相关工作
该数据集衍生出一系列标志性工作,包括三篇入选ACM Multimedia 2025与ICCV 2025的论文:Golyadkin等人提出的《Evaluation of Egyptian Hieroglyph Classification Across Diverse Writing Styles》建立了风格熵增下的分类评估框架;《MEH: A Multi-Style Dataset and Toolkit for Advancing Egyptian Hieroglyph Recognition》提供了完整的识别管线与基准;《MuMMy: Multimodal Dataset supporting VLM-based Egyptology Research Assistant》开创了多模态埃及学助手范式。这些工作共同构建了从分类、识别到多模态对话的完整技术生态,为后续基于大模型的古文字解译研究奠定了数据与方法论基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务