遇见数据集

Enheduanna-Dataset

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

该数据集是针对古代楔形文字碑文的多模态资源,包含多个配置版本,用于支持不同粒度的研究和机器学习任务。default 配置提供原始的碑文符号列表、文本内容和翻译,并附带时期、体裁、语言和出处的标签;该配置包含约 108.8 万条训练样本和 6 万条验证样本。documents 配置以文档级粒度组织,包含文本、翻译和相同的标签,训练集约 13.6 万条,验证集 7664 条,测试集 7516 条。signs_translit 配置专注于符号转写,提供符号列表、文本和碑文编号,训练集约 170.7 万条,验证集 94159 条,测试集 96772 条。vision 配置包含碑文图像及其对应的时期、体裁、出处和语言,以及图像中文本区域的边界框坐标(x1, y1, x2, y2),训练集 11327 张图像,验证集 632 张,测试集 666 张。数据集适用于文本分类、符号识别、翻译、图像检测、多模态学习等任务。

This dataset is a multimodal resource for ancient cuneiform inscriptions, containing multiple configuration versions to support research and machine learning tasks at different granularities. The default configuration provides original lists of cuneiform signs, text content, and translations, along with labels for period, genre, language, and provenance; it includes approximately 1.088 million training samples and 60,000 validation samples. The documents configuration organizes data at the document level, including text, translations, and the same labels, with approximately 136,000 training samples, 7,664 validation samples, and 7,516 test samples. The signs_translit configuration focuses on sign transliteration, providing lists of signs, text, and inscription numbers, with approximately 1.707 million training samples, 94,159 validation samples, and 96,772 test samples. The vision configuration includes inscription images along with their corresponding period, genre, provenance, and language, as well as bounding box coordinates (x1, y1, x2, y2) for text regions in the images, with 11,327 training images, 632 validation images, and 666 test images. The dataset is suitable for tasks such as text classification, sign recognition, translation, image detection, and multimodal learning.

创建时间:
2026-09-02
原始信息汇总

Enheduanna-Dataset 数据集概述

数据集简介

Enheduanna-Dataset是针对古代楔形文字文献研究的多模态数据集,以美索不达米亚文学经典《Enheduanna》为基础资料构建。数据集包含多个配置(config),覆盖文本、符号转写与图像三种数据形式,旨在支持亚述学、语言学和计算机视觉等相关研究领域。

数据集配置

1. default(默认配置)

  • 适用场景:基础的文本与翻译对齐任务。
  • 数据字段
    • signs:楔形符号序列(列表形式)
    • text:原文文本
    • tablet_id:泥板编号
    • period_labels:时期标签(整数)
    • genre_labels:体裁标签(整数)
    • language_labels:语言标签(整数)
    • provenience_labels:出土位置标签(整数)
    • translation:翻译文本
  • 数据规模
    • 训练集:1,087,943 条
    • 验证集:60,477 条
  • 数据大小:总大小约 875 MB(下载大小约 93 MB)

2. documents(文档级配置)

  • 适用场景:面向整篇文献的处理任务(如文档分类、翻译等),每条记录对应一篇完整文献。
  • 数据字段:与 default 相同(共8个字段)。
  • 数据规模
    • 训练集:135,628 条
    • 验证集:7,664 条
    • 测试集:7,516 条
  • 数据大小:总大小约 200 MB(下载大小约 152 MB)

3. signs_translit(符号转写配置)

  • 适用场景:专注楔形符号级转写研究,不包含标签与翻译信息。
  • 数据字段
    • signs:楔形符号序列(列表形式)
    • text:转写文本(英文音译)
    • tablet_id:泥板编号
  • 数据规模
    • 训练集:1,707,204 条
    • 验证集:94,159 条
    • 测试集:96,772 条
  • 数据大小:总大小约 194 MB(下载大小约 134 MB)

4. vision(视觉配置)

  • 适用场景:用于泥板图像中的符号检测与定位任务,提供图像及其对应的标注框与元数据。
  • 数据字段
    • tablet_id:泥板编号
    • image:泥板图像
    • x1, y1, x2, y2:边界框坐标(float32)
    • period:时期(字符串)
    • genre:体裁(字符串)
    • provenience:出土位置(字符串)
    • language:语言(字符串)
  • 数据规模
    • 训练集:11,327 条
    • 验证集:632 条
    • 测试集:666 条
  • 数据大小:总大小约 218 MB(下载大小约 217 MB)

综合统计

  • 总数据量:约 1,487,947,165 字节(约 1.49 GB)
  • 总下载大小:约 597,127,341 字节(约 597 MB)
  • 四种配置均提供明确的 train/validation/test(或 train/validation)划分,便于开展有监督学习实验。
搜集汇总
数据集介绍
Enheduanna-Dataset 数据集图片
构建方式
Enheduanna-Dataset的构建立足于楔形文字文献的数字化整理,通过汇集带有注释的泥板文本,并以多层级标注体系对原始材料进行结构化编码,数据集涵盖符号序列、转写文本、泥板标识以及时期、体裁、语言和出土地点等元数据标签。文档配置下,文本按泥板单元聚合,形成可追溯的篇章级样本;符号转写配置则提供逐符号拆解与对应转写。视觉配置进一步整合泥板图像与边界框坐标,将文本信息与视觉证据关联起来,从而构建出兼具文本、符号和图像模态的综合资源。
特点
该数据集在配置上呈现多元异构的特点,包含默认、文档、符号转写与视觉四种配置,分别服务于符号级、篇章级和图像级任务。默认配置提供符号序列、文本、转写及四类标签,样本规模逾百万;文档配置保留篇章完整性,并设有独立测试集。符号转写配置聚焦符号与转写映射,样本量达一百七十余万。视觉配置则提供泥板图像及区域坐标,并附时期、体裁、出土地和语言等标注,为跨模态研究提供支撑。
使用方法
研究者可依据任务目标选择相应配置进行加载。符号级语言建模或序列标注任务宜采用默认配置,利用signs、text与各类标签字段;篇章级分类或翻译任务可选用文档配置,以text、translation和元数据标签为输入。若需探究符号与转写对应关系,可加载符号转写配置,使用signs与text字段。视觉任务则可基于视觉配置,结合image与边界框坐标,开展泥板区域检测、图文对齐或多模态学习。
背景与挑战
背景概述
楔形文字作为人类最早的文字系统之一,承载着古代美索不达米亚文明数千年的历史记忆。Enheduanna-Dataset的命名源自阿卡德帝国时期著名女祭司与诗人恩赫杜安娜,彰显了该数据集致力于保存和解析古代文献的学术使命。该数据集由专业研究团队构建,汇集了海量楔形文字符号、转写文本、翻译及视觉图像等多模态信息,其核心研究问题在于如何利用计算手段辅助古代文本的自动解析与理解。通过提供大规模、多层次的标注数据,该数据集为楔形文字的数字人文研究、机器翻译及文字识别等领域注入了新的活力,对推动古代语言计算研究具有深远影响。
当前挑战
Enheduanna-Dataset所面对的领域挑战根植于楔形文字本身的复杂性:符号多义性、文本残缺及语言演变等问题长期困扰着亚述学研究者,传统的人工解读方式效率低下且依赖专家经验。在数据集构建过程中,挑战同样严峻:从高精度图像中提取符号边界、对齐转写与翻译、处理不同时期与体裁的标注一致性,以及应对训练数据中存在的类别不平衡与噪声,均需精细的方法论与大量人工校验。此外,视觉配置中的坐标标注与多模态融合亦对技术提出了更高要求。
常用场景
经典使用场景
在古楔形文字计算语言学领域,Enheduanna-Dataset以其多模态架构为基石,经典地服务于楔形文字符号序列的预训练与微调任务。研究者依托其default与signs_translit分支,开展符号级语言建模、文本转写与机器翻译,而documents分支则支撑文档级分类与断代分析。vision分支提供图像级标注,推动楔形文字OCR与视觉定位研究。该数据集统一了符号、文本、图像与元数据,成为亚述学与自然语言处理交叉研究的基准资源,尤其适用于低资源古代语言的表征学习与跨模态对齐。
实际应用
在数字人文与文化遗产保护实践中,Enheduanna-Dataset赋能博物馆与考古机构开展大规模楔形文字泥板的自动编目、残片缀合与虚拟修复。其视觉分支支持移动端或云端OCR应用,辅助学者快速检索与转写藏品;文本分支则可用于构建古代文献知识图谱与语义搜索引擎,促进跨馆藏资源整合。此外,该数据集还服务于教育平台,提供交互式楔形文字学习工具,降低公众接触古代文明的认知门槛。
衍生相关工作
依托Enheduanna-Dataset,学界衍生出多项经典工作,涵盖楔形文字预训练语言模型(如基于Transformer的古代语言编码器)、跨模态检索系统与自动断代算法。部分研究利用其符号序列开发了无监督分词与形态分析工具,另一些工作则基于vision分支构建了泥板目标检测与符号定位基准。这些衍生成果不仅提升了楔形文字信息处理的自动化水平,还催生了面向亚述学的专用评测榜单与共享任务,持续拓展该数据集在计算考古学中的影响力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务