遇见数据集

Ancient-Bench

收藏
arXiv2026-08-27 更新2026-08-29 收录
官方服务:

资源简介:

Ancient-Bench是一个全面评估古代中国文物文本识别的基准数据集,由华南理工大学与华为技术有限公司联合创建。该数据集包含2700张精心标注的图像,覆盖甲骨、青铜、简牍、帛书、印章、碑刻、摩崖、古籍和书法九种媒介,以及甲骨文、金文、篆书、隶书、楷书、草书和行书七种历史字体,时间跨度超过3000年。数据源自14个国家级文化遗产机构,经格式标准化、质量筛选、区域定位,并制定了符号、字符和解析三种标准化标注规范,确保跨媒介一致性。该基准旨在揭示现有模型在异体字、特殊符号处理及幻觉现象上的系统性不足,为跨时代、跨媒介、跨字体的文物文本识别研究提供统一评估框架。

Ancient-Bench is a benchmark dataset for comprehensive evaluation of ancient Chinese cultural relic text recognition, jointly created by South China University of Technology and Huawei Technologies Co., Ltd. This dataset contains 2700 carefully annotated images, covering nine types of carriers including oracle bone relics, bronze wares, bamboo slips, silk manuscripts, seals, stone steles, cliff inscriptions, ancient books and calligraphy works, as well as seven categories of historical Chinese scripts: oracle bone script, bronze script, seal script, clerical script, regular script, cursive script and running script, with a time span of over 3000 years. The dataset is sourced from 14 national-level cultural heritage institutions, and has undergone format standardization, quality screening and region localization, with three standardized annotation specifications (symbol-level, character-level and parsing-level) formulated to ensure cross-media consistency. This benchmark aims to reveal the systematic limitations of existing models in handling variant Chinese characters, special symbols and hallucination phenomena, and provide a unified evaluation framework for cross-era, cross-media and cross-script research on cultural relic text recognition.

创建时间:
2026-08-27
原始信息汇总

Ancient_Bench 数据集详情

数据集概述

Ancient_Bench 是一个由 SCUT-DLVCLab 团队发布的数据集,其核心内容与“古代”主题相关,旨在为相关领域的研究提供基准测试(Benchmark)支持。

数据集用途

该数据集以基准测试(Benchmark)为主要定位,可用于评估和比较模型在特定任务(推测为古代相关文本、图像或多模态任务)上的表现。

数据集来源与维护

  • 发布机构:SCUT-DLVCLab(华南理工大学深度学习与视觉计算实验室)
  • 代码仓库:https://github.com/SCUT-DLVCLab/Ancient_Bench

内容说明

当前数据集的 README 文件内容较为简洁,仅包含数据集名称 Ancient_Bench,未提供更详细的字段说明、数据规模、任务类型或评估指标等信息。如需进一步了解数据集的具体构成与使用方式,建议直接访问上述 GitHub 仓库获取详细文档。

搜集汇总
数据集介绍
Ancient-Bench 数据集图片
构建方式
Ancient-Bench的构建始于对权威文化遗产机构公开资源的系统性梳理与整合,覆盖14家国家级博物馆及图书馆,横跨甲骨、青铜、简牍、帛书、玺印、碑刻、摩崖、古籍版刻与书法九大载体类别。在图像预处理阶段,采用格式标准化、基于多模态大模型的质检过滤及精准区域裁剪三级流程,以确保数据纯净度与可识别性。针对古代文本的复杂性,研究者定义了三大标注规范:符号标准化、文字标准化与版式解析标准化。符号标准化遵循“所见即所得”原则,保留重文号、残损占位符及未编码字标记;文字标准化规范了古文字隶定、简繁字原则及异体字处理,兼顾学术严谨性;版式解析标准化则明确定义了换行标记、夹注符号与阅读顺序,以重构原始文本的排版逻辑。全部数据由20名经过训练的标注员历经六个月完成逐字校验,并经领域专家与独立审核人双重把关。
特点
Ancient-Bench作为一项综合性基准,其显著特点在于多维度覆盖与统一标准化的深度融合。数据集包含2,700幅精心标注的图像,横跨逾三千年汉字演化史(约公元前1200年至公元1911年),涵盖甲骨文、金文、篆书、隶书、楷书、草书、行书七种主流书体,以及九类异质物质载体,其图像分辨率从41×80像素至5795×16745像素跨越两个数量级,充分反映了不同载体的物理特性。尤为重要的是,该基准首次提出了跨介质的三大标注规范,有效解决了既有基准中媒介单一、文字体系不全、时间断层及标注标准缺失的“碎片化”问题。此外,其数据来源的多元性(14家权威机构)保障了地域、风格及保存状态的多样性,使得评估结果更贴近真实应用场景。
使用方法
Ancient-Bench专为评估古代中国文物文字识别模型而设计,适用于通用视觉语言模型(VLMs)与OCR专业模型。使用时,研究者可直接采用其标准化的文本标注进行端到端识别性能测试,亦可根据九类媒介细分任务,深入分析模型在特定载体上的表现瓶颈。基准提供了统一的规范化评估协议,包括特殊标记的原子化处理、计数组件的匹配策略、空白字符剔除等,确保评测的公平性与可复现性。配套发布的代码库支持灵活的分割与评估流程,用户可依据研究焦点(如异体字识别、特殊符号检测或阅读顺序解析)选取相应子集进行靶向实验。该基准亦为模型开发提供了挑战性参照,揭示当前技术在古文字识别中的系统性缺陷,从而指引优化方向。
背景与挑战
背景概述
Ancient-Bench是由华南理工大学与华为技术有限公司联合构建的综合性基准数据集,于2026年发布,旨在系统评估中国古代器物文字识别模型的性能。该数据集包含2700幅精细标注图像,覆盖甲骨、青铜、简牍、帛书、印章、碑刻、摩崖、古籍刻本与书法九大媒介类型,时间跨度逾三千年,涵盖七种主要书体形态。其核心研究问题在于应对现有基准的碎片化困境,即时间覆盖有限、媒介类型单一及书体形态不全,从而为跨时代、跨媒介、跨书体的古文识别研究提供统一评测平台。Ancient-Bench的发布填补了该领域缺乏综合性基准的空白,对文化遗产数字化及数字人文研究具有重要的推动意义。
当前挑战
Ancient-Bench面临多重挑战。领域层面,古文识别需处理甲骨文、金文等古文字的隶定转换、异体字与生僻字的辨识、特殊符号的语义解析,以及复杂版面中的阅读顺序与段落结构还原;同时,不同媒介的物理特性(如甲骨裂纹、青铜锈蚀、简牍残断、帛书破损等)引入大量噪声,对模型的鲁棒性提出极高要求。构建层面,原始数据来源广泛且标注标准不一,需统一图像格式、过滤劣质样本、精准定位文本区域;此外,需制定跨媒介的符号标准化、字符标准化与解析标注规范,确保标注的一致性与学术严谨性。这些挑战使得当前最优模型在Ancient-Bench上的NED仅达52.08%,凸显任务之艰巨。
常用场景
经典使用场景
Ancient-Bench数据集在古籍数字化与文化遗产保护领域中,主要用于全面评估和推动古代中国文物文字识别的模型性能。其经典使用场景涵盖甲骨文、青铜器铭文、简牍、帛书、印章、碑刻、摩崖石刻、刻本及书法作品等九大媒介,跨越七种历史书体及三千余年的文字演变历程。研究者利用该数据集对通用视觉语言模型(VLMs)与OCR专业模型进行标准化测试,系统性地检验其在异质媒介与多样书体下的识别精度、鲁棒性及泛化能力,从而揭示现有模型在古老文字识别任务中的真实水平与局限性。
解决学术问题
Ancient-Bench直面古代文字识别领域长期存在的“碎片化”困境,即已有基准在时间跨度、媒介类型、书体覆盖及标注规范上的局限性,致使模型泛化能力的系统评估受阻。通过构建涵盖三千余年、九类媒介与七种书体的综合基准,并首创符号标准化、字符标准化与解析标准化三层标注协议,该数据集有效解决了跨时代、跨媒介、跨书体统一评测的学术难题,为古文字学、文献学及数字人文研究提供了可靠的数据支撑与评估范式,推动了古代文字识别从单一媒介向多维度综合研究的范式转变。
衍生相关工作
Ancient-Bench的发布催生了一系列前沿研究方向与衍生工作。其一,围绕其提出的三层标准化协议,学界开始探索更为精细的古代文字标注体系与评测指标,推动领域规范的统一。其二,基于该基准暴露的模型缺陷,研究者针对甲骨文、金文等难例场景研制专用识别算法,并尝试融合古文字学先验知识以提升识别准确性。其三,Ancient-Bench所引入的多媒介、多书体综合评估思路,启发了后续跨领域基准的构建,如历史文献版面解析基准与多语种古籍识别基准,从而促进了数字人文与计算机视觉交叉领域的蓬勃发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务