OBI-Bench
收藏资源简介:
OBI-Bench是一个旨在评估大型多模态模型(LMMs)是否能辅助甲骨文处理任务的基准数据集。它包含五个任务:甲骨文字符识别、碎片文本重组、字符分类、图像检索和甲骨文解读。数据集收集了来自11个不同来源的5,523张甲骨文图像,并提出了原始甲骨文识别(O2BR)数据集和甲骨文重组(OBI-rejoin)数据集。
OBI-Bench is a benchmark dataset designed to evaluate whether large multimodal models (LMMs) can assist with oracle bone script processing tasks. It comprises five core tasks: oracle bone character recognition, fragment text reconstruction, character classification, image retrieval, and oracle bone script interpretation. The dataset contains 5,523 oracle bone script images collected from 11 distinct sources, and introduces two newly constructed sub-datasets: the Original Oracle Bone Recognition (O2BR) dataset and the Oracle Bone Rejoin (OBI-rejoin) dataset.
OBI-Bench 数据集概述
概述
OBI-Bench 是一个应用于甲骨文研究的开放数据集,旨在通过大型多模态模型(LMMs)来辅助古代文字的研究。数据集包含五个主要任务:
- 识别:从原始甲骨或拓片中定位密集的甲骨文文字。
- 重组:将碎片化的文本片段重构为连贯的文本。
- 分类:将单个字符分类为其对应的含义。
- 检索:根据给定的甲骨文图像返回相关结果。
- 解译:解释甲骨文以进行历史和文化研究。
数据集发布
- 发布时间:2024年12月2日
- GitHub仓库:OBI-Bench
数据集来源
数据集收集了来自11个不同来源的5,523张甲骨文图像。由于缺乏公开的甲骨文识别和重组数据集,数据集提出了**原始甲骨识别(O2BR)数据集和甲骨文重组(OBI-rejoin)**数据集。
基准模型
数据集选择了23个最新的主流LMMs进行评估,包括6个专有LMMs和17个开源LMMs。
性能基准
数据集提供了五个任务的性能基准结果,包括:
- 识别任务
- 重组任务
- 分类任务
- 检索任务
- 解译任务
数据集待发布
- 原始甲骨识别(O2BR)数据集:即将发布
- 甲骨文重组(OBI-rejoin)数据集:即将发布
联系信息
- 作者:Zijian Chen
- 邮箱:zijian.chen@sjtu.edu.cn
引用
@misc{chen2024obibench, title={OBI-Bench: Can LMMs Aid in Study of Ancient Script on Oracle Bones?}, author={Zijian Chen and Tingzhu Chen and Wenjun Zhang and Guangtao Zhai}, year={2024}, eprint={2412.01175}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2412.01175}, }




