PictOBI-20k
收藏资源简介:
PictOBI-20k是一个大规模数据集,旨在评估大型多模态模型(LMM)在象形甲骨文字(OBC)视觉解读任务上的表现。该数据集包含20,000个精心策划的OBC-对象图像对和超过15,000个多选问题。为了进一步评估视觉推理能力,还提供了主观注释,检查人类和LMM之间参考点的一致性。实验结果表明,虽然通用LMM表现出初步的视觉解读能力,但它们往往无法有效利用视觉信息,并受到语言先验的约束。PictOBI-20k可作为推进面向OBC的LMM视觉注意力评估和优化的基础。
PictOBI-20k is a large-scale dataset designed to evaluate the performance of large multimodal models (LMMs) on the visual interpretation task of oracle bone script pictograms (OBC). This dataset contains 20,000 carefully curated OBC-object image pairs and over 15,000 multiple-choice questions. To further assess visual reasoning capabilities, subjective annotations are also provided to examine the consistency of reference points between humans and LMMs. Experimental results show that although general-purpose LMMs exhibit preliminary visual interpretation abilities, they often fail to effectively leverage visual information and are constrained by linguistic priors. PictOBI-20k can serve as a foundation for advancing visual attention evaluation and optimization of LMMs tailored for OBC.
PictOBI-20k 数据集概述
数据集简介
PictOBI-20k 是一个用于评估大型多模态模型在象形甲骨文字视觉解读能力的大规模基准数据集。该数据集包含 2 万个精心策划的甲骨文字-物体图像对和超过 1.5 万个多项选择题。
数据来源
- 甲骨文字图像:收集自 3 个甲骨文字专业网站(殷契文渊、小学堂、国学大师)和 5 个开源甲骨文字数据集(Oracle-241、Oracle-50k、HUST-OBS、OBI125、OBIdatasetIJDH)
- 真实物体图像:从 Freepik、Pexels、Pinterest 和中研院青铜器数据库精心收集约 4800 张图像
基准设计
- 构建 15,175 个多项选择题用于大型多模态模型评估
- 提供甲骨文字-物体图像对的人类标注参考点
- 涵盖多种字体外观和类别
评估模型
评估 11 个大型多模态模型,包括:
- GPT-4o
- Gemini 2.5 Pro
- Claude 4 Sonnet
- GLM-4.5V
- Qwen2.5-VL 系列
- InternVL3 系列
同时评估三个视觉编码器(DINOv2-L/14、CLIP-L/14、InternViT-300M)的多模态和纯视觉性能。
性能评估维度
- 分类任务:按甲骨文字类别的平均准确率
- 一致性任务:人类与大型多模态模型在 240 个甲骨文字-物体对上的视觉参考一致性
- 视觉编码器分析:注意力图可视化和视觉编码器直接读取的准确率
数据集状态
- GitHub 仓库已于 2025 年 9 月 9 日上线
- 公开数据集即将发布
相关论文
Chen, Z., Hua, W., Li, J., Deng, L., Du, F., Chen, T., & Zhai, G. (2025). PictOBI-20k: Unveiling Large Multimodal Models in Visual Decipherment for Pictographic Oracle Bone Characters. arXiv preprint arXiv:2509.05773.




