遇见数据集

GAP-ocrbench-v1

收藏
Hugging Face2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

该数据集包含由 Gemma 系列模型(如 gemma-4-26b-a4b-it 和 gemma-4-e4b-it)生成的视觉语言模型输出。数据集包含多个配置,每个配置对应不同的模型变体、生成模式(指令生成或思考生成)以及最大 token 长度和视觉 token 数的设置。每个样本包含一个视觉问题、参考答案、图像、模型生成的文本以及详细的 token 处理信息(如输入 token 长度、生成 token 长度、预填充 token 数、视觉 token 总数和最大视觉 token 数)。此外,还记录了生成模型的路径、是否启用思考模式、图像指纹、图像处理器配置等信息。数据集适用于多模态推理、指令跟随、思维链生成等任务的训练或评估。每个配置的训练集样本数从 50 到 1000 不等,以支持不同规模实验。

This dataset contains visual language model outputs generated by the Gemma series models (such as gemma-4-26b-a4b-it and gemma-4-e4b-it). The dataset includes multiple configurations, each corresponding to different model variants, generation modes (instruction generation or thinking generation), and settings for maximum token length and visual token count. Each sample consists of a visual question, a reference answer, an image, the model-generated text, and detailed token processing information (such as input token length, generated token length, prefill token count, total visual tokens, and maximum visual token count). Additionally, it records the generation model path, whether thinking mode is enabled, image fingerprint, image processor configuration, and other information. The dataset is suitable for training or evaluation of tasks such as multimodal reasoning, instruction following, and chain-of-thought generation. The number of training samples per configuration ranges from 50 to 1000 to support experiments of different scales.

创建时间:
2026-08-25
原始信息汇总

数据集概述:GAP-ocrbench-v1

基本信息

  • 数据集名称:GAP-ocrbench-v1
  • 数据集地址:https://huggingface.co/datasets/elichen-skymizer/GAP-ocrbench-v1
  • 数据集用途:该数据集包含多种配置(config),每个配置对应不同的模型生成策略和视觉令牌参数,用于OCR(光学字符识别)基准测试。

数据配置(Configs)

该数据集包含多个配置,每个配置的样本数量和数据集大小均有所不同:

配置名称 样本数 数据集大小 (bytes) 下载大小 (bytes)
gemma-4-26b-a4b-it-ins-gen-2048-vt280 1000 91,523,033 90,535,295
gemma-4-26b-a4b-it-ins-gen-2048-vt280-subsample-50 50 5,928,740 5,055,620
gemma-4-26b-a4b-it-ins-gen-2048-vt280-subsample-100 100 9,582,264 7,601,049
gemma-4-26b-a4b-it-think-gen-4096-vt280 993 101,044,267 99,518,233
gemma-4-26b-a4b-it-think-gen-4096-vt280-subsample-50 50 6,185,435 4,484,151
gemma-4-26b-a4b-it-think-gen-4096-vt280-subsample-100 100 11,142,397 8,482,300
gemma-4-e4b-it-ins-gen-2048-vt140 1000 89,622,333 88,608,415
gemma-4-e4b-it-ins-gen-2048-vt140-subsample-50 50 5,825,325 5,056,883
gemma-4-e4b-it-ins-gen-2048-vt140-subsample-100 100 9,386,809 7,607,072
gemma-4-e4b-it-ins-gen-2048-vt280 1000 91,756,999 90,746,783
gemma-4-e4b-it-ins-gen-2048-vt280-subsample-50 50 5,948,978 5,061,050
gemma-4-e4b-it-ins-gen-2048-vt280-subsample-100 100 9,618,072 7,611,493
gemma-4-e4b-it-ins-gen-2048-vt560 1000 96,112,223 95,105,165
gemma-4-e4b-it-ins-gen-2048-vt560-subsample-50 50 6,165,346 5,059,196
gemma-4-e4b-it-ins-gen-2048-vt560-subsample-100 100 10,063,890 7,613,662
gemma-4-e4b-it-think-gen-4096-vt140 不适用 不适用 不适用

数据特征(Features)

每个配置包含以下字段:

字段名 数据类型 说明
source string 数据来源
item_id string 条目ID
origin_id int64 原始ID
sample_seed int64 采样种子
question string 问题
images list[image] 图像列表
num_images int32 图像数量
ref_answer string 参考答案
category string 类别
input_ids list[int64] 输入ID列表
input_tokens_len int64 输入令牌长度
generated_texts string 生成的文本
generated_tokens_len int64 生成令牌长度
n_prefill_tokens int64 预填充令牌数
finish_reason string 完成原因
seed int64 种子
labels list[int64] 标签列表
image_fingerprint string 图像指纹
image_processor_config string 图像处理器配置
image_processor_config_hash string 图像处理器配置哈希
sum_vision_tokens int64 视觉令牌总数
max_vision_tokens int64 最大视觉令牌数
id string 唯一ID
truncated_by_cap bool 是否因上限被截断
generation_model_name_or_path string 生成模型名称或路径
enable_thinking bool 是否启用思考模式

数据分割(Splits)

  • 分割类型:所有配置均包含 train 分割
  • 分割详情:具体样本数见上文配置表格

配置命名规则说明

配置名称遵循特定格式,例如 gemma-4-26b-a4b-it-ins-gen-2048-vt280

  • gemma-4-26b-a4bgemma-4-e4b:使用的模型名称
  • ins-gen-2048think-gen-4096:指令生成(ins-gen)或思考生成(think-gen)模式,以及生成令牌数
  • vt140vt280vt560:不同视觉令牌(vision tokens)参数
  • subsample-50subsample-100:代表从完整数据集中抽取的50或100个样本子集
搜集汇总
数据集介绍
GAP-ocrbench-v1 数据集图片
构建方式
GAP-ocrbench-v1数据集的构建源于对视觉语言模型在OCR任务中性能评估的迫切需求。该数据集通过精心设计的流程,从多个来源收集图像与问题对,并利用先进的Gemma系列模型(如gemma-4-26b-a4b-it和gemma-4-e4b-it)在两种推理模式(指令跟随与思考模式)下生成答案。每个样本都包含原始问题、参考回答、模型生成文本、详细的token级元数据(如输入输出长度、视觉token统计)以及图像指纹等,确保了数据的丰富性和可追溯性。数据集提供了多种配置,包括不同模型、视觉token上限(vt140、vt280、vt560)及子采样版本,以支持多样化的实验需求。
特点
该数据集的核心特色在于其多维度的信息记录。每个样本不仅包含图像、问题和答案,还细粒度地记录了模型推理过程的元数据,如prefill token数、生成结束原因、视觉token的聚合与最大值,以及图像处理器的配置和哈希值。这种设计使得研究者能够深入分析模型在OCR任务中的行为,例如视觉注意力分配和token效率。此外,数据集通过引入思考模式(think)与指令跟随模式(ins)的对比,以及不同视觉token上限的设置,为探究推理策略对性能的影响提供了宝贵资源。子采样配置(如50、100样本)则为快速验证和调试提供了便利。
使用方法
使用GAP-ocrbench-v1数据集时,研究者可根据研究目标选择合适的配置。对于模型评估,可直接加载默认配置(如gemma-4-e4b-it-ins-gen-2048-vt140),利用其包含的生成文本和参考答案进行性能对比。对于深入分析,可利用详细的token元数据(如n_prefill_tokens、sum_vision_tokens)来研究模型的计算效率和视觉编码策略。子样本配置适用于快速实验或方法开发。所有配置均提供HuggingFace格式,可通过datasets库轻松加载,并支持自定义数据处理流程。研究者还可结合图像指纹和处理器配置,进行跨模型或跨设置的复现与扩展研究。
背景与挑战
背景概述
GAP-ocrbench-v1数据集由Google于2025年构建,旨在系统评估多模态大语言模型在光学字符识别(OCR)任务上的能力。该数据集基于Gemma模型(如gemma-4-26b-a4b-it和gemma-4-e4b-it)生成,包含多种配置,通过调整视觉令牌数量(如140、280、560)和生成模式(指令生成与思维链生成),提供了1000个样本的完整集及50、100的随机子集,用于研究不同模型规模和视觉编码对OCR性能的影响。该数据集的核心研究问题在于量化多模态模型在复杂文本识别中的准确性与鲁棒性,并探索推理增强(如thinking模式)对提升OCR效果的作用。作为OCRbench系列之一,它为多模态模型的基准测试提供了新视角,推动了对视觉语言模型细粒度评估的进程,尤其在文档理解、场景文本识别等应用领域具有重要参考价值。
当前挑战
该数据集面临多重挑战。在领域层面,OCR任务本身需应对多样化的文本样式、复杂背景、手势遮挡及低分辨率图像,多模态模型需在图像理解与文本生成间实现精确对齐,而当前模型在长文本识别与语义推理上仍存在显著误差。在构建过程中,挑战包括:如何生成高质量且多样化的OCR问题与答案,避免模型偏见与过拟合;如何合理设定视觉令牌数量(vt)以平衡计算成本与识别精度,如vt280与vt560的差异需优化;如何确保生成文本(generated_texts)与参考答案(ref_answer)的一致性,并处理截断(truncated_by_cap)与推理模式(enable_thinking)对输出质量的影响;此外,数据集的规模(如1000样本)相对有限,可能不足以覆盖复杂场景,且子采样策略(50、100)需验证其代表性。这些挑战共同影响了数据集在评估模型泛化能力时的可信度与实用性。
常用场景
经典使用场景
GAP-ocrbench-v1数据集作为多模态大语言模型(MLLM)在光学字符识别(OCR)任务上的基准测试集,被广泛用于评估和比较不同模型在文本识别、版面分析、端到端OCR等核心任务上的性能。该数据集涵盖多种图像类型和复杂场景,支持指令微调、少样本学习及零样本泛化测试。研究者基于其标准化的数据格式和丰富的元信息(如视觉token数、生成token数等),设计实验探究模型在不同输入长度、视觉分辨率下的鲁棒性,从而推动OCR技术在多模态理解领域的发展。
解决学术问题
在学术研究中,该数据集解决了多模态大模型在OCR任务上缺乏统一评估基准的问题。通过提供细粒度的过程数据(如预填充token数、生成token数、视觉token、完成原因等),支持对模型推理效率、上下文建模能力及视觉与文本对齐机制进行深入剖析。其子采样配置(如subsample-50/100)便于在不同规模下快速验证假设。数据集的引入促进了量化对比研究,帮助揭示模型在长文本识别、版面结构理解等难题上的表现差异,对提升MLLM的可解释性和可靠性具有关键意义。
衍生相关工作
基于GAP-ocrbench-v1,衍生出多个相关研究工作。研究者利用其数据注释和生成结果,开发了针对视觉token长度优化的新模型架构,如采用自适应视觉编码器的方法。同时,数据集被用作训练数据增强来源,与自监督学习结合,提升了模型对多样化字体和噪声背景的适应能力。相关研究还包括基于生成token的置信度校准方法,以及跨语言OCR迁移学习的探索。这些工作共同推动了多模态OCR系统在学术和工业界的持续创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务