遇见数据集

GAP-ocrbench-v2

收藏
Hugging Face2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

该数据集是一个多模态视觉语言数据集,由Gemma系列模型(如gemma-4-26b-a4b-it和gemma-4-e4b-it)生成,包含图像和文本对。每个样本包含一个视觉问题(question)、参考答案(ref_answer)以及模型生成的文本(generated_texts),并附带图像(images)及相关元数据(如图像指纹、图像处理器配置、视觉token数量等)。数据集支持多种配置,包括不同的生成模式(ins-gen指令生成、think-gen思考生成)、最大token长度(2048或4096)和视觉token数量(140、280、560)。此外,提供了子样本配置(50样本和100样本)用于快速实验。该数据集适用于训练或评估视觉语言模型在视觉问答、图像描述或指令跟随任务上的表现。

This dataset is a multimodal vision-language dataset generated by the Gemma series models (such as gemma-4-26b-a4b-it and gemma-4-e4b-it), containing image-text pairs. Each sample includes a visual question, a reference answer, and generated text from the model, along with the image and associated metadata (such as image fingerprint, image processor configuration, number of visual tokens, etc.). The dataset supports multiple configurations, including different generation modes (ins-gen instruction generation, think-gen thinking generation), maximum token lengths (2048 or 4096), and numbers of visual tokens (140, 280, 560). In addition, subsample configurations (50 samples and 100 samples) are provided for quick experiments. This dataset is suitable for training or evaluating vision-language models on tasks such as visual question answering, image captioning, or instruction following.

创建时间:
2026-08-25
原始信息汇总

数据集 GAP-ocrbench-v2 概述

基本信息

数据集配置(Configurations)

该数据集包含多个配置(config),每个配置基于不同模型、生成模式和视觉令牌数(vt)组合。共分为两大生成模式:

1. 指令模式(ins-gen)与思考模式(think-gen)

  • ins-gen-2048: 模型以指令生成模式运行,最大生成长度为 2048 token
  • think-gen-4096: 模型以思考生成模式运行,最大生成长度为 4096 token

2. 模型与视觉令牌配置

模型 视觉令牌数 (vt) 配置名称示例
gemma-4-26b-a4b-it vt280 gemma-4-26b-a4b-it-ins-gen-2048-vt280
gemma-4-e4b-it vt140 gemma-4-e4b-it-ins-gen-2048-vt140
gemma-4-e4b-it vt280 gemma-4-e4b-it-ins-gen-2048-vt280
gemma-4-e4b-it vt560 gemma-4-e4b-it-ins-gen-2048-vt560

3. 子采样变体

每个主配置还包含 -subsample-50-subsample-100 子集,分别包含 50 和 100 个样本,用于快速测试。

数据规模

完整配置

配置 样本数 数据集大小
gemma-4-26b-a4b-it-ins-gen-2048-vt280 984 ~551.6 MB
gemma-4-26b-a4b-it-think-gen-4096-vt280 968 ~568.4 MB
gemma-4-e4b-it-ins-gen-2048-vt140 988 ~554.4 MB
gemma-4-e4b-it-ins-gen-2048-vt280 991 ~557.4 MB
gemma-4-e4b-it-ins-gen-2048-vt560 992 ~561.5 MB
gemma-4-e4b-it-think-gen-4096-vt140 未完整提供

子采样配置(示例)

配置 样本数 数据集大小
*-subsample-50 50 约 15-50 MB
*-subsample-100 100 约 43-75 MB

数据结构与字段

每个样本包含以下字段:

标识与来源

  • source: 数据来源
  • item_id: 样本唯一标识
  • origin_id: 原始 ID(整数)
  • id: 样本 ID
  • sample_seed: 采样种子

内容字段

  • question: 问题文本
  • ref_answer: 参考答案
  • category: 类别标签
  • images: 图像列表
  • num_images: 图像数量

生成与 token 相关字段

  • input_ids: 输入 token ID 列表
  • input_tokens_len: 输入 token 长度
  • generated_texts: 模型生成的文本
  • generated_tokens_len: 生成 token 长度
  • n_prefill_tokens: 预填充 token 数
  • labels: 标签列表
  • finish_reason: 生成结束原因
  • seed: 随机种子

视觉处理相关字段

  • image_fingerprint: 图像指纹
  • image_processor_config: 图像处理器配置
  • image_processor_config_hash: 配置哈希值
  • sum_vision_tokens: 视觉 token 总数
  • max_vision_tokens: 最大视觉 token 数

生成配置字段

  • generation_model_name_or_path: 生成模型名称或路径
  • enable_thinking: 是否启用思考模式
  • truncated_by_cap: 是否因容量限制被截断(布尔值)

数据划分

所有配置均仅包含 训练集(train) 划分,无验证集或测试集。训练集样本数根据配置不同为 50 至 992 不等。

搜集汇总
数据集介绍
GAP-ocrbench-v2 数据集图片
构建方式
GAP-ocrbench-v2数据集是针对光学字符识别(OCR)任务的多模态评估基准,其构建过程融合了多种主流视觉语言模型(VLMs)的生成特性。数据集包含了多个配置,每项配置基于不同的生成模型(如gemma-4系列)和不同的视觉token设置(如vt140、vt280、vt560)进行构建,同时区分了指令跟随(ins-gen)与思维链(think-gen)两种生成模式。每条样本记录了问题、图像、参考答案、类别以及模型生成的完整文本,并附带了详尽的token级元数据,如输入token长度、视觉token总数等,为深度学习模型的训练与评估提供了丰富的信息基础。
特点
该数据集的一个显著特点是其多维度、精细化的数据标注体系,涵盖了从原始图像到生成文本的全链路信息。每个样本包含了图像指纹(image_fingerprint)、图像处理器配置及其哈希值,从而保证了数据可追溯性和图像处理流程的透明性。此外,数据集提供了预填充token数(n_prefill_tokens)、生成token数等关键性能指标,以及是否被截断(truncated_by_cap)和是否启用思维过程(enable_thinking)等质量标志,使得研究者能够深入分析模型在不同条件下的表现。数据规模覆盖了从50到近1000个样本的多种子集,便于在不同计算资源下进行快速实验。
使用方法
使用GAP-ocrbench-v2数据集时,研究者可根据研究目标选择合适的配置和子集。例如,若需评估模型在思维链模式下的OCR能力,可选用think-gen系列配置;若需进行快速原型验证,可选用subsample-50或subsample-100子集。数据集提供了标准化的字段,如question、images、ref_answer,可直接用于多数视觉语言模型的微调或零样本评估流程。同时,详细的token级元数据支持对模型解码效率、视觉token压缩等专题进行分析。建议在使用时结合HuggingFace的datasets库加载数据,并参考图像处理器配置以复现特征提取流程。
背景与挑战
背景概述
GAP-ocrbench-v2数据集诞生于2025年Google DeepMind对Gemma系列多模态模型(gemma-4-26b-a4b-it与gemma-4-e4b-it)进行视觉问答能力评估的背景下,由核心研究团队针对光学字符识别(OCR)任务精心构建而成。该数据集旨在系统性地剖析模型在视觉文本理解中的性能边界,其核心研究问题聚焦于不同模型架构(参数量、视觉token数)及推理模式(指令遵循与思考模式)对OCR任务精度的影响。数据集涵盖了多种配置,包括不同的视觉token数(vt140、vt280、vt560)和生成长度(2048、4096),并配备完整的输入输出、生成文本、token数量等细粒度特征,为多模态大语言模型的OCR能力基准测试提供了高保真、多维度的评估框架,对推动文档理解、场景文字识别等现实应用的发展具有重要参考价值。
当前挑战
构建GAP-ocrbench-v2数据集面临多重严峻挑战。在领域问题层面,OCR任务本身蕴含图像畸变、字体多样性、背景干扰及长文本序列等复杂场景,评测基准需精准建模这些噪声因素以保证泛化性,而现有数据集往往难以覆盖真实世界的极端情况。在构建过程中,数据采集需从大规模图像中筛选并标注高质量的OCR问题,涵盖多样化的文本布局和语言,确保类别均衡;同时,针对不同模型配置(如视觉token数、生成长度)的适配处理(如截断、子采样)要求精密的token管理以避免信息丢失。此外,生成文本的评测需设计合理的评价指标,以区分模型在推理深度与答案准确性间的权衡,对数据集的科学性和工程实现均构成了显著挑战。
常用场景
经典使用场景
GAP-ocrbench-v2数据集专为光学字符识别(OCR)领域的研究与评测而设计,其核心用途在于对多模态大语言模型(MLLMs)的OCR能力进行基准测试。该数据集精心采集了包含图像、问题及参考答案的样本,覆盖了从简单文本识别到复杂版面理解的多样化任务。研究者可利用此数据集评估模型在文本提取、表格解析、场景文字识别等经典OCR子任务上的表现,进而推动模型在真实世界图像理解中的鲁棒性与准确性提升。
实际应用
在实际应用中,GAP-ocrbench-v2可助力开发高精度的文档数字化工具,例如自动扫描文档的信息抽取、票据识别、车牌识别及实时翻译等系统。其丰富的图像与文本对齐样本可用于训练与微调生产级OCR服务,提升金融、物流、教育等行业对印刷体与手写体文字的识别能力。此外,该数据集还可用于验证多模态模型在边缘设备或云端的部署性能,为工业界的智能文档处理流水线提供关键测试基准。
衍生相关工作
该数据集的发布催生了众多衍生研究工作,包括针对OCR任务的模型压缩与加速方法、视觉令牌剪枝策略,以及多模态模型的高效推理框架。基于其元数据设计,研究者已提出动态上下文缩减技术,在保持识别精度的同时大幅降低计算开销。此外,该数据集还被用于联合建模视觉编码器与语言解码器的协同优化,促进了OCR专用模型、跨语言文字识别模型及可解释性分析等方向的蓬勃发展,成为连接基础研究与产业应用的重要纽带。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务