GAP-ocrbench-v2
收藏资源简介:
该数据集是一个多模态视觉语言数据集,由Gemma系列模型(如gemma-4-26b-a4b-it和gemma-4-e4b-it)生成,包含图像和文本对。每个样本包含一个视觉问题(question)、参考答案(ref_answer)以及模型生成的文本(generated_texts),并附带图像(images)及相关元数据(如图像指纹、图像处理器配置、视觉token数量等)。数据集支持多种配置,包括不同的生成模式(ins-gen指令生成、think-gen思考生成)、最大token长度(2048或4096)和视觉token数量(140、280、560)。此外,提供了子样本配置(50样本和100样本)用于快速实验。该数据集适用于训练或评估视觉语言模型在视觉问答、图像描述或指令跟随任务上的表现。
This dataset is a multimodal vision-language dataset generated by the Gemma series models (such as gemma-4-26b-a4b-it and gemma-4-e4b-it), containing image-text pairs. Each sample includes a visual question, a reference answer, and generated text from the model, along with the image and associated metadata (such as image fingerprint, image processor configuration, number of visual tokens, etc.). The dataset supports multiple configurations, including different generation modes (ins-gen instruction generation, think-gen thinking generation), maximum token lengths (2048 or 4096), and numbers of visual tokens (140, 280, 560). In addition, subsample configurations (50 samples and 100 samples) are provided for quick experiments. This dataset is suitable for training or evaluating vision-language models on tasks such as visual question answering, image captioning, or instruction following.
数据集 GAP-ocrbench-v2 概述
基本信息
- 数据集名称: GAP-ocrbench-v2
- 数据集地址: https://huggingface.co/datasets/elichen-skymizer/GAP-ocrbench-v2
- 数据集类型: 视觉语言模型(VLM)OCR 评测基准数据集
数据集配置(Configurations)
该数据集包含多个配置(config),每个配置基于不同模型、生成模式和视觉令牌数(vt)组合。共分为两大生成模式:
1. 指令模式(ins-gen)与思考模式(think-gen)
- ins-gen-2048: 模型以指令生成模式运行,最大生成长度为 2048 token
- think-gen-4096: 模型以思考生成模式运行,最大生成长度为 4096 token
2. 模型与视觉令牌配置
| 模型 | 视觉令牌数 (vt) | 配置名称示例 |
|---|---|---|
| gemma-4-26b-a4b-it | vt280 | gemma-4-26b-a4b-it-ins-gen-2048-vt280 |
| gemma-4-e4b-it | vt140 | gemma-4-e4b-it-ins-gen-2048-vt140 |
| gemma-4-e4b-it | vt280 | gemma-4-e4b-it-ins-gen-2048-vt280 |
| gemma-4-e4b-it | vt560 | gemma-4-e4b-it-ins-gen-2048-vt560 |
3. 子采样变体
每个主配置还包含 -subsample-50 和 -subsample-100 子集,分别包含 50 和 100 个样本,用于快速测试。
数据规模
完整配置
| 配置 | 样本数 | 数据集大小 |
|---|---|---|
| gemma-4-26b-a4b-it-ins-gen-2048-vt280 | 984 | ~551.6 MB |
| gemma-4-26b-a4b-it-think-gen-4096-vt280 | 968 | ~568.4 MB |
| gemma-4-e4b-it-ins-gen-2048-vt140 | 988 | ~554.4 MB |
| gemma-4-e4b-it-ins-gen-2048-vt280 | 991 | ~557.4 MB |
| gemma-4-e4b-it-ins-gen-2048-vt560 | 992 | ~561.5 MB |
| gemma-4-e4b-it-think-gen-4096-vt140 | 未完整提供 | — |
子采样配置(示例)
| 配置 | 样本数 | 数据集大小 |
|---|---|---|
| *-subsample-50 | 50 | 约 15-50 MB |
| *-subsample-100 | 100 | 约 43-75 MB |
数据结构与字段
每个样本包含以下字段:
标识与来源
source: 数据来源item_id: 样本唯一标识origin_id: 原始 ID(整数)id: 样本 IDsample_seed: 采样种子
内容字段
question: 问题文本ref_answer: 参考答案category: 类别标签images: 图像列表num_images: 图像数量
生成与 token 相关字段
input_ids: 输入 token ID 列表input_tokens_len: 输入 token 长度generated_texts: 模型生成的文本generated_tokens_len: 生成 token 长度n_prefill_tokens: 预填充 token 数labels: 标签列表finish_reason: 生成结束原因seed: 随机种子
视觉处理相关字段
image_fingerprint: 图像指纹image_processor_config: 图像处理器配置image_processor_config_hash: 配置哈希值sum_vision_tokens: 视觉 token 总数max_vision_tokens: 最大视觉 token 数
生成配置字段
generation_model_name_or_path: 生成模型名称或路径enable_thinking: 是否启用思考模式truncated_by_cap: 是否因容量限制被截断(布尔值)
数据划分
所有配置均仅包含 训练集(train) 划分,无验证集或测试集。训练集样本数根据配置不同为 50 至 992 不等。




