DatBench
收藏资源简介:
DatBench是一个高保真视觉语言基准测试,提供两种版本:DatologyAI/DatBench(高保真子集,约5K样本/能力,总计约45K)和DatologyAI/DatBench-Full(完整数据集,约205K样本)。包含九种评估能力,涵盖多样化的视觉语言任务,如图表理解、对象计数、文档解析、通用VQA、数学推理等。每个样本包含唯一标识符、图像、问题、答案、评估模式等信息。
DatBench is a high-fidelity visual-language benchmark that provides two versions: DatologyAI/DatBench, the high-fidelity subset with approximately 5K samples per capability and a total of around 45K samples, and DatologyAI/DatBench-Full, the complete dataset with roughly 205K samples. It includes nine evaluation capabilities, covering a diverse set of visual-language tasks such as chart understanding, object counting, document parsing, general-purpose VQA, mathematical reasoning and more. Each sample contains information including a unique identifier, image, question, answer, evaluation protocol and other relevant details.
DatBench数据集概述
数据集基本信息
- 数据集名称: DatBench
- 托管地址: https://github.com/datologyai/DatBench
- 性质: 一个高保真度的视觉-语言基准测试数据集,包含精确的评分实现。
数据集版本与规模
- DatologyAI/DatBench: 高保真度子集(每种能力约5K样本,总计约45K样本)。
- DatologyAI/DatBench-Full: 完整数据集(总计约205K样本)。
评估能力范围
涵盖九种视觉-语言任务评估能力:
- chart: 图表理解、信息图问答。
- counting: 物体计数任务。
- document: 光学字符识别(OCR)、文档解析、关键信息提取(KIE)。
- general: 通用视觉问答(VQA)、推理。
- grounding: 指代表达式定位、点定位。
- math: 数学推理、几何。
- scene: 场景文本识别、多场景OCR。
- spatial: 空间推理、现实世界问答。
- table: 表格理解、图表问答。
样本数据结构
每个样本包含以下字段:
id: 唯一标识符。image: 图像(由Hugging Face自动加载为PIL.Image)。question: 格式化后的提示词,可直接用于推理。answer: 标准答案。all_answers: 其他有效答案列表。eval_mode: 评估模式,值为"direct"或"judge"。is_circular: 是否为循环评估变体。metadata: 包含数据集特定元数据的JSON字符串。source_info: 来源信息字典,包含dataset(源数据集名称)和original_idx(原始样本ID)。
主要评估工具
- 核心类:
DatBenchEvaluator - 主要方法:
__init__(hf_dataset, capability): 使用Hugging Face数据集初始化。get_inference_tasks(): 获取InferenceTask对象列表。create_judge_tasks(vlm_responses): 创建评判评估任务。compute_metrics(vlm_responses, judge_responses=None): 计算分数并生成报告。
数据类定义
- InferenceTask: 视觉语言模型的输入任务,包含
id、image、question、eval_mode。 - VLMResponse: 视觉语言模型的输出,包含
id、raw_output、parsed_answer(可选预提取答案)。 - DatBenchReport: 最终评估结果,包含
summary(总体准确率、数据集指标等字典)、results(每个样本得分的详细列表)和save(path)方法(将报告保存为JSON文件)。




