kivqa-baseline-3contexts
收藏资源简介:
KI-VQA Frozen Answer Contexts 是一个用于统一知识库E-VQA和InfoSeek数据集比较的冻结答案上下文数据集。该数据集提供了多个基线模型(EchoSight、IBA、OMGM、CC-VQA)在E-VQA和InfoSeek两个数据集上的预先生成上下文文件,每个文件为JSONL格式。E-VQA数据集包含5,750行,InfoSeek数据集包含71,335行。每行数据包含标准字段:canonical data_id、问题、便携式查询图像路径、渲染后的上下文以及结构化的上下文章节(context_sections)。此外,还提供了清单文件(manifest),记录行数、章节计数分布、文件大小和SHA256摘要。对于InfoSeek上的OMGM基线,仅使用所选top-1实体可用的章节,因此部分行章节数少于3(64,687行有3个章节,3,410行有2个,3,238行有1个)。CC-VQA基线在InfoSeek上有一个行有2个章节,其余71,334行有3个章节。查询图像另行分发在Kyle-han/kivqa-baseline仓库中(E-VQA和InfoSeek分别对应不同tar文件)。该数据集适用于视觉问答(VQA)任务中知识库增强方法的评测与比较。
KI-VQA Frozen Answer Contexts is a dataset of frozen answer contexts for unified knowledge base E-VQA and InfoSeek dataset comparison. It provides pre-generated context files for multiple baseline models (EchoSight, IBA, OMGM, CC-VQA) on E-VQA and InfoSeek datasets, each in JSONL format. The E-VQA dataset contains 5,750 rows, and the InfoSeek dataset contains 71,335 rows. Each row includes standard fields: canonical data_id, question, portable query image path, rendered context, and structured context sections. Additionally, manifest files are provided, recording row counts, section count distributions, file sizes, and SHA256 checksums. For the OMGM baseline on InfoSeek, only sections available for the selected top-1 entity are used, so some rows have fewer than 3 sections (64,687 rows with 3 sections, 3,410 rows with 2, 3,238 rows with 1). The CC-VQA baseline on InfoSeek has one row with 2 sections, and the remaining 71,334 rows have 3 sections. Query images are distributed separately in the Kyle-han/kivqa-baseline repository (E-VQA and InfoSeek correspond to different tar files). This dataset is suitable for evaluating and comparing knowledge base augmentation methods in visual question answering (VQA) tasks.
数据集概述
KI-VQA Frozen Answer Contexts 是一个用于视觉问答(Visual Question Answering, VQA)任务的数据集,专为统一知识库(unified-KB)上的 E-VQA 和 InfoSeek 基准测试提供冻结的答案上下文(frozen answer contexts)。
数据集基本信息
- 名称:KI-VQA Frozen Answer Contexts
- 语言:英语(en)
- 任务类别:视觉问答(visual-question-answering)
数据集内容
该数据集包含用于多个基线模型(Baseline)的上下文文件,涵盖两个基准测试:E-VQA 和 InfoSeek。
| 基准测试 | 基线模型 | 上下文文件路径 | 行数 |
|---|---|---|---|
| E-VQA | EchoSight | unified_eval/e-vqa/contexts/echosight/context.top3.jsonl |
5,750 |
| E-VQA | IBA | unified_eval/e-vqa/contexts/iba/context.top3.jsonl |
5,750 |
| E-VQA | OMGM | unified_eval/e-vqa/contexts/omgm/context.top3.jsonl |
5,750 |
| E-VQA | CC-VQA | unified_eval/e-vqa/contexts/ccvqa/context.top3.jsonl |
5,750 |
| InfoSeek | EchoSight | unified_eval/infoseek/contexts/echosight/context.top3.jsonl |
71,335 |
| InfoSeek | IBA | unified_eval/infoseek/contexts/iba/context.top3.jsonl |
71,335 |
| InfoSeek | OMGM | unified_eval/infoseek/contexts/omgm/context.top3.jsonl |
71,335 |
| InfoSeek | CC-VQA | unified_eval/infoseek/contexts/ccvqa/context.top3.jsonl |
71,335 |
数据结构
每个 JSONL 行包含以下字段:
- data_id:标准化的数据标识符
- question:问题内容
- portable query-image path:可移植的查询图像路径
- rendered context:渲染后的上下文
- context_sections:结构化的上下文章节
此外,相关的清单(Manifests)记录了行数、章节数量分布、文件大小以及 SHA256 摘要。
特殊情况说明
- InfoSeek OMGM:仅使用其选定 top-1 实体中可用的章节,不会用其他实体填充短文。因此,有 64,687 行包含三个章节,3,410 行包含两个章节,3,238 行包含一个章节。
- CC-VQA (InfoSeek):有 1 行包含两个可用章节,71,334 行包含三个章节。
查询图像获取
查询图像单独分发在 Kyle-han/kivqa-baseline 数据集中:
- E-VQA:
validation/e-vqa/images/evqa_inference_images.tar - InfoSeek:
validation/infoseek/images/oven_val.tar
附加文档
Fresh-server vLLM 命令记录在私有仓库 hws2002/kivqa-baselines 的 baselines/unified_eval/docs/ANSWER_ONLY_SERVER.md 文件中。





