遇见数据集

kivqa-baseline-3contexts

收藏
Hugging Face2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

KI-VQA Frozen Answer Contexts 是一个用于统一知识库E-VQA和InfoSeek数据集比较的冻结答案上下文数据集。该数据集提供了多个基线模型(EchoSight、IBA、OMGM、CC-VQA)在E-VQA和InfoSeek两个数据集上的预先生成上下文文件,每个文件为JSONL格式。E-VQA数据集包含5,750行,InfoSeek数据集包含71,335行。每行数据包含标准字段:canonical data_id、问题、便携式查询图像路径、渲染后的上下文以及结构化的上下文章节(context_sections)。此外,还提供了清单文件(manifest),记录行数、章节计数分布、文件大小和SHA256摘要。对于InfoSeek上的OMGM基线,仅使用所选top-1实体可用的章节,因此部分行章节数少于3(64,687行有3个章节,3,410行有2个,3,238行有1个)。CC-VQA基线在InfoSeek上有一个行有2个章节,其余71,334行有3个章节。查询图像另行分发在Kyle-han/kivqa-baseline仓库中(E-VQA和InfoSeek分别对应不同tar文件)。该数据集适用于视觉问答(VQA)任务中知识库增强方法的评测与比较。

KI-VQA Frozen Answer Contexts is a dataset of frozen answer contexts for unified knowledge base E-VQA and InfoSeek dataset comparison. It provides pre-generated context files for multiple baseline models (EchoSight, IBA, OMGM, CC-VQA) on E-VQA and InfoSeek datasets, each in JSONL format. The E-VQA dataset contains 5,750 rows, and the InfoSeek dataset contains 71,335 rows. Each row includes standard fields: canonical data_id, question, portable query image path, rendered context, and structured context sections. Additionally, manifest files are provided, recording row counts, section count distributions, file sizes, and SHA256 checksums. For the OMGM baseline on InfoSeek, only sections available for the selected top-1 entity are used, so some rows have fewer than 3 sections (64,687 rows with 3 sections, 3,410 rows with 2, 3,238 rows with 1). The CC-VQA baseline on InfoSeek has one row with 2 sections, and the remaining 71,334 rows have 3 sections. Query images are distributed separately in the Kyle-han/kivqa-baseline repository (E-VQA and InfoSeek correspond to different tar files). This dataset is suitable for evaluating and comparing knowledge base augmentation methods in visual question answering (VQA) tasks.

创建时间:
2026-08-13
原始信息汇总

数据集概述

KI-VQA Frozen Answer Contexts 是一个用于视觉问答(Visual Question Answering, VQA)任务的数据集,专为统一知识库(unified-KB)上的 E-VQA 和 InfoSeek 基准测试提供冻结的答案上下文(frozen answer contexts)。

数据集基本信息

  • 名称:KI-VQA Frozen Answer Contexts
  • 语言:英语(en)
  • 任务类别:视觉问答(visual-question-answering)

数据集内容

该数据集包含用于多个基线模型(Baseline)的上下文文件,涵盖两个基准测试:E-VQA 和 InfoSeek。

基准测试 基线模型 上下文文件路径 行数
E-VQA EchoSight unified_eval/e-vqa/contexts/echosight/context.top3.jsonl 5,750
E-VQA IBA unified_eval/e-vqa/contexts/iba/context.top3.jsonl 5,750
E-VQA OMGM unified_eval/e-vqa/contexts/omgm/context.top3.jsonl 5,750
E-VQA CC-VQA unified_eval/e-vqa/contexts/ccvqa/context.top3.jsonl 5,750
InfoSeek EchoSight unified_eval/infoseek/contexts/echosight/context.top3.jsonl 71,335
InfoSeek IBA unified_eval/infoseek/contexts/iba/context.top3.jsonl 71,335
InfoSeek OMGM unified_eval/infoseek/contexts/omgm/context.top3.jsonl 71,335
InfoSeek CC-VQA unified_eval/infoseek/contexts/ccvqa/context.top3.jsonl 71,335

数据结构

每个 JSONL 行包含以下字段:

  • data_id:标准化的数据标识符
  • question:问题内容
  • portable query-image path:可移植的查询图像路径
  • rendered context:渲染后的上下文
  • context_sections:结构化的上下文章节

此外,相关的清单(Manifests)记录了行数、章节数量分布、文件大小以及 SHA256 摘要。

特殊情况说明

  • InfoSeek OMGM:仅使用其选定 top-1 实体中可用的章节,不会用其他实体填充短文。因此,有 64,687 行包含三个章节,3,410 行包含两个章节,3,238 行包含一个章节。
  • CC-VQA (InfoSeek):有 1 行包含两个可用章节,71,334 行包含三个章节。

查询图像获取

查询图像单独分发在 Kyle-han/kivqa-baseline 数据集中:

  • E-VQAvalidation/e-vqa/images/evqa_inference_images.tar
  • InfoSeekvalidation/infoseek/images/oven_val.tar

附加文档

Fresh-server vLLM 命令记录在私有仓库 hws2002/kivqa-baselinesbaselines/unified_eval/docs/ANSWER_ONLY_SERVER.md 文件中。

搜集汇总
数据集介绍
kivqa-baseline-3contexts 数据集图片
构建方式
该数据集源于视觉问答(VQA)领域对多模态知识检索与推理的深入研究,旨在为统一知识库的E-VQA和InfoSeek基准提供标准化的答案上下文。构建过程精心整合了四种前沿基线模型(EchoSight、IBA、OMGM、CC-VQA)的推理结果,每个模型的上下文文件均以JSONL格式存储,包含规范的数据标识、问题文本、便携式图像路径、渲染后的上下文内容及结构化的上下文分段。通过严格的清单记录,数据集确保了行数、分段分布、文件大小及SHA256摘要的透明可溯源性。
特点
此数据集的显著特点在于其结构化的上下文表示与高度的兼容性。所有数据行均包含规范化的数据ID与结构化分段,便于下游任务的直接调用。尤其值得关注的是,InfoSeek OMGM变体根据实体可用性动态调整上下文分段数,展现出自适应分组策略。同时,该数据集提供了详细的清单文件,记录分段统计与文件校验信息,确保数据完整性与复现性。其多基线覆盖设计,使得研究者能够在同一数据基础上公平比较不同VQA模型的性能表现。
使用方法
在使用该数据集时,研究者需首先从关联仓库获取对应的查询图像,并依据上下文文件中的便携式路径进行关联。数据集设计用于离线评估与模型对比,可通过加载JSONL文件提取问题与上下文部分,结合外部视觉编码器进行端到端的推理。对于需要实时服务的应用场景,README中提供了基于vLLM的应答专用服务器部署文档,有助于快速搭建集成环境。此外,该数据集可作为统一知识库VQA基准的参考输出,用于验证并提升多模态检索系统的鲁棒性。
背景与挑战
背景概述
视觉问答(VQA)作为多模态领域的前沿方向,旨在让机器理解图像内容并回答相关自然语言问题。传统VQA方法多依赖图像中显式信息,难以处理需要外部知识的问题。为弥合这一鸿沟,知识增强型视觉问答(KI-VQA)应运而生,通过整合结构化知识库提升模型推理能力。在此背景下,本数据集由相关研究团队创建,聚焦于多源知识上下文对VQA模型的影响,系统性地比较了EchoSight、IBA、OMGM和CC-VQA等主流基线在E-VQA和InfoSeek两个基准上的表现。数据集提供了统一的冻结答案上下文,确保评估的公平性,共涵盖约23万条问答对,成为验证知识增强VQA模型鲁棒性的重要资源。其发布推动了该领域从单模型评估向多基线统一比较的转变,对后续研究具有深远影响。
当前挑战
构建过程中面临的关键挑战包括:一是知识上下文获取的异构性,不同基线模型(如基于检索或生成)产出上下文的格式与覆盖范围不一致,需设计统一的上下文表示以确保可比性;二是长尾知识处理的复杂性,InfoSeek中大量样本涉及稀有实体,OMGM等模型因仅选取单一实体导致部分条目上下文不完整(如三节占比仅90.6%),需权衡信息完整性与噪声控制;三是数据规模与质量平衡,71,335行InfoSeek样本的上下文生成需高吞吐计算,且需通过SHA256校验保证数据完整性;四是跨数据集迁移的适应性,E-VQA与InfoSeek在问题风格和知识需求上的差异,要求上下文既通用又具针对性,这对上下文构建策略提出严苛要求。
常用场景
经典使用场景
KI-VQA Frozen Answer Contexts数据集作为知识型视觉问答(Knowledge-based Visual Question Answering, K-VQA)领域内用于统一评估与对比的关键资源,其经典使用场景聚焦于多模态模型的知识检索与答案生成能力的标准化评测。该数据集精心固化了来自E-VQA与InfoSeek两大基准的查询实例,并为每种实例提供了来自EchoSight、IBA、OMGM及CC-VQA四种典型基线系统的答案上下文(top-3),旨在构建一个公平、可复现的对比环境。研究者可依托此数据集的‘冻结上下文’特性,在恒定信息条件下,精确衡量不同模型在外部知识辅助下的视觉推理与开放式问答性能,从而避免因上下文检索差异导致的评估偏差。其JSONL行结构包含规范化data_id、问题、图像路径及结构化上下文段,极大便利了实验数据的加载与处理,成为该领域标准化的测试平台。
实际应用
在实际应用中,该数据集堪称多模态人工智能系统研发的‘质量标尺’。缘于其全面覆盖了E-VQA与InfoSeek的广泛真实世界图像-问题对,可用于工业级VQA产品(如智能助手、图像搜索引擎、无障碍辅助工具)的回归测试与基准验证。开发团队能够利用其中分发的独立图像压缩包和详尽上下文清单,快速在自身推理服务器(如vLLM)上部署统一评估流程,从而持续监控模型在知识问答情景下的精度与稳定性。尤为重要的是,其针对不同上下文数量的分类统计(如三节、两节、一节)为系统设计者提供了调优线索——例如,当上下文稀疏时模型表现如何衰减——进而指导知识库索引策略与答案置信度校准,直接赋能产品迭代中的工程决策。
衍生相关工作
该数据集源自KI-VQA项目的统一评估框架,已然催生了多个方向的后续工作。首先,它作为基准平台,直接支撑了EchoSight、IBA、OMGM与CC-VQA等原创性算法论文的实证对比,其中每项工作均提出了独特的上下文建模思想——从密集检索到实体中心编码——这些方法在公开评测中得以横向验证。更进一步,数据集中‘冻结上下文’的设定启发了探索上下文鲁棒性的研究工作,如分析段落数目变异(64,687行三节、3,410行两节、3,238行一节)对模型泛化的影响,进而衍生出针对不完整知识输入的增强策略。此外,其结构化的context_sections和JSONL格式被后续数据集建设者奉为规范模板,推动了统一评测语料(如InfoSeek后续版本)的标准化进程,成为K-VQA研究社区中承前启后的关键枢纽。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务