遇见数据集

kivqa-results

收藏
Hugging Face2026-08-14 更新2026-08-15 收录
官方服务:

资源简介:

KIVQA 检索与重排序结果数据集包含了 E-VQA 和 InfoSeek 两个子数据集的固定权重密集事实候选及后续重排序输出。E-VQA 子集包含 5,750 个问题,其中 4,040 个经过验证的问题由 BEM 候选扩展后经 Qwen3-14B 验证生成,重排序器使用 Qwen3-VL-Reranker-8B。InfoSeek 子集有 70,695 个查询行,其中 66,785 个符合严格召回条件,仅发布了最终密集 top-20 候选。数据集还包含权重搜索相关文件,最终融合权重为查询和文档的加权组合。检索是在包含 1,648,876 个事实的统一知识库上进行的。评估指标包括事实召回率和实体召回率。

The KIVQA retrieval and re-ranking results dataset contains fixed-weight dense fact candidates and subsequent re-ranking outputs for two sub-datasets: E-VQA and InfoSeek. The E-VQA subset includes 5,750 questions, of which 4,040 verified questions are generated by BEM candidate expansion followed by verification with Qwen3-14B, and the re-ranker uses Qwen3-VL-Reranker-8B. The InfoSeek subset has 70,695 query rows, of which 66,785 meet the strict recall condition, and only the final dense top-20 candidates are released. The dataset also includes weight search related files, with the final fusion weights being a weighted combination of queries and documents. Retrieval is performed on a unified knowledge base containing 1,648,876 facts. Evaluation metrics include fact recall and entity recall.

创建时间:
2026-08-13
原始信息汇总

KIVQA 检索与重排序结果数据集

数据集概览

该数据集存储了 E-VQA 和 InfoSeek 两个基准上,固定权重密集事实候选及其重排序输出的结果。数据最终采用统一的稠密融合权重,检索范围覆盖包含 1,648,876 条事实的统一知识库(KB)。

稠密融合权重设置

  • 查询方(Query)0.60 图像 + 0.05 生成S + 0.25 生成P + 0.10 生成O
  • 文档方(Document)0.25 WAL + 0.10 D_S + 0.50 D_P + 0.15 D_O

其中 WAL 指主题维基百科条目的引言部分(去除显式主题标签前缀)。

数据集结构

text evqa/ top20candidates/ # 前20候选结果 rerank/ # 重排序结果 infoseek/ top20candidates/ # 前20候选结果 rerank/ # 重排序结果(待定) others/ weightsearch/ # 权重搜索数据

E-VQA 子集

  • 问题数量:5,750
  • 已验证事实-黄金标准问题:4,040
  • 黄金标准构建:BEM 候选扩展 + Qwen3-14B 验证
  • 重排序模型:Qwen3-VL-Reranker-8B
  • 查询输入:实际图像 + 原始问题
  • 文档输入:纯文本完整 SPO

E-VQA 性能指标

排名方式 Fact R@1 R@3 R@5 R@10 R@20 Entity R@1
Dense base 15.40 23.42 27.43 32.80 39.11 45.01
SPO reranker 29.55 35.57 37.20 38.64 39.11 53.22
Base + SPO RRF 21.21 30.37 33.94 38.64 39.11 50.24

InfoSeek 子集

  • 查询行数:70,695
  • 严格召回合格行数:66,785
  • 重排序状态:待定,目前仅发布最终稠密前20候选

InfoSeek 稠密检索性能

稠密检索 R@1 R@3 R@5 R@10 R@20
严格事实召回 47.71 61.56 66.57 72.54 77.47
去重实体召回 63.95 77.26 81.49 85.99 89.49

权重搜索数据

others/weightsearch/ 包含完整的 969 x 969 InfoSeek 训练集 Recall@1 全景(938,961 个查询/文档权重对)、确定性单纯形网格、最终选定权重、复现脚本及渲染热力图。标记的全局最优点即上文锁定的最终融合设置。

搜集汇总
数据集介绍
kivqa-results 数据集图片
构建方式
该数据集精心构筑了面向视觉知识问答的稠密检索与重排序结果体系,分别针对E-VQA与InfoSeek两大基准存储了固定权重的稠密事实候选及其后续重排输出。在E-VQA部分,采用了BEM候选扩展结合Qwen3-14B验证的方式生成标准答案,并运用Qwen3-VL-Reranker-8B作为重排器。而InfoSeek部分则仅放出最终稠密检索的Top-20候选。数据集内另含权重搜索目录,记录了在InfoSeek训练集上进行的969×969网格搜索全过程,涵盖Recall@1全景、确定性单纯形网格、最终胜出权重及复现脚本,锁定了多维融合权重,实现了查询与文档多源特征的加权融合。
使用方法
研究者可直接利用本数据集中的稠密候选与重排结果进行下游视觉问答任务的评估与对比。对于E-VQA,可加载预生成的重排JSON文件,按目标指标审视模型性能;对于InfoSeek,可在Top-20候选基础上实施自定义重排策略。同时,权重搜索目录中的复现脚本支持重新执行网格搜索以验证最优权重,热力图辅助洞察权重敏感性。各文件夹内附有数据模式说明,便于无缝接入现有知识检索与问答框架。
背景与挑战
背景概述
该数据集由致力于多模态知识检索与视觉问答的研究团队于近期构建,旨在解决图像-文本跨模态事实检索中的信息融合与排序难题。依托InfoSeek与E-VQA两大基准,数据集系统整合了大规模结构化知识库(包含1,648,876条事实三元组),并通过Qwen3-VL系列模型实现查询构建、候选生成与重排序的闭环。其核心研究问题在于:如何通过动态权重融合图像特征、生成式描述与知识实体表征,以提升复杂视觉问题的零样本事实召回能力。数据集发布的检索与重排结果(如E-VQA上SPO重排使Fact R@1提升至29.55%)为多模态知识推理领域提供了关键参照,推动跨模态密集检索与判别式重排技术的前沿探索。
当前挑战
数据集面临的挑战集中于多模态检索的跨域鸿沟与高精标注的构建困难。在领域问题层面,视觉问题中的模糊实体指称、知识库稀疏性及图像—文本语义异质性,导致传统单模态检索难以精确对齐事实三元组;同时,重排序阶段需权衡图像、生成文本与知识本体特征的贡献,权重敏感性显著影响最终召回率。在构建过程中,需应对大规模事实库的噪声过滤、跨数据集(E-VQA与InfoSeek)Query-事实映射的一致性验证,以及重排序器训练中对无标注数据的高依赖——当前InfoSeek重排尚未完成,而E-VQA的Ground Truth仅靠启发式扩展与模型验证,存在标签偏差风险,权重搜索亦需在969×969参数空间内权衡计算效率与全局最优性。
常用场景
经典使用场景
该数据集聚焦于多模态知识图谱问答中的密集检索与重排序任务,适用于图像-文本交叉模态的事实检索场景。其核心设计围绕视觉问答(VQA)与知识感知信息检索的融合,通过为E-VQA和InfoSeek提供固定权重的稠密事实候选及重排输出,支撑研究者构建端到端的检索-重排序流水线。数据集中包含的top-20候选、重排结果及权重搜索空间,使其成为评估稠密向量检索在复杂事实查询中性能的基准,尤其适用于需要联合利用图像与文本信号进行事实推理的研究。
解决学术问题
该数据集解决了多模态知识图谱问答中事实检索精度不足的学术难题。传统方法常陷于视觉特征与文本知识异构对齐的困境,而该数据集通过精细化的权重分配(如查询侧融合图像、生成问题、谓词、宾语的特征;文档侧结合维基百科、描述、谓词、宾语特征),并利用大语言模型验证和重排序,显著提升了事实级召回率。E-VQA上SPO重排使Fact R@1从15.40提升至29.55,证明重排序对粗粒度检索的增益,为视觉问答中的知识密集型推理提供了方法论启示。
实际应用
在实际应用中,该数据集可服务于多模态搜索引擎、智能助手及知识型对话系统。例如,基于用户上传的图片和自然语言查询,系统能从统一的百万级事实库中精准返回相关答案。E-VQA的重排序输出可直接用于提升问答系统的响应准确性;InfoSeek的大规模严格事实召回(R@20达77.47)则支持开放域事实验证。此外,权重搜索空间可引导模型对图像与文本来源进行动态加权,增强对模糊查询的鲁棒性,适用于电商商品信息抽取、医疗影像辅助诊断等需结合视觉与文本知识的场景。
数据集最近研究
最新研究方向
该数据集聚焦于多模态事实检索与重排序的前沿探索,依托E-VQA与InfoSeek基准,创新性地融合视觉与文本特征构建稠密向量检索体系。研究重点在于通过加权融合策略(如图像、生成文本与Wikipedia摘要的协同)优化查询与文档表示,并借助大型视觉-语言模型(如Qwen3-VL)进行细粒度重排序,显著提升事实召回率。该方向呼应了知识密集型视觉问答中证据获取的迫切需求,其发布的高质量候选集与调优权重为跨模态证据推理提供了标准化评测平台,推动可解释、可验证的多模态问答系统发展,对未来AI的可靠知识溯源具有示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务