ibm-research/WikiVQABench
收藏资源简介:
WikiVQABench是一个基于知识的视觉问答(VQA)基准数据集,通过系统地结合Wikipedia图像、相关文章标题和Wikidata的结构化知识构建而成。使用大型语言模型(LLMs)生成候选的多选题图像-问题-答案集,并经过人工审核以确保事实正确性、视觉-文本一致性以及每个问题需要外部知识来解答。数据集包含344个例子,主要用于评估知识感知的视觉语言模型。每个基准例子包括base64编码的图像、自然语言问题、正确答案和三个干扰答案。
WikiVQABench is a human-curated knowledge-grounded VQA benchmark constructed by systematically combining Wikipedia images, their associated article captions, and structured knowledge from Wikidata. We used large language models (LLMs) to generate candidate multiple-choice image-question-answer sets which were subsequently reviewed and curated by human annotators to ensure factual correctness, visual-text consistency, and that each question requires external knowledge in addition to visual evidence for correct resolution. WikiVQABench comprises a substantial collection of Wikipedia images with curated multiple-choice questions designed to benchmark knowledge-aware vision-language models.




