MM-Hallu/Common-O-Bench
收藏官方服务:
资源简介:
用于评估视觉语言模型(VLMs)中跨场景推理幻觉的基准数据集。包含10,426个问题对,每个问题对基于两个图像询问“有什么共同点?”,旨在测试模型在跨图像场景下的推理能力和避免幻觉现象。
Benchmark for evaluating cross-scene reasoning hallucinations in VLMs. 10,426 question pairs asking whats in common? across two images.
提供机构:
MM-Hallu


