SUGARCREPE
收藏资源简介:
SUGARCREPE是一个用于评估视觉语言模型组合性的新型基准数据集,由华盛顿大学的研究团队开发。该数据集包含7512个示例,每个示例包括一张图片、一个正确的描述文本和一个通过大型语言模型生成的误导性描述文本。SUGARCREPE旨在通过减少现有数据集中的偏见,提高对模型组合性理解的评估准确性。数据集涵盖了多种类型的误导性文本,包括替换、交换和添加等操作,以全面测试模型的理解和推理能力。
SUGARCREPE is a novel benchmark dataset for evaluating the compositionality of vision-language models, developed by a research team from the University of Washington. This dataset contains 7512 examples, each consisting of an image, a correct descriptive text, and a misleading descriptive text generated by a large language model. SUGARCREPE aims to improve the evaluation accuracy of models' compositional understanding by reducing biases in existing datasets. The dataset covers various types of misleading texts, including substitution, swapping, and addition operations, to comprehensively test models' comprehension and reasoning capabilities.

- 1SugarCrepe: Fixing Hackable Benchmarks for Vision-Language Compositionality华盛顿大学 · 2023年



