DARE
收藏资源简介:
DARE(多样化的视觉问答与鲁棒性评估)是一个精心创建和策划的多项选择VQA基准。它评估视觉语言模型在五个不同类别上的性能,并包括基于提示、答案选项子集、输出格式和正确答案数量的四种鲁棒性评估。数据集的验证部分包含图像、问题、答案选项和正确答案,而测试部分的正确答案未公开以防止污染。
DARE (Diverse Visual Question Answering and Robustness Evaluation) is a meticulously created and curated multiple-choice VQA benchmark. It evaluates the performance of vision-language models across five distinct categories, and incorporates four robustness assessments based on prompts, answer option subsets, output formats, and the number of correct answers. The validation split of the dataset includes images, questions, answer options, and correct answers, while the correct answers for the test split are withheld to avoid data contamination.
DARE 数据集概述
数据集信息
特征
- id: 字符串类型
- instance_id: 64位整数类型
- question: 字符串类型
- answer: 字符串列表类型
- A: 字符串类型
- B: 字符串类型
- C: 字符串类型
- D: 字符串类型
- category: 字符串类型
- img: 图像类型
配置
- 1_correct:
- validation:
1_correct/validation/0000.parquet - test:
1_correct/test/0000.parquet
- validation:
- 1_correct_var:
- validation:
1_correct_var/validation/0000.parquet - test:
1_correct_var/test/0000.parquet
- validation:
- n_correct:
- validation:
n_correct/validation/0000.parquet - test:
n_correct/test/0000.parquet
- validation:
数据集描述
DARE (Diverse Visual Question Answering with Robustness Evaluation) 是一个精心创建和策划的多项选择视觉问答基准。DARE 评估 VLM 在五个不同类别上的性能,并包括基于以下变体的四个鲁棒性评估:
- 提示
- 答案选项的子集
- 输出格式
- 正确答案的数量
验证集包含图像、问题、答案选项和正确答案。为了防止污染,测试集的正确答案未公开。
数据集加载
使用 Hugging Face 的 datasets 库加载数据集:
python from datasets import load_dataset
加载数据集
subset = "1_correct" # 根据需要更改子集 dataset = load_dataset("cambridgeltl/DARE", subset)




