visres_bench
收藏资源简介:
VisRes Bench 是一个多模态视觉推理基准数据集,涵盖29个任务类别和多个难度级别。每个任务提供两种提示风格(通用型和引导型),用于评估视觉语言模型在不同指令特异性下的表现。数据集包含38,956条样本,按不同任务分为多个配置(config),每个配置包含两个分割(generic_prompt和guided_prompt)。数据样本包含id、task、level、prompt_type、images、question和answer等字段,适用于视觉问答、图像到文本生成等视觉语言任务。数据集由TII UAE发布,遵循Apache-2.0许可。
VisRes Bench 数据集概述
基本信息
- 数据集名称: VisRes Bench
- 发布者: TII UAE
- 发布日期: 2025年
- 许可证: Apache-2.0
- 数据规模: 1K<n<10K (共 38,956 行数据)
- 访问地址: https://huggingface.co/datasets/tiiuae/visres_bench
任务与语言
- 任务类别: 视觉问答、图像到文本
- 核心功能: 多模态视觉推理基准测试
- 覆盖范围: 29个任务类别,涵盖多个难度级别
- 语言: 英语
数据集标签
- benchmark
- vision-language
- multimodal
- visual-reasoning
数据集结构
配置与划分
- 每个任务是一个独立的配置。
- 每个配置内包含两个划分:
generic_prompt: 最小化、开放式提示,测试模型在没有提示情况下的推理能力。guided_prompt: 结构化、引导式提示,提供更多上下文和方向。
数据模式
| 列名 | 类型 | 描述 |
|---|---|---|
id |
string |
唯一行标识符 |
task |
string |
原始任务名称 |
level |
string |
难度级别 (例如 L1, L2, L3, L4) |
prompt_type |
string |
generic 或 guided |
images |
List[Image] |
一个或多个输入图像 |
question |
string |
向模型提出的问题 |
answer |
string |
真实答案 |
可用配置与数据量
| 配置名称 | 划分 | 行数 |
|---|---|---|
level_1_global_occlusion_50percent |
generic_prompt |
1,000 |
level_1_global_occlusion_50percent |
guided_prompt |
1,000 |
level_1_global_occlusion_70percent |
generic_prompt |
1,000 |
level_1_global_occlusion_70percent |
guided_prompt |
1,000 |
level_1_global_occlusion_80percent |
generic_prompt |
1,000 |
level_1_global_occlusion_80percent |
guided_prompt |
1,000 |
level_1_edges_eval_6k_location_only_dino_mode_options |
generic_prompt |
1,000 |
level_1_edges_eval_6k_location_only_dino_mode_options |
guided_prompt |
1,000 |
level_1_eval_6k_location_only_random_sampling |
generic_prompt |
1,000 |
level_1_eval_6k_location_only_random_sampling |
guided_prompt |
1,000 |
level_1_eval_6k_brightness_dino_options |
generic_prompt |
1,000 |
level_1_eval_6k_brightness_dino_options |
guided_prompt |
1,000 |
level_1_eval_6k_blur_dino_options |
generic_prompt |
1,000 |
level_1_eval_6k_blur_dino_options |
guided_prompt |
1,000 |
level_1_eval_6k_rotation_direct_dino_options |
generic_prompt |
1,000 |
level_1_eval_6k_rotation_direct_dino_options |
guided_prompt |
1,000 |
level_1_eval_6k_single_rotation_same_options |
generic_prompt |
1,000 |
level_1_eval_6k_single_rotation_same_options |
guided_prompt |
1,000 |
level_1_edges_eval_6k_location_only_random_sampling |
generic_prompt |
1,000 |
level_1_edges_eval_6k_location_only_random_sampling |
guided_prompt |
1,000 |
level_1_eval_6k_location_only_dino_mode_options |
generic_prompt |
1,000 |
level_1_eval_6k_location_only_dino_mode_options |
guided_prompt |
1,000 |
l1_count_only |
generic_prompt |
500 |
l1_count_only |
guided_prompt |
500 |
l1_count_progression_mixed |
generic_prompt |
500 |
l1_count_progression_mixed |
guided_prompt |
500 |
l1_orientation_only |
generic_prompt |
458 |
l1_orientation_only |
guided_prompt |
458 |
l1_count_distribution_2same_1diff |
generic_prompt |
500 |
l1_count_distribution_2same_1diff |
guided_prompt |
500 |
l1_orientation_distribution_2same_1diff |
generic_prompt |
498 |
l1_orientation_distribution_2same_1diff |
guided_prompt |
498 |
l1_color_only |
generic_prompt |
500 |
l1_color_only |
guided_prompt |
500 |
l1_count_operations |
generic_prompt |
500 |
l1_count_operations |
guided_prompt |
500 |
l1_count_minmax |
generic_prompt |
500 |
l1_count_minmax |
guided_prompt |
500 |
l1_orientation_distribution |
generic_prompt |
500 |
l1_orientation_distribution |
guided_prompt |
500 |
l1_color_distribution_2same_1diff |
generic_prompt |
500 |
l1_color_distribution_2same_1diff |
guided_prompt |
500 |
l1_color_distribution |
generic_prompt |
500 |
l1_color_distribution |
guided_prompt |
500 |
l1_count_distribution |
generic_prompt |
500 |
l1_count_distribution |
guided_prompt |
500 |
l4_compositional_spiral_orientation |
generic_prompt |
350 |
l4_compositional_spiral_orientation |
guided_prompt |
350 |
l4_compositional_spiral_object_color |
generic_prompt |
464 |
l4_compositional_spiral_object_color |
guided_prompt |
464 |
l2_coupled_count_color |
generic_prompt |
500 |
l2_coupled_count_color |
guided_prompt |
500 |
l3_independent_color_object_orientation |
generic_prompt |
355 |
l3_independent_color_object_orientation |
guided_prompt |
355 |
l2_coupled_orientation_color |
generic_prompt |
374 |
l2_coupled_orientation_color |
guided_prompt |
374 |
l3_independent_distribution_arithmetic_object |
generic_prompt |
479 |
l3_independent_distribution_arithmetic_object |
guided_prompt |
479 |
加载方式
加载特定任务
python from datasets import load_dataset ds = load_dataset("tiiuae/visres_bench", "l1_count_only") generic = ds["generic_prompt"] guided = ds["guided_prompt"]
直接加载单个划分
python ds = load_dataset("tiiuae/visres_bench", "l1_count_only", split="generic_prompt")
列出所有可用配置
python from datasets import get_dataset_config_names configs = get_dataset_config_names("tiiuae/visres_bench") print(configs)
引用格式
bibtex @dataset{visres_bench, title = {VisRes Bench}, author = {TII UAE}, year = {2025}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/tiiuae/visres_bench} }



