Vision-Flan/vision-flan
收藏资源简介:
Vision-Flan是一个由人类标注的视觉指令调优数据集,包含200多个多样化的视觉-语言任务,这些任务源自101个开源计算机视觉数据集。每个任务都配备了专家编写的指令和精心设计的输入输出模板。数据集涵盖了图像描述、视觉问答和视觉理解等多种任务。Vision-Flan旨在支持视觉-语言模型的各种研究和应用,推动这两种模态之间的理解和交互的边界。数据集包括1,664,261个实例和187个多样化任务。
Vision-Flan is a human-annotated visual instruction tuning dataset containing over 200 diverse vision-language tasks sourced from 101 open-source computer vision datasets. Each task is paired with expert-written instructions and carefully crafted input-output templates. The dataset encompasses a wide range of tasks such as image captioning, visual question answering (VQA), and visual understanding. Vision-Flan is designed to support various research and application efforts for vision-language models, and advance the boundaries of understanding and interaction between visual and linguistic modalities. The dataset includes 1,664,261 instances and 187 diverse tasks.
数据集概述
数据集名称
- Vision-Flan
数据集描述
- Vision-Flan 是最大的由人工标注的视觉指令调整数据集,包含超过200种多样化的视觉-语言任务,这些任务源自101个开源计算机视觉数据集。
- 每个任务都配有专家撰写的指令和精心设计的输入输出模板。
- 数据集覆盖了广泛的视觉-语言任务,如图像字幕生成、视觉问答和视觉理解。
- 旨在支持视觉-语言模型研究,推动视觉与语言两种模态之间的理解和交互。
数据集内容
- 包含1,664,261个实例,来源于学术数据集。
- 包含187种不同的任务。
数据集结构
- 数据集列包括:
conversations: LIST(DICT)id: STRINGtask_name: STRINGimage: STRING
使用方法
-
使用
datasets库加载数据集: python from datasets import load_dataset dataset = load_dataset("Vision-Flan/vision-flan") dataset.save_to_disk("test.hf") -
运行
unzip.sh脚本解压所有压缩数据。
注意事项
- Vision-Flan 数据集仅供研究使用。
- 使用前请仔细检查原始数据集的许可证。
- 原始数据集的URL和Bibtex可在此页面找到。
- 如需移除任何任务或图像,请联系 Zhiyang Xu 和 Lifu Huang。




