Leopard-Instruct
收藏资源简介:
Leopard-Instruct 是一个大规模指令微调数据集,包含92.5万条实例,其中73.9万条专为文本丰富的多图像场景设计。该数据集已用于训练 Leopard-LLaVA 和 Leopard-Idefics2。
Leopard-Instruct 是一个大规模指令微调数据集,包含92.5万条实例,其中73.9万条专为文本丰富的多图像场景设计。该数据集已用于训练 Leopard-LLaVA 和 Leopard-Idefics2。
Leopard-Instruct 数据集概述
基本信息
- 许可证: Apache 2.0
- 语言: 英语
- 标签:
- multimodal
- instruction-following
- multi-image
- lmm
- vlm
- mllm
- 数据量: 100K<n<1M
数据集配置
- arxiv:
- 分割: train
- 路径: arxiv/*
- chartgemma:
- 分割: train
- 路径: chartgemma/*
- chartqa:
- 分割: train
- 路径: chartqa/*
- dude:
- 分割: train
- 路径: dude/*
- dvqa:
- 分割: train
- 路径: dvqa/*
- figureqa:
- 分割: train
- 路径: figureqa/*
- iconqa:
- 分割: train
- 路径: iconqa/*
- infographics:
- 分割: train
- 路径: infographics/*
- llavar:
- 分割: train
- 路径: llavar/*
- mapqa:
- 分割: train
- 路径: mapqa/*
- mathv360k:
- 分割: train
- 路径: mathv360k/*
- mind2web:
- 分割: train
- 路径: mind2web/*
- monkey:
- 分割: train
- 路径: monkey/*
- mpdocvqa:
- 分割: train
- 路径: mpdocvqa/*
- mplugdocreason:
- 分割: train
- 路径: mplugdocreason/*
- multichartqa:
- 分割: train
- 路径: multi_chartqa/*
- multihiertt:
- 分割: train
- 路径: multihiertt/*
- multitab:
- 分割: train
- 路径: multitab/*
- omniact:
- 分割: train
- 路径: omniact/*
- pew_chart:
- 分割: train
- 路径: pew_chart/*
- rico:
- 分割: train
- 路径: rico/*
- slidesgeneration:
- 分割: train
- 路径: slidesgeneration/*
- slideshare:
- 分割: train
- 路径: slideshare/*
- slidevqa:
- 分割: train
- 路径: slidevqa/*
- docvqa:
- 分割: train
- 路径: spdocvqa/*
- tab_entity:
- 分割: train
- 路径: tab_entity/*
- tabmwp:
- 分割: train
- 路径: tabmwp/*
- tat_dqa:
- 分割: train
- 路径: tat_dqa/*
- website_screenshots:
- 分割: train
- 路径: website_screenshots/*
- webui:
- 分割: train
- 路径: webui/*
- webvision:
- 分割: train
- 路径: webvision/*
数据集概述
- Leopard-Instruct 是一个大规模指令调优数据集,包含925K个实例,其中739K个实例专门设计用于文本丰富的多图像场景。
- 该数据集用于训练 Leopard-LLaVA 和 Leopard-Idefics2 模型。
数据加载
-
加载数据集而不自动下载和处理图像: python import datasets dataset = datasets.load_dataset("wyu1/Leopard-Instruct", "webvision")
-
加载所有子集的图像: python from datasets import get_dataset_config_names, load_dataset config_dataset = {} for config_name in get_dataset_config_names(): config_dataset[config_name] = load_dataset("wyu1/Leopard-Instruct", config_name)
引用
@article{jia2024leopard, title={LEOPARD: A Vision Language Model For Text-Rich Multi-Image Tasks}, author={Jia, Mengzhao and Yu, Wenhao and Ma, Kaixin and Fang, Tianqing and Zhang, Zhihan and Ouyang, Siru and Zhang, Hongming and Jiang, Meng and Yu, Dong}, journal={arXiv preprint arXiv:2410.01744}, year={2024} }




