VARGPT_datasets
收藏资源简介:
VARGPT数据集用于训练VARGPT模型,支持多模态理解和生成任务,包括图像描述、视觉问答(VQA)、文本到图像生成等。
The VARGPT Dataset is utilized for training the VARGPT model, supporting multimodal understanding and generation tasks including image captioning, visual question answering (VQA), and text-to-image generation.
VARGPT 数据集概述
数据集简介
VARGPT 是一个用于视觉自回归多模态大语言模型的数据集,支持图像、视频和文本的统一生成与理解。该数据集由北京大学的研究团队开发,旨在通过多模态数据的联合训练,提升模型在图像描述、视觉问答(VQA)、文本到图像生成等任务中的表现。
数据集发布信息
- 发布日期:2025年1月22日
- 数据集版本:7B+2B
- 数据集地址:VARGPT_datasets
数据集结构
VARGPT 数据集分为三个阶段进行训练数据的准备:
-
第一阶段(stage1-pt):
- 包含1.28M的预训练指令微调数据集,用于VARGPT的初步训练。
-
第二阶段(stage2-sft):
llava_v1_5_mix665k:基于LLaVA-1.5的训练数据。llava_onevision_508k:从LLaVA-onevision Dataset中采样。ImageNet-Instruct-5k:从第三阶段的ImageNet-Instruct-130k数据集中采样。
-
第三阶段(stage3-sft):
ImageNet-Instruct-130kImageNet-Instruct-1270k
图像数据下载与处理
VARGPT 数据集使用了多个公开的图像数据集,包括:
- ImageNet:ImageNet
- COCO:train2017
- GQA:images
- OCR-VQA:images
- TextVQA:train_val_images
- VisualGenome:part1, part2
- LLaVA-Onevision Dataset:LLaVA-Onevision Dataset
数据集使用
- 模型推理代码:提供了多模态理解和文本到图像生成的推理代码。
- 性能评估:使用lmms-eval工具进行模型性能评估。
引用
如需引用该数据集,请使用以下格式: bibtex @misc{zhuang2025vargptunifiedunderstandinggeneration, title={VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model}, author={Xianwei Zhuang and Yuxin Xie and Yufan Deng and Liming Liang and Jinghan Ru and Yuguo Yin and Yuexian Zou}, year={2025}, eprint={2501.12327}, archivePrefix={arXiv}, primaryClass={cs.CV}, url={https://arxiv.org/abs/2501.12327}, }
致谢
VARGPT 数据集基于多个开源项目,包括LLaVA-1.5、VAR、LLaVA-NeXT等。感谢所有作者的工作。




