相关数据集
5CD-AI/Vietnamese-lmms-lab-LLaVA-Video-178K-gg-translated
该数据集是一个翻译后的数据集,包含178,509个caption条目、960,791个开放式问答条目和196,198个多项选择问答条目。数据集的视频来源自lmms-lab/LLaVA-Video-178K仓库。数据集的任务类别包括视觉问答和视频文本到文本转换,语言为英语和越南语,标签为视频和文本,大小类别为1M到10M之间。
Hugging Face2024-10-22 更新250
mobile-vlm-data
这是一个包含多个配置的数据集集合,每个配置都包含图像和与其相关的对话信息。对话信息由问题与响应组成,适用于视觉问答等任务。
Hugging Face2025-11-25 更新170
salma-remyx/vqasynth_sample_spatial_new
该数据集包含图像和消息两个主要特征。图像特征的数据类型为图像,消息特征是一个列表,包含内容和角色两个子特征。内容子特征进一步包含索引、文本和类型三个子特征,数据类型分别为整数、字符串和字符串。角色子特征的数据类型为字符串。数据集包含一个名为训练的分割,包含10个示例,总大小为1566310字节。数据集的总下载大小为1391554字节。数据集标签包括vqasynth和remyx。
Hugging Face2024-12-04 更新100
kihoonlee/RLAIF-V-1k
该数据集包含图像、问题、答案和来源四个特征。其中,答案是字符串序列。数据集包含一个训练分割,共有1000个样本,总大小为163423360.0字节。
Hugging Face2024-06-26 更新190
ChuGyouk/PubMedVision-EnKo
PubMedVision是一个大规模的医学视觉问答数据集。该数据集从PubMed中提取高质量的图像-文本对,并使用GPT-4V进行格式化以提升其质量。PubMedVision显著提高了多模态语言模型在医学领域的多模态能力。数据集包含1,294,062个医学视觉问答实例,分为对齐视觉问答和指令微调视觉问答两部分,每部分各含647,031个数据。
Hugging Face2025-01-20 更新140



