登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
GQA VQA Subset
GQA VQA Subset
收藏
kaggle
2026-03-21 更新
2026-05-09 收录
视觉问答
图像理解推理
数据链接:
https://www.kaggle.com/datasets/minhngcng3/gqa-vqa-subset
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
GQA questions (train/val/test) aligned with a 30k image subset.
与3万张图像子集对齐的GQA问题集(训练集、验证集及测试集)
应用场景:
创建时间:
2026-03-20
相关数据集
GQA-Scene-Graph
视觉问答
目标检测
GQA-35k数据集是一个包含35000个样本的大规模视觉问答数据集,由FiftyOne平台提供。该数据集主要用于目标检测任务,每个图像都附有详细的场景图注释,描述图像中的对象、属性和关系。场景图基于Visual Genome的清洁版本,每个图像的场景图以字典形式提供,包含图像元数据、对象字典(每个对象ID映射到其名称、边界框坐标、属性和关系)以及关系(以三元组形式表示谓词和目标对象ID)。数据集
Hugging Face
2024-07-11 更新
177
0
ranjaykrishna/visual_genome
图像理解
视觉问答
Visual Genome是一个数据集和知识库,旨在将结构化的图像概念与语言连接起来。它包含108,077张图像,5.4百万区域描述,1.7百万视觉问答,3.8百万对象实例,2.8百万属性和2.3百万关系。该数据集主要用于图像到文本、对象检测和视觉问答等任务,所有注释均使用英语。
Hugging Face
2023-06-29 更新
47
0
Nano1337/CLOVE-scores-negative-VQAnotCLIP
视觉问答
图像文本匹配
该数据集包含100个训练样本,每个样本包含uid、image、caption、CLIPscore、VQAscore、CLIPscore_percentile、VQAscore_percentile和percentile_difference等特征。其中,uid是字符串类型,image是图像类型,caption是字符串类型,CLIPscore、VQAscore、CLIPscore_percentil
Hugging Face
2024-06-16 更新
20
0
cjfcsjt/AITW_Single
Android控制
视觉问答
--- dataset_info: - config_name: unseen_subject features: - name: ep_id dtype: string - name: step_id dtype: int64 - name: android_api_level dtype: int64 - name: current_activity
Hugging Face
2024-04-24 更新
51
0
5CD-AI/Vietnamese-lmms-lab-LLaVA-Video-178K-gg-translated
视觉问答
音视频文本转换
该数据集是一个翻译后的数据集,包含178,509个caption条目、960,791个开放式问答条目和196,198个多项选择问答条目。数据集的视频来源自lmms-lab/LLaVA-Video-178K仓库。数据集的任务类别包括视觉问答和视频文本到文本转换,语言为英语和越南语,标签为视频和文本,大小类别为1M到10M之间。
Hugging Face
2024-10-22 更新
25
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广