登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Performance comparison results on VQA 2.0 dataset.
Performance comparison results on VQA 2.0 dataset.
收藏
Figshare
2022-11-28 更新
2026-04-28 收录
视觉问答
多模态理解
数据链接:
https://figshare.com/articles/dataset/Performance_comparison_results_on_VQA_2_0_dataset_/21634624
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Performance comparison results on VQA 2.0 dataset.
应用场景:
创建时间:
2022-11-28
相关数据集
GoodBaiBai88/M3D-VQA
医学3D成像
视觉问答
M3D-VQA是一个大规模的3D医学多模态视觉问答数据集,包含510K数据。该数据集通过公开的大型语言模型(LLMs)分析现有诊断报告生成VQA数据,并经过专家和LLMs的验证,确保数据质量。数据集支持开放和封闭式视觉问答任务,数据格式为CSV文件,分为训练集、验证集、测试集和小测试集。图像数据基于M3D-Cap数据集,需要单独下载和配置。
Hugging Face
2024-04-25 更新
73
0
Multimodal-Fatima/OK-VQA_test_embeddings
视觉问答
机器学习
--- dataset_info: features: - name: image dtype: image - name: id dtype: int64 - name: vision_embeddings sequence: float32 splits: - name: openai_clip_vit_large_patch14 num
Hugging Face
2023-03-20 更新
14
0
nace-ai/billing_dataset_rl_v1
文档智能
视觉问答
该数据集包含PDF路径、图像、问题、输出和叠加图像等特征,数据类型分别为字符串、图像、字符串、字符串和图像。数据集包含一个名为train的分割,共有758个示例,占用405756304字节。该数据集适用于涉及PDF、图像和文本问题及输出的多模态任务。
Hugging Face
2026-01-16 更新
10
0
ChiQA
图问答
多模态理解
ChiQA是一个大规模基于图像的现实世界问答数据集,用于多模态理解。该数据集包含真实世界的问题,这些问题是开放域用户查询,发送到搜索引擎。ChiQA的图像也是从搜索引擎收集的真实世界图像,这些图像与问题相关,但不一定能回答问题。数据集通过两阶段主动学习过程进行数据众包,使得数据更具挑战性,并内在地消除对某些属性或语言模式的偏见。
github
2024-05-13 更新
17
0
open-social-world/EgoNormia
社会规范认知
视觉问答
EgoNormia是一个具有挑战性的问答基准测试,用于测试VLM模型在上下文中推理社会规范的能力。该数据集包含来自Ego4D的1853个基于物理的egocentric交互视频片段和对应的每个视频片段的五个选项多项选择题任务。EgoNormia涵盖了100个不同的场景,跨越了广泛的活动、文化和互动。与其它基于视觉的时空、预测或因果推理基准测试不同,EgoNormia评估模型在社交规范下应该做什么的推
Hugging Face
2025-06-11 更新
13
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广