登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Nano Banana 2.0: The Omni-Subject Dataset
Nano Banana 2.0: The Omni-Subject Dataset
收藏
kaggle
2026-03-22 更新
2026-05-09 收录
多模态AI
跨领域认知建模
数据链接:
https://www.kaggle.com/datasets/ahnuf05/nano-banana-2-0-the-omni-subject-dataset
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
1067 Ways Gemini Sees the World
1067种视角:Gemini大语言模型眼中的世界
应用场景:
创建时间:
2026-03-22
相关数据集
VL-RewardBench
视觉语言模型
多模态AI
VL-RewardBench是由香港大学、华南理工大学、上海交通大学、北京大学、华盛顿大学和艾伦人工智能研究院联合创建的一个综合视觉语言生成奖励模型基准数据集。该数据集包含1250个高质量样本,涵盖了多模态查询、视觉幻觉检测和复杂推理任务。数据集的创建过程结合了AI辅助的样本选择和人工验证,旨在全面评估和挑战现有的视觉语言模型。VL-RewardBench主要应用于多模态AI系统的对齐和评估,旨在
arXiv
2024-11-26 更新
263
0
EgoThink 第一人称视角下视觉问答基准数据集
视觉问答
多模态AI
EgoThink 是由清华大学提出的一个基于第一人称视角的视觉问答基准数据集。该数据集包含 700 张图像,涵盖了 6 个核心能力,细分为 12 个维度。 EgoThink 的图像来源于 Ego4D 第一人称视频数据集的采样图片,为了确保数据的多样性,每个视频最多只采样 2 张图片。
超神经
2024-04-11 更新
31
0
vTikZ
代码定制
多模态AI
vTikZ数据集是一个专门用于评估大型语言模型(LLMs)在代码定制方面能力的基准数据集。该数据集包含100个精心策划的TikZ编辑场景,每个场景都需要对代码进行修改以实现指定的视觉变化。vTikZ数据集由人类创建的TikZ代码变体组成,每个变体都是从一个原始的TikZ代码中衍生出来的,并附有相应的编辑指令。数据集还包括参数化的地面真实情况,以应对多个代码变体可能正确实现给定的视觉修改的问题。此外
arXiv
2025-05-07 更新
16
0
REXTIME
视频时间推理
多模态AI
REXTIME数据集由国立台湾大学开发,是一个专注于视频时间推理的基准,特别强调在不同视频片段间进行因果关系理解的能力。该数据集包含2143个精心策划的测试样本,每个样本都经过人工标注以确保准确性和相关性。数据集的创建过程利用了大型语言模型辅助的数据生成管道,显著减少了人工标注的需求。REXTIME主要应用于评估和提升多模态AI模型在视频时间推理方面的能力,特别是在机器人、医疗和法律政策制定等领域
arXiv
2024-07-02 更新
66
0
Vl-RewardBench
视觉语言
多模态AI
VLRewardBench是一个综合性的基准测试,旨在评估视觉语言生成奖励模型(VL-GenRMs)在视觉感知、幻觉检测和推理任务中的表现。该基准包含1,250个高质量的示例,专门设计用于探测模型的局限性。每个实例包含多模态查询,涵盖三个关键领域:一般多模态查询、视觉幻觉检测任务和多模态知识与数学推理。数据集的结构包括多个字段,如实例ID、多模态提示的文本查询、图像输入、由模型生成的两个候选响应、
Hugging Face
2024-12-08 更新
17
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广