登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Cognition performance comparison on MME benchmark.
Cognition performance comparison on MME benchmark.
收藏
NIAID Data Ecosystem
2026-05-02 收录
多模态模型评估
认知性能比较
数据链接:
https://figshare.com/articles/dataset/Cognition_performance_comparison_on_MME_benchmark_/29884275
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Cognition performance comparison on MME benchmark.
应用场景:
创建时间:
2025-08-11
相关数据集
VideoHallu
音视频异常检测
多模态模型评估
VideoHallu是一个基准测试集,由流行模型如Sora、Veo2、Kling生成的合成视频构建而成,并配有专家制作的问答对示例,这些示例可以轻松通过人类水平的感知和推理解决。该数据集旨在评估多模态大语言模型(MLLMs)在合成视频中检测异常内容的能力。
github
2025-05-06 更新
92
0
TRIG-Bench
多模态模型评估
视觉文本定位
TRIG-Bench是由Adobe Research等机构创建的一个新型任务,专为评估和提升多模态大型语言模型在文档问题回答中的视觉文本定位能力而设计。该数据集包括800个由人工收集的问题回答对,以及来自四个不同数据源的90k个合成训练样本。数据集通过OCR-LLM-人类交互管道构建,旨在为文档相关的视觉问题提供一个标准化的评估框架。
arXiv
2025-04-07 更新
45
0
II-Bench
图像理解
多模态模型评估
# II-Bench [**🌐 Homepage**](https://ii-bench.github.io/) | [**🤗 Paper**](https://huggingface.co/papers/2406.05862) | [**📖 arXiv**](https://arxiv.org/abs/2406.05862) | [**🤗 Dataset**](https://hug
魔搭社区
2026-05-27 更新
35
0
MOAT
多模态模型评估
视觉语言
MOAT(Multimodal model Of All Trades)是一个用于评估大型多模态模型(LMMs)的挑战性基准测试数据集。它包含视觉语言任务,要求LMM整合多种视觉语言能力,并参与类似人类的通用视觉问题解决。MOAT的许多任务还关注LMMs在复杂文本和视觉指令上的基础能力,这对于LMMs在野外应用至关重要。
github
2025-03-14 更新
48
0
tsinghua-ee/AVUTBenchmark
视频理解
多模态模型评估
音频中心视频理解基准(AVUT)数据集旨在评估多模态大型语言模型(LLM)对视频的理解能力,特别关注音频信息。该数据集通过使用答案排列过滤机制来解决其他基准中存在的文本捷径问题。数据集包括两个主要的注释文件:一个由人工标注者精心创建,另一个由Gemini模型自动生成。
Hugging Face
2025-09-28 更新
35
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广