登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Yang
Yang
收藏
OpenXLab
2026-04-18 收录
多模态模型评估
数据链接:
https://openxlab.org.cn/datasets/oyy2000/MMBench-test-image-style-augmentation
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
It is an augmentation of MMBench Test Dataset
应用场景:
提供机构:
oyy2000
创建时间:
2024-01-30
相关数据集
VideoHallu
音视频异常检测
多模态模型评估
VideoHallu是一个基准测试集,由流行模型如Sora、Veo2、Kling生成的合成视频构建而成,并配有专家制作的问答对示例,这些示例可以轻松通过人类水平的感知和推理解决。该数据集旨在评估多模态大语言模型(MLLMs)在合成视频中检测异常内容的能力。
github
2025-05-06 更新
92
0
MOAT
多模态模型评估
视觉语言
MOAT(Multimodal model Of All Trades)是一个用于评估大型多模态模型(LMMs)的挑战性基准测试数据集。它包含视觉语言任务,要求LMM整合多种视觉语言能力,并参与类似人类的通用视觉问题解决。MOAT的许多任务还关注LMMs在复杂文本和视觉指令上的基础能力,这对于LMMs在野外应用至关重要。
github
2025-03-14 更新
48
0
AV-Odyssey/AV_Odyssey_Bench
多模态模型评估
视听理解测试
AV-Odyssey是一个评估多模态大型语言模型理解音视频信息能力的综合评估基准,包含26个不同任务和4555个融合文本、视觉和音频元素的问题。数据集为全新收集并由人工注释,特点包括全面的音频属性、广泛的领域以及交织的文本、音频和视觉组件。
Hugging Face
2025-01-15 更新
17
0
用于评估多模态大型语言模型的眼科图像数据集
眼科图像分析
多模态模型评估
本研究构建了一个新颖的多模态基准,用于通过眼底照片和光学相干断层扫描(OCT)图像综合评估多模态大型语言模型(MLLMs)的诊断性能。该数据集经过严格的质控和专家标注,包含439张眼底图像和75张OCT图像,旨在解决眼科诊断中的实际问题,为多模态模型的评估提供了新的视角。
arXiv
2025-03-10 更新
62
0
tsinghua-ee/AVUTBenchmark
视频理解
多模态模型评估
音频中心视频理解基准(AVUT)数据集旨在评估多模态大型语言模型(LLM)对视频的理解能力,特别关注音频信息。该数据集通过使用答案排列过滤机制来解决其他基准中存在的文本捷径问题。数据集包括两个主要的注释文件:一个由人工标注者精心创建,另一个由Gemini模型自动生成。
Hugging Face
2025-09-28 更新
35
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广