遇见数据集

MMOOC

收藏
github2026-07-31 更新2026-08-01 收录
数据链接:
官方服务:

资源简介:

MMOOC是一个综合基准,用于评估多模态大语言模型中的鲁棒回答和适当拒绝,包含超过41,000个图像-问题对,涵盖3种问题格式、8种上下文偏移类型、6种视觉场景和18个代表性多模态大模型。

创建时间:
2026-07-29
原始信息汇总

MMOOC 基准数据集概述

MMOOC 是一个用于评估多模态大语言模型(MLLMs)在“上下文偏离”场景下能力综合表现的基准数据集,核心目标在于同时衡量模型的两个互补能力:对真正不可回答的上下文外(Out-of-Context, OOC) 问题的适当拒绝能力,以及对虽受误导但核心视觉问题仍可回答的上下文内偏移(Shifted In-Context, Shifted IC) 问题的稳健回答能力。

数据集规模与构成

  • 总样本量:包含超过 41,000 个图像-问题对(具体为 41,883 个)。
  • 数据来源
    • Out-of-Context 样本:20,664 个
    • Shifted In-Context 样本:12,299 个
    • 自动洗牌(Auto Shuffle)样本:8,920 个
  • 问题格式:涵盖三种格式,即“是/否”判断题、多项选择题和开放式 VQA。
  • 上下文偏移类型:包含 8 种细分类型,其中 5 种为 OOC 类别,3 种为 Shifted IC 类别。
  • 视觉场景:覆盖 6 种,包括粗细粒度感知、空间与物理理解、逻辑与符号推理等。
  • 评估模型:共评估了 18 个代表性 MLLMs,包括 13 个开源模型(如 Qwen3-VL 系列、InternVL3 系列、LLaVA-1.5 等)和 5 个专有模型(如 GPT-4o、o1、o3、Gemini-3.1-Pro、Claude-Opus-4.6)。

基准分类体系

数据集首先根据是否可依据视觉证据和稳定常识回答来判断样本,随后根据上下文偏移的主要来源对样本进行细粒度分类。

Out-of-Context (OOC) 类别:

类别名称 缩写 描述
多模态歧义 MA 图像不清晰或不完整,或文本查询有歧义。
视觉错误前提 VFP 问题假设了图像中不支持的物体、属性、动作或关系。
不确定的空间与物理背景 USPC 图像缺乏足够的空间、视角、深度、支撑、运动或物理动力学证据。
不清晰的逻辑与符号 ULS 相关的符号、标签、规则或中间逻辑线索缺失或不可靠。
缺失知识与背景 MKB 问题需要输入中不可用的身份、位置、时间、事件、文化、历史等背景信息。

Shifted In-Context (Shifted IC) 类别:

类别名称 缩写 预期行为
误导性前提 MP 忽略或纠正不支持的前提,并回答有根据的核心问题。
部分可回答性 PA 回答受支持的部分,并识别不受支持的部分,而非拒绝整个请求。
图像-问题不匹配 IQM 识别全局不匹配,同时恢复图像中仍可见的目标事实。

数据构建与验证

  • 数据生成:采用三种互补的生成管道,包括使用多个 MLLMs(如 Qwen3.5-122B-A10B、GPT-4o、o1)进行生成、人工设计问题,以及从 MME、MMStar、OK-VQA 等数据集通过自动洗牌方式派生样本。
  • 数据过滤与验证:生成的样本由 GPT-4o、o1 和 o3 三个模型独立评估,仅当三者对其可回答性判断一致时才保留。保留的样本再经过人工审核,以验证可回答性标签、参考答案、解释与类别的合理性,以及问题的清晰度与自然度。

评估方法

  • Shifted In-Context 评估:报告 准确率(模型是否提供正确答案)和 答案合理性(回答是否正确、相关且与证据一致),总体得分为二者的平均值。
  • Out-of-Context 评估:报告 拒绝率(模型是否正确拒绝不支持的问题)和 拒绝合理性(拒绝是否准确识别了缺失信息并提供连贯且基于证据的解释),总体得分为二者的平均值。
  • 多裁判评估:采用不参与数据生成、过滤或评估模型集的多独立裁判模型来评估回答合理性,并在 2,000 个采样回答上进行了人工评估以验证自动评估协议。

主要发现

  • 当前 MLLMs 在平衡稳健回答与适当拒绝方面仍有困难。
  • OOC 性能在不同问题格式和上下文偏移类型间差异显著。
  • “不确定的空间与物理背景”和“不清晰的逻辑与符号”类问题尤其具有挑战性。
  • 更大的模型规模或更强的通用能力并不总是意味着更好的 OOC 鲁棒性。
  • Shifted IC 问题通常比 OOC 问题容易,但“部分可回答性”类别在开放式 VQA 中仍然较难。
  • 专有模型并不普遍优于开源模型。
  • 监督微调能改善拒绝行为,但更强的拒绝对齐可能会降低通用多模态任务的性能。
  • 显式的拒绝提示可能导致过度拒绝,而思维链提示能在回答与拒绝之间取得更好的平衡。

数据集资源与说明

  • 数据集、评估代码、排行榜等资源将通过 Hugging Face、GitHub 等平台发布(部分链接为占位符)。
  • 计划发布的内容包括基准标注、评估脚本、参考答案与解释,以及模型预测文件。
  • 数据集中包含的图片和问答内容来自多个来源,使用者需遵守原始数据集和图片来源的许可与条款。如发现侵权内容,可联系作者或通过 GitHub issue 反馈,经核实后会审查并移除相关样本。
  • 当前版本仅涉及图像-文本交互,扩展至视频、音频和具身环境是未来工作。
搜集汇总
数据集介绍
MMOOC 数据集图片
构建方式
MMOOC数据集的构建融合了多种互补的生成流程,以丰富视觉内容与问题表述的多样性。其数据来源涵盖三大路径:其一,利用Qwen3.5-122B-A10B、GPT-4o及o1等多模态大模型生成基于图像的描述、上下文偏移问题及参考答案;其二,由人类标注者设计贴近真实交互情境的自然且具有挑战性的问题;其三,通过自动洗牌策略,从MME、MMStar和OK-VQA等现有数据集中引入不匹配或信息不足的图像-问题对,保留原始人类编写内容。所有生成样本均经过GPT-4o、o1和o3的独立评估,仅当三者对可回答性判断一致时予以保留,随后进行人工审核,验证可回答性标签、参考答案、解释与类别的一致性以及问题的清晰度和自然性,剔除无效样本并修正细微错误。
特点
MMOOC以其全面性和精细分类著称,包含超过41K图像-问题对,覆盖三种问题格式(是非题、选择题、开放式VQA)、八种上下文偏移类型(五种上下文外类别与三种上下文内偏移类别)以及六种视觉场景,从粗粒度感知到逻辑符号推理。区别于现有仅聚焦不可回答问题的基准,MMOOC同时评估模型的恰当拒绝能力和鲁棒回答能力,特别强调在误导性前提或全局不匹配下仍能基于视觉证据作答。此外,基准采用多裁判模型评估回答与拒绝的合理性,并通过2000个样本的人工评估验证自动化方案,确保评估的可靠性和中立性。
使用方法
使用者可通过Hugging Face平台获取MMOOC数据集及配套评估代码。评估流程针对可回答的上下文内偏移样本与不可回答的上下文外样本分别进行:对于前者,计算准确率和回答合理性,综合为上下文内得分;对于后者,计算拒绝率和拒绝合理性,综合为上下文外得分。回答与拒绝合理性由未参与数据生成的独立裁判模型评估,并辅以人工验证。数据集支持对18种代表性多模态大模型进行评测,包括开源模型(如Qwen3-VL系列、InternVL3)与闭源模型(如GPT-4o、Claude-Opus-4.6)。用户可运行评估脚本获取模型预测、排行榜结果,并利用提供的参考答案和解释进行深入分析。
背景与挑战
背景概述
随着多模态大语言模型(MLLMs)在视觉-语言任务中取得显著进展,其在实际交互中对视觉信息不足问题的处理能力日益受到关注。为系统评估模型在上下文偏移情境下的鲁棒作答与恰当拒答能力,香港理工大学视觉计算实验室的朱文杰等人于2026年构建了MMOOC基准,涵盖超过4.1万对图像-问题样本,涉及三种问题格式、八种上下文偏移类型及六种视觉场景,并评估了18个代表性MLLMs。该基准弥补了现有拒答导向基准的不足,为多模态模型的可靠性研究提供了重要参考,推动了该领域对模型认知边界与安全交互的深入探索。
当前挑战
MMOOC所应对的领域挑战在于模型需在视觉证据不足时准确拒答,同时在存在误导性上下文时维持正确作答,这要求模型具备精细的判别与推理能力。基准构建亦面临多重挑战:多源生成(如GPT-4o等)需确保问题自然多样,经由三重模型一致性过滤及人工复核以保证标注质量;不同上下文偏移类型(如模糊多模态、视觉虚假前提等)的界定与分类需严谨;评估协议需权衡拒答率与作答理性,且需避免过度拒答损害可用性。实验显示,多数模型难以平衡两者,尤其在空间物理与逻辑符号情境中表现欠佳,且规模增大或通用能力增强并未显著提升上下文外鲁棒性,突显了该任务的复杂性与挑战性。
常用场景
经典使用场景
MMOOC基准数据集为多模态大语言模型在视觉问答、图像描述及视觉推理等核心任务中的鲁棒性评估提供了标准化的测试平台。其精巧设计的逾四万一千条图文对,涵盖三种问题格式、六类视觉场景,能够细致刻画模型在面对上下文偏移时的应答与拒答能力,成为研究者衡量模型可靠性的权威标尺。
衍生相关工作
围绕MMOOC,学界已衍生出多项具有深远影响的研究工作,涵盖针对上下文外鲁棒性的微调策略、基于思维链的拒答决策机制,以及多裁判模型的自动评估协议等。这些工作进一步深化了对多模态模型内在认知边界的理解,推动了从‘盲目作答’向‘知性拒答’的行为范式转变,并启发了后续在视频、音频及具身智能等新模态场景下的扩展性研究。
数据集最近研究
最新研究方向
MMOOC基准的提出标志着多模态大语言模型(MLLMs)评估范式的关键转向,聚焦于模型在视觉证据不足或误导性上下文下的鲁棒应答与适度拒答能力。该基准涵盖41,883个图像-问题对,系统划分了五个出上下文(OOC)类别与三个移入上下文(Shifted IC)类别,并集成18种代表性MLLMs进行多维度评估。前沿研究焦点在于平衡模型的可信度与可用性,防止幻觉同时避免过度拒答。实验揭示,现有模型在处理空间物理与逻辑符号等复杂上下文的拒答合理性上仍显薄弱,且模型规模与鲁棒性并非简单正相关。此外,监督微调可改善拒答行为,但可能牺牲通用多模态性能,而链式思考提示在应答与拒答间取得更优平衡。MMOOC为构建更安全、可依赖的多模态交互系统提供了新的评测标尺,推动该领域向高鲁棒性与高实用性方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务