遇见数据集

ModalityFaultLines-SCEval

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

SCEval(Modality Fault Lines)是一个用于评估全模态(omni-modal)推理鲁棒性的人工验证基准数据集。该数据集通过引入结构破坏(structural corruptions)来测试模型在文本、视觉和音频三种模态同时存在时,能否正确识别并利用可靠的信息。每个破坏样本都与一个干净的基线样本配对,使得可以在相同的底层问题、选项和参考答案上进行干净与破坏后的对比。数据集包含三个子集:baseline(273 个干净的三模态问题)、single(29,144 个单模态破坏样本,覆盖 14 种破坏操作和 4 个严重度级别)和 combined(17,875 个双模态/三模态联合破坏样本)。每条记录包含问题文本、选项(A0-A4)、正确答案键、破坏元数据(如破坏模态、操作类型、严重度、变体)以及媒体文件的直接 URL。媒体文件来源于 Social-IQ、OmniBench 和 VALOR 三个基准数据集,覆盖视频和图像。该数据集适用于多模态问答、鲁棒性评估、结构破坏分析等任务。

SCEval (Modality Fault Lines) is a human-validated benchmark dataset for evaluating the robustness of omni-modal reasoning. It introduces structural corruptions to test whether models can correctly identify and utilize reliable information when text, vision, and audio modalities are present simultaneously. Each corrupted sample is paired with a clean baseline sample, allowing comparison between clean and corrupted versions on the same underlying question, options, and reference answer. The dataset includes three subsets: baseline (273 clean tri-modal questions), single (29,144 unimodal corruption samples covering 14 corruption operations and 4 severity levels), and combined (17,875 bimodal/trimodal joint corruption samples). Each record contains question text, options (A0-A4), correct answer key, corruption metadata (e.g., corrupted modality, operation type, severity, variant), and direct URLs to media files. Media files are sourced from three benchmark datasets: Social-IQ, OmniBench, and VALOR, covering videos and images. The dataset is suitable for tasks such as multimodal question answering, robustness evaluation, and structural corruption analysis.

创建时间:
2026-08-26
原始信息汇总

数据集概述

SCEval — Modality Fault Lines 是一个用于评估全模态(omni-modal)推理鲁棒性的人工验证基准数据集,对应论文 Modality Fault Lines: Structural Corruptions Reveal Fragile Omni-Modal Reasoning(EMNLP 2026 Findings)。其核心设计理念是:在文本、视觉和音频三模态均存在的前提下,对某个模态施加受控的结构性损坏,使该模态内部的证据变得不可靠,从而测试模型的鲁棒性。所有损坏样本均与其干净版本配对,同一底层问题、选项和参考答案可直接进行对比。

数据集构成

数据分割 行数 内容说明
baseline 273 干净的三模态问题,作为所有损坏样本的对照基准。
single 29,144 单模态损坏样本,涵盖14种损坏算子,严重度级别为10/30/50/70。
combined 17,875 双模态与三模态联合损坏样本,包含18种双模态和11种三模态预设条件。

数据文件以 JSONL 格式存储,每行包含一个问题及其完整评估信息,包括问题文本、选项、参考答案、损坏元数据以及媒体文件的直接 URL。媒体目录结构为 <source>/<sample_id>/<modality>/<operator>/<severity>/<variant>/<file>

媒体资源

媒体文件来源于三个现有基准数据集,共273个基础样本:

  • Social_IQ_single_question:视频 + 音频,100个基础样本;
  • omnibench:图像 + 音频,77个基础样本;
  • valor:视频 + 音频,96个基础样本。

完整媒体资源约112 GB,可通过 snapshot_download 按子目录选择性下载。

关键字段说明

字段 含义
row_id, question_id, sample_id 标识符,sample_id 用于关联损坏样本与对应干净样本。
dataset 来源基准(Social_IQ_single_question / omnibench / valor)。
question, original_question 损坏后/损坏前的问题文本(文本通道未损坏时二者相同)。
options, gold_key, gold_answer_raw 答案选项(A0–A3)、正确选项键及其完整文本。
visual_url, audio_url 该行实际展示给模型的媒体文件 URL。
original_visual_url, original_audio_url 同一示例的干净媒体文件 URL。
corrupted_url 被损坏的通道对应的媒体 URL,等于 visual_urlaudio_url
visual_kind 视觉通道类型:videoimage
corruption_modality 被损坏的模态:文本 / 视觉 / 音频。
corruption_group, corruption_type 损坏算子族及具体算子。
severity_base 严重度级别:10、30、50、70。
severity_variant 同一严重度下的多次随机实现标识。
is_baseline 仅在 baseline 分割中为 true
condition_id, condition_label 仅在 combined 分割中出现,标识联合损坏的预设条件。
human_understandable, human_valid, human_must_three_modal 人工验证结果(是/否)。

评估约定

  • 损坏样本必须与其同 sample_id 的基线样本配对评估,因此 baseline 分割应与任何损坏分割同时使用。
  • 对于随机算子,同一 (模型、模态、算子、严重度) 桶内的多个 severity_variant 实现采用最差情况聚合:若任一实现回答错误,该桶计为错误。

许可证与来源

本数据集以 Apache-2.0 许可证发布,损坏媒体基于以下三个现有基准数据集派生,其原始资料仍受原许可证约束:

  • Social-IQ(https://github.com/A2Zadeh/Social-IQ)
  • OmniBench(https://m-a-p.ai/OmniBench/)
  • VALOR(https://github.com/TXH-mercury/VALOR)

使用本数据集时,除引用本工作外,请同时引用上述来源数据集。

引用格式

bibtex @inproceedings{sceval2026, title = {Modality Fault Lines: Structural Corruptions Reveal Fragile Omni-Modal Reasoning}, booktitle = {Findings of the Association for Computational Linguistics: EMNLP 2026}, year = {2026} }

搜集汇总
数据集介绍
ModalityFaultLines-SCEval 数据集图片
构建方式
ModalityFaultLines-SCEval数据集源于对全模态推理鲁棒性的深入探究,通过系统性结构损坏方法构建。其核心设计在于,在保留文本、视觉与音频模态存在性的前提下,对单一或组合模态施加受控的损坏操作,从而制造出证据不可靠的样本。数据集包含273个干净基线样本、29144个单模态损坏样本及17875个多模态联合损坏样本,每个损坏样本均与对应干净样本配对,确保比较的一致性。损坏操作涵盖14种算子,并设置了10、30、50、70四个严重等级,以全面覆盖不同程度的模态退化。
特点
该数据集的显著特点在于其细致入微的损坏标注体系与人工验证机制。每个样本均包含丰富的元数据,如损坏模态类型、具体算子、严重程度及多种随机变体,为分析模型在不同故障模式下的表现提供了精细的粒度。特别地,所有样本均经过人工验证,标注了人类可理解性、有效性及是否必须依赖三模态等信息,确保了损坏的合理性与评价的可靠性。此外,数据集的配对结构使得研究能够精确衡量模态损坏对推理能力的独立影响,为全模态模型的鲁棒性评估设立了新标准。
使用方法
使用该数据集时,研究者需遵循其特有的评估协议。核心要点在于,所有损坏样本必须与同一样本ID的干净基线样本联合分析,通过对比损坏前后模型的回答差异来揭示脆弱性。对于随机算子产生的多样体,采用最坏情况聚合原则,即任一变体回答错误则该条件视为失败。数据加载上,可通过HuggingFace datasets库快速获取元数据,媒体文件则经快照下载,并可按需选择子目录以节省存储。该工具还提供了完整的评估代码与文档,便于研究者复现实验并扩展至新的全模态模型的鲁棒性测评。
背景与挑战
背景概述
随着多模态大模型在视频、图像与音频等异构信号上的深度融合,全模态(omni-modal)推理能力已成为人工智能领域的前沿焦点。然而,现有基准多聚焦于模态齐全时的整体性能,鲜有系统考察模态内部信息遭受结构扰动时的鲁棒性。在此背景下,SCEval——即Modality Fault Lines数据集,由研究者于2026年EMNLP Findings会议首次提出,旨在填补这一空白。该数据集依托Social-IQ、OmniBench与VALOR三大既有基准,精心构建了273个干净三模态问题及其对应的46,019个受控损坏样本,通过逐项配对设计,使模型在相同提问与选项下面对证据链中某一信道失效的极端情境。研究者通过人类验证确保损坏样本的自然有效性与多模态必要性,从而为评估全模态推理的脆弱性提供了严苛且可复现的测试平台,对多模态鲁棒性研究具有重要的推动作用。
当前挑战
SCEval所应对的核心挑战源自全模态推理的本体困境:模型若仅依赖表面关联而非深层跨模态一致性,便会在单一模态证据失真时迅速崩溃。这一领域难题在基准构建中尤为凸显——如何在不破坏数据天然语义的前提下,对文本、视觉或音频施加以结构性损坏,既保证扰动具备实际威胁,又避免引入不自然的痕迹。数据集采用的14种操作算子与四级严重度(10/30/50/70)需在信噪比与可辨识性间精准权衡,而双模态与三模态联合扰动(29,144单模态及17,875组合样本)进一步放大了组合爆炸的风险。此外,人类验证环节需确保每个损坏样本仍能被人工理解且必须依赖三模态协同作答,这要求对源数据集的语义边界有深刻把握。最终,评估协议的worst-case聚合机制要求模型在多样本随机实现中无一处失败,显著提升了基准的鉴别力的同时,也对模型鲁棒性提出了极为苛刻的要求。
常用场景
经典使用场景
ModalityFaultLines-SCEval数据集是评估全模态大模型鲁棒性的关键基准,其核心使用场景在于系统性地注入单模态或多模态的结构性损坏(如文本扰动、视觉遮挡、音频噪声),以测试模型在部分信息不可靠时的推理能力。该数据集包含273个干净样本和超过4.7万个损坏样本,每个损坏样本与干净样本配对,支持细粒度的性能对比分析。研究者常利用该基准进行模态鲁棒性压力测试,通过控制损坏类型(文本、视觉、音频)和严重程度(10至70等级),量化模型在不同模态失效下的性能衰减,从而揭示模型依赖的脆弱模态通道。
衍生相关工作
该数据集自发布以来,已衍生多项重要研究。其基准测试结果催生了针对模态注意力重校准的改进方法,如动态模态加权机制,以减轻对脆弱模态的过度依赖。后续工作基于该数据集提出了模态缺失推理框架,通过生成式填补或跨模态预测来恢复受损信息,提升了模型在损坏条件下的推理准确性。还有研究利用其配对样本设计对比学习目标,增强模型对模态扰动的语义不变性。此外,该数据集的评估协议也被应用于多模态大模型的韧性分析,推动了鲁棒性评估标准化的进程,为理论模型到实际应用的转化提供了验证平台。
数据集最近研究
最新研究方向
随着多模态大模型在文本、视觉与音频融合推理上的迅猛发展,其面对单一模态信息结构损坏时的脆弱性已成为制约实际部署的关键瓶颈。SCEval数据集的提出,通过系统性地引入模态内部的结构性损坏(如文本字符替换、视觉帧遮挡、音频噪声注入)并保持各模态在现象层面的完整存在,精准揭示了模型在依赖特定模态证据时的隐性缺陷。该工作呼应了近期对多模态模型鲁棒性与可解释性的前沿关注,其成对设计的干净—损坏对照机制为细粒度归因分析提供了可靠基准,推动了从任务性能评估向模态级可靠性验证的研究范式转变,对构建更为可信的全模态智能系统具有重要的实证价值与指导意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务